【Python】家庭用电数据分析Prophet预测

Ne0inhk

21 Mar 2026 — 7 min read

数据集：Household Electricity Consumption | Kaggle

数据集简介

240000-household-electricity-consumption-records数据集包含了一个家庭6个月的用电数据，收集于2007年1月至2007年6月。这些数据包括全球有功功率、全球无功功率、电压、全球强度、分项计量1（厨房）、分项计量2（洗衣房）和分项计量3（电热水器和空调）等信息。该数据集共有260,640个测量值。

列名	说明
Date	日期
Time	时间
Globalactivepower	该家庭所消耗的总有功功率（千瓦）
Globalreactivepower	该家庭消耗的总无功功率（千瓦）
Voltage	向家庭输送电力的电压（伏特）
Global_intensity	输送到家庭的平均电流强度（安培）
Submetering1	厨房消耗的有功功率（千瓦）
Submetering2	洗衣房所消耗的有功功率（千瓦）
Submetering3	电热水器和空调所消耗的有功功率（千瓦）

探索性分析

导入数据集并读取头部

import numpy as np import pandas as pd import matplotlib.pyplot as plt data_path = "./household_power_consumption.csv" df = pd.read_csv(data_path,index_col='index') df.head()

面向特定客户时可将列名替换为中文

# # 将列名替换为中文 # df.rename(columns={ # 'Date': '日期', # 'Time': '时间', # 'Global_active_power': '有功功率', # 'Global_reactive_power': '无功功率', # 'Voltage': '电压', # 'Global_intensity': '电流', # 'Sub_metering_1': '厨房的有功功率', # 'Sub_metering_2': '洗衣房的有功功率', # 'Sub_metering_3': '电热水器和空调的有功功率', # },inplace=1) # # 再次预览前5行数据 # df.head()

对DataFrame 中的数值列进行统计

df.describe()

查看DataFrame中各列的数据类型

df.dtypes

转换数据格式

from tqdm.auto import tqdm from ipywidgets import HBox, FloatProgress, HTML # 将'Date'列转换为日期时间格式 df['Date']=pd.DatetimeIndex(df['Date']) # 定义需要转换为数字的列 make_em_num = ['Global_active_power', 'Global_reactive_power', 'Voltage', 'Global_intensity', 'Sub_metering_1', 'Sub_metering_2', 'Sub_metering_3'] # 定义一个函数，将字符串转换为浮点数，如果转换失败则返回0 def floating(string): try: return float(string) except: return float(0) # 遍历需要转换为数字的列 for column in tqdm(make_em_num): # 将列中的每个元素应用floating函数，转换为浮点数 df[column] = df[column].apply(lambda item: floating(item)) # 创建一个水平布局，包含一个浮点进度条和一个HTML元素 HBox(children=(FloatProgress(value=0.0, max=7.0), HTML(value='')))

查看转换效果，转换后的数据类型

df.dtypes

查看转换效果，转换后的数据头部

df.head()

绘制相关系数热力图。使用Seaborn库中的heatmap函数来绘制一个热力图,展示数据框df中各列之间的相关性

df.drop表示删除名为index、Date和Time的列。axis=1表示按列删除。
annot=True，使得热力图上显示相关系数的具体数值。

import seaborn as sns sns.heatmap(df.drop(['Date','Time'], axis=1).corr(), annot=True)

Prophet预测

https://github.com/facebook/prophet

Prophet是一种基于可加性模型预测时间序列数据的程序，其中非线性趋势可以按年度、每周和每日的季节性，以及假日效应进行拟合。它最适合于具有强烈季节效应的时间序列和有几个季节的历史数据。Prophet对于缺失的数据和趋势的变化是稳健的，并且通常能够很好地处理异常值。

获取DataFrame的形状

from prophet import Prophet df.shape

通过 Prophet 对有功功率和电压进行预测

# 从数据框中随机抽取10000行 df=df.sample(n=10000) # 定义一个函数，用于使用Prophet模型进行预测 def prophet_forecaster(data, x, y, period=100): # 创建一个新的数据框，包含日期和目标变量 new_df = pd.DataFrame(columns=['ds', 'y']) new_df['ds']= data[x] new_df['y'] = data[y] # 创建一个Prophet模型 model = Prophet() # 使用新的数据框进行模型训练 model.fit(new_df) # 创建未来日期的数据框 future_dates = model.make_future_dataframe(periods=period) # 使用模型进行预测 forecast = model.predict(future_dates) # 绘制预测结果 model.plot(forecast) # 设置图表标题 plt.title(f"Forecasting on the next {period} days for {y}") # 使用Prophet模型对Global_active_power进行预测 prophet_forecaster(df, x='Date', y='Global_active_power', period=180) # 使用Prophet模型对Global_reactive_power进行预测 prophet_forecaster(df, x='Date', y='Global_reactive_power', period=180) # 使用Prophet模型对Voltage进行预测 prophet_forecaster(df, x='Date', y='Voltage', period=180) # 使用Prophet模型对Global_intensity进行预测 prophet_forecaster(df, x='Date', y='Global_intensity', period=180)

未来半年有功功率预测结果：

未来半年无功功率预测结果

未来半年电压预测结果：

未来半年电流预测结果

Prophet模型

g(t) 表示趋势函数，能够拟合非周期性变化；
s(s)表示周期性变化，例如每周，每年，每季节等；
h(t)表示假期变化，节假日通常为一天或多天；
ϵt为噪声项，表示随机无法预测的波动，通常假设ϵt是高斯的。

Prophet理念

趋势中有两个增长函数，分别是分段线性函数（linear）和非线性逻辑回归函数（logistic）。通过从数据中选择变化点，Prophet自动探测趋势变化；
使用傅里叶级数建模每年的季节分量；
使用虚变量代表过去，将来的相同节假日，属于节假日就为1，不属于就是0;
用户提供的重要节假日列表
Modeling：建立时间序列模型。分析师根据预测问题的背景选择一个合适的模型。
Forecast Evaluation：模型评估。根据模型对历史数据进行仿真，在模型的参数不确定的情况下，我们可以进行多种尝试，并根据对应的仿真效果评估哪种模型更适合。
Surface Problems：呈现问题。如果尝试了多种参数后，模型的整体表现依然不理想，这个时候可以将误差较大的潜在原因呈现给分析师。
Visually Inspect Forecasts：以可视化的方式反馈整个预测结果。当问题反馈给分析师后，分析师考虑是否进一步调整和构建模型。

Prophet优点

准确，快速，高效率地拟合，可以针对所需关键数据进行交互式探索
集成全自动流程，无需人工操作就能对混乱的数据做出合理的预测
可调整的预测，预测模型的参数非常容易解释，可用业务知识改进或调整预测
对缺失值和变化剧烈的时间序列和离散值有很好的鲁棒性，不需要填补缺失值；

关闭VSCode的GitHub Copilot功能

解决方法： 1. 卸载VSCode自带的Github Copilot插件，在已安装的插件列表中选择卸载。打开Setting，搜索github，勾选"Chat:Disable AI Features"选项。

一文掌握 Git 分支：本地管理 + 远程协作 + 最佳实践

前言：为什么分支如此重要？在现代软件开发中，分支（Branch）是 Git 最强大的特性之一。想象一下： * 🚀 你可以在不影响主代码的情况下开发新功能 * 🐛 你可以独立修复紧急 Bug * 🧪 你可以安全地尝试实验性想法 * 👥 团队成员可以并行工作而不互相干扰这一切都归功于 git branch 命令。本文将带你从零开始，全面掌握 Git 分支管理的核心技能。一、分支的本质：理解 Git 分支模型在深入命令之前，先理解分支的本质： ┌─────────────────────────────────────────────────┐ │ Git 分支 = 指向提交的轻量级指针 │ │ │ │ main ──→ ● ──→ ● ──→ ● (最新提交) │ │ ↘ │ │ feature ──→ ● ──→ ● (独立开发线) │ └─────────────────────────────────────────────────┘ 关键概念： * 分支只是一个指向特定提交的指针 * 创建分支几乎零成本（只创建指针，不复制文件）

PandaWiki：更轻量的开源知识库，问答效果到底如何？（本地部署教程+效果实测）

开源 RAG 项目我之前主要围绕 RAGFlow 写了不少落地案例。RAGFlow 定位是大而全的企业级 RAG 引擎，所以社区里也一直有人吐槽：资源吃得多、处理慢。但这事儿某种程度上就是端到端全包（解析、切分、向量化、检索、权限、工作流、评测）的代价，工程体量上去了，默认就不可能太轻。如果你想找一款更轻量的开源方案，主要用来处理产品文档、技术文档、FAQ、博客等内容，那可以看看今天要介绍的 PandaWiki。一句话总结：PandaWiki 更像开源版的知识库产品，而不是一个给工程师从零拼装的 RAG 引擎。这个项目实际我也是近期才注意到，GitHub 目前 8.6K Star，看趋势图下半年热度是一路走高。我花了几天集中测了下，确实有一些可圈可点的地方，这篇就抓大放小，来和各位说道说道。这篇试图说清楚： PandaWiki 的手把手本地部署过程、

3大开源修复模型横评：云端镜像快速部署，1天完成全面测试

3大开源修复模型横评：云端镜像快速部署，1天完成全面测试你是不是也遇到过这样的情况：团队要选一个AI图像修复工具，大家各自在本地跑GFPGAN、CodeFormer、GPEN，结果有人用笔记本CPU跑，有人用高端显卡，测试速度、画质效果完全没法比？最后开会讨论时，谁的电脑配置高，谁的结果就“看起来更好”，根本没法做出公正决策。这正是很多技术主管在搭建AI工具链时最头疼的问题——缺乏统一、可复现的测试环境。不同设备、不同依赖版本、不同参数设置，导致评估结果偏差巨大，选型变成“看运气”。别急，今天我就来帮你解决这个痛点。我们不靠本地部署“拼电脑”，而是直接上云端标准化镜像环境，一键部署三大主流开源人脸修复模型：GFPGAN、CodeFormer 和 GPEN，在相同GPU资源下完成公平对比测试，1天内搞定从部署到出报告的全流程。 ZEEKLOG星图平台提供了预置好这三大模型的AI镜像，无需手动安装复杂依赖，不用折腾CUDA、PyTorch版本兼容问题，点击即用，还能对外暴露API服务，方便团队成员远程调用测试。整个过程就像租了一台“AI修复工作站”，谁都能用，结果可比对。

数据集简介

探索性分析

Prophet预测

Prophet模型

Prophet理念

Prophet优点

Read more

关闭VSCode的GitHub Copilot功能

一文掌握 Git 分支：本地管理 + 远程协作 + 最佳实践

PandaWiki：更轻量的开源知识库，问答效果到底如何？（本地部署教程+效果实测）

3大开源修复模型横评：云端镜像快速部署，1天完成全面测试