一种基于大数据技术的电力系统短期负荷预测方法
【技术领域】
[0001] 本发明设及电力系统工程技术领域,尤其设及一种基于大数据技术的电力系统短 期负荷预测方法。
【背景技术】
[0002] 电力系统短期负荷预测结果关系到电力系统调度运行和生产计划的制定,准确的 短期负荷预测结果有助有提高系统的安全性和稳定性,能够减少发电成本。随着电力系统 中分布式能源(太阳能、风能、储能等)的大量接入,负荷的变化规律更加难W把握,该种不 确定性将会增加电力系统负荷预测的难度。因此亟待一种能够更好把握负荷变化规律的预 测方法。
[0003] 用户是电网中的最基础组成部分,也是造成电网负荷波动的源头。然而,现今的负 荷预测方法都是针对系统级的负荷预测,最深入的也不过是母线级别的预测。因此,研究一 种针对用户级的负荷预测框架,并利用数据挖掘方法发掘用户用电行为规律,提高负荷预 测的精度是十分必要的。
【发明内容】
[0004] 本发明提出了一种基于大数据技术的电力系统短期负荷预测方法,有效解决由于 用户用电规律复杂造成的负荷预测精度较低问题。
[0005] 为达到上述目的,本发明采用的技术方案是;一种基于大数据技术的电力系统短 期负荷预测方法,包括如下步骤:
[0006] (1)负荷曲线聚类分析。对待预测日前一年的历史负荷数据进行W天为单位的凝 聚层次聚类分析,将形状特征相似的负荷曲线归为一类;
[0007] (2)确立关键影响因素。结合历史负荷及天气数据计算灰色关联分析结果,并对结 果排序得出影响负荷的关键影响因素;
[0008] (3)建立分类规则,W层次聚类分析结果及关键影响因素为输入,采用CART算法 建立决策树,得到凝聚层次聚类分析结果;
[0009] (4)将待预测日分类。将待预测日的关键因素日特征向量数据输入决策树,得到待 预测日的分类结果;
[0010] (5)训练预测模型并预测。选取相应类中的历史负荷数据训练支持向量机模型,根 据步骤4中得出的待预测日的分类结果,选用对应的支持向量机模型完成预测;
[0011] 做计算系统负荷。针对预测目标电网中的所有用户,重复W上步骤,累加所有用 户负荷并叠加网损负荷得到整个电网的系统级负荷。
[0012] 进一步的,所述步骤(1)具体包括如下步骤:
[0013] 采用的聚类分析算法为改进的凝聚层次聚类算法。同时,本发明将欧式距离中每 一个维度的差值进行最大值归一化,如下式所示:
[0014]
[0015] 其中,每一天为一个负荷序列,n代表该负荷序列为一个n维向量(通常为96维); di2代表负荷序列1和负荷序列2的空间距离;该距离中的Xik代表第一个负荷序列中的第 k维数据,x,k代表第二个负荷序列中的第k维数据;X代表所有负荷序列第k维中的最大 值。
[0016] 将待预测日前一年的历史负荷数据作为历史数据集。采用上述应用标准化欧式距 离改进的层次聚类算法,W每天n点的负荷数据形成一个向量,通过计算各个向量之间的 标准化欧式距离,将其由零散分布的独立样本逐渐归为趋势相近的若干类。
[0017] 进一步的,所述步骤(2)具体包括如下步骤:
[0018] 采用灰色关联分析算法计算每个因素的灰色关联度。将预测日前一年的历史负荷 数据、气象数据W及日类型数据集作为分析样本,设定母序列为负荷值,天气因素、日类型 为若干子序列。采用灰色关联分析算法分析各个子序列与母序列的相关性,最后将一年每 天的灰色关联度求均值即可得到各个影响因素的灰色关联度。对灰色关联度进行排序,选 定值较大的前4个作为影响负荷的关键影响因素,具体步骤如下:
[0019] (a)确定规范化属性矩阵;
[0020] 历史负荷数据值为母序列Y= {y。72,…,yp}T,与之对应的关键影响因素为子序列 Xi= {Xii,X2。…,XpjT,则可得到矩阵如下;
[0021]
[0022] 式中P代表有P个样本,q代表有q个待分析的影响因素,X代表因素序列,y代表 负荷序列。
[0023] 化)接下来对A矩阵按列用下式进行均值规范化处理,
[002引式中,Xik代表第i个因素的第t时刻的值,di代表各个序列的均值化算子,是化 表每列元素的平均值。其中,母序列Y也按照同理规范化处理,记其均值化算子为D。
[0027] (C)A矩阵经过规范化后为:
[0028]
[002引 (d)计算关联系数
[0030]因素Xi的第t个指标与负荷序列Y的第t个指标之间的关联系数Ci(t)的几何 意义是曲线Xi与曲线Y在t时刻的相对差值,其计算公式如下:
[0031]
[0032]式中,Amax为|mk(t)-ei(t)I的最大值,Amin为|mk(t)-ei(t)I的最小值; I化(t)-ei(t)|为t时刻的值。P为分辨系数,其作用在于提高关联系数之间的差异性,一 般在0~1之间选取,通常取P= 0. 5。
[0033] (e)确定关键影响因素排序
[0034] 在上述关联系数的基础上,可m十算出因素X占负荷Y的关联度为:
[00 巧]
[0036] 一般情况下,灰色关联度值值在0到1之间。值越接近1,变量X、Y之间的线性 相关程度就越大,的绝对值越接近0,表示X、Y之间越没有线性相关关系;0<r<l,表示X、 Y有相关关系,但是非线性关系;IrI> 0. 6,视为局度关联;0. 2《IrI<0. 6,视为中等相关; IrI<0. 2,视为关联性极弱,可W忽略。
[0037] 进一步的,所述步骤(3)具体包括如下步骤:
[0038] 采用的算法为CART决策树算法,在每个节点(除叶节点外)将选用Gini指数最 小的关键影响因素,将当前节点的历史负荷数据集分割为两个子集,直到最后的分类结果 与步骤1中的聚类结果吻合。该过程完成对历史负荷及关键影响因素数据与聚类结果间禪 合关系的学习,能够清楚完善的表征分类规则。
[0039] 进一步的,所述步骤巧)具体包括如下步骤:
[0040] 针对步骤1的分类结果,将每类的负荷数据及相应的关键因素数据构建训练样 本,训练若干个支持向量机模型。支持向量机的核函数选择RBF核函数,参数的寻优方法选 用网格寻优法,即穷举法。
[0041] 根据步骤4中得出的待预测日的分类结果,选用对应的支持向量机模型完成预 测。
[0042] 进一步的,所述步骤(6)在化doop大数据计算平台上完成。
[0043] 本发明具有的优点和积极效果是;本发明提供一种基于大数据技术的电力系统短 期负荷预测方法,并利用数据挖掘方法发掘用户用电行为规律,提高负荷预测的精度,有助 有提高电力系统的安全性和稳定性,能够减少发电成本。
【附图说明】
[0044] 图1为本发明的结构框架示意图;
[0045] 图2为本发明的算法流程图;
[0046] 图3为用户#1的层次聚类树状图;
[0047] 图4为用户#1的6类负荷曲线图;
[0048] 图5为大数据计算平台框架图;
[0049] 图6为基于大数据技术的电力系统短期负荷预测方法效果图。
【具体实施方式】
[0050] 下面结合附图和【具体实施方式】对本发明作进一步详细的说明。
[0051] 如图2所示,一种基于大数据技术的电力系统短期负荷预测方法,包括W下步骤:
[0052] S1输入历史负荷数据;
[0053] S2利用改进层次聚类算法对输入历史负荷数据进行聚类;
[0054] 由于负荷曲线的走势与日类型,天气因素等密切相关。通过曲线的聚类分析,可W 将形状特征相似的负荷曲线归为一类。
[00巧]本发明采用的聚类分析算法为改进的凝聚层次聚类算法。同时,本发明将欧式距 离中每一个维度的差值进行最大值归一化,如下式所示:
[0056]
[0057] 其中,每一天为一个负荷序列,n代表该负荷序列为一个n维向量(通常为96维); dl2代表负荷序列1和负荷序列2的空间距离;该距离中的X化代表第一个负荷序列中的 第k维数据,X化代表第二个负荷序列中的第k维数据;xmax代表所有负荷序列第k维中的 最大值。
[0058] 将待预测日前一年的历史负荷数据作为历史数据集。采用上述应用标准化欧式距 离改进的层次聚类算法,W每天n点的负荷数据形成一个向量,通过计算各个向量之间的 标准化欧式距离,将其由零散分布的独立样本逐渐归为趋势相近的若干类。
[0059] S3同时利用输入历史负荷数据及天气信息及历史日日类型数据采用灰色关联分 析算法找出关键影响因素;
[0060] 本发明采用灰色关联分析算法计算每个因素(如日最高气温,日平均气温,平均 湿度,日类型(星期几)等)的灰色关联度。将预测日前一年的历史负荷数据、气象数据W 及日类型数据集作为分析样本,设定母序列为负荷值,天气因素、日类型为若干子序列。采 用灰色关联分析算法分析各个子序列与母序列的相关性,最后将一年每天的灰色关联度求 均值即可得到各个影响因素的灰色关联度。对灰色关联度进行排序,选定值较大的前4个 作为影响负荷的关键影响因素。
[0061] S4在S2和S3的基础上,利用CART算法生成决策树;
[0062] 在每个节点(除叶节点外)将选用Gini指数最小的关键影响因素,将当前节点的 历史负荷数据集分割为两个子集,直到最后的分类结果与S1中的聚类结果吻合。该过程完 成对历史负荷及关键影响因素数据与聚类结果间禪合关系的学习,能够清楚完善的表征分 类规则。
[0063] S5根据S2的聚类结果N,形成N个历史数据样本集;
[0064] S6保存S4生成决策树表征的分类规则;
[0065] S7根据N个历史数据样本集训练对应的N*96个支持向量机模型(96代表负荷数 据96个采样点,因此每个采样点对应一个支持向量机模型);
[0066] 针对步骤1的分类结果,将每类的负荷数据及相应的关键因素数据构建训练样 本,训练若干个支持向量机模型。在该个过程中,支持向量机的核函数选择RBF核函数,因 为此核函数下需要确定的支持向量机参数有核函数参数5 2,不敏感系数e和惩罚参数C。 参数的寻优方法选用网格寻优法,即穷举法。
[0067] S8根据待预测日的关键影响因素信息形成待预测日关键影响因素向量;
[0068] S9将S8中的向量输入S6中的分类规则中,得出该待预测日所属的类别;
[0069] S10根据S9中待预测日所属的类别,选择S7中对应的模型进行预测;
[0070] S11对目标电网中所有的用户执行上述操作;
[0071] S12对所有用户的预测结果进行求和;
[007引 S13输出求和的预测结果,即是系统负荷。
[0073] W浙江省某市的市级系统负荷预测为例,该市装配220kv级变电站13座,共有用 户120万户。同时该市配备了用电信息采集系统,能够获取每个用户96点/天的等间距负 荷采样点。
[0074] 实施步骤1(对应S1、S2):选定用户#1,用户待预测日前1年的负荷数据,格式如 下:
[00 巧]
[0076] 上述表格中的每一行数据为一个96维的数据样本,利用下式计算两两向量间的 标准化欧式距离:
[0077]
[0078] 根据计算结果合并距离最近的样本,如附图3中所示,该图的最底层为365个历史 负荷数据样本,自顶向上逐步合并,最终归为6类。六种颜色即代表6类,图4为六类负荷 的曲线图。
[0079] 实施步骤2(对应S3);根据历史负荷数据、历史天气因素数据W及日类型数据,采 用灰色关联分析算法找出影响负荷变化的关键影响因素。数据格式如下:
[0080]
[0081] m亥数据表格的前7列为子序列,第8列为母序列,采用w下灰色关联分析算法计 算:
[0082] 将灰色关联分析法应用到影响负荷变化的关键因素确定中去,步骤如下:
[0083] (a)确定规范化属性矩阵;
[0084] 历史负荷数据值为母序列Y= {y。72,…,yp}T,与之对应的关键影响因素为子序列 Xi= {Xii,X2i,…,Xpi}T,则可得到矩阵如下;
[0085]
[0086] 式中P代表有P个样本,q代表有q个待分析的影响因素,X代表因素序列,y代表 负荷序列。
[0087] 化)接下来对A矩阵按列用下式进行均值规范化处理,
[0090]式中,Xik代表第i个因素的第t时刻的值,di代表各个序列的均值化算子,是代 表每列元素的平均值。其中,母序列Y也按照同理规范化处理,记其均值化算子为D。
[0091] (C)A矩阵经过规范化后为:
[0092]
[0093] (d)计算关联系数
[0094] 因素Xi的第t个指标与负荷序列Y的第t个指标之间的关联系数Ci(t)的几何 意义是曲线Xi与曲线Y在t时刻的相对差值,其计算公式如下:
[0095]
[009引式中,Amax为|mk(t)-ei(t)I的最大值,Amin为|mk(t)-ei(t)I的最小值;I化(t)-ei(t)|为t时刻的值。P为分辨系数,其作用在于提高关联系数之间的差异性,一 般在0~1之间选取,通常取P= 0. 5。
[0097] (e)确定关键影响因素排序
[009引在上述关联系数的基础上,可W计算出因素X占负荷Y的关联度为:
[0099]
[0100] 一般情况下,灰色关联度值值在0到1之间。值越接近1,变量X、Y之间的线性 相关程度就越大,的绝对值越接近0,表示X、Y之间越没有线性相关关系;0<r<l,表示X、 Y有相关关系,但是非线性关系;IrI> 0. 6,视为局度关联;0. 2《IrI<0. 6,视为中等相关; IrI<0. 2,视为关联性极弱,可W忽略。
[0101] 通过上述计算,得到用户#1的6个影响因素的灰色关联度如下:
[0102]
[0103] 判定平均降水和平均风速为极弱相关性因素,剩下的最高气温、平均温度、平均湿 度及日类型为影响负荷走势的关键影响因素。
[0104] 实施步骤3 (对应S4、S6);根据用户#1的2012年负荷数据聚类结果及关键影响 因素,利用CART算法生成决策树。数据格式如下:
[0105]
阳1〇引数据格式说明:上表的前4列为实施步骤2中找出的影响用户#1负荷走势的4项 关键影响因素,聚类结果则代表历史负荷曲线在实施步骤1中被聚到了 6类中的哪一类。 [0107] 将该表格的最后一列作为决策树的最终叶节点类型,前面四项关键影响因素数据 作为决策树节点分裂的备选集,在每个节点分类时计算采用哪个属性的何值作为最佳分类 属性,算法如下:
[010引CART决策树是一种二分递归分割技术,其在每个节点(除叶节点外)将当前样本 集分割为两个子集。与采用基于信息论的信息增益法不同,CART算法所采用的属性选择度 量是基巧指数(Giniindex)。基巧指数用来度量训练样本集D的不纯度,假设数据集合D 包含m个类别,那么其基巧指数的计算公式为:
[0109]
[0110] 其中,Pj是j类元素出现的频率。基巧指数需要考虑每个属性的二元划分,假定 属性的二元划分将D划分成Di和D2,则此次在子节点W某属性A划分样本集D的基巧指数 为:
[0111]
[0112] 对于每个属性,考虑每种可能的二元划分,最终选择该属性产生的最小基巧指数 的子集作为其分裂子集。因此,由上式可知在属性A上的基巧指数Gini^D)越小,则表示在 属性A上的划分效果越好。在此规则下,由上至下不断分裂,直到整棵决策树生长完成。保 存该棵决策树,即为其分类规则。
[011引实施步骤4(对应S5、S7);
[0114]实施步骤4可与实施步骤2同
时进行,本步骤主要完成预测模型的训练。根据实 施步骤1中的聚类结果,将对应的每类的历史数据整理成样本集,格式如下:
[011引
[0116]
[0117] 数据格式说明:该表格为第一类结果中的数据,因为支持向量机模型需要每一个 数据维度一个模型,所W该类就需要训练96个支持向量机模型并保存。
[011引实施步骤5 (对应S8、S9和S10);现在选定预测对象为2013年4月29日全天96 点的负荷值。该日的天气预报信息及日类型信息如下:
[0119]
阳I20] 将该^^量输人实ffi步骤S中li立的分类M则中,得出|分类结果为m2类。然后选 取实施步骤4中建立的对应第二类的支持向量机模型进行96点的负荷预测,并输出结果保 存。
[0121] 实施步骤6(对应S11、S12和S13);
[0122] 该步骤的实施过程在化doop大数据计算平台上完成,化doop大数据计算平台为 开源的数据平台。化doop框架中最核屯、的设计就是:皿FS和MapRe化ce,图5为大数据平 台的框架图。皿FS提供了海量数据的存储,MapRe化ce提供了对数据的并行计算。我们所 使用的大数据平台包含4台服务器,每台服务器配置两个E5-2630V2CPU和500G的存储空 间。对浙江省该市120万用户进行实施步骤1至实施步骤5的操作,计算时间如下表所示:
[0123]
[0124] 对上述120万个用户的负荷预测结果进行累加,即可得到最终的系统负荷。预测 结果如附图6所示。
[0125] 传统方法的最大相对误差为3. 36%,最小相对误差为0.51%,平均相对误差为 1. 68%;而采用本发明得到的预测结果为最大相对误差为1. 35%,最小相对误差为0. 07%, 平均相对误差为1.68%。
[0126] W上对本发明的实施例进行了详细说明,但所述内容仅为本发明的较佳实施例, 不能被认为用于限定本发明的实施范围。凡依本发明范围所作的均等变化与改进等,均应 仍归属于本专利涵盖范围之内。
【主权项】
1. 一种基于大数据技术的电力系统短期负荷预测方法,包括如下步骤: (1) 负荷曲线聚类分析。对待预测日前一年的历史负荷数据进行以天为单位的凝聚层 次聚类分析,将形状特征相似的负荷曲线归为一类; (2) 确立关键影响因素。结合历史负荷及天气数据计算灰色关联分析结果,并对结果排 序得出影响负荷的关键影响因素; (3) 建立分类规则,以层次聚类分析结果及关键影响因素为输入,采用CART算法建立 决策树,得到凝聚层次聚类分析结果; (4) 将待预测日分类。将待预测日的关键因素日特征向量数据输入决策树,得到待预测 日的分类结果; (5) 训练预测模型并预测。选取相应类中的历史负荷数据训练支持向量机模型,根据步 骤4中得出的待预测日的分类结果,选用对应的支持向量机模型完成预测; (6) 计算系统负荷。针对预测目标电网中的所有用户,重复以上步骤,累加所有用户负 荷并叠加网损负荷得到整个电网的系统级负荷。2. 根据权利要求1所述的一种基于大数据技术的电力系统短期负荷预测方法,其特征 在于:所述步骤(1)具体包括如下步骤: 采用的聚类分析算法为改进的凝聚层次聚类算法。同时,本发明将欧式距离中每一个 维度的差值进行最大值归一化,如下式所示:其中,每一天为一个负荷序列,η代表该负荷序列为一个η维向量(通常为96维);d12 代表负荷序列1和负荷序列2的空间距离;该距离中的xlk代表第一个负荷序列中的第k维 数据,x2k代表第二个负荷序列中的第k维数据;χ_代表所有负荷序列第k维中的最大值。 将待预测日前一年的历史负荷数据作为历史数据集。采用上述应用标准化欧式距离改 进的层次聚类算法,以每天η点的负荷数据形成一个向量,通过计算各个向量之间的标准 化欧式距离,将其由零散分布的独立样本逐渐归为趋势相近的若干类。3. 根据权利要求1所述的一种基于大数据技术的电力系统短期负荷预测方法,其特征 在于:所述步骤(2)具体包括如下步骤: 采用灰色关联分析算法计算每个因素的灰色关联度。将预测日前一年的历史负荷数 据、气象数据以及日类型数据集作为分析样本,设定母序列为负荷值,天气因素、日类型为 若干子序列。采用灰色关联分析算法分析各个子序列与母序列的相关性,最后将一年每天 的灰色关联度求均值即可得到各个影响因素的灰色关联度。对灰色关联度进行排序,选定 值较大的前4个作为影响负荷的关键影响因素,具体步骤如下: (a)确定规范化属性矩阵; 历史负荷数据值为母序列Y= {yi,y2,…,yp}T,与之对应的关键影响因素为子序列X i = Ixli, x2i,…,Xpi}τ,贝IJ可得到矩阵如下:式中P代表有P个样本,q代表有q个待分析的影响因素,X代表因素序列,y代表负荷 序列。 (b) 接下来对A矩阵按列用下式进行均值规范化处理,式中,Xik代表第i个因素的第t时刻的值,d i代表各个序列的均值化算子,无代表每 列元素的平均值。其中,母序列Y也按照同理规范化处理,记其均值化算子为D。 (c) A矩阵经过规范化后为:(d) 计算关联系数 因素 Xi的第t个指标与负荷序列Y的第t个指标之间的关联系数ξ Jt)的几何意义 是曲线Xi与曲线Y在t时刻的相对差值,其计算公式如下:式中,^?为lmk⑴-ei⑴I的最大值,~!!为lmk⑴-ei⑴I的最小值;1?⑴ -ei⑴ 为t时刻的值。P为分辨系数,其作用在于提高关联系数之间的差异性,一般在O~1之间 选取,通常取P = 0. 5。 (e) 确定关键影响因素排序 在上述关联系数的基础上,可以计算出因素 Xi与负荷Y的关联度为:一般情况下,灰色关联度值A值在0到1之间。值越接近1,变量X、Y之间的线性相 关程度就越大,&的绝对值越接近0,表示X、Y之间越没有线性相关关系;0〈r〈l,表示X、Y 有相关关系,但是非线性关系;|r|多0.6,视为尚度关联;0.2 < |r|〈0. 6,视为中等相关; I r I〈0. 2,视为关联性极弱,可以忽略。4.根据权利要求1所述的一种基于大数据技术的电力系统短期负荷预测方法,其特征 在于:所述步骤(3)具体包括如下步骤: 采用的算法为CART决策树算法,在每个节点(除叶节点外)将选用Gini指数最小的关 键影响因素,将当前节点的历史负荷数据集分割为两个子集,直到最后的分类结果与步骤1 中的聚类结果吻合。该过程完成对历史负荷及关键影响因素数据与聚类结果间耦合关系的 学习,能够清楚完善的表征分类规则。5. 根据权利要求1所述的一种基于大数据技术的电力系统短期负荷预测方法,其特征 在于:所述步骤(5)具体包括如下步骤: 针对步骤1的分类结果,将每类的负荷数据及相应的关键因素数据构建训练样本,训 练若干个支持向量机模型。支持向量机的核函数选择RBF核函数,参数的寻优方法选用网 格寻优法,即穷举法。 根据步骤4中得出的待预测日的分类结果,选用对应的支持向量机模型完成预测。6. 根据权利要求1所述的一种基于大数据技术的电力系统短期负荷预测方法,其特征 在于:所述步骤(6)在Hadoop大数据计算平台上完成。
【专利摘要】本发明提供一种基于大数据技术的电力系统短期负荷预测方法,利用数据挖掘技术实现用户级的负荷预测,并累加形成系统负荷,包括以下步骤:负荷曲线聚类分析,将形状特征相似的负荷曲线归为一类;确立关键影响因素,达到约简分类规则,简化预测模型的目的;建立分类规则,采用CART决策树算法,得到凝聚层次聚类分析结果;将待预测日分类;训练预测模型并预测,根据得出的待预测日的分类结果,选用对应的支持向量机模型完成预测;计算系统负荷该步骤在Hadoop大数据计算平台上完成。本发明研究一种针对用户级的负荷预测框架,并利用数据挖掘方法发掘用户用电行为规律,提高了负荷预测的精度。
【IPC分类】G06Q10/04, G06Q50/06
【公开号】CN104881706
【申请号】CN201410851910
【发明人】张沛
【申请人】天津弘源慧能科技有限公司
【公开日】2015年9月2日
【申请日】2014年12月31日
转载请注明原文地址:https://www.famiwei.com/read-8138370.html