用于支撑智慧城市运行管理的智能电网大数据挖掘系统及方法

xiaoxiao2020-10-23  14

用于支撑智慧城市运行管理的智能电网大数据挖掘系统及方法
【技术领域】
[0001] 本发明属于数据挖掘领域,特别设及一种适用于支撑智慧城市运行管理的智能电 网大数据挖掘系统及方法。
【背景技术】
[0002] 智慧城市是城市可持续发展需求与新一代信息技术应用相结合的产物,是通过综 合运用现代科学技术,统筹业务应用系统,整合信息通信资源,集城市运行管理、能源供需、 公共服务、产业优化、环境监测等为一体的城市科学发展新实践,智能电网与智慧城市紧密 结合,能够促进城市绿色发展,保障城市用电安全,完善城市通信信息网络,带动城市产业 发展,丰富城市服务内涵。智慧城市的高效运转离不开智能电网,智能电网是智慧城市的关 键基础和客观需要。
[0003] 智慧城市的本质是对数据的智慧处理。大数据改变了城市的管理方式、运行模式, 让人们享受智慧的生活体验。在智慧城市建设的过程中,大数据的收集、存储、分析挖掘及 使用是智慧城市面临的挑战。又由于智能电网对智慧城市的支撑作用,对智能电网的大数 据挖掘则显得尤其重要。
[0004] 大数据是智能电网的典型特点,要实现智能电网支撑智慧城市必须掌握数据处理 的关键技术即大数据挖掘技术。目前存在多种数据挖掘方法和技术,基本上按挖掘任务分 属五类:预测、分类、关联规则、聚类分析、离群分析。通过该些技术方法来进行数据挖掘, 得到有用信息。但是数据挖掘模型的建立没有通用性,一般现在大多数的做法是根据需要 的一个任务目标来建立相应模型进行数据挖掘,然而该个模型在其他的任务上却没有适用 性。

【发明内容】

[0005] 针对现有方法存在的不足,本发明提出一种用于支撑智慧城市运行管理的电网大 数据挖掘系统及方法。
[0006] 本发明所采用的技术方案是该样实现的:
[0007] -种用于支撑智慧城市运行管理的智能电网大数据挖掘系统,包括:
[0008] 数据提取模块:用于提取智慧城市运行管理所需的智能电网数据;
[0009] 数据处理模块;用于对数据提取模块提取的智能电网数据进行分类整合处理;
[0010] 数据挖掘模块:具有基于云计算的数据聚类分析方法(即,基于云计算的MapRe化ce-APS方法)、改进的关联规则方法和改进的离群分析方法该=种数据挖掘方法, 并具有独立工作模式和联合工作模式;能够根据不同运行任务目标,进行工作模式选择后, 对数据处理模块处理后的智能电网数据进行挖掘得到有用信息;所述独立工作模式,指的 是根据运行任务目标从基于云计算的数据聚类分析方法、改进的关联规则方法和改进的离 群分析方法中选择一种数据挖掘方法进行数据挖掘的工作模式;所述联合工作模式指的是 根据运行任务目标从基于云计算的数据聚类分析方法、改进的关联规则方法和改进的离群 分析方法中选择至少两种挖掘方法联合进行数据挖掘的工作模式;
[0011] 数据可视化模块;用于可视化数据挖掘模块的智能电网大数据挖掘后得到的有用 f目息;
[0012] 一种用于支撑智慧城市运行管理的电网大数据挖掘方法,包括如下步骤:
[0013] 步骤1 ;各城市运行管理部口从智能电网数据库中提取出所需的智能电网数据;
[0014] 步骤2;对步骤1提取的智能电网数据进行分类整合处理得到所需的数据集;
[0015] 步骤3;将数据集和城市运行管理部口的运行任务目标输入到数据挖掘模块;
[0016] 步骤4 ;数据挖掘模块对运行任务目标进行分析;
[0017] 步骤5;在对输入的运行任务目标分析后,根据所输入的运行任务目标的个数,数 据挖掘模块决定其数据挖掘的工作模式;当所选的运行目标任务为一个时,则数据挖掘模 块进行独立工作模式;当所选的运行目标任务为多个时,则数据挖掘模块进行联合工作模 式;
[0018] 步骤6 ;在不同的工作模式下,根据不同挖掘方法进行数据挖掘,得到的有用信息 输出到数据可视化模块进行显示。
[0019] 所述的基于云计算的数据聚类分析方法的运行环境由两种不同类型的数据节点 组成;在从节点上负责数据的处理,在主节点上负责运行目标任务调度及不同节点之间的 数据共享;具体包括如下步骤;
[0020] 步骤A01 ;首先采用AP算法(即,近邻传播聚类算法)确定最佳聚类数的捜索范 围,并选择合适的有效性分析指标,评估该捜索范围内各聚类结果的质量,根据评估结果得 到数据集聚类数1。。,从而得到最佳聚类数范围[2,1。。],并将数据集聚类数1。。作为基于云 计算的数据聚类分析方法的输入;
[0021] 步骤A02;基于并行框架的方法,将输入的数据集进行随机划分,划分结果标 记为数据片spliti、split2、splits、...、和邱,并将各随机划分的数据片均转化为 <key,value〉形式,作为各map函数的输入;
[002引步骤A03 ;Map阶段;根据步骤A01中输入的数据集聚类数1。。对输入的数据片运 用C均值聚类算法(又称FCM聚类算法)进行分析,得到初始聚类中屯、,根据密度指标将数 据集中每个数据点划分到数据点附近的聚类中,直到所有的数据点都划分完毕;
[002引步骤A04 ;取所有map函数的输出,对输出结果进行汇总对map函数输出的数据 节点,Wkey值为索引进行分组和排序,将属于同一聚类的数据点进行汇总,汇总之后输出 至Re化ce阶段;
[0024]步骤A05 ;Re化ce阶段;读取步骤A04的输出结果并进行汇总处理,处理结束后输 出聚类中屯、点及隶属于该个聚类中屯、的数据至下一步的验证环节;
[00巧]步骤A06 ;对Re化ce阶段的输出结果进行验证;采用Si化ouette指标对输出结果 进行有效性分析,符合指标则作为最终结果进行输出并显示,否则返回到步骤A01,同时改 变输入最佳聚类数为1。。+1。
[0026] 所述的改进的关联规则方法,是通过将DIC算法与DHP算法结合,相比于DIC算法 能够进一步减少扫描数据库的次数,提高效率,高效找出事物中的全部频集,并且精确度又 比DHP算法高。按如下步骤进行:
[0027] 步骤B01;用户设定最小支持度和最小置信度,输入待处理数据事物库;
[0028] 步骤B02;基于分层划分技术的方法,对给定的数据事物库进行DIC算法分区,将 数据库划分为N片表区;
[0029] 步骤B03;计算每个表区内项目集的最小支持度;
[0030] 步骤B04;统计每个表区内的局部频繁项目集巧,形成候选项目集,其中每个表区 内最小支持度大于设定的最小支持度的项目集为频繁项目集,i表示频繁项目集中的项目 个数;k表示频繁项目集中第k个项目;
[003。步骤B05;在上一步的基础上进一步采用畑P算法,将每个表区的候选项目集中含 有i-1个公共项目的局部频繁项目集进行两两合并;
[0032] 步骤B06;对每个表区重复执行步骤B03至步骤B04,得到全局项目频繁集;
[0033] 步骤B07;执行Apriori算法第二步,计算全局频繁项目集的最小置信度,进而得 到关联规则。
[0034] 所述的改进的离群分析方法,为首先根据用户需要的检测方向(例如,检测电 压),确定检测属性(例如,电压)从而进行相应的子空间选择;选择了子空间后在各子空 间中运用聚类密度算法检测子空间中差异性较大的离群数据点;在此基础之上,通过计算 多个子空间的离群程度的加权和来定义一个离群对象;按如下步骤进行:
[0035] 步骤C01;用户根据检测方向从原始输入数据中决定最终输入数据(例如原始输 入数据含有电压,电流,功率等等数据,但是用户现在的检测方向只是检测电压,那么只选 取电压数据作为最终的输入数据),并基于检测属性(电压)选择子空间;
[0036] 步骤C02;在子空间中运用基于密度的聚类算法来检测子空间中差异性较大的离 群数据点;
[0037] 步骤C03;计算多个子空间属性的边际密度概率和子空间的联合密度分布概率来 判断子空间属性之间的相关性;
[0038] 步骤C04;选取相关性较大的子空间,并计算被怀疑的离群数据点相对于前述相 关性较大的子空间的离群偏差程度的加权和;
[0039] 步骤C05;将步骤C04得到的计算结果与设定好的离群偏差加权和阔值比较,大于 阔值的则被认为是离群数据点;
[0040] 步骤C06;统计由步骤C05中得到的相对于相关程度大的子空间检测出的离群数 据点和个别独立的子空间中检测出的离群数据点作为最终结果输出并显示。
[0041] 本发明的优点;本发明的用于支撑智慧城市运行管理的电网大数据挖掘系统及 方法中的数据挖掘模炔基于云计算的MapRe化ce-APS算法、改进的关联规则算法和改进的 离群分析算法,具有采用其中之一的算法单独执行数据挖掘的独立工作模式和具有采用其 中至少两种算法联合进 行数据挖掘的联合工作模式,可W运用到城市的运行管理的方方面 面。该模块解决了W往据挖掘模型的局限性,不仅仅只是针对某一个部口或某一个模型,不 同的运行管理部口可W根据运行目标任务不同,进行不同挖掘方法和工作模式选择,从而 得到具有针对性的有用信息,具有通用性。
【附图说明】
[0042] 图1为本发明一种实施方式的用于支撑智慧城市运行管理的电网大数据挖掘系 统的结构示意图;
[0043] 图2为本发明一种实施方式的用于支撑智慧城市运行管理的电网大数据挖掘方 法流程图;
[0044] 图3为本发明一种实施方式的基于云计算的MapRe化ce-APS算法原理图
[0045] 图4为本发明一种实施方式的基于云计算的MapRe化ce-AR5算法流程图;
[0046] 图5为本发明一种实施方式通过实验仿真得到的两种类别的用电规律趋势图;
[0047] 图6为本发明一种实施方式的改进的关联规则原理图;
[0048] 图7为本发明一种实施方式的改进的关联规则算法流程图;
[0049] 图8为本发明一种实施方式的改进的离群分析算法原理图;
[0050] 图9为本发明一种实施方式的改进的离群分析算法流程图;
[0051] 图10为一种实施方式通过实验仿真得到的=种算法精确度对比图;
[0052] 图11为一种实施方式的联合工作模式下数据挖掘流程图。
【具体实施方式】
[0053] 下面结合附图和【具体实施方式】对本发明作进一步详细说明。
[0054] 本实施方式中的适用于用于支撑智慧城市运行管理的智能电网大数据挖掘系统 如图1所示,包括:
[00巧]数据提取模块:用于从智能电网数据库中提取智慧城市运行管理所需的智能电网 数据;
[0056] 数据处理模块;用于对数据提取模块提取的智能电网数据进行分类整合处理;
[0057] 数据挖掘模块:具有基于云计算的数据聚类分析方法、改进的关联规则方法和改 进的离群分析方法该=种数据挖掘方法,并具有独立工作模式和联合工作模式;能够根据 不同运行任务目标,进行工作模式选择后,对数据处理模块处理后的智能电网数据进行挖 掘得到有用信息;所述独立工作模式,指的是根据运行任务目标从基于云计算的数据聚类 分析方法、改进的关联规则方法和改进的离群分析方法中选择一种数据挖掘方法进行数据 挖掘的工作模式;所述联合工作模式指的是根据运行任务目标从基于云计算的数据聚类分 析方法、改进的关联规则方法和改进的离群分析方法中选择至少两种挖掘方法联合进行数 据挖掘的工作模式;
[0058] 数据可视化模块;用于可视化数据挖掘模块的智能电网大数据挖掘后得到的有用 信息;
[0059] 本实施方式的用于支撑智慧城市运行管理的电网大数据挖掘方法,如图2所示, 包括如下步骤:
[0060] 步骤1;各城市运行管理部口从智能电网数据库中提取出所需的智能电网数据;
[0061] 步骤2 ;对步骤1提取的智能电网数据进行分类整合处理得到所需的数据集;
[0062] 步骤3 ;将数据集和城市运行管理部口的运行任务目标输入到数据挖掘模块;
[0063] 步骤4;数据挖掘模块对输入的数据及运行任务目标进行分析;
[0064] 步骤5;在对输入的运行任务目标分析后,根据所输入的运行任务目标的个数,数 据挖掘模块决定其数据挖掘的工作模式;当所选的运行目标任务为一个时,则数据挖掘模 块进行独立工作模式;当所选的运行目标任务为多个时,则数据挖掘模块进行联合工作模 式;
[0065] 步骤6;在不同的工作模式下根据不同挖掘方法得到有用信息并输入到数据可视 化模块进行显示。所述独立工作模式,指的是根据运行任务目标从基于云计算的数据聚类 分析方法、改进的关联规则方法和改进的离群分析方法中选择一种数据挖掘方法进行数据 挖掘的工作模式;所述联合工作模式指的是根据运行任务目标从基于云计算的数据聚类分 析方法、改进的关联规则方法和改进的离群分析方法中选择至少两种挖掘方法联合进行 数据挖掘的工作模式;
[0066] 由前述,独立工作模式指的是基于云计算的MapRe化ce-APS方法、改进的关联规 则算法和改进的离群分析算法该=种数据挖掘方法同时存在于数据挖掘模块中,根据运行 任务目标选择其中一种挖掘方法进行数据挖掘的工作模式;则可W得知数据挖掘模块中的 独立工作模式存在3种,即第一种独立工作模式为选择基于云计算的MapRe化ce-APS方法 (即,基于云计算的聚类分析方法)进行数据挖掘的工作模式;第二种独立工作模式为选择 改进的关联规则方法(即,基于云计算的聚类分析方法)进行数据挖掘的工作模式;第=种 独立工作模式为选择改进的离群分析方法(即,基于云计算的聚类分析方法)进行数据挖 掘的工作模式。
[0067] 不同城市运行管理部口的任务要求不同,第一种独立工作模式则是专口针对那些 重视数据趋势走向的部口。
[0068] 结合图3和图4对基于云计算的聚类分析方法(本实施方式中将其命名为 MapRe化ce-APS方法)的设计及实施流程进行如下说明:
[0069] 步骤A01;首先采用近邻传播聚类算法(简称AP算法)确定最佳聚类数的捜索范 围,并选择合适的有效性分析指标,评估该捜索范围内各聚类结果的质量,根据评估结果得 到数据集聚类数1。。,从而得到最佳聚类数范围[2,1。。],并将数据集聚类数1。。作为基于云 计算数据聚类分析方法的输入;
[0070]为了在聚类捜索范围内选择合适的有效性分析指标并评估该捜索范围内各聚类 结果的质量得到最佳聚类数引入了AP算法(即,近邻传播聚类算法),AP算法不需要事 先确定聚类个数,最初将所有样本点都看作潜在的类代表,通过迭代竞争类代表,达到理 想的聚类结果。AP算法的计算速度快,较样本数N有效的减少了捜索范围,并且较传统最 大聚类数Imax等于n的开平方的经验选择方式更具科学性。具体工作过程如下;先计算 N个点之间的相似度值,将计算出的相似度值放在S矩阵中,再选取数据点能否成为聚类 中屯、的判断标准,即参考度P值(一般取S的中值),同时设置一个最大迭代次数,迭代过 程开始后,计算每一次的R值和A值,根据R也k)+A也k)值来判断是否为聚类中屯、,当 (R(k,k)+A化,k)) >0时认为是一个聚类中屯、。其中,R(k,k)用来描述点k适合作为数据 点的聚类中屯、的程度;A(k,k)用来描述数据点选取k点作为聚类中屯、的适合程度。当迭代 次数超过最大值或者当聚类中屯、连续多次迭代不发生改变时终止计算。通过AP算法为后 面的FCM算法提供了输入。
[0071] 步骤A02;基于并行框架的方法,对输入的数据集进行随机分片,分片结果标记为 数据片spliti、split2、split3、...、和,并将各数据片均转化为<key,value〉形式, 分别作为各map函数的输入;
[007引步骤A03 ;Map阶段;根据步骤A01中输入的数据集聚类数1。。对输入的数据片运 用C均值聚类算法(又称FCM聚类算法)进行分析,得到初始聚类中屯、,根据密度指标将数 据集中每个数据点划分到数据点附近的聚类中,直到所有的数据点都划分完毕;
[0073] 根据前面的AP算法得到的聚类数lop,对输入的数据片进行FCM算法分析。此处 的FCM算法把n个向量Xi(i= 1,2,…n)划分为C个模糊组,C的取值范围为[2,lop]。
[0074] 具体步骤为;
[007引步骤A03.1拥值在0,1间的随机数初始化隶属矩阵U,使巧馬足
[0076] 步骤A03. 2;聚类中屯、个数C属于巧,lop],首先令c= 2;
[0077] 步骤A03. 3;利用公式
计算C个聚类中屯、Ci(i= 1,….C)
[0078] 步骤A03. 4;根据
计算价值函数;其中Uy介于0, 1 之间;Ci为模糊组I的聚类中屯、;dIICi-Xj.II为第i个聚类中屯、与第j个数据点间的欧 几里德距离;如果计算的价值函数值小于设定的阀值,或当前计算的价值函数值相对前一 次计算的价值函数值的改变量小于设置的阀值,则结束;否则,则执行步骤A03. 5 ;
[0079] 步骤A03. 5;根据公式
计算新的矩阵U,返回步骤A03. 3;
[0080] 运用W上方法将每个数据点划分到距离最近的聚类中,并将得到的聚类中屯、和隶 属于它的数据点进行输出。
[00則步骤A04 ;取所有map函数的输出,对输出结果进行汇总:对map函数输出的数据 节点,Wkey值为索引进行分组和排序,将属于同一聚类的数据点进行汇总,汇总之后输出 结果<c。list(Xj)〉至Re化ce阶段;其中Ci表示聚类中屯、,list(xj)表示隶属于Ci的数据 点集合。
[0082] 步骤A05 ; Re化ce阶段;读取步骤A04的输出结果并进行汇总处理,处理结束后输 出聚类中屯、点及隶属于该个聚类中屯、的数据至下一步的验证环节;
[0083] 读取输出的<c。list(Xj.)〉,对输入的所有<c。list(Xj.)〉进行汇总处理,处理结束 后输出C个聚类中屯、点及各个聚类中屯、点所包含的数据。
[0084] 步骤A06;对Re化ce阶段的输出结果进行验证;采用Si化ouette指标对输出结果 进行有效性分析,符合指标则作为最终结果进行输出并显示,否则返回到步骤A01,同时改 变输入最佳聚类数为1。。+1。
[0085] 本实施方式使用沈阳某电网公司用户的24小时用电数据作为输入数据,对所采 集的数据运用提出的基于云计算的MapRe化ce-AI^S算法按照上面的方法进行处理,最后聚 成两类,仿真结果如附图5所示,对该两类数据进行分析,得到两种用电规律。根据图5可 知,仿真结果验证了本方法的有效性。电网企业可w依据此算法获取用户的用电行为,对其 进行分析,并制定相应策略,从而进行智能化管理。
[0086] 第二种独立工作模式则主要针对的是那些想要发现不同项目集或属性之间的关 联性W及探索某些特定组合的事件反复发生的规则的部口。
[0087] 本实施方式结合图6与图7对改进的关联规则算法的设计及实施流程进行如下说 明:
[0088] 步骤B01 ;用户设定最小支持度和最小置信度,输入待处理数据事物库;
[0089] 数据事物库D中的规则义与>r是受支持度(support)和置信度(confidence)约 束的。支持度表示规则的频度,置信度表示规则的强度。
[0090] 步骤B02;基于分层划分技术的方法,对给定的数据事物库进行DIC算法分区,将 数据库划分为N片表区;
[00川 DIC算法将数据库划分为N片表区Di,......D。,通过下面的公式:
[0094]来计算规则.Y 在事务库D中的支持度和置信度。项集A在数据库Di中的 支持度为义马>7在数据库Di中的支持度且有义nF= 0,XUY=A,记为suppod(A)。
[009引步骤B03;计算每个表区内项目集的最小支持度;
[0096] 步骤B04;统计每个表区内的局部频繁项目集片,形成候选项目集,其中每个表区 内最小支持度大于设定的最小支持度的项目集为频繁项目集,i表示频繁项目集中的项目 个数;k表示频繁项目集中第k个项目;
[0097] 步骤B05;在上一步的基础上进一步采用畑P算法,将每个表区的候选项目集中含 有i-1个公共项目的局部频繁项目集进行两两合并;
[0098] 在确定了所有的局部频繁项目集之后,进一步合并有i-1个公共项的两个Li频 繁项目集,进一步减少扫描次数,使处理时间更短。在上一步的基础上,先对每个数据库 町先设定一个最小支持数,然后将每个分块的数据库Di中得到的所有的频繁项目集进行 分解,得到所有的项目集,并对得到的所有项目及应用哈希函数(哈希函数为M{x,y}}= ((order of x)*10+(order of y))mod7其中,order ofX为X在所有取值序列中的序号)。 首先生成候选1-项目集,统计1-项目集的支持度W生成Li,并读取每行事物,根据要构造 的候选集合的长度对读取的每行事物进行组合分解,为1-项目集建立用于快速统计的哈 希表Hi。然后采用DHP算法检测1-项目集中的每个项是否在哈希表Hi中,如果在哈希表 Hi中,则把该项的支持数加1。否则,向哈希表中插入该项并将支持数置为1。统计后得到 结果位向量。接下来进行LiXLi,将LiXLi中的2-项目集带入哈希函数,得到每个2-项目 集对应的哈希地址并W同样的方法放到哈希表&中。然后根据位向量取值,从L1X Li过滤 2-项目集,对应位向量为0的2-项目集组合被删掉,得到新的频繁项目集。
[0099] 步骤B06;对每个表区均执行步骤B04至步骤B05后,得到全局频繁项目集;
[0100] 步骤B07;执行Apriori算法第二步,计算得到的频繁项目集的最小置信度,得到 关联规则。
[010。为了说明本实施方式的改进的关联规则方法的性能,利用了UCI数据库提供的机 器学习的标准数据集进行实验测试。实验环境的PC配置为Intel 2.30GHz CPU,内存为2. 3GB,操作系统为Windows Tprofessinonal,采用Visual Sl:udio 2010进行算法的编写。
[0102] 将支持度阔值和置信度阔值分别设置为1%和50%,分别采用=种算法进行分类 准确性测试,结果如表1所示。
[0103] 表1=种算法的分类正确率对比表
[0104]
[0105] 由表1的正确率数据对比可W看出,改进的关联规则方法的正确率相比于Aprior 算法和Die算法并没有显著的下降,而改进的关联规则方法减少了扫描次数,在操作复杂 度和处理时间上占有很大优势。
[0106] 第=种独立工作模式适用于智能电网支撑智慧城市运行管理的离群分析方法。离 群点是那些被怀疑由其他未知机制产生的与绝大多数正常数据有很强差异性的数据。越来 越多的领域注重离群点检测,针对该一目标,设计了适应于智能电网支持智慧城市建设的 离群分析方法。
[0107] 本实施方式结合图8与图9对该种适应于智能电网支撑智慧城市运行管理的离群 分析方法的设计及实施流程进行如下说明:
[010引步骤C01 ;用户根据检测方向,从原始输入数据中决定最终输入数据,并基于检测 属性选择子空间;从智能电网数据库中提取出的数据作为原始的输入数据;各运行管理部 口根据检测方向即需求来确定属性,选择子空间。例如:节点电压大小就可W是一个属性, 从而确定出一个子空间。
[0109] 步骤C02;在子空间中运用基于密度的聚类算法来检测子空间中差异性较大的离 群数据点;在根据属性选择出了不同的子空间后运用基于密度的聚类算法来分析数据点特 性从而检测出子空间中差异性较大的离群数据点。
[0110] 步骤C03;计算多个子空间属性的边际密度概率和子空间的联合密度分布概率来 判断属性之间的相关性;对子空间进行处理,比较子空间属性的边际密度、分布概率和子空 间的联合密度分布概率来判断子空间属性之间是否相关。划分出两类子空间:相关性较大 的相关子空间和"独立的"子空间。
[01U] 步骤C04;选取相关性较大的子空间,并计算被怀疑的离群数据点相对于前述相 关性较大的子空间的离群偏差程度的加权和;对于相关性较大的多个离群子空间的离群偏 差程度进行加权处理,并统计出相关性较小的"独立的"子空间的离群数据点。
[0112] 基于密度的聚类算法分析;考虑到邻居点的距离值并同时考虑与领域内的密度对 比,通过距离检测加上密度检测来最终检测出离群数据点。(a)基于距离的检测方法:策略 就是将与大部分数据点间的距离大于指定的阔值的数据点检测出来,并将该些检测出的数 据点列为离群数据点。实际计算时用的方法就是W该数据点为圆屯、,W制定距离为半径画 圆。在圆内的邻居个数少于邻居数据集总个数的一定比例时,将该个数据点列为被怀疑的 离群数据点。根据该方法能够先检测出一部分被怀疑的离群数据点。对于全局离群点可W 用基于距离的方法检测出来,局部离群点则运用基于密度的方法检测。化)基于密度的检测 方法;对于正整数k,对象P的第k距离可记为k-distance(P)。当满足W下两个条件时则 认为k-distance(P) =d(p,〇)。
[011引
[0114] 依据局部密度公式;对象X的局部密度用k最近邻计算
[0118] 其中,N(x,k)是包含X的k-最近邻集合,|N(x,k)|是该集合的大小,y是X的一 个最近邻。通过W上两个公式可检测出与邻居密度差异很大的离群点。最终整合两种方法 检测出的离群点作为最终检测结果。
[0119] 步骤C05 ;将步骤C04得到的计算结果与设定好的离群偏差加权和阔值比较,大于 阔值的则被认为是离群数据点;
[0120] 步骤C06 ;统计由步骤C05中得到的相对于相关程度大的子空间检测出的离群数 据点和个别独立的子空间中检测出的离群数据点作为最终结果输出并显示。
[0121] 为了验证本实施方式的改进的离群分析方法的有效性,选取具有代表性的K孤 CUP99数据集作为实验数据,因该数据集中收录了很多攻击数据,正常的只占20%左右,所 W必须先对该数据集进行必要的筛选和处理,使数据集中正常连接的数据占大多数,W符 合离群点的定义。
[0122] 为了测试数据集规模及检测改进的离群分析方法,构建了记录数分别为 10000, 20000, 30000, 40000的四个数据集,该四个数据集均是从邸D CUP99数据集中随机 抽取的,并控制攻击比例,使数据集正常连接数的比例在98%左右。数 据集中包含了四种攻 击型数据:探测攻击、拒绝服务攻击、本地用户权限提升攻击和远程攻击。下面是数据集中 的一条记录:
[012引 0, tcp, private, SF, 432, 386, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 1, 1, 0. 00, 0. 0 0, 0. 00, 0. 00, 1. 00, 0. 00, 0. 00, 105, 276, 1. 00, 0. 01,0. 00, 0. 00, 0. 00, 0. 00, 0. 00, 0. 00,no rmal.
[0124] 通过在给定的数据集上运行该改进的离群分析方法并与基于密度的检测方法和 基于距离的检测方法进行对比来评价改进的离群分析方法好坏。并计算正确找到的离群数 和离群点总数做比例得到精确度。仿真结果见附图10。
[0125] 由实验结果可知改进的离群分析方法的精确度明显高于其他两种算法。
[0126] 对于实际城市运行管理中,有的部口可能具有多个运行任务目标要求,因此本系 统的数据挖掘模块中不仅仅只是上述=种独立工作模式,还具有联合工作模式,联合工作 模式指的是基于云计算的MapRe化ce-APS方法、改进的关联规则方法和改进的离群分析方 法该=种数据挖掘方法同时存在数据挖掘模块中,根据需要选择其中至少两种挖掘方法联 合进行数据挖掘的工作模式。由于联合工作模式的情况较多,本实施方式W-种联合工作 模式为例进行说明,该联合工作模式如图11所示,该联合工作模式同时选择了基于云计算 的MapRe化ce-APS方法和改进的离群分析方法进行数据挖掘。
【主权项】
1. 一种用于支撑智慧城市运行管理的智能电网大数据挖掘系统,其特征在于:包括: 数据提取模块:用于提取智慧城市运行管理所需的智能电网数据; 数据处理模块:用于对数据提取模块提取的智能电网数据进行分类整合处理; 数据挖掘模块:具有基于云计算的数据聚类分析方法、改进的关联规则方法和改进的 离群分析方法这三种数据挖掘方法,并具有独立工作模式和联合工作模式;能够根据不同 运行任务目标,进行工作模式选择后,对数据处理模块处理后的智能电网数据进行挖掘得 到有用信息;所述独立工作模式,指的是根据运行任务目标从基于云计算的数据聚类分析 方法、改进的关联规则方法和改进的离群分析方法这三种数据挖掘方法中选择一种进行数 据挖掘的工作模式;所述联合工作模式指的是根据运行任务目标从基于云计算的数据聚类 分析方法、改进的关联规则方法和改进的离群分析方法这三种数据挖掘方法中选择至少两 种数据挖掘方法联合进行数据挖掘的工作模式; 数据可视化模块:用于可视化数据挖掘模块的智能电网大数据挖掘后得到的有用信 息。2. 采用权利要求1所述系统的用于支撑智慧城市运行管理的智能电网大数据挖掘方 法,其特征在于:包括如下步骤: 步骤1 :各城市运行管理部门从智能电网数据库中提取出所需的智能电网数据; 步骤2 :对步骤1提取的智能电网数据进行分类整合处理得到所需的数据集; 步骤3 :将数据集和城市运行管理部门的运行任务目标输入到数据挖掘模块; 步骤4 :数据挖掘模块对运行任务目标进行分析; 步骤5 :在对输入的运行任务目标分析后,根据所输入的运行任务目标的个数,数据挖 掘模块决定其数据挖掘的工作模式:当所选的运行目标任务为一个时,则数据挖掘模块进 行独立工作模式;当所选的运行目标任务为多个时,则数据挖掘模块进行联合工作模式; 所述独立工作模式,指的是根据运行任务目标从基于云计算的数据聚类分析方法、改进的 关联规则方法和改进的离群分析方法中选择一种数据挖掘方法进行数据挖掘的工作模式; 所述联合工作模式指的是根据运行任务目标从基于云计算的数据聚类分析方法、改进的关 联规则方法和改进的离群分析方法中选择至少两种联合进行数据挖掘的工作模式; 步骤6 :在不同的工作模式下,根据不同挖掘方法进行数据挖掘,得到的有用信息输出 到数据可视化模块进行显示。3. 根据权利要求2所述的用于支撑智慧城市运行管理的智能电网大数据挖掘方法,其 特征在于:所述的基于云计算的数据聚类分析方法的运行环境由两种不同类型的数据节点 组成:在从节点上负责数据的处理,在主节点上负责运行目标任务调度及不同节点之间的 数据共享;具体包括如下步骤: 步骤AOl :首先采用AP算法确定最佳聚类数的搜索范围,并利用有效性分析指标评估 该搜索范围内各聚类结果的质量,根据评估结果得到数据集聚类数Itjp,从而得到最佳聚类 数范围[2, ItJ,并将数据集聚类数Itjp作为基于云计算的数据聚类分析方法的输入; 步骤A02 :基于并行框架的方法,将输入的数据集进行随机划分,划分结果标记为数据 片splits、split2、split3、· · ·、和',并将各数据片均转化为〈key, value〉形式,作为 各map函数的输入; 步骤A03 :Map阶段:根据步骤AOl中输入的数据集聚类数Itjp对输入的数据片运用C均 值聚类算法进行分析,得到初始聚类中心,根据密度指标将数据集中每个数据点划分到数 据点附近的聚类中,直到所有的数据点都划分完毕; 步骤A04 :取所有map函数的输出,对输出结果进行汇总,并将汇总结果输出至Reduce 阶段,汇总方法为:对map函数输出的数据节点,以key值为索引进行分组和排序,将属于同 一聚类的数据点进行汇总; 步骤A05 =Reduce阶段:读取步骤A04的输出结果并进行汇总处理,处理结束后输出聚 类中心点及隶属于这个聚类中心的数据; 步骤A06 :对Reduce阶段的输出结果进行验证:采用Silhouette指标对输出结果进行 有效性分析,符合指标则作为最终结果进行输出并显示,否则返回到步骤A01,同时改变输 入最佳聚类数为VI。4. 根据权利要求2所述的用于支撑智慧城市运行管理的智能电网大数据挖掘方法,其 特征在于:所述的改进的关联规则方法,具体包括如下步骤: 步骤BOl :用户设定最小支持度和最小置信度,输入待处理数据事物库; 步骤B02 :基于分层划分技术的方法,对给定的数据事物库进行DIC算法分区,将数据 库划分为N片表区; 步骤B03 :计算每个表区内项目集的最小支持度; 步骤B04 :统计每个表区内的局部频繁项目集0,形成候选项目集,其中每个表区内最 小支持度大于设定的最小支持度的项目集为频繁项目集,i表示频繁项目集中的项目个数; k表示频繁项目集中第k个项目; 步骤B05 :进一步采用DHP算法,将每个表区的候选项目集中含有i-Ι个公共项目的局 部频繁项目集进行两两合并; 步骤B06 :对每个表区均执行步骤B04至步骤B05后,得到全局频繁项目集; 步骤B07 :执行Apriori算法第二步,计算全局频繁项目集的最小置信度,得到关联规 则。5. 根据权利要求2所述的用于支撑智慧城市运行管理的智能电网大数据挖掘方法,其 特征在于:所述的改进的离群分析方法,具体包括如下步骤: 步骤COl :根据用户的检测方向选择相应的子空间; 步骤C02 :在子空间中运用基于密度的聚类算法来检测子空间中差异性较大的离群数 据点; 步骤C03 :计算多个子空间属性的边际密度概率和子空间的联合密度分布概率来判断 子空间属性之间的相关性,划分出两类子空间:相关性较大的相关子空间和"独立的"子空 间; 步骤C04:选取相关性较大的子空间,并计算被怀疑的离群数据点相对于前述相关性 较大的子空间的尚群偏差程度的加权和; 步骤C05 :将步骤C04得到的计算结果与设定好的离群偏差加权和阈值比较,大于阈值 的则被认为是离群数据点; 步骤C06 :统计由步骤C05中得到的相对于相关程度大的子空间检测出的离群数据点 和个别独立的子空间中检测出的离群数据点作为最终结果输出并显示。
【专利摘要】一种用于支撑智慧城市运行管理的电网大数据挖掘系统及方法;从智能电网数据库中提取出所需的数据;对提取的数据进行分类整合处理得到所需的数据集;输入数据集和城市运行管理部门的运行任务目标;对运行任务目标进行分析;根据运行任务目标,基于云计算的MapReduce-APS方法、改进的关联规则方法和改进的离群分析方法,确定数据挖掘工作模式,选用其中一种方法单独执行数据挖掘的独立工作模式或者选用其中至少两种方法联合进行数据挖掘的联合工作模式;根据不同挖掘方法进行数据挖掘,得到的有用信息输出到数据可视化模块进行显示。不同的运行管理部门可以根据运行目标任务不同,进行不同挖掘方法和工作模式选择,从而得到具有针对性的有用信息,具有通用性。
【IPC分类】G06Q50/06, G06Q10/06
【公开号】CN104881735
【申请号】CN201510243729
【发明人】金鹏, 刘鑫蕊, 郭昆亚, 孙秋野, 邵枫, 陈斯, 张化光, 王智良, 刘爽
【申请人】国家电网公司, 国网辽宁省电力有限公司沈阳供电公司, 东北大学
【公开日】2015年9月2日
【申请日】2015年5月13日
转载请注明原文地址:https://www.famiwei.com/read-8138341.html

最新回复(0)