一种面向电网调控运行的数据血统分析方法

xiaoxiao2020-10-23  20

一种面向电网调控运行的数据血统分析方法【
技术领域
】[0001]本发明设及一种电网调控运行数据分析方法,尤其设及一种面向电网调控运行的数据血统分析方法,属于电力系统调度自动化
技术领域
。【
背景技术
】[0002]随着智能电网调度技术支持系统(SG-OS巧的持续建设,电力调度数据中屯、所存储的数据越来越多。该些数据主要包含电网运行类、生产管理类和市场运营类等方面的数据。智能电网在运行过程中,数据不可避免地会发生跳变、不刷新等异常错误,由于数据的存储方式和数据的分散性,让用户很难直接找到异常错误的相关数据并进行分析,进而找到异常发生的原因。随着智能电网的发展,电网生产运行和管理对数据准确性提出更高要求,调度数据必须具有可靠性和完整性,才能准确反映电网运行情况。[0003]在信息化时代,对于调度所有办公自动化业务,应用与数据是密不可分的。目前,数据使用者对电力数据有异常疑问时无法智能追踪数据来源,更多是通过咨询厂家或者根据自己的工作经验来分析数据来源,在工作中大大降低了工作效率和数据处理的准确度。随着电网业务需求逐步增多,电网数据质量要求越来越高,在电网实际应用业务中难免存在异常数据,仅仅通过智能电网调度数据模型,对于异常数据透明化查找的支持非常欠缺,不能很快的找到异常数据的关联数据,进而对异常进行分析、处理。例如调度上报业务,需要统计全网日电量,各个地区上报给省调,省调汇总再上报国调,当省调对各个地方的日电量进行汇总发现数据异常时,通常需要人工判断查找各地区上报分量,不能很快的找到异常数据的关联数据,大大浪费调度员的上报时间,而且,在异常数据处理上人工干预太多,主观性过强,准确度不高,缺少对数据透明化的追踪查找,不能满足智能电网调度管理的实际应用要求。[0004]在公开号为CN104424269A的中国专利申请中,公开了一种数据血统分析方法与装置,包括基于模式配置对查询语句进行分析,W识别其中的目标表、目标字段、源表与源字段;获取各类数据库系统定义的或用户自定义的元数据并利用元数据对查询语句的模糊字段进行精确匹配;根据识别出的目标字段与源字段的字段追溯顺序生成查询语句的数据血统关系;通过多层语句解析分析出多条查询语句之间的数据血统关系。该方案能够实现对查询语句中脚本数据的追踪。但是,现有技术并没有将其应用在智能电网调度技术支持系统中,用W分析整合电网调控运行数据。【
发明内容】[0005]针对现有技术的不足,本发明所要解决的技术问题在于提供一种面向电网调控运行的数据血统分析方法。[0006]为实现上述发明目的,本发明采用下述的技术方案:[0007]一种面向电网调控运行的数据血统分析方法,包括如下步骤:[000引S1,为电网调控运行数据建立数据血统结构,组成哈希表;[0009]S2,发现数据异常时,在数据血统结构中定位目标数据的节点;[0010]S3,基于数据血统结构和目标数据的节点,遍历捜索数据队列,查询所述捜索数据队列的队头元素的数据血统信息,将数据血统信息中的基因信息W及遗传运算符加入源数据队列末尾,将最终的源数据队列作为所述目标数据的来源的追踪结果;[0011]S4,将追踪结果进行可视化呈现,供调度员分析、决策。[0012]其中较优地,在步骤S1中,对电网调控运行数据进行分析,W生成识别源数据、中间数据和目标数据的业务数据。[0013]其中较优地,所述哈希表包含业务数据和数据血统信息;[0014]所述数据血统信息包含数据基因标识和遗传因子两部分。[0015]其中较优地,所述数据基因标识包括数据所在数据库表、字段W及行键值;[0016]所述行键值为任意值或空值。[0017]其中较优地,根据基因标识的所述数据库表、所述字段W及所述行键值,通过哈希函数为所述基因标识生成一个唯一标识。[0018]其中较优地,所述中间数据不在所述追踪结果中进行存储。[0019]其中较优地,在步骤S3中,对目标数据的来源进行追踪具体包括如下步骤:[0020]S31,获取目标数据的基因标识的唯一标识,并将所述唯一标识放入捜索数据队列;[002US32,遍历捜索数据队列,若捜索数据队列为空,则跳转到步骤S34;否则,取出队头元素,W所述队头元素为键在所述哈希表中查询所述队头元素的数据血统信息;[0022]S33,若数据血统信息中的遗传因子项为空,将数据血统信息中的基因信息放入源数据队列末尾,转向步骤S32;否则取出遗传因子中遗传运算符,加入源数据队列末尾,同时取出遗传因子中双亲的唯一标识,并加入捜索数据队列末尾,转向步骤S32;[0023]S34,将源数据队列作为追踪结果提取出来。[0024]其中较优地,在步骤S31中,所述获取目标数据的基因标识的唯一标识,并将所述唯一标识放入捜索数据队列具体包括如下步骤:[0025]首先,取出目标数据的基因标识,包括;数据库表名、字段名W及数据行键值;[0026]然后,初始化捜索数据队列;[0027]最后,使用哈希函数算出目标数据的唯一标识,将所述唯一标识放入所述捜索数据队列中。[002引本发明所提供的面向电网调控运行的数据血统分析方法,为电网调控运行数据建立数据血统结构,当发生数据异常时,通过采用基于宽度优先遍历的数据血统追踪算法对目标数据的来源进行追踪,将追踪结果可视化呈现给调度员,供调度员分析、决策。该方法可W快速地找到数据异常的相关数据W及数据之间的相互关系,在电网调度应用中便于业务数据来源的追踪,更好的满足调度数据业务的需求,为调度业务数据提供满足安全性、可靠性、一致性要求的有效数据,有效地提高了调度生产辅助决策能力。【附图说明】[0029]图1为本发明所提供的面向电网调控运行的数据血统分析方法的流程图;[0030]图2为本发明所提供的数据血统分析方法中,单一电网调控运行数据的数据血统结构示意图;[0031]图3为本发明所提供的数据血统分析方法中,电网调控运行数据建立的数据血统结构的整体结构示意图;[0032]图4为本发明所提供的数据血统分析方法中,采用数据血统追踪算法对目标数据的来源进行追踪的流程图。【具体实施方式】[0033]下面结合附图和具体实施例对本发明的技术内容进行进一步的详细说明。[0034]本发明针对数据异常难W追踪分析该一问题,提供一种面向电网调控运行的数据血统分析方法。该方法将采集的电网调控运行数据进行分析,W识别源数据、中间数据和目标数据。其中,源数据是电力调度系统直接采集来的原始数据;中间数据和目标数据是在其他数据(源数据或中间数据)的基础上通过计算得到的数据,且中间数据只是在计算的过程中出现,并没有保存在数据库(追踪结果)中,能最大限度地简化追踪结果,使追踪结果中只显示与异常数据相关联的数据W及运算关系,使追踪结果一目了然,提高了异常数据的处理效率。为上述=类数据添加数据血统信息,包含数据基因标识和遗传因子两部分,最终生成哈希表HTLine。基因标识由数据所在数据库表、字段、行键值(可W为空)W及数据唯一标识组成。而遗传因子由双亲数据标识W及遗传运算符号组成,用W描述数据的转换过程。建立数据血统结构的电网调控运行数据被持久化在数据库血统信息表中,并在系统运行过程中被加载入内存W加快查找。当调度员发现数据异常时,启动对应数据的血统追踪分析过程,逐层查找数据的祖先,并将与该数据有血缘关系的所有祖先返回,供调度员分析、决策。[0035]其中,数据血统是近几年随着数据库和网络的发展而发展起来的一个研究领域,其内容主要包括数据血统的计算、存储、传播和查询等。数据血统记载了对数据处理的整个历史,包括数据的起源和处理该些数据的所有后继过程(数据产生、并随着时间推移而演变的整个过程)。数据血统的相关研究近几年吸引了数据集成、Web捜索、语义标注、海量存储等领域学者的广泛关注。[0036]数据血统关系是指数据之间的上下文关系,数据的血统分析是对数据库系统追溯查询结果的来源,W衡量数据的可信度、数据的质量。通过数据血统追踪,在分布数据共享时可W解决数据的可信度、质量、版本信息等,对于各种导出数据集也能解决该些问题。通过数据血统追踪,可W获得数据在数据流的演化过程。[0037]如图1所示,在本发明所提供的面向电网调控运行的数据血统分析方法中,首先,为电网调控运行数据建立数据血统结构。然后,基于数据血统结构和目标数据的节点,设计基于宽度优先遍历的数据血统追踪算法对目标数据的来源进行追踪,找到与异常数据相关联的数据W及运算关系,组成追踪结果。最后,将追踪结果可视化呈现,供调度员分析、决策。下面对该一过程做详细具体的说明。[003引S1,为电网调控运行数据建立数据血统结构,组成哈希表。[0039]数据血统分析包括对数据的血统结构定义,血统追踪算法W及追踪结果可视化呈现=部分。在本发明所提供的实施例中,数据血统结构设计主要包含两方面;业务数据和数据血统信息。业务数据是对前文中定义的源数据、中间数据及目标数据的统称。在对电网调控运行数据进行抽取时,将其转化为业务数据,然后分别为源数据、中间数据和目标数据定义数据血统信息,包括数据基因标识和遗传因子两部分。数据基因标识由数据所在数据库表、字段W及可W为空的行键值组成,并通过哈希函数,根据基因标识为数据生成一个唯一标识,即;[0040]gene=(table,column,rowkey,id)[004U其中,Id=hash(t油le,column,rowk巧)。对于中间数据,由于其没有基因标识数据,则为其随机生成一个与上述哈希函数生成结果不同的唯一标识。而遗传因子由双亲数据标识W及遗传运算符号组成,用W描述数据的转换过程,即;[0042]inherit=(idi,id],op)[0043]其中,哗SA/当前第1页1 2  …中间数据和目标数据都有遗传因子信息,源数据没有遗 传因子信息,可W据此对其进行区分。建立数据血统结构的电网调控运行数据被持久化在 数据库血统信息表中,并在系统运行过程中被加载入内存,形成一个W数据id为键,数据 基因及遗传因子为值的哈希表HTLine,即构建为数据血统结构。其中,哈希表HTLine表示 为:
[0044] HTLine= {id, (gene,inherit)}
[0045] 在本发明所提供的实施例中,W省调调度上报应用为例进行说明。省调调度上报 过程需要统计上报各个地调的日电量和各个电厂发电量,在省调汇总后上报国调。省调汇 总中发现全网日电量有异常,该时将启动数据来源追踪过程来查找异常数据来源。所W,在 进行统计W前,会为电网调控运行数据建立数据血统结构。
[0046] 如图2所示,为电网调控运行数据建立数据血统结构当业务数据附加了数据血统 信息后,通过数据基因标识可W定位数据血统信息,并反向追踪查找到数据的双亲,便于追 溯数据来源。在本发明所提供的实施例中,W省调上报全网总加数据为例,迂宁省日电量= 大连日电量+鞍山日电量+阜新日电量+……,上述公式中所包含的电网调控运行数据可W 建立如图3所示的数据血统结构。
[0047] S2,发现数据异常时,在数据血统结构中定位目标数据的节点。
[0048] 当调度员发现数据异常时,在数据血统结构中定位目标数据的节点。在本发明所 提供的实施例中,在数据血统结构中定位的目标数据的节点的id为006,将其放入捜索数 据队列(QSearch队列)中,通过数据血统结构向前追踪。
[0049] S3,基于数据血统结构和目标数据的节点,采用基于宽度优先遍历的数据血统追 踪算法对目标数据的来源进行追踪。
[0050] 当在数据血统结构中定位目标数据的节点后,将其放入QSearch队列中,启动对 应的数据血统追踪分析过程,如图4所示,具体包括如下步骤:
[0051] S31,取出目标数据的基因标识,初始化待捜索数据队列、源数据队列,并用哈希函 数算出目标数据的唯一标识,将此唯一标识放入QSearch队列。
[0052] 启动对应的数据血统追踪分析过程,首先取出目标数据的基因标识,包括:数据 库表名、字段名W及数据行键值。其中,数据行键值可W为空。然后,初始化捜索数据队列 (QSearch队列)、源数据队列(QSource队列)。最后,使用哈希函数算出目标数据的唯一标 识。其中,目标数据的唯一标识id=hash(t油le,column,rowkey)将id放入QSearch队 列。
[005引S32,遍历QSearch队列,若QSearch队列为空,则跳转到步骤S34 ;否则,取出队 头元素,W此元素为键在哈希表HTLine中查询得到该队头元素的数据血统信息<gene, inherit〉。
[0054] S33,若数据血统信息中的遗传因子项(inherit)为空,将该数据的基因信息放入 QSource队列末尾,转向步骤S32 ;否则取出遗传因子中遗传运算符op,加入QSource队列 末尾,同时取出遗传因子中的双亲id值并加入到QSearch队列末尾,转向步骤S32。
[0化5]若数据血统信息中的遗传因子项(inherit)为空,说明该数据为源数据,不存在 亲子数据,则将该数据的基因信息放入QSource队列末尾,转向步骤S32 ;否则,取出遗传 因子中遗传运算符op,加入QSource队列末尾,同时取出遗传因子中的双亲id值并加入到 QSearch队列末尾,转向步骤S32。
[0化6] 在本发明所提供的实施例中,首先将006节点的遗传运算符"+ "放入输出结果 QSource队列末尾。然后通过006节点存储的遗传因子信息(<004,005,+〉)找到ID为004 和005的两个节点,分别进行处理。其中,004节点是中间数据的节点,将其遗传运算符"+ " 放入QSource队列末尾,并取出遗传因子中的两个双亲节点;001和002,放入QSearch队 列。005是源数据的节点,将其放入QSource队列。
[0化7] 继续取出QSearch队列的队头元素;001和002,001和002均为源数据的节点,将 其信息直接放入QSource队列。
[0化引S34,将QSource队列作为追踪结果提取出来,算法结束。
[0化9] 在本发明所提供的实施例中,基于宽度优先遍历的数据血统追踪算法对目标数据 的来源进行追踪,输出结果QSource队列为:
[0060] <+, +,005,001,002)
[0061] 该一队列可W非常简单的使用前缀表达式解析方法转换为数学算式。进而找到目 标数据的相关数据,W及目标数据和该相关数据的运算关系。
[0062] 通过数据血统追踪算法找到源数据,根据源数据基因标识信息可W精确的找到对 应的数据表、字段W及数据的具体位置。
[0063]S4,将追踪结果进行可视化呈现,供调度员分析、决策。
[0064] 在步骤S3中的基于宽度优先遍历的数据血统追踪算法中,对数据血统信息采用 了宽度优先遍历的捜索策略,因此数据血统追踪算法的执行结果中的遗传运算符、数据遗 传信息是按照"波兰表示法"(也称前缀表示法)的顺序出现在QSource队列中的。在对追 踪结果进行可视化呈现的过程中,在没有括号的情况下,仍然可W无歧义地对源数据之间 的运算关系进行正确的解析。将追踪结果可视化呈现后,供调度员分析、决策。在电网调度 应用中便于业务数据来源的追踪,更好的满足调度数据业务的需求,为调度业务数据提供 满足安全性、可靠性、一致性要求的有效数据。
[00化]综上所述,本发明所提供的面向电网调控运行的数据血统分析方法,为电网调控 运行数据建立数据血统结构,当发生数据异常时,通过采用基于宽度优先遍历的数据血统 追踪算法对目标数据的来源进行追踪,将追踪结果可视化呈现给调度员,供调度员分析、决 策。该方法可W快速地找到数据异常的相关数据W及数据之间的相互关系,及时有效地对 其进行处理,提高了调度生产辅助决策能力,进而提高了电网运行安全稳定性。
[0066] 上面对本发明所提供的面向电网调控运行的数据血统分析方法进行了详细的说 明。对本领域的一般技术人员而言,在不背离本发明实质精神的前提下对它所做的任何显 而易见的改动,都将构成对本发明专利权的侵犯,将承担相应的法律责任。
【主权项】
1. 一种面向电网调控运行的数据血统分析方法,其特征在于包括如下步骤: S1,为电网调控运行数据建立数据血统结构,组成哈希表; 52, 发现数据异常时,在数据血统结构中定位目标数据的节点; 53, 基于数据血统结构和目标数据的节点,遍历搜索数据队列,查询所述搜索数据队列 的队头元素的数据血统信息,将数据血统信息中的基因信息以及遗传运算符加入源数据队 列末尾,将最终的源数据队列作为所述目标数据的来源的追踪结果。2. 如权利要求1所述的面向电网调控运行的数据血统分析方法,其特征在于: 在步骤Sl中,对电网调控运行数据进行分析,以生成识别源数据、中间数据和目标数 据的业务数据。3. 如权利要求1所述的面向电网调控运行的数据血统分析方法,其特征在于: 所述哈希表,包含业务数据和数据血统信息; 所述数据血统信息包含数据基因标识和遗传因子两部分。4. 如权利要求3所述的面向电网调控运行的数据血统分析方法,其特征在于: 所述数据基因标识包括数据所在数据库表、字段以及行键值; 所述行键值为任意值或空值。5. 如权利要求4所述的面向电网调控运行的数据血统分析方法,其特征在于: 根据基因标识的所述数据库表、所述字段以及所述行键值,通过哈希函数为所述基因 标识生成一个唯一标识。6. 如权利要求1或2所述的面向电网调控运行的数据血统分析方法,其特征在于: 所述中间数据不在所述追踪结果中进行存储。7. 如权利要求1所述的面向电网调控运行的数据血统分析方法,其特征在于在步骤S3 中,对目标数据的来源进行追踪具体包括如下步骤: S31,获取目标数据的基因标识的唯一标识,并将所述唯一标识放入搜索数据队列; 532, 遍历搜索数据队列,若搜索数据队列为空,则跳转到步骤S34;否则,取出队头元 素,以所述队头元素为键在所述哈希表中查询所述队头元素的数据血统信息; 533, 若数据血统信息中的遗传因子项为空,将数据血统信息中的基因信息放入源数据 队列末尾,转向步骤S32;否则取出遗传因子中遗传运算符,加入源数据队列末尾,同时取 出遗传因子中双亲的唯一标识,并加入搜索数据队列末尾,转向步骤S32 ; 534, 将源数据队列作为追踪结果提取出来。8. 如权利要求7所述的面向电网调控运行的数据血统分析方法,其特征在于在步骤 S31中,所述获取目标数据的基因标识的唯一标识,并将所述唯一标识放入搜索数据队列具 体包括如下步骤: 首先,取出目标数据的基因标识,包括:数据库表名、字段名以及数据行键值; 然后,初始化搜索数据队列; 最后,使用哈希函数算出目标数据的唯一标识,将所述唯一标识放入所述搜索数据队 列中。
【专利摘要】本发明公开一种面向电网调控运行的数据血统分析方法,包括如下步骤:S1,为电网调控运行数据建立数据血统结构,组成哈希表;S2,发现数据异常时,在数据血统结构中定位目标数据的节点;S3,基于数据血统结构和目标数据的节点,遍历搜索数据队列,查询所述搜索数据队列的队头元素的数据血统信息,将数据血统信息中的基因信息以及遗传运算符加入源数据队列末尾,将最终的源数据队列作为所述目标数据的来源的追踪结果。本发明可以快速地找到数据异常的相关数据以及数据之间的相互关系,及时有效地对其进行处理,提高了调度生产辅助决策能力,进而提高了电网运行安全稳定性。
【IPC分类】G06F17/30, G06Q50/06
【公开号】CN104881427
【申请号】CN201510152697
【发明人】武江, 何蕾, 李勇, 曹宇, 刘涛, 庞传军, 苏迤, 杨笑宇, 喻宏元, 徐家慧
【申请人】北京科东电力控制系统有限责任公司, 华中电网有限公司
【公开日】2015年9月2日
【申请日】2015年4月1日
转载请注明原文地址:https://www.famiwei.com/read-8138648.html

最新回复(0)