一种结构化数据本体学习中的概念映射方法

xiaoxiao2020-10-23  12

一种结构化数据本体学习中的概念映射方法
【技术领域】
[0001] 本发明设及一种结构化数据本体学习中的概念映射方法,属于数据语义集成领 域;特别设及基于语义相似度的概念映射。主要适用于数据集成、信息检索和知识管理等关 键领域。
【背景技术】
[0002] 本体学习的ntologyLearning)是将机器学习、统计学的原理和技术用于本体的 自动化构建和半自动化构建的过程,可W通过利用知识获取技术来降低本体构建的开销。 目前,虽然数据的结构类型愈加复杂,数据管理的方式的也越来越多,但大多数质量较高的 数据依然W结构化的形式存储在关系数据库中。各数据库中模式、结构、概念、关系、属性等 因素各不相同,通过本体学习技术可W将多源异构的数据整合为统一、标准的有机整体。研 究如何从结构化数据源中获取本体数据受到各国学者的广泛关注,世界万维网联盟W3C的 RDB2RDF工作组在其发布的调查报告中提到至少有15种开源工具支持将关系数据库数据 映射为本体数据。目前最新的研究成果是该组织开发的R2RML语言,为结构化数据本体学 习提供了映射标准,有利于完成异构结构化数据源到本体的映射。
[0003] 结构化数据本体学习是指将结构化数据源中的数据转化为概念明确的、规范化 的、可共享的本体。结构化数据本体学习可W分为两类,即从数据库中直接获取本体和数据 库转化为给定模型的本体。在一些学科领域中,已经存在比较规范的领域本体模型,因此通 过本体学习技术将结构化数据转化为符合领域本体模型的本体,能够获取质量更高、可用 性更好的本体,本文研究的即是给定本体条件下的结构化数据本体学习技术。结构化数据 本体学习中要解决概念映射和关系发现两个关键问题,其中概念映射是将数据库中的相关 词汇、术语转化为本体中概念的过程,是本体学习的必要步骤。概念映射生成的规则主要是 基于对概念之间语义相似度和映射阔值的考察,如何针对不同的数据应用环境自适应地确 定概念映射的相关参数是概念映射要解决的核屯、问题。

【发明内容】

[0004] 本发明的目的致力于解决结构化数据本体学习中概念映射问题。
[0005] 本发明的技术方案;一种结构化数据本体学习中的概念映射方法步骤如下:
[0006] (1)首先提取数据库的模式信息与本体中的结构信息。针对结构化数据本体学习 的特点,通过提取数据库的模式信息和本体的结构信息进行匹配,分析概念所在数据库的 属性,包括类型、定义域、值域、唯一性,将数据库中的数值型属性Int、Double、Boolean,转 化为本体的数值型属性Int、Floating、Double,将数据库中的字符型属性Char、Text,转化 为本体的字符型属性Literal、String,将数据库中的时间型属性Date、Datetime、Time,转 化为本体的时间型属性化tetime,化tetimeStamp,在对应该些属性的基础上,完成结构化 数据的概念到本体概念的映射;
[0007] (2)其次计算概念之间的语义相似度。针对结构化数据本体学习的特点, 提出了一种新的语义相似度计算方法,将Edit Distance的方法、基于Wor化et的 方法和基于Wikipedia的方法作为语义相似度的计算因子,Edit Distance因子的 计算公式为
基于Wor化et的方法是将同义关系定义为1,近 义关系定义为0. 9,包含关系定义为0. 7,无关则为0,基于Wikipedia的方法的计 算公式为
I通过输入样例数据,将各算子的权值代入到公式
中进行反复地迭代修正,使之成为最符合应用背 景的权值,然后将此最优权值用于该领域的语义相似度计算;
[0008] (3)第=步确定映射阔值5并完成映射,首先分析映射阔值5对映射效果影响, 确定具体数据应用背景下5取值的最优解,当5取值较大时,满足概念映射条件的数量 较少,映射的精度Precision将增大,而召回率Recall减小;5取值较小时,概念映射的 数量增加,召回率Recall增大导致精度Precision将减小,此处采用F-Measure为指标评 价5取值不同时算法的作用效果,通过输入某领域的样例数据,计算在不同映射阔值下 F-Measure的值,取5值使得F-Measure值最大时的值即为该领域最优映射阔值。本发明 的核屯、是;通过混合语义相似度算法,实现对不同领域领域的自适应本体学习。
[0009] 本发明的关键之一是:针对结构化数据本体学习的特点,通过提取数据库的模式 信息和本体的结构信息进行匹配,在分析概念的类型、定义域、值域、唯一性等属性的基础 上,完成结构化数据的概念到本体概念的映射。将数据库中的主要数据类型有数值型(Int, Double,Boolean…)、字符型(Qiar,Text…)、时间型值ate、Datetime、Time…)等类型, 分别与本体中的数值型(Int,Floating,Double…)、字符型(Literal、String…)、时间型 值atetime,DatetimeStamp…)等类型相对应。
[0010] 本发明的关键之二是:在结构化数据本体学习中提出了混合的语义相似度计算方 法,综合了基于编辑距离巧dit Distance)的方法、基于Wor化et的方法和基于Wikipedia 的方法,将此=种方法分别作为计算因子,分析其在不同的领域背景中发挥的权重影响。权 值的确定是通过输入样例数据,将各算子的权值代入到公式中进行反复地迭代修正,使之 成为最符合应用背景的权值。然后将此最优权值用于该领域的语义相似度计算。
[0011] 本发明的关键之S是;确定映射阔值S,通过分析映射阔值5对映射效果影响, 确定具体数据应用背景下5取值的最优解。5取值较大时,满足概念映射条件的数量较 少,映射的精度Precision将增大,而召回率Recall减小;5取值较小时,概念映射的数量 增加,召回率Recall增大导致精度Precision将减小。采用F-Measure为指标评价5取 值不同时算法的作用效果,通过输入某领域的样例数据,计算在不同映射阔值下F-Measure 的值,使得F-Measure值最大的5即为该领域最优映射阔值。
[0012] 本发明的有益效果;概念映射是通过计算概念之间在特定数据应用环境中语义相 似度,实现各数据源中概念到本体概念的映射。本发明该方法首先分析关系数据库模式信 息与本体的结构信息,将提取出的实体概念进行匹配;其次混合了几种经典的语义相似度 计算方法,通过测试样例数据计算出最优算子权值和映射阔值,增强算法在不同领域的适 用性;最后对满足领域最优映射阔值的概念进行映射。相比较常用的概念映射方法,本发明 能够显著提高概念映射的精度、召回率和F-Measure,对于实现不同领域的自适应本体学习 具有重要价值。
【附图说明】
[0013] 图1概念映射模型框架
【具体实施方式】
[0014] 本发明提出一种结构化本体学习中的概念映射方法,利用本发明,可W对通过考 察结构化数据的模式信息与目标本体的结构信息,自动抽取出实体概念,计算同类概念之 间的语义相似度在最优阔值下完成映射过程。
[0015] 本方法的运行包括如下步骤:
[0016] 1.提取数据库的模式信息与本体中的结构信息
[0017] 关系数据的结构、联系和约束的描述称为关系数据模式巧elational Data Schema),通常由关系、字段集及其关联的属性元素等构成,其结构如表1所示。
[0018] 表1关系数据模式结构表
[0019]
[0020] 定义1结构化数据源(Struc化redDataSource)。在数据集成环境E中,包含n 个结构化数据来源D,表示为E=化1,〇2, . . .,D。}。
[0021] 定义2关系巧elation)。在关系数据库中,一个关系R中包括关系名咕、字段集 Fs、主键RpK、外键RpK、唯一键Ruk等元数据信息,表示为R=出^,Fs,RpK,RpK,RmJ。
[00过定义 3 字段集(SetofFields)。Fs= {F|F;=Fn,Ft,Fl,Fnl,Fd,VfK其中F代表 关系R中的一个字段,町为字段名,FT为字段类型,F^为字段度,FwJ戈表字段是否为空,Fd 表示默认值,Vp表示相应元组的字段值。
[0023] 本体提供了客观世界的一个概念模型,描述了客观世界中概念的属性定义及相互 之间的关系。本文所设及的本体是指符合RDF/XML语法的本体,下面参考Gomez Perez定 义的五元组本体模型,给出本体的形式化描述。
[0024] 定义4本体类(Class)。一个本体类化中通常包括类名C、结构关系SR、属性集Ps、 实例6,记为化={0,5私口5,6}。其中,(:、51?、口5通常是从领域内的术语订61'111)和关系中提取 出的,类与类之间的结构关系主要有从属关系(subClassOf)和等价关系巧quivalentTo) 等。
[00幼定义5属性集(SetofProperties)。属性集Ps可表示为Ps=IP。,PJ,其中P。 为对象属性,描述类与其他对象之间的关系;Pd为数据类型属性,定义了具体的数据类型, 用于描述属性信息。
[0026] 语义依赖于具体的环境和领域而存在,其相似程度在不同的具体应用中有不同的 含义。例如"苹果"一词,在生物学领域代表一种水果,而在电子科技领域代表一种商业品 牌;"苹果"与"小米"在生物学领域中处于不同的类别,相似度较小,而在电子科技领域,"苹 果"与"小米"都是电子科技公司,相似度 较大。结构化数据的本体学习通常是针对某具体 领域的,本文研究数据库中的关系名、字段名与本体中的类名、数据类型属性之间的映射, 此处将咕与Fw记为数据库的概念Ct,Pd与C记为本体的概念C。。下面给出语义相似度的 定义。
[0027] 定义6语义相似度(SemanticSimilarity)。数据库中概念Cf与本体C。中概念 的语义相似度表示为Sim(Cf,c。),其取值范围是[0,1]。若两概念之间为同名或在领域主题 词典中为同义词关系的,其相似度为1 ;若无相匹配的字符并在词典和语料库中无任何关 系的,其相似度为0,其它情况的语义相似度都在(〇,1)之间。
[0028] 2.计算概念之间的语义相似度
[0029] 影响语义相似度的因素有概念的名称、数据类型、词典关系、语境关联等信息,结 合常用的语义相似度计算方法,将各方法作为计算因子(简称算子)纳入到计算中,分析各 算子对语义相似度的影响,W提高语义相似度计算的精度。
[0030] 1.概念名称算子
[0031] 该算子用于计算Cf与C。在字符串层面的语义相似度,记为Str(Ct,c。)。采用编辑 距离的方法进行计算,设Cf的为Sti.. .s",C。为S。1.. .S。。,设编辑距离D(心C。)为Cf转换到 C。所需要的最少的插入、删除和替换操作数目。概念名称算子的计算公式如式(1),其中a 为常数。
[003引
(1 )
[003引 2.数据类型算子
[0034] 该算子用于判断C,与C。的数据类型是否匹配,记为Type(c,,C。)。数据库中的数 据类型主要有数值型(Int,Double,Boolean. ..)、字符型(Qiar,Text. ..)、时间型值ate、Datetime、Time...)等类型,分别与本体中的数值型(Int,Floating,Double. ..)、字符型 (Literal、String. ..)、时间型值atetime,DatetimeStamp...)等类型相对应。如果Cf与 C。的数据类型一致,则Type(Ct,C。)的值为1,反之为0。
[003引 3.词典关系算子
[0036] 该算子用于计算C,与C。在领域主题词典中的关系,记为Die(C,,C。)。领域主题词 典中通常包括领域内的概念、同义关系、近义关系、术语释意等信息,本文假定词典中概念 涵盖了所有的C。,C,与C。同义时,其词典关系为1;ct与C。近义,其词典关系为0. 9;ct存在 于C。的术语释意中,则其词典关系为0.7,其计算公式如式(2)所示。
[0037] (2)
[00測 4.语境关联算子
[0039] 该算子用于计算C,与C。在语料库环境中的关系,记为化V(C,,C。)。采用共现分析 (Co-occurrenceAnalysis)的方法,统计Cf与C。在同一文档中同时出现的概率得出语义 上的相关性,计算公式如式(3)所示,其中p(Cf)、p(c。)表示Cf与C。在文档中出现的概率, P(Cr,C。)表示Cr与C。在文档中同时出现的概率。
[0040]
(3)
[0041] 结合W上算子给出综合语义相似度的计算公式如式(4)所示,此公式不包括字符 全等或概念同义时语义相似度为1的情况,其中5,、5。、5,表示概念名称算子、词典关系 算子、语境关联算子对语义相似度的影响权值,其加和为1。
[0042]
(4)
[0043] 3.确定概念映射阔值
[0044] 针对某具体应用领域,输入样例数据进行学习训练,将映射阔值5进行反复 地迭代修正,使之成为最符合应用背景的映射阔值,保证最优的映射效果。使用精度 (Precision)、召回率化ecall)和综合评价指标(F-Measure)作为评价指标,计算公式如式 (5)、式做、式(7)所示。
[0048] 在不同的数据应用背景中,CM0L计算公式中的各参数对语义相似度的影响程度是 不一样的,人为确定的经验参数值并不具有普遍的应用意义。因此在具体定领域的概念映 射中,首先要针对样例数据进行学习训练,经过反复的迭代修正,然后计算出最符合该领域 背景的5,、5。、6。和映射阔值5。下面针对5组数据集进行测试,具体信息如表2所示。
[0049] 实验1. CM0L算子权值计算
[0050] 首先测试各数据在单一算子作用下的映射效果,并记录F-Measure的值。然后将 5,、5。、6,在[0,0.8]的范围内进行迭代计算,计算出在指定映射阔值为0.7的条件下 F-Measure的最大值。使F-Measure获得最大值的5s、5。、Se的取值即是该数据应用背 景下的最优权值,如表3所示。
[005。 表2测试数据集
[0052]
[0055] 实验2. CMOL映射阔值确定
[0056] 本实验通过分析映射阔值5对映射效果影响,确定具体数据应用背景下5取值 的最优解。5取值较大时,满足概念映射条件的数量较少,映射的精度Precision将增大, 而召回率Recall减小;5取值较小时,概念映射的数量增加,召回率Recall增大导致精度 Precision将减小。因此仍采用F-Measure为指标评价5取值不同时算法的作用效果。实 验结果表明,针对该五组测试数据的最优5值分别为0.7,0. 7,0. 7,0. 6,0. 6,如表4所示。
[0057] 表4最优阔值性能表现
[0058]
[0059] 实验3.本实验参考文献错误!未定义书签。中的实验方法,针对测试数据进行实 验,对比CM0L与SMap、C0MA++、Lily和AROMA四种映射方法的性能。从
[0060] 表5中可W看出,在精度上CM0L明显高于SMap、C0MA++和Lily,略高于AROMA。 在召回率上,CMOL略高于SMap,远高于C0MA++、Lily和AROMA,如表6所示。对于综合评价 指标(F-Measure),CM0L较其他方法体现出了明显的优势,F-Measure值分别超过其他方法 5%、13%、10%、10%,如表 7 所示。
[0061] 表5各映射方法性能对比(指标;Precision)
[0062]
[0067] 综上所述,本发明所提方法CMOL能够显著提高概念映射的精度、召回率和F-Measure,对于实现不同领域的自适应本体学习具有重要价值。
【主权项】
1. 一种结构化数据本体学习中的概念映射方法,其特征是该方法步骤如下: (1) 首先提取数据库的模式信息与本体中的结构信息,针对结构化数据本体学习的特 点,通过提取数据库的模式信息和本体的结构信息进行匹配,分析概念所在数据库的属性, 包括类型、定义域、值域、唯一性,将数据库中的数值型属性1拉、0〇1*1 6、8〇〇1册11,转化为本 体的数值型属性Int、Floating、Double,将数据库中的字符型属性Char、Text,转化为本体 的字符型属性Literal、String,将数据库中的时间型属性Date、Datetime、Time,转化为本 体的时间型属性Datetime,DatetimeStamp,在对应这些属性的基础上,完成结构化数据的 概念到本体概念的映射; (2) 其次计算概念之间的语义相似度,针对结构化数据本体学习的特点,提出 了一种新的语义相似度计算方法,将Edit Distance的方法、基于Wordnet的方法 和基于Wikipedia的方法作为语义相似度的计算因子,Edit Distance因子的计 算公式为_于Wordnet的方法是将同义关系定义为1,近义 关系定义为〇. 9,包含关系定义为0. 7,无关则为0,基于Wikipedia的方法的计算 公式为,通过输入样例数据,将各算子的权值代入到公式中进行反复地迭代修正,使之成为最符合应用 背景的权值,然后将此最优权值用于该领域的语义相似度计算; (3) 第三步确定映射阈值δ并完成映射,首先分析映射阈值δ对映射效果影响,确定 具体数据应用背景下δ取值的最优解,当δ取值较大时,满足概念映射条件的数量较少, 映射的精度Precision将增大,而召回率Recall减小;δ取值较小时,概念映射的数量增 加,召回率Recall增大导致精度Precision将减小,此处采用F-Measure为指标评价δ取 值不同时算法的作用效果,通过输入某领域的样例数据,计算在不同映射阈值下F-Measure 的值,取S值使得F-Measure值最大时的值即为该领域最优映射阈值。
【专利摘要】本发明属于数据语义集成领域,特别涉及基于语义相似度的概念映射。主要适用于数据集成、信息检索和知识管理等关键领域。本体学习是将数据转化为本体的有效技术途径。针对结构化数据本体学习中的概念映射问题,提出了一种基于语义相似度的概念映射方法。该方法首先分析关系数据库模式信息与本体的结构信息,将提取出的实体概念进行匹配;其次混合了几种经典的语义相似度计算方法,通过测试样例数据计算出最优算子权值和映射阈值,增强算法在不同领域的适用性;最后对满足领域最优映射阈值的概念进行映射。
【IPC分类】G06F17/30
【公开号】CN104881473
【申请号】CN201510288261
【发明人】李新明, 李亢, 刘 东, 李艺, 邢维艳, 朱鸿乔, 饶磊, 闫雪飞, 王寿彪, 于少波, 李强
【申请人】中国人民解放军装备学院
【公开日】2015年9月2日
【申请日】2015年6月1日
转载请注明原文地址:https://www.famiwei.com/read-8138602.html

最新回复(0)