基于联想网络的语义相关性计算方法
【技术领域】
[0001] 本发明设及自然语言处理,具体地,设及基于联想网络的语义相关性计算方法。
【背景技术】
[0002] 经检索,发现如下相关文献:
[0003] 相关检索结果1 :
[0004] 申请(专利)号;201010191677.X,名称;中文词语语义相似度度量方法
[0005] 该专利文献提出了一种中文词语语义相似度度量方法,并且与其它的传统方法相 比,该专利文献对于语义相似度有更好的区分度,并且计算结果更符合人的主观感觉。
[0006] 技术要点比较:
[0007] 1.语义相似性是语义相关性的一种特例。该专利文献只能计算词语的语义相似 性,无法计算词语之间的语义相关性;而本发明可W准确计算更加一般性的语义相关性。 [000引 2.该专利文献只能计算词语之间的语义关系;而本发明通过首先建立词语联想 网络,进而基于已构建的联想网络设计算法的方式,使得本发明不仅能够计算词语之间的 语义关系,并且可W计算句子和短文本之间的语义关系。
[0009] 相关检索结果2 ;
[0010] 申请(专利)号;201110343122. 7,名称;一种基于上下文语境的词的语义相关性 度量方法
[0011] 该专利文献基于统计方法度量词自身的语义相关性;度量词在上下文语境中的语 义相关性;将词自身的语义相关性和词在上下文语境中的语义相关性进行融合,从而获得 基于上下文语境的词的语义相关性度量值。
[001引技术要点比较:
[0013] 1.该专利文献的词对共现频率只有一种,基于"归一化谷歌距离"统计得到;而本 发明中词对共现频率共有五种,利用利用维基百科丰富的、半结构化的文本资源统计得到。 因此本发明中所采用的词对共现频率更加丰富,且较之归一化"谷歌距离"更加可靠。
[0014] 2.该专利文献着重计算特定的上下文语境中词的语义相关性;而本发明在词语 语义相关性计算方面,着重普适的、计算上下文语境无关的词语相关性。
[0015] 相关检索结果3;
[0016] 申请(专利)号;201210037968. 2,名称;一种基于维基百科度量概念之间语义相 关度的方法
[0017] 该专利文献提出了一种能用维基百科中的类别来表示概念之间的语义关系的基 于维基百科度量概念之间语义相关度的方法,包括离线步骤和在线步骤;在离线步骤中,从 维基百科的原始数据中利用错文本链接生成概念之间的初始关系和概念与类别之间的初 始关系。
[001引技术要点比较:
[0019] 1.该发明从维基百科中提取概念和概念之前通过错文本链接得到的链接关系作 为算法的基础统计信息资源;而本发明共利用五种不同的词对共现关系作为基础统计信息 资源,其中"普通页面标题与正文内超链接词语的共现"一项资源本质上等价于该发明所用 的"错文本链接"资源,因此本发明所用的统计资源更为丰富。
[0020] 2.该发明在计算语义相关性的过程中没有利用任何人脑屯、理现象有关的数据; 而发明基于"自由联想"屯、理现象捕捉人脑对于语义相关性的度量方法,并模拟人脑"自由 联想"屯、理现象构建联想网络,基于已构建的联想网络设计算法计算词对或句对之间的语 义相关性。语义相关性的计算准确与否最终是按照人脑的衡量为标准的,因此本发明可W 更有效地捕捉人脑对于语义相关性的理解和度量并实现更为准确的计算。
【发明内容】
[0021] 针对现有技术中的缺陷,本发明的目的是提供一种基于联想网络的语义相关性计 算方法。本发明要解决的技术问题体现在W下几点:
[0022] 1)利用维基百科丰富的、半结构化的文本资源统计词对共现频率。
[0023] 2)基于"自由联想"屯、理现象捕捉人脑对于语义相关性的度量方法。
[0024]如模拟人脑"自由联想"屯、理现象构建联想网络,并基于已构建的联想网络设计算 法计算词对或句对之间的语义相关性。
[0025] 根据本发明提供的一种基于联想网络的语义相关性计算方法,包括如下步骤:
[0026]步骤1,共现词频统计步骤
[0027] 步骤1. 1 ;解析维基百科数据库转储文件,对多种不同的词对共现方式统计词对 共现频率,并统计词对中单个词的出现频率;
[002引步骤1. 2 ;根据所述词对共现频率和词对中单个词的出现频率,对每种词对共现 方式计算词对之间的联想概率;
[0029] 步骤2,网络构建及参数学习步骤
[0030] 构建有向加权图联想网络;在有向加权图联想网络中,每个词语作为一个结点,两 个结点间存在双向边的条件是:当且仅当该两个结点所对应的两个词语之间在所述多种不 同的词对共现方式中至少一种词对共现方式下的共现频率不为零;边上所带的权重用于度 量人脑由出边一词联想到入边一词的概率,所述权重通过参数学习得到;
[0031] 其中,所述参数学习采用线性回归机器学习算法,具体为;W自由联想方法所收 集的词语数据计算自由联想的条件概率,并将自由联想的条件概率作为参数学习训练数据 的标注真值,W步骤1. 2计算得到的词对之间的联想概率作为参数学习训练数据的学习特 征,学习得到权重,从而将在所述多种不同的词对共现方式下词对之间的联想概率统一为 模拟人脑的联想概率。
[0032] 步骤3,语义相关性计算步骤
[0033] 利用词对之间的联想概率、有向加权图联想网络,计算词对或句对之间的语义相 关性。
[0034] 优选地,在步骤1中,对五种不同的词对共现方式统计词对共现频率,其中,该五 种词对共现方式为:
[0035]-普通页面正文句内两词的共现;
[0036]-普通页面标题与正文内超链接词语的共现;
[0037]-普通页面标题与定义段内非超链接词语的共现;
[003引-普通页面标题与非定义段内非超链接词语的共现;
[0039]-类别页面中类别词的共现;
[0040] 其中,所述普通页面是指词语条目所对应的页面,类别页面是指预设的词语分类 所对应的页面。
[0041] 优选地,步骤1. 2包括如下步骤:
[0042] 对于词对(U,V),利用如下公式度量联想难易程度r, (U,V):
[0043]
[0044] 其中;Pt(U,V)正比于词对(U,V)在第T种词对共现方式下的共现频率,Pt(V)正 比于词V的出现频率,Pt(U)正比于词U的出现频率,a为可调指数参数;下标T为自然 数;r, (U,V)表示在第T种词对共现方式下词对(U,V)之间的联想难易程度,Pt(U,V)表 示词对(U,V)的共现频率除W第T种词对共现方式下的总词数,Pt(V)表示词V的出现频 率除W第T种词对共现方式下的总词数,Pt(U)表示词U的出现频率除W第T种词对共 现方式下的总词数,U、V表示在维基百科中的不同词语;
[0045] 将r, (U,V)进一步正则化为词对之间的联想概率:
[0046]
[0047] 其中,Wt(U,V)表示在第T种词对共现方式下词对(U,V)之间的联想概率。
[0048] 优选地,自由联想方法收集词语数据的方式为:
[0049] 提供给受试者一个暗示词U并要求受试者记录下自己由暗示词U自由联想到的第 一个联想词V,将由暗示词U、联想词V构成的词对作为所述自由联想方法所收集的词语数 据。
[0化0] 优选地,标注真值的计算方法为;用由暗示词U联想到联想词V的人数除W被提供 到暗示词U的总人数得到比值,并用该比值作为自由联想的条件概率。
[0化1 ]
优选地,所述步骤3,具体为:
[0052] 对于词对语义相关性,将由一个词所对应结点联想到另一个词所对应结点的难易 程度作为语义相关性的度量,联想的难易程度由该两结点之间的直接联想概率和经由中间 结点的间接联想概率共同决定;
[0化3] 对于句对之间的语义相关性,首先通过词袋模型将每个句子抽象为一组词W及该 组词中各个词语在该句内出现的频率,其次利用有向加权图联想网络对两个句子对应的两 组词采用加入重要的中间结点的方式分别做扩充,最后计算两组词之间的余弦相似度作为 该句对间语义相关性的度量;
[0化4] 其中,所述重要的中间结点的选取方式为;对于任意句内的词对(u,v)计算各个 中间结点X对应的间接联想概率(X),并将各个间接联想概率(X)按照值由大到小 排序为序列,取该序列前K个间接联想概率(X)对应的中间结点作为所述重要的中间 结点,其中K为可调参数,用W控制扩充的强度。
[0化5] 优选地,词对语义相关性计算,具体为:
[0056] 对于词对(U,V),w(u, V)代表由结点U联想到结点V的直接联想概率,即由结点U 指向结点V的边上的权重,若由结点U指向结点V的边不存在,则W(U,V)为零;结点u与结 点V之间经由结点X的间接联想概率记为Wb,Y>(x),计算方法为;
[0057]W山,V) (X)=max(W (U, X)XW (X, V), W (V, X)XW (X, U))
[0058] 其中,W(U,X)表示结点U联想到结点X的直接联想概率,W(X,V)表示结点X联想 到结点V的直接联想概率,W(V,X)表示结点V联想到结点X的直接联想概率,W(X,U)表示 结点X联想到结点U的直接联想概率;
[0化9]词对(U,V)之间的语义相关性通过如下计算式得到:
[0060]
[0061] 其中,V代表有向加权图联想网络的结点集合,w(v,u)代表由结点V联想到结点U 的直接联想概率。
[0062] 与现有技术相比,本发明具有如下的有益效果:
[0063] 1、通过引入"自由联想"领域屯、理学研究所收集的数据模拟人脑对于词对的联想 概率度量,提高语义相关性计算准确性。
[0064] 2、通过引入维基百科词对共现频率数据,保证了联想网络的大规模和非稀疏两个 重要特性,从而实现任意词对和句对之间的语义相关性计算。
[0065] 3、语义相关性计算的算法设计中,通过基于"中间结点"计算间接联想概率和扩充 词袋,进一步提高语义相关性计算准确性。
【附图说明】
[0066] 通过阅读参照W下附图对非限制性实施例所作的详细描述,本发明的其它特征、 目的和优点将会变得更明显:
[0067] 图1为本发明的流程示意图。
【具体实施方式】
[0068] 下面结合具体实施例对本发明进行详细说明。W下实施例将有助于本领域的技术 人员进一步理解本发明,但不W任何形式限制本发明。应当指出的是,对本领域的普通技术 人员来说,在不脱离本发明构思的前提下,还可W做出若干变化和改进。该些都属于本发明 的保护范围。
[0069] 本发明所提供方法的主要功能是;利用由维基百科丰富的、半结构化的文本资源 统计所得的词对共现频率W及"自由联想"领域屯、理学研究所收集的数据构建大规模、非稀 疏联想网络,并基于已构建的联想网络设计算法计算词对和句对之间的语义相关性。
[0070] 本发明提供的方法包括W下S个步骤;共现词频统计、网络构建及参数学习、语义 相关性计算。
[0071] 共现词频统计步骤,解析维基百科数据库转储文件,并对五种不同的词对共现方 式统计共现频率,该五种词对共现方式为;普通页面正文句内两词的共现、普通页面标题与 正文内超链接词语的共现、普通页面标题与定义段内非超链接词语的共现、普通页面标题 与非定义段内非超链接词语的共现、类别页面中类别词的共现。基于统计所得词对共现频 率和单个词的出现频率,对每种共现方式计算词对之间的联想概率。普通页面指的是某个 词语条目(如"姚明")所对应的页面,如http://zh.w化ipedia.org/w化i/%E5%A7% 9A%E6% 98% 8E;分类页面指的是由维基管理者所预先定义的某个词语分类(如"体育人 物")对应的页面,如http://zh.W化ipedia.org/w化i/CategoiT: %E4% 抓% 93%E8% 82%B2%E4%BA%BA%E7% 89%A9〇
[0072] 网络构建及参数学习步骤,构建有向加权图联想网络,邮箱加权图中每个词语作 为一个结点,当且仅当两词之间在某种共现方式下共现频率不为零两节点间存在双向边, 边上所带权重用W度量人脑由出边一词联想到入边一词的概率,该权重通过参数学习得 至IJ。参数学习采用线性回归机器学习算法,自由联想"领域屯、理学研究所收集的数据计 算自由联想条件概率作为参数学习训练数据的标注真值,W共现词频统计步骤计算的词对 之间的联想概率作为参数学习训练数据的学习特征,学习得到权重参数用W将五种词对之 间的联想概率统一为最终的、模拟人脑的联想概率。
[0073] 语义相关性计算步骤,基于由上述方法构建的联想网络设计算法计算词对或句对 之间的语义相关性。对于词对语义相关性,考虑由一个词所对应结点联想到另一个词所对 应结点的难易程度作为语义相关性的度量,联想的难易程度由两结点之间直接的联想概率 和经由中间结点的间接联想概率共同决定;对于句对之间的语义相关性,首先通过"词袋模 型"将每个句子抽象为一组词和它们在句内出现的频率,其次利用联想网络对两个句子对 应的两组词W加入重要的中间结点的方式分别做扩充,最后计算两组词之间的余弦向量相 似性作为该句对间语义相关性的度量。
[0074] 在一个优选例中;
[0075] (1)由共现频率计算联想概率
[0076] 共现词频统计步骤的最后一步中基于统计所得词对共现频率和单个词的出现 频率对每种共现方式计算词对之间的联想概率,具体的计算方法如下;T代表词对共现 方式,对于词对(u,v)利用公式
度量联想难易程度,其中Pt(u,v)正 比于词对(u,v)在T共现方式下的共现频率,Pt(V)正比于词V的出现频率,指数参数a用于调节对词语的分数削减程度,例如,a用于调节对高频词的分数削减程度,其中, 高频词不是一个绝对概念,它指的是相对高频;一个词语相对于其它词语出现频率越高, 就越高频,它所对应的分数就被削减的越厉害。而后将此度量进一步正则化为联想概率:
[0077] (2)参数学习的标注真值
[007引网络构建及参数学习步骤中自由联想"领域屯、理学研究所收集的数据计算自 由联想条件概率作为参数学习训练数据的标注真值,其中"自由联想"的数据收集方式为提 供给受试者一个暗示词并要求受试者记录下自己由暗示词自由联想到的第一个词语。对于 由某对有序词对(u,v)构成的训练数据,标注真值的计算方法为用由"自由联想"数据中暗 示词U联想到词V的人数除W拿到暗示词U的总人数,它的根据是W频率之比近似联想的 条件概率。
[0079] 需要注意的是,仅由"自由联想"数据计算得到的标注真值也可W构建联想网络, 联想网络的每个结点是"自由联想"数据出现的词,边上的权重即为作为标注真值联想概 率。该样构建得到联想网络由于完全依赖人工收集的"自由联想"屯、理学数据而存在两个 重要的缺陷;一是"自由联想"数据中只有约5000个词语,导致联想网络中的结点数十分有 限,难W用于计算任意词对之间的语义相关性;二是"自由联想"数据每个暗示词只提供给 有限的受试者(约150人),导致联想网络具有稀疏性,使得语义相关性计算的准确度下降。 因此将受实验人数限制的由"自由联
想"数据计算得来的联想概率作为标注真值用W训练 参数,从而结合维基百科的词对共现信息构建大规模、非稀疏的联想网络是十分必要的。
[0080] (3)语义相关性计算算法
[0081] 语义相关性计算步骤中计算词对或句对之间语义相关性的具体算法如下。
[008引词对语义相关性计算:对于词对(U,V),w(u,V)代表由结点U联想到结点V的概 率,即由U指向V的边上的权重,若不存在由U指向V的边不存在则W(U,V)为零。结点U 与结点V之间经由结点X的间接联想概率记为(X),计算方法为Wb,Y>(x)=max(W(U,X )Xw(X,V),w(V,X)Xw(X,u))。结点u与结点V之间的语义相关性由直接联想概率和间接联 想概率共同决定,计算方式是W(U,V)+W(V,U) +E ,e vWb,v>(X),其中V代表联想网络的结点 集合。
[0083] 句对语义相关性计算:在由通过"词袋模型"将每个句子抽象为一组词和它们在句 内出现的频率后,利用联想网络对两个句子对应的两组词加入重要的结点做扩充,结点的 选取方式为对于任意句内的词对(U,v)选取使得间接联想概率W<4Y>(x)最大的K个中间结 点X作为扩充结点,其中K为可调参数,用W控制扩充步骤的强度。
[0084] W上对本发明的具体实施例进行了描述。需要理解的是,本发明并不局限于上述 特定实施方式,本领域技术人员可W在权利要求的范围内做出各种变化或修改,该并不影 响本发明的实质内容。
【主权项】
1. 一种基于联想网络的语义相关性计算方法,其特征在于,包括如下步骤: 步骤1,共现词频统计步骤 步骤1. 1 :解析维基百科数据库转储文件,对多种不同的词对共现方式统计词对共现 频率,并统计词对中单个词的出现频率; 步骤1. 2 :根据所述词对共现频率和词对中单个词的出现频率,对每种词对共现方式 计算词对之间的联想概率; 步骤2,网络构建及参数学习步骤 构建有向加权图联想网络:在有向加权图联想网络中,每个词语作为一个结点,两个结 点间存在双向边的条件是:当且仅当这两个结点所对应的两个词语之间在所述多种不同的 词对共现方式中至少一种词对共现方式下的共现频率不为零;边上所带的权重用于度量人 脑由出边一词联想到入边一词的概率,所述权重通过参数学习得到; 其中,所述参数学习采用线性回归机器学习算法,具体为:以自由联想方法所收集的词 语数据计算自由联想的条件概率,并将自由联想的条件概率作为参数学习训练数据的标注 真值,以步骤1. 2计算得到的词对之间的联想概率作为参数学习训练数据的学习特征,学 习得到权重,从而将在所述多种不同的词对共现方式下词对之间的联想概率统一为模拟人 脑的联想概率; 步骤3,语义相关性计算步骤 利用词对之间的联想概率、有向加权图联想网络,计算词对或句对之间的语义相关性。2. 根据权利要求1所述的基于联想网络的语义相关性计算方法,其特征在于,在步骤1 中,对五种不同的词对共现方式统计词对共现频率,其中,这五种词对共现方式为: -普通页面正文句内两词的共现; -普通页面标题与正文内超链接词语的共现; -普通页面标题与定义段内非超链接词语的共现; -普通页面标题与非定义段内非超链接词语的共现; -类别页面中类别词的共现; 其中,所述普通页面是指词语条目所对应的页面,类别页面是指预设的词语分类所对 应的页面。3. 根据权利要求1所述的基于联想网络的语义相关性计算方法,其特征在于,步骤1. 2 包括如下步骤: 对于词对(u,v),利用如下公式度量联想难易程度rT(u,v):其中:ρτ (u,V)正比于词对(u,V)在第τ种词对共现方式下的共现频率,Ρτ (V)正比 于词V的出现频率,ρτ (U)正比于词u的出现频率,α为可调指数参数;下标τ为自然数; r, (u,V)表示在第τ种词对共现方式下词对(u,V)之间的联想难易程度,Ρτ (u,V)表示词 对(u,V)的共现频率除以第τ种词对共现方式下的总词数,Ρτ (V)表示词V的出现频率除 以第τ种词对共现方式下的总词数,Ρτ (u)表示词u的出现频率除以第τ种词对共现方 式下的总词数,u、V表示在维基百科中出现的不同词语; 将Γτ (U,V)进一步正则化为词对之间的联想概率:其中,(u,v)表示在第τ种词对共现方式下词对(u,v)之间的联想概率。4. 根据权利要求1所述的基于联想网络的语义相关性计算方法,其特征在于,自由联 想方法收集词语数据的方式为: 提供给受试者一个暗示词u并要求受试者记录下自己由暗示词u自由联想到的第一个 联想词V,将由暗示词U、联想词V构成的词对作为所述自由联想方法所收集的词语数据。5. 根据权利要求4所述的基于联想网络的语义相关性计算方法,其特征在于,标注真 值的计算方法为:用由暗示词u联想到联想词V的人数除以被提供到暗示词u的总人数得 到比值,并用该比值作为自由联想的条件概率。6. 根据权利要求1所述的基于联想网络的语义相关性计算方法,其特征在于,所述步 骤3,具体为: 对于词对语义相关性,将由一个词所对应结点联想到另一个词所对应结点的难易程度 作为语义相关性的度量,联想的难易程度由该两结点之间的直接联想概率和经由中间结点 的间接联想概率共同决定; 对于句对之间的语义相关性,首先通过词袋模型将每个句子抽象为一组词以及该组词 中各个词语在该句内出现的频率,其次利用有向加权图联想网络对两个句子对应的两组词 采用加入重要的中间结点的方式分别做扩充,最后计算两组词之间的余弦相似度作为该句 对间语义相关性的度量; 其中,所述重要的中间结点的选取方式为:对于任意句内的词对(u,v)计算各个中间 结点X对应的间接联想概率W(u,v) (X),并将各个间接联想概率W(u,v) (X)按照值由大到小排序 为序列,取该序列前K个间接联想概率W(u,v) (X)对应的中间结点作为所述重要的中间结点, 其中K为可调参数,用以控制扩充的强度。7. 根据权利要求6所述的基于联想网络的语义相关性计算方法,其特征在于,词对语 义相关性计算,具体为: 对于词对(U, V),W (U, V)代表由结点U联想到结点V的直接联想概率,即由结点U指向 结点V的边上的权重,若由结点U指向结点V的边不存在,则W(U, V)为零;结点U与结点V 之间经由结点X的间接联想概率记为W(u;v) (X),计算方法为: ff(u,v) (χ) = rnax(w(u, x) Xw(x, v), w(v, x) Xw(x, u)) 其中,w(u, x)表示结点u联想到结点x的直接联想概率,w(x, v)表示结点x联想到结 点V的直接联想概率,W (V, X)表示结点V联想到结点X的直接联想概率,W (X, U)表示结点 X联想到结点U的直接联想概率; 词对(u,v)之间的语义相关性通过如下计算式得到:其中,V代表有向加权图联想网络的结点集合,W(V,U)代表由结点V联想到结点U的直 接联想概率。
【专利摘要】本发明提供了一种基于联想网络的语义相关性计算方法,包括步骤:步骤1,共现词频统计步骤,步骤2,网络构建及参数学习步骤,步骤3,语义相关性计算步骤。本发明通过引入自由联想方法所收集的数据模拟人脑对于词对的联想概率度量,提高语义相关性计算准确性,并通过引入维基百科词对共现频率数据,保证了联想网络的大规模和非稀疏两个重要特性,从而实现任意词对和句对之间的语义相关性计算,而且通过基于中间结点计算间接联想概率和扩充词袋,进一步提高语义相关性计算准确性。
【IPC分类】G06F17/27
【公开号】CN104881400
【申请号】CN201510256490
【发明人】朱其立, 张可阳
【申请人】上海交通大学
【公开日】2015年9月2日
【申请日】2015年5月19日
转载请注明原文地址:https://www.famiwei.com/read-8138675.html