缩写词扩展方法和装置的制造方法

xiaoxiao2020-10-23  11

缩写词扩展方法和装置的制造方法
【技术领域】
[0001] 本发明信息处理领域,更具体地涉及一种缩写词扩展方法和装置。
【背景技术】
[0002] 实体链接(Entitylinking)是将非结构化文本,如新闻,博客,论坛,微博等中的 实体,如人,地点,组织与互联网知识库,如Wikipedia,DBPedia进行关联的技术。实体链 接技术可W用于知识库的构建与动态更新,将文本内容语义化。然而,在实体链接过程中, 实体名的形式往往为缩写形式,如"CNPC", "ABC"等。由于每一个缩写词可W指代多个 实体,例如"ABC"即可W用来指代"AmericanBroadcastingCompany"又可W用来指代 "Agricul化ralBankof化ina",因此增加了实体链接中的消除歧义的难度。因此,确定该 些缩写词的全称形式是实体链接首要解决的问题。
[0003] 因此需要一种能够对缩写词进行扩展的方法和装置。

【发明内容】

[0004] 在下文中给出关于本发明的简要概述,W便提供关于本发明的某些方面的基本理 解。应当理解,该个概述并不是关于本发明的穷举性概述。它并不是意图确定本发明的关 键或重要部分,也不是意图限定本发明的范围。其目的仅仅是W简化的形式给出某些概念, W此作为稍后论述的更详细描述的前序。
[0005] 本发明的一个主要目的在于,提供一种在多个语境中对缩写词进行扩展的方法, 包括:在多个语境中,将与缩写词具有共现模式关系的全称词确定为缩写词的第一类候选 全称词,并设置第一类候选全称词的置信度;在不存在具有共现模式关系的缩写词和全称 词的语境中,将第一类候选全称词作为检索词进行检索,如果某个语境含有第一类候选全 称词,则将该第一类候选全称词确定为缩写词在该语境中的第二类候选全称词,并设置第 二类候选全称词的置信度;在不存在具有共现模式关系的缩写词和全称词的语境中,将基 于网络信息获取的与第一类候选全称词不同的所有其他与缩写词对应的全称词作为检索 词进行检索,确定缩写词在各语境中的第H类候选全称词;W及根据多个语境与第一类候 选全称词和/或第二类候选词的对应关系W及第一类候选全称词和/或第二类候选词的置 信度来构建训练数据集,利用训练数据集学习分类模型,基于分类模型来确定第H类候选 全称词的置信度,从而确定缩写词在各个语境中对应的全称词。
[0006] 根据本发明的一个方面,提供了一种在多个语境中对缩写词进行扩展的装置,包 括:第一类候选全称词确定单元,第一类候选全称词确定单元被配置为在多个语境中,将与 缩写词具有共现模式关系的全称词确定为缩写词的第一类候选全称词,并设置第一类候选 全称词的置信度;第二类候选全称词确定单元,第二类候选全称词确定单元被配置为在不 存在具有共现模式关系的缩写词和全称词的语境中,将第一类候选全称词作为检索词进行 检索,如果某个语境含有第一类候选全称词,则将该第一类候选全称词确定为缩写词在该 语境中的第二类候选全称词,并设置第二类候选全称词的置信度;第H类候选全称词确定 单元,第H类候选全称词确定单元被配置为在不存在具有共现模式关系的缩写词和全称词 的语境中,将基于网络信息获取的与第一类候选全称词不同的所有其他与缩写词对应的全 称词作为检索词进行检索,确定缩写词在各语境中的第H类候选全称词;W及第H类候选 全称词置信度确定单元,第H类候选全称词置信度确定单元被配置为根据多个语境与第一 类候选全称词和/或第二类候选词的对应关系W及第一类候选全称词和/或第二类候选词 的置信度来构建训练数据集,利用训练数据集学习分类模型,基于分类模型来确定第H类 候选全称词的置信度,从而确定缩写词在各个语境中对应的全称词。
[0007] 另外,本发明的实施例还提供了用于实现上述方法的计算机程序。
[0008] 此外,本发明的实施例还提供了至少计算机可读介质形式的计算机程序产品,其 上记录有用于实现上述方法的计算机程序代码。
[0009] 通过本发明,可W利用缩写词出现的多个语境的上下文信息进行协同扩展来得到 与该缩写词对应的全称词(也称为扩展词)。从而可W在高召回率前提下,获得更精确的全 称词候选,有效减少消歧处理的工作量。
[0010] 通过W下结合附图对本发明的最佳实施例的详细说明,本发明的该些W及其他优 点将更加明显。
【附图说明】
[0011] 参照下面结合附图对本发明实施例的说明,会更加容易地理解本发明的W上和其 它目的、特点和优点。附图中的部件只是为了示出本发明的原理。在附图中,相同的或类似 的技术特征或部件将采用相同或类似的附图标记来表示。
[0012] 图1是示出根据本发明的一个实施例的缩写词扩展方法的示例性流程图;
[001引图2是互联网知识库中关于缩写词"IBM"的相关信息的示意图;
[0014] 图3是互联网知识库中关于缩写词"ABC"的消岐页面的示意图;
[0015]图4是示出根据本发明的一个实施例的缩写词扩展装置400的示例性配置的框图
[0016] 图5是示出可W用于实施本发明的文本提取方法和装置的计算设备的举例的结 构图。
【具体实施方式】
[0017] 下面参照附图来说明本发明的实施例。在本发明的一个附图或一种实施方式中描 述的元素和特征可W与一个或更多个其它附图或实施方式中示出的元素和特征相结合。应 当注意,为了清楚的目的,附图和说明中省略了与本发明无关的、本领域普通技术人员已知 的部件和处理的表示和描述。
[001引本发明提出一种基于"协同+反馈"的缩写词扩展技术,该技术利用缩写词出现的 多个语境的上下文信息进行协同扩展来得到与该缩写词对应的全称词(也称为扩展词)。该 里,"语境"可W是一篇文档、一个章节、一个段落、甚至一句话。
[001引例如,实体名"ABC"出现在n个文档中,可W利用n个文档中"ABC"的上下文对所 有的"ABC"进行协同扩展,而不是分别利用该n个文档对"ABC"进行单独扩展。因为,"ABC" 在第i个文档中的上下文可W辅助"ABC"在第j个文档中的扩展。同时,该技术利用互联 网知识库和数据得到与"ABC"对应的全称词候选集合,并将该全称词候选集合反馈到相关 文档上下文,利用上下文进一步精炼全称词候选集合。该技术可w在高召回率前提下,获得 更精确的全称词候选,从而有效减少消歧处理的工作量。
[0020] 下面,W文档1至文档5五篇文档作为五个语境、"ABC"为给定缩写词为例,详细 说明根据本发明的一个实施例的缩写词扩展方法。
[0021] 图1示出了根据本发明的一个实施例的缩写词扩展方法的示意图。
[0022] 首先,在步骤S110中,将与给定缩写词具有共现模式关系的全称词确定为缩写词 的第一类候选全称词,并设置第一类候选全称词的置信度。
[0023] 具体地,对于给定的缩写词"ABC",首先抽取该缩写词的局部上下文,如选取缩写 词前后各m个词作为缩写词的局部上下文。然后利用全称词与缩写词的共现模式关系,例 女口"全称词(缩写词)"或"缩写词(全称词)"该样格式,从缩写词的上下文中抽取缩写词的全 称词。
[0024]在该实施例中,在文档 1 中找到了"ABC(AmericanBroadcastingCompany)",在 文档2中找到"ABC(Agri州huralBankofQiina)"。
[0025] 为了方便说明,将通过W上共现模式找到的与给定缩写词"ABC"对应的全 称词称为该缩写词的第一类候选全称词,即,"AmericanBroadcastingCompany"和 "Agri州;UuralBankof化ina"都是"ABC"的第一类候选全称词,并将其在文档1和文档 2中的置信度都设置为1.0。
[0026] 我们假设,如果在一个语境中出现了给定缩写词与对应的全称词的共现模式,贝U 与该缩写词对应的全称词是唯一确定的。例如,在一篇文档中,如果出现了"ABCXAmerican BroadcastingCompany)",那么在该文档中再次出现的"ABC"-定表示"American BroadcastingCompany",而不会是其它。如果在一篇文档的不同位置处,例如不同段落 分别出现了"ABC(AmericanBroadcastingCompany)"和"ABC(Agri州huralBankof Qiina)",则可WW-个段落作为一个语境,即"ABC(AmericanBroadcastingCompany)" 和"ABC(Agricu;UuralBankof化ina)"是在不同语境中,来执行根据本发明的缩写词扩 展方法。
[0027] 在一个实施例中,可W通过表格来更清楚地示出根据本发明的缩写词扩展方法的 各个步骤。例如,可W将步骤S110的执行结果填入到表1中。在表1中,包括5列,分别 是缩写词、文档ID、全称ID、全称名和置信度。其中,缩写词是给定的缩写词,在该实施例 中是"ABC";文档ID是各个语境的标号,在该实施例中是D1-D5,分别指代文档1至文档 5 ;全称ID是在文档中出现的全称名的标号,在该实施例中,D1中出现了"ABC(American Broadcast ingCompany)",其全称名为"AmericanBroadcastingCompany",全称ID为FI, D2中出现了"ABC(Agri州huralBankofQiina)",其全称名为"Agri州huralBankof 化ina",全称ID为F2 ;置信度表示在该文档中,"ABC"指代相应全称名的置信度,例如表1 中第一行C(F1,D1) =1.0 表示ABC在文档1中指代"AmericanBroadcastingCompany"的 置信度为1. 0。
[0028] 将在步骤S110中通过共现模式找到的第一类全称词填入表格中,如果不存在具 有共现模式关系的缩写词和全称词,则填NIL。将第一类全称词的置信度填为1.0,否则为 NIL。此时的状态可W用表1表示。
[0029]表1.
[0030]
[0031] 通过步骤SllO, 一些文档(D1和D2)中的缩写词已经找到了全称形式并确定了置 信度。对于在步骤S110中没有找到全称形式的文档,执行步骤S120 ;在不存在具有共现模 式关系的缩写词和全称词的语境中,将第一类候选全称词作为检索词进行检索,如果某个 语境含有第一类候选全称词,则将该第一类候选全称词确定为缩写词在该语境中的第二类 候选全称词,并设置第二类候选全称词的置信度。
[0032] 其中,可W根据第二类候选全称词与缩写词的距离(例如,全称词与缩写词之间的 句子的数目)来确定第二类候选全称词的置信度。
[0033] 其中,可W对不存在与缩写词具有共现模式关系的全称词的文档建立索引IN呢X。 然后将第一类候选全称词作为检索词检索文档索引INDEX。
[0034] 在该具体实施例中,分别将"AmericanBroadcastingCompany"(其全称ID为F1) 和"Agri州1化ralBankof化ina"(其全称ID为F2)作为检索词在文档3-5中进行检索。 例如,在文档3中检索到文档3中含有全称F1,文档5中含有全称巧,可W对表1中的内容 进行更新得到表2来表示执行步骤S120之后的状态。在该种情况下,可W将F1在文档3 中的置信度设置为F1到缩写词"ABC"的距离的函数,例如,可W设置C(F1,D3) =e-"stante(w, 其中,distance(F1)表示在文档3中F1到"ABC"的距离。类似地,巧在文档5的置信度 C(F2,DW=e-"st-ce(F2),其中,distance(F2)表示在文档 5 中巧至IJ"ABC"的距离。。
[00巧]表2.
[0036]
[0037] 如果在一个语境中确定具有多个第二类候选全称词,例如,文档3中同时含有全 称词F1和F2,那么此时的状态可W用表3表示。
[0038]表3.
[0039]
[0040] 该里,将F1在文档3中的置信度设置为e-"stanee<W,巧在文档3的置信度设置为 e-distanee<P2>,其中,distance(F1)表示在文档3中F1到"ABC"的距离,distance(F2)表示 在文档3中巧到"ABC"的距离。为了表述简单,下面仍W在文档3中只含有全称词F1为 例进行说明。
[0041] 接下来,在步骤S130中,在不存在具有共现模式关系的缩写词和全称词的语境 中,将基于网络信息获取的与第一类候选全称词不同的所有其他与缩写词对应的全称词作 为检索词进行检索,确定缩写词在各语境中的第H类候选全称词。
[0042] 缩写词的可能的全称还可W从互联网知识库,如W化ipedia,DBPedia,BaWuBaAe 中得到。例如,可W包括W下来源:重定向链接(见图2)、首段中的黑体字(见图2)、消歧页 面(见图3)W及销文本与实体的链接关系等。通过该些网络信息,可W构建缩写词的全局 全称词集合。
[0043] 遍历全局全称词集合中与在步骤SllO中确定的第一类候选全称词不同的全称词 作为检索词在文档索引INDEX中进行检索。如果某个文档含有某个全称词,则将该全称词 称为第H类候选全称词。
[0044] 例如,基于网络信息,还可W获得与"ABC"对应的ABCDevelopmentCo巧oration、 AsahiBroadcastingCorporation、AssociatedBritishCorporation、Australian BroadcastingCo巧oration等多个全称词候选,其全称ID分别为F3、F4、巧和F6。
[0045] 分别在文档3至文档5中遍历除"AmericanBroadcastingCompany"和 "Agricul化ralBankof化ina"之外的全称词候选,确定在文档4中含有全称词F3和F4, 文档5中含有全称词巧和F6,那么此时的状态可W用表4表示。
[0046]表 4.
[0047]
[0049] 通过W上步骤,可W得到大部分文档中缩写词的全称词候选(有些文档可能不能 找到缩写词的扩展词)。D1中缩写词的全称ID为F1、D2中缩写词的全称ID为F2、D3中缩 写词的全称ID为F1、D4中缩写词的全称ID为F3,F4、D5中缩写词的全称ID为巧,F5,F6。
[0050] 接下来,在步骤S140中,根据多个语境与第一类候选全称词和/或第二类候选词 的对应关系W及第一类候选全称词和/或第二类候选词的置信度来构建训练数据集,利用 训练数据集来学习分类模型,基于分类模型来确定第H类候选全称词的置信度,从而确定 缩写词在各个语境中的全称词。
[0051] 从W上表4中可w看到,第一类候选全称词的置信度已经设置为1.0,第二类候选 全称词的置信度为全称词到缩写词的距离的函数值,如D1中的F1、D2中的F2、D3中的F1 W及D5中的巧,而第H类候选全称词的置信度还不确定。下面将介绍计算第H类候选全称 词的置信度的方法的一个实施例。
[0052] 首先,根据表4可W得到表5。
[0053]表 5
[0054]
[0055]
[0056] 在表5中,表示文档D1-D5和全称词F1-F6的对应关系。如果在某篇文档中存在 该全称词,则在相应的表格中填1,否则就填0。
[0057] 根据表5可W分别对文档D1-D5构建训练数据集。
[005引 文档D1
[0059]


[006引其中,+l和-l是类别标签。例如,在<f(Fl,Dl),f(巧,Dl),+l〉中,+l表示f(Fl,Dl)比f(巧,Dl)大,即在文档1中"ABC"对应的全称词是FI的置信度要比是巧的置 信度高;在钟(尸2,01),^尸1,01),-1〉中,-1表示^尸2,01)比^尸1,01)小,即在文档1中 "ABC"对应的全称词是巧的置信度要比是F1的置信度低。
[0070]f(Fl,Dl)是由D1中的n个训练特征构成的n维向量。训练特征可W包括但不限 于W下特征:
[0071]
[0072]
[0073] 利用W上所述的训练特征构建训练数据集,然后可W使用RankingSVM(排序 支持向量机)算法学习一个分类模型,基于该分类模型可W得到C(F3,D4)、C(F4,D4)、 C(巧,D5)和C(F6,D5)的排序结果,再根据排序结果分别对C(F3,D4)、C(F4,D4)、C(巧,D5) 和"尸6,05)打分,从而可^确定"尸3,04)、"尸4,04)、〔(巧,05)和"尸6,05)的值。
[0074] 最后,基于各类候选全称词的置信度,可W确定给定缩写词在各个语境中对应的 全称词。
[0075] 本领域技术人员可W理解,也可W使用其他分类算法,例如ListNet算法、SVM(支 持向量机)算法、贝叶斯算法等分类算法来学习分类模型,
[0076] 图4是示出根据本发明的一个实施例的在多个语境中对缩写词进行扩展的装置 400的示例性配置的框图。
[0077] 如图4所示,对缩写词进行扩展的装置400包括第一类候选全称词确定单元410、 第二类候选全称词确定单元420、第H类候选全称词确定单元430、第H类候选全称词置信 度确定单元440。
[0078] 其中,第一类候选全称词确定单元410被配置为在多个语境中,将与缩写词具有 共现模式关系的全称词确定为缩写词的第一类候选全称词,并设置第一类候选全称词的置 信度。
[0079] 第二类候选全称词确定单元420被配置为在不存在具有共现模式关系的缩写词 和全称词的语境中,将第一类候选全称词作为检索词进行检索,如果某个语境含有第一类 候选全称词,则将该第一类候选全称词确定为缩写词在该语境中的第二类候选全称词,并 设置第二类候选全称词的置信度。
[0080] 第H类候选全称词确定单元430被配置为在不存在具有共现模式关系的缩写词 和全称词的语境中,将基于网络信息获取的与第一类候选全称词不同的所有其他与缩写词 对应的全称词作为检索词进行检索,确定缩写词在各语境中的第H类候选全称词。
[0081] 第H类候选全称词置信度确定单元440被配置为根据多个语境与第一类候选全 称词和/或第二类候选词的对应关系W及第一类候选全称词和/或第二类候选词的置信度 来构建训练数据集,利用训练数据集学习分类模型,基于分类模型来确定第H类候选全称 词的置信度,从而确定缩写词在各个语境中对应的全称词。
[0082] 其中,第二类候选全称词确定单元420还被配置为;根据第二类候选全称词与缩 写词的距离来确定第二类候选全称词的置信度。
[0083] 其中,第一类候选全称词确定单元还被配置为将第一类候选全称词的置信度设置 为 1. 0。
[0084] 其中,对缩写词进行扩展的装置400还包括索引建立单元(未示出),索引建立单元 被配置为对不存在具有共现模式关系的缩写词和全称词的语境建立索引。
[0085] 其中,第H类候选全称词置信度确定单元440还被配置为使用排序支持向量机算 法、支持向量机算法、ListNet算法、或贝叶斯算法来学习排序模型。
[0086] 其中,网络信息包括;重定向链接、首段中的黑体字、消歧页面W及销文本与实体 的链接关系。
[0087] 其中,第一类候选全称词确定单元410还被配置为基于缩写词的局部上下文来确 定在各个语境中是否存在与缩写词具有共现模式关系的全称词。
[008引其中,缩写词和与其对应的全称词的共现模式关系为"全称词(缩写词)"或"缩写 词(全称词)"。
[0089] 其中,第H类候选全称词置信度确定单元440还被配置为利用多个语境的训练特 征来构建训练集。
[0090] 关于对缩写词进行扩展的装置400的各个部分的操作和功能的细节可W参照结 合图1-3描述的本发明的在多个语境中对缩写词进行扩展的方法的实施例,该里不再详细 描述。
[0091] 在此需要说明的是,图4所示的对缩写词进行扩展的装置400及其组成单元的结 构仅仅是示例性的,本领域技术人员可W根据需要对图4所示的结构框图进行修改。
[0092] 本发明提出一种基于"协同+反馈"的缩写词扩展技术,该技术利用缩写词出现的 多个语境的上下文信息进行协同扩展来得到与该缩写词对应的全称词。通过本发明,可W 在高召回率前提下,获得更精确的全称词候选,从而有效减少消歧处理的工作量。
[0093] W上结合具体实施例描述了本发明的基本原理,但是,需要指出的是,对本领域的 普通技术人员而言,能够理解本发明的方法和装置的全部或者任何步骤或者部件,可W在 任何计算装置(包括处理器、存储介质等)或者计算装置的网络中,w硬件、固件、软件或者 它们的组合加W实现,该是本领域普通技术人员在阅读了本发明的说明的情况下运用他们 的基本编程技能就能实现的。
[0094]因此,本发明的目的还可W通过在任何计算装置上运行一个程序或者一组程序来 实现。所述计算装置可W是公知的通用装置。因此,本发明的目的也可W仅仅通过提供包 含实现所述方法或者装置的程序代码的程序产品来实现。也就是说,该样的程序产品也构 成本发明,并且存储有该样的程序产品的存储介质也构成本发明。显然,所述存储介质可W 是任何公知的存储介质或者将来所开发出来的任何存储介质。
[0095] 在通过软件和/或固件实现本发明的实施例的情况下,从存储介质或网络向具有 专用硬件结构的计算机,例如图5所示的通用计算机500安装构成该软件的程序,该计算机 在安装有各种程序时,能够执行各种功能等等。
[0096]在图5中,中央处理单元(CPU)501根据只读存储器(R0M)502中存储的程序或从 存储部分508加载到随机存取存储器(RAM) 503的程序执行各种处理。在RAM503中,也根 据需要存储当CP呪01执行各种处理等等时所需的数据。CP呪0UR0M502和RAM503经由总 线504彼此链路。输入/输出接口 505也链路到总线504。
[0097] 下述部件链路到输入/输出接口 505;输入部分506 (包括键盘、鼠标等等)、输出 部分507 (包括显示器,比如阴极射线管(CRT)、液晶显示器(LCD)等,和扬声器等)、存储部 分508 (包括硬盘等)、通信部分509 (包括网络接口卡比如LAN卡、调制解调器等)。通信部 分509经由网络比如因特网执行通信处理。根据需要,驱动器510也可链路到输入/输出 接口 505。可拆卸介质511比如磁盘、光盘、磁光盘、半导体存储器等等根据需要被安装在驱 动器510上,使得从中读出的计算机程序根据需要被安装到存储部分508中。
[0098] 在通过软件实现上述系列处理的情况下,从网络比如因特网或存储介质比如可拆 卸介质511安装构成软件的程序。
[0099] 本领域的技术人员应当理解,该种存储介质不局限于图5所示的其中存储有程 序、与设备相分离地分发W向用户提供程序的可拆卸介质511。可拆卸介质511的例子 包含磁盘(包含软盘(注册商标))、光盘(包含光盘只读存储器(CD-ROM)和数字通用盘 值VD))、磁光盘(包含迷你盘(MD)(注册商标))和半导体存储器。或者,存储介质可W是 R0M502、存储部分508中包含的硬盘等等,其中存有程序,并且与包含它们的设备一起被分 发给用户。
[0100] 本发明还提出一种存储有机器可读取的指令代码的程序产品。指令代码由机器读 取并执行时,可执行上述根据本发明实施例的方法。
[0101] 相应地,用于承载上述存储有机器可读取的指令代码的程序产品的存储介质也包 括在本发明的公开中。存储介质包括但不限于软盘、光盘、磁光盘、存储卡、存储棒等。
[0102] 本领域的普通技术人员应理解,在此所例举的是示例性的,本发明并不局限于此。
[0103]在本说明书中,"第一"、"第二及"第N个"等表述是为了将所描述的特征在文 字上区分开,W清楚地描述本发明。因此,不应将其视为具有任何限定性的含义。
[0104] 作为一个示例,上述方法的各个步骤W及上述设备的各个组成模块和/或单元可 W实施为软件、固件、硬件或其组合,并作为相应设备中的一部分。上述装置中各个组成模 块、单元通过软件、固件、硬件或其组合的方式进行配置时可使用的具体手段或方式为本领 域技术人员所熟知,在此不再费述。
[0105] 作为一个示例,在通过软件或固件实现的情况下,可W从存储介质或网络向具有 专用硬件结构的计算机(例如图5所示的通用计算机500)安装构成该软件的程序,该计算 机在安装有各种程序时,能够执行各种功能等。
[0106] 在上面对本发明具体实施例的描述中,针对一种实施方式描述和/或示出的特征 可WW相同或类似的方式在一个或更多个其他实施方式中使用,与其他实施方式中的特征 相组合,或替代其他实施方式中的特征。
[0107] 应该强调,术语"包括/包含"在本文使用时指特征、要素、步骤或组件的存在,但 并不排除一个或更多个其他特征、要素、步骤或组件的存在或附加。
[010引此外,本发明的方法不限于按照说明书中描述的时间顺序来执行,也可W按照其 他的时间顺序地、并行地或独立地执行。因此,本说明书中描述的方法的执行顺序不对本发 明的技术范围构成限制。
[0109] 本发明及其优点,但是应当理解在不超出由所附的权利要求所限定的本发明的精 神和范围的情况下可W进行各种改变、替代和变换。而且,本发明的范围不仅限于说明书 所描述的过程、设备、手段、方法和步骤的具体实施例。本领域内的普通技术人员从本发明 的公开内容将容易理解,根据本发明可W使用执行与在此的相应实施例基本相同的功能或 者获得与其基本相同的结果的、现有和将来要被开发的过程、设备、手段、方法或者步骤。因 此,所附的权利要求旨在在它们的范围内包括该样的过程、设备、手段、方法或者步骤。
[0110] 基于W上的说明,可知公开至少公开了W下技术方案:
[0111] 附记1、一种在多个语境中对缩写词进行扩展的方法,包括:
[0112] 在多个语境中,将与所述缩写词具有共现模式关系的全称词确定为所述缩写词的 第一类候选全称词,并设置第一类候选全称词的置信度;
[0113] 在不存在具有共现模式关系的缩写词和全称词的语境中,将所述第一类候选全称 词作为检索词进行检索,如果某个语境含有第一类候选全称词,则将该第一类候选全称词 确定为所述缩写词在该语境中的第二类候选全称词,并设置所述第二类候选全称词的置信 度;
[0114] 在所述不存在具有共现模式关系的缩写词和全称词的语境中,将基于网络信息获 取的与第一类候选全称词不同的所有其他与所述缩写词对应的全称词作为检索词进行检 索,确定所述缩写词在各语境中的第H类候选全称词;W及
[0115] 根据所述多个语境与第一类候选全称词和/或第二类候选词的对应关系W及所 述第一类候选全称词和/或所述第二类候选词的置信度来构建训练数据集,利用所述训练 数据集学习分类模型,基于所述分类模型来确定所述第H类候选全称词的置信度,从而确 定所述缩写词在各个语境中对应的全称词。
[0116] 附记2、根据附记1所述的方法,其中设置所述第二类候选全称词的置信度包括: 根据所述第二类候选全称词与所述缩写词的距离来确定所述第二类候选全称词的置信度。
[0117] 附记3、根据附记1或2所述的方法,其中,设置第一 类候选全称词的置信度包括将 所述第一类候选全称词的置信度设置为1. 0。
[0118] 附记4、根据附记1或2所述的方法,其中,对所述不存在具有共现模式关系的缩写 词和全称词的语境建立索引。
[011引附记5、根据附记1或2所述的方法,其中,使用排序支持向量机算法、支持向量机 算法、ListNet算法、或贝叶斯算法来学习分类模型。
[0120] 附记6、根据附记1或2所述的方法,其中,所述网络信息包括運定向链接、首段 中的黑体字、消歧页面W及销文本与实体的链接关系。
[0121] 附记7、根据附记1或2所述的方法,其中,基于所述缩写词的局部上下文来确定在 各个语境中是否存在与所述缩写词具有所述共现模式关系的全称词。
[0122] 附记8、根据附记1或2所述的方法,其中,所述缩写词和与其对应的全称词的共现 模式关系为"全称词(缩写词)"或"缩写词(全称词)"。
[0123] 附记9、根据附记1或2所述的方法,其中,根据所述多个语境与第一类候选全称词 和/或第二类候选词的对应关系W及所述第一类候选全称词和/或所述第二类候选词的置 信度来构建训练数据集包括利用所述多个语境的训练特征来构建训练数据集。
[0124] 附记10、一种在多个语境中对缩写词进行扩展的装置,包括:
[0125] 第一类候选全称词确定单元,所述第一类候选全称词确定单元被配置为在多个语 境中,将与所述缩写词具有共现模式关系的全称词确定为所述缩写词的第一类候选全称 词,并设置第一类候选全称词的置信度;
[0126] 第二类候选全称词确定单元,所述第二类候选全称词确定单元被配置为在不存在 具有共现模式关系的缩写词和全称词的语境中,将所述第一类候选全称词作为检索词进行 检索,如果某个语境含有第一类候选全称词,则将该第一类候选全称词确定为所述缩写词 在该语境中的第二类候选全称词,并设置所述第二类候选全称词的置信度;
[0127] 第H类候选全称词确定单元,所述第H类候选全称词确定单元被配置为在所述不 存在具有共现模式关系的缩写词和全称词的语境中,将基于网络信息获取的与第一类候选 全称词不同的所有其他与所述缩写词对应的全称词作为检索词进行检索,确定所述缩写词 在各语境中的第H类候选全称词;W及
[0128] 第H类候选全称词置信度确定单元,所述第H类候选全称词置信度确定单元被配 置为根据所述多个语境与第一类候选全称词和/或第二类候选词的对应关系W及所述第 一类候选全称词和/或所述第二类候选词的置信度来构建训练数据集,利用所述训练数据 集学习分类模型,基于所述分类模型来确定所述第H类候选全称词的置信度,从而确定所 述缩写词在各个语境中对应的全称词。
[0129] 附记11、根据附记10所述的装置,其中,所述第二类候选全称词确定单元还被配 置为:根据所述第二类候选全称词与所述缩写词的距离来确定所述第二类候选全称词的置 信度。
[0130] 附记12、根据附记10或11所述的装置,其中,所述第一类候选全称词确定单元还 被配置为将所述第一类候选全称词的置信度设置为1.0。
[0131] 附记13、根据附记10或11所述的装置,还包括索引建立单元,所述索引建立单元 被配置为对所述不存在具有共现模式关系的缩写词和全称词的语境建立索引。
[0132] 附记14、根据附记10或11所述的装置,其中,所述第H类候选全称词置信度确定 单元还被配置为使用排序支持向量机算法、支持向量机算法、ListNet算法、或贝叶斯算法 来学习排序模型。
[013引附记15、根据附记10或11所述的装置,其中,所述网络信息包括運定向链接、首 段中的黑体字、消歧页面w及销文本与实体的链接关系。
[0134]附记16、根据附记10或11所述的装置,其中,所述第一类候选全称词确定单元还 被配置为基于所述缩写词的局部上下文来确定在各个语境中是否存在与所述缩写词具有 所述共现模式关系的全称词。
[013引附记17、根据附记10或11所述的装置,其中,所述缩写词和与其对应的全称词的 共现模式关系为"全称词(缩写词)"或"缩写词(全称词)"。
[0136]附记18、根据附记10或11所述的装置,其中,所述第H类候选全称词置信度确定 单元还被配置为利用所述多个语境的训练特征来构建训练数据集。
【主权项】
1. 一种在多个语境中对缩写词进行扩展的方法,包括: 在多个语境中,将与所述缩写词具有共现模式关系的全称词确定为所述缩写词的第一 类候选全称词,并设置第一类候选全称词的置信度; 在不存在具有共现模式关系的缩写词和全称词的语境中,将所述第一类候选全称词作 为检索词进行检索,如果某个语境含有第一类候选全称词,则将该第一类候选全称词确定 为所述缩写词在该语境中的第二类候选全称词,并设置所述第二类候选全称词的置信度; 在所述不存在具有共现模式关系的缩写词和全称词的语境中,将基于网络信息获取的 与第一类候选全称词不同的所有其他与所述缩写词对应的全称词作为检索词进行检索,确 定所述缩写词在各语境中的第三类候选全称词;以及 根据所述多个语境与第一类候选全称词和/或第二类候选词的对应关系以及所述第 一类候选全称词和/或所述第二类候选词的置信度来构建训练数据集,利用所述训练数据 集学习分类模型,基于所述分类模型来确定所述第三类候选全称词的置信度,从而确定所 述缩写词在各个语境中对应的全称词。2. 根据权利要求1所述的方法,其中设置所述第二类候选全称词的置信度包括:根据 所述第二类候选全称词与所述缩写词的距离来确定所述第二类候选全称词的置信度。3. 根据权利要求1或2所述的方法,其中,设置第一类候选全称词的置信度包括将所述 第一类候选全称词的置信度设置为1. 0。4. 根据权利要求1或2所述的方法,其中,对所述不存在具有共现模式关系的缩写词和 全称词的语境建立索引。5. 根据权利要求1或2所述的方法,其中,使用排序支持向量机算法、支持向量机算法、 ListNet算法、或贝叶斯算法来学习分类模型。6. 根据权利要求1或2所述的方法,其中,所述网络信息包括:重定向链接、首段中的 黑体字、消歧页面以及锚文本与实体的链接关系。7. 根据权利要求1或2所述的方法,其中,基于所述缩写词的局部上下文来确定在各个 语境中是否存在与所述缩写词具有所述共现模式关系的全称词。8. 根据权利要求1或2所述的方法,其中,所述缩写词和与其对应的全称词的共现模式 关系为"全称词(缩写词)"或"缩写词(全称词)"。9. 根据权利要求1或2所述的方法,其中,根据所述多个语境与第一类候选全称词和 /或第二类候选词的对应关系以及所述第一类候选全称词和/或所述第二类候选词的置信 度来构建训练数据集包括利用所述多个语境的训练特征来构建训练数据集。10. -种在多个语境中对缩写词进行扩展的装置,包括: 第一类候选全称词确定单元,所述第一类候选全称词确定单元被配置为在多个语境 中,将与所述缩写词具有共现模式关系的全称词确定为所述缩写词的第一类候选全称词, 并设置第一类候选全称词的置信度; 第二类候选全称词确定单元,所述第二类候选全称词确定单元被配置为在不存在具 有共现模式关系的缩写词和全称词的语境中,将所述第一类候选全称词作为检索词进行检 索,如果某个语境含有第一类候选全称词,则将该第一类候选全称词确定为所述缩写词在 该语境中的第二类候选全称词,并设置所述第二类候选全称词的置信度; 第三类候选全称词确定单元,所述第三类候选全称词确定单元被配置为在所述不存在 具有共现模式关系的缩写词和全称词的语境中,将基于网络信息获取的与第一类候选全称 词不同的所有其他与所述缩写词对应的全称词作为检索词进行检索,确定所述缩写词在各 语境中的第三类候选全称词;以及 第三类候选全称词置信度确定单元,所述第三类候选全称词置信度确定单元被配置为 根据所述多个语境与第一类候选全称词和/或第二类候选词的对应关系以及所述第一类 候选全称词和/或所述第二类候选词的置信度来构建训练数据集,利用所述训练数据集学 习分类模型,基于所述分类模型来确定所述第三类候选全称词的置信度,从而确定所述缩 写词在各个语境中对应的全称词。
【专利摘要】本发明涉及一种在多个语境中对缩写词进行扩展的方法和装置。该方法包括:在多个语境中,将与缩写词具有共现模式关系的全称词确定为缩写词的第一类候选全称词;在不存在具有共现模式关系的缩写词和全称词的语境中,将第一类候选全称词作为检索词进行检索,如果某个语境含有第一类候选全称词,则将其确定为第二类候选全称词;将基于网络信息获取的与第一类候选全称词不同的所有其他与缩写词对应的全称词作为检索词进行检索,确定第三类候选全称词;以及根据多个语境与第一类候选全称词和/或第二类候选词的对应关系以及置信度来构建训练数据集,学习分类模型,确定第三类候选全称词的置信度,从而确定缩写词在各个语境中对应的全称词。
【IPC分类】G06F17/30, G06F17/27
【公开号】CN104881397
【申请号】CN201410068944
【发明人】缪庆亮, 孟遥
【申请人】富士通株式会社
【公开日】2015年9月2日
【申请日】2014年2月27日
转载请注明原文地址:https://www.famiwei.com/read-8138678.html

最新回复(0)