一种专利文献聚类方法
【技术领域】
[0001] 本发明设及一种专利文献语料的聚类方法,尤其是一种专利文献聚类方法。
【背景技术】
[0002] 当下经济环境中,专利对于提升企业价值的作用愈来愈重要。通过申请专利可W 保护企业的知识产权,进而保护企业的核屯、竞争力。目前学者们已经进行针对专利文献进 行了很多研究,如对专利摘要的标注,对专利关键技术的抽取,对专利进行聚类分析等。
[0003] 近年来,在数据挖掘领域中,对文本聚类的研究取得了很多成果。其中很多方法均 W将文档表示成向量形式为基础,利用聚类算法对文档进行聚类分析。专利文献中包含大 量非结构的信息形式,因此可W将聚类应用于专利分析。目前,已经有很多关于专利聚类分 析的研究,如基于词向量的专利聚类分析,基于技术功效矩阵的聚类分析等。目前,基于词 向量的专利聚类研究,主要是将关键词的文档和词频信息加入到文档向量表示中。该种特 征表示形式容易造成维灾难,应用与降维的方法有设置阔值和矩阵分解,常用的矩阵分解 方法有奇异值分解和非负矩阵分解。该些方法虽然可W达到降维的目的,却还是没有将特 征词上下文信息加入。深度学习可W被应用到文本的向量表示,该方法在降维的同时将文 本上下文信息加入到文档向量中,可W很好地提升文档向量包含的信息。
[0004]目前对专利文本聚类的研究中,大部分是对专利摘要的文本进行研究,该些研究 都取得了不错的效果。选择一种聚类因素进行专利聚类分析,可能对专利分析不够全面。另 一方面,仅使用同一种形式的语料进行聚类融合,可能会遗漏很多隐含信息。
【发明内容】
[0005] 本发明的目的是提供一种充分挖掘专利文本摘要中隐含的语义信息、充分利用大 规模语料中隐藏信息的专利文献聚类方法。
[0006] 本发明解决现有技术问题所采用的技术方案:一种专利文献聚类方法,包括W下 步骤:
[0007]S1、语料集采集及预处理:
[0008]al、语料集采集;选定预定领域,从专利文献数据库中按照专利IPC分类号在每个 类别中采集专利文献信息组成语料集,所述专利文献信息包括专利文献的专利标题、IPC分 类号和专利摘要;从所述语料集中提取所有专利文献的专利摘要并存储为词向量训练语 料集;从语料集中提取部分专利文献的专利摘要并存储为属性和属性值模型训练语料集; 从语料集中提取部分专利文献的专利标题、专利摘要和IPC分类号并存储为聚类分析语料 集;从聚类分析语料集中抽取所有专利摘要并将其分成两个部分,一部分作为聚类分析摘 要集,另一部分作为聚类分析属性和属性值抽取集;从聚类分析语料集中抽取所有专利标 题并存储为聚类分析标题集;
[0009]a2、分词处理及标注;采用分词模型对词向量训练语料集、聚类分析标题集、聚类 分析摘要集、属性和属性值模型训练语料集、聚类分析属性和属性值抽取集进行分词处理 分别得到相对应的词向量训练词语集、聚类分析标题词语集、聚类分析摘要词语集、属性和 属性值模型训练词语集、聚类分析属性和属性值抽取词语集,同时对属性和属性值模型训 练词语集和属性值抽取词语集进行词性标注及属性标注;所述属性标注W属性和属性值组 成的数据组的形式进行标注;
[0010] S2、聚类分析语料的特征词提取;对步骤S1中得到的与聚类分析摘要集相对应的 聚类分析摘要词语集,统计聚类分析摘要词语集中每个词语在聚类分析摘要集的每篇摘要 中出现的频率和聚类分析摘要集中包含该词语的专利摘要的数量,计算每个词语的TFIDF 值:
[0011]
[0012] 其中,N为聚类分析语料集的语料总数,为第k个词语在聚类分析摘要集中的 第i篇专利摘要中出现的次数,nk,d为聚类分析摘要集中包含第k个词语的专利摘要的数 量;预设阔值,对于与聚类分析摘要集的每条摘要所对应的聚类分析摘要词语集中的词语 将TFIDF值大于阔值的词语作为与该专利摘要的特征词,每条专利摘要的特征词组成聚类 分析摘要特征词集合;遍历步骤S1得到的聚类分析标题词语集,对于每一条专利标题,将 属于对应聚类分析摘要特征词集合中的词语提取并保存为聚类分析专利标题特征词集;
[0013] S3、基于词向量的聚类分析数据专利向量表示:
[0014] 包括如下步骤:
[0015] bl、获取词向量;利用词向量技术,得到所述词向量训练词语集中每个词语的词向 量;
[0016] b2、属性和属性值抽取;将属性和属性值作为命名实体,利用序列标注技术,通过 步骤a2得到的经过属性标注后的属性和属性值模型训练词语集所对应的属性和属性值模 型训练语料集训练得到的条件随机场模型,并将训练得到的条件随机场模型应用于聚类分 析属性和属性值抽取集,完成对聚类分析属性和属性值抽取集中的每个专利摘要的标签预 巧U;对于经过标签预测的聚类分析属性和属性值抽取集,提取聚类分析属性和属性值抽取 集中的每一篇专利摘要中被赋予标签的词语,并将上述词语保存为聚类分析摘要属性和属 性值集;
[0017] b3、专利摘要属性和属性值的向量表示:利用词向量技术将步骤b2得到的聚类分 析摘要属性和属性值集中词语表示为词向量形式,将每篇专利摘要所对应的聚类分析摘要 属性和属性值集中的词向量进行线性加和作为该专利摘要属性和属性值的向量表示;
[0018] b4、专利标题的向量表示:利用步骤bl,将聚类分析标题集中包含的专利标题特 征词替换成对应的词向量;将聚类分析标题集中每一调专利标题所对应的所有专利标题特 征词的词向量进行线性相加,得到该条专利标题的向量表示;
[0019] b5、专利摘要文本的向量表示;利用步骤b4的方法得到专利摘要文本的向量表 示;
[0020] b6、加权融合;将步骤b3-b5得到专利摘要属性和属性值的向量表示、专利标题的 向量表示和专利摘要文本的向量表示进行加权线性求和,求和之后得到的和向量即为聚类 分析数据专利向量表示;
[0021]S4、聚类;针对步骤S3得到的聚类分析数据专利向量,利用聚类分析法通过计算 聚类分析数据专利向量之间的相似度完成初次聚类;再结合具体的阔值,对初始聚类结果 进行不断调整,最后得到聚类分析数据中专利的聚类结果;
[0022] S5、聚类结果评价:根据预设的评价指标对聚类结果进行评价。
[0023] 步骤S1中抽取属性和属性值模型训练语料集和聚类分析语料集的方法为;按照 专利IPC分类号在语料集中在每个类别中分别抽取相同数量的专利摘要组成属性和属性 值模型训练语料集;按照专利IPC分类号在语料集中在每个类别中分别抽取相同数量的专 利标题、专利摘要和IPC分类号组成聚类分析语料集。
[0024] 所述词向量训练语料集、属性和属性值模型训练语料集和聚类分析语料集中的专 利文献信息W分行形式进行存储,其中每行专利文献信息对应一篇专利文献。
[00巧]所述属性标注的具体方法为:对于完成词性标注后的属性和属性值模型训练词语 集,对于标注标签集合{属性的开始部分,属性的中间部分,属性的结束部分,属性值的开 始部分,属性值的中间部分,属性值的结束部分,其他},判断完成词性标注后的属性和属 性值模型训练词语集中每个词对应于标注标签集合中的对应属性标签,并标记为相应的标 签,而将无法在标注标签中对应的词标
记为{其他};将完成词性标注的聚类分析属性和属 性值抽取词语集中的词语均标注为{其他}
[0026] 分词处理的方法采用隐马尔科夫模型。
[0027] 步骤b6中加权融合的方法如下;
[003。其中,D为专利文档向量,V为一种形式的文档向量,?为特征词对应的词向量,Wi 为第i种信息形式对应文档向量的权重,q,.第j个关键词在一篇文档中出现的次数,di表 示关键词对应的实数向量的一个维度
[0032] 步骤S4中的聚类方法包括如下步骤:
[0033] cl、选定k个专利文献作为聚类中屯、;
[0034]c2、计算其他专利文献与所述聚类中屯、的距离,比较得到距离最近的中心将所述 其他专利文献标记为类别i,得到多个类簇;
[0035]c3、选定k个类簇并计算该K个类簇的中屯、,求出每个类簇的平均值,得到新的聚 类中屯、;
[0036]c4、重复步骤c2-c3,直到两次中屯、的差异度小于预设阔值。
[0037] 步骤S5中,预设的评价指标包括聚类结果的准确率、召回率和F值;聚类结果的准 确率通过如下公式获得:
[0041] 其中,P为聚类结果的准确率,P(Ci)为第i个类簇的准确率,分别计算k个类别在 类簇i中的准确率,选择最大的准确率作为类簇i的准确率;"Wr,为类簇i和类别k中相 同的专利的个数,n。,为类簇i中专利的个数;
[0042] 聚类结果的召回率通过如下公式获得:
[0046] 其中,R为聚类结果的召回率,R(Ci)为第i个类簇的召回率,分别计算k个类别在 类簇i中的召回率,选择最大的召回率作为类簇i的召回率;"/化为类簇i和类别k中相 同的专利的个数,"/i为类别k中专利的个数;
[0047] 聚类结果的F值通过如下公式获得:
[0048]
[0049] 本发明的有益效果在于;本发明的专利文献聚类方法综合考虑了专利文献的标题 和摘要信息,取得很好的专利聚类效果;通过将专利摘要信息从不同角度进行利用,考虑专 利摘要文本的整体信息,同时考虑专利摘要中属性和属性值的信息,充分挖掘了专利文本 摘要中隐含的语义信息;充分利用大规模语料中隐藏的信息,利用大规模的语料进行特征 训练,将词语表示成低绅度的向量形式,避免了维灾难的同时更好地提取了文本中的信息; 设置不同的权重,将标题、摘要和摘要的属性值对=种形式的数据进行融合,得到很好的专 利聚类效果;在相同的语料上,本发明的聚类结果的准确率、召回率和F值分别是0.5912、 0. 4656和0. 5208,对比实验准确率、召回率和F值分别是0. 5208, 0. 1859, 0. 2739。
【附图说明】
[0050] 图1为本发明的逻辑原理图。
【具体实施方式】
[0051] W下结合附图及具体实施例对本发明进行说明:
[00閲 实施例
[0053]S1、语料集采集及预处理:
[0054]al、语料集采集;
[0055] 选定汽车领域,从"国家知识产权局专利数据库"中利用爬虫技术按照专利IPC分 类号A-H八个类别在每个类别中爬取专利文献信息组成语料集。专利文献信息包含专利标 题、IPC分类号和专利摘要;抽取语料集中所有专利文献的专利摘要存储为词向量训练语 料集;抽取语料集中1000篇专利文献的专利摘要存储为属性和属性值模型训练语料集,属 性和属性值模型训练语料集中包含A-H八个类别的专利摘要且每一个类别的抽取125篇专 利摘要;从语料集中抽取640篇专利文献的专利标题、专利摘要和IPC分类号并存储为聚类 分析语料集,同样的,所抽取的聚类分析语料集中包含A-H八个类别的专利文献信息,且每 一个类别中抽取80篇专利文献的专利标题、专利摘要和IPC分类号;从聚类分析语料集抽 取所有的专利摘要将其分成两个部分,一部分作为聚类分析摘要集,另一部分作为聚类分 析属性和属性值抽取集;聚类分析语料集中抽取所有专利标题并存储为聚类分析标题集; 为了便于数据处理,词向量训练语料集、属性和属性值模型训练语料集、聚类分析语料集及 聚类分析标题集中的专利文献信息W分行形式进行存储,其中每行专利文献信息对应一篇 专利文献。即每一行数据对应一篇专利文献的专利摘要;聚类分析标题集中每一行数据对 应一篇专利的标题,聚类分析语料集中的每一行数据对应一篇专利的标题、IPC分类号和摘 要;
[0056]a2、分词处理及标注;采用隐马尔科夫模型对词向量训练语料集、聚类分析标题 集、聚类分析摘要集、属性和属性值模型训练语料集、聚类分析属性和属性值抽取集进行分 词处理,分别得到相对应的词向量训练词语集、聚类分析标题词语集、聚类分析摘要词语 集、属性和属性值模型训练词语集、聚类分析属性和属性值抽取词语集,同时对属性和属性 值模型训练词语集和聚类分析属性和属性值抽取词语集进行词性标注及属性标注;所述属 性标注W属性和属性值组成的数据组的形式进行标注;
[0057] 其中,属性标注的具体方法为;对于完成词性标注后的属性和属性值模型训练词 语集,设定标注标签集合为巧-A,M-A,E-A,B-V,M-V,E-V,0},分别表示{属性的开始部分, 属性的中间部分,属性的结束部分,属性值的开始部分,属性值的中间部分,属性值的结束 部分,其他},判断完成词性标注后的属性和属性值模型训练词语集中每个词对应于标注标 签集合中的对应属性标签,并标记为相应的标签,而将无法在标注标签中对应的词标记为 {其他}(即标签"0");将完成词性标注的聚类分析属性和属性值抽取词语集中的词语均标 注为{其他}(即标签"0");将属性标记完成的属性和属性值模型训练词语集和聚类分析 属性和属性值抽取词语集进行处理,使得处理后性和属性值模型训练词语集和聚类分析属 性和属性值抽取词语集的每一行只包含一个词、该词的词性和标签,彼此之间用"\t" (T油 键)分开,同时数据文件中的每一篇专利摘要的数据之间用空行隔开。
[0058]S2、聚类分析语料的特征词提取;对步骤S1中得到的与聚类分析摘要集相对应的 聚类分析摘要词语集,统计聚类分析摘要词语集中每个词语在聚类分析摘要集的每篇摘要 中出现的频率和聚类分析摘要集中包含该词语的专利摘要的数量,计算每个词语的TFIDF 值:
[0059]
[0060] 其中,N为聚类分析语料集的语料总数,rikj为第k个词语在聚类分析摘要集中的 第i篇专利摘要中出现的次数,为聚类分析摘要集中包含第k个词语的专利摘要的数 量;预设阔值,对于与聚类分析摘要集的每条摘要所对应的聚类分析摘要词语集中的词语 将TFIDF值大于阔值的词语作为与该专利摘要的特征词,每条专利摘要的特征词组成聚类 分析摘要特征词集合;遍历步骤S1得到的聚类分析标题词语集,对于每一条专利标题,将 属于对应聚类分析摘要特征词集合中的词语提取并保存为聚类分析专利标题特征词集。
[0061]S3、基于词向量的聚类分析数据专利向量表示:
[0062] 包括如下步骤:
[006引 bl、获取词向量;利用词向量word2vec技术,得到所述词向量训练词语集中每个 词语的词向量;词向量的维度是200。
[0064]b2、属性和属性值抽取;将属性和属性值作为命名实体,利用序列标注技术,通过 步
骤a2得到的经过属性标注后的属性和属性值模型训练词语集所对应的属性和属性值模 型训练语料集训练得到的条件随机场模型,并将训练得到的条件随机场模型应用于聚类分 析属性和属性值抽取集,完成对聚类分析属性和属性值抽取集中的每个专利摘要的标签预 巧U;对于经过标签预测的聚类分析属性和属性值抽取集,提取聚类分析属性和属性值抽取 集中的每一篇专利摘要中被赋予标签的词语,并将上述词语保存为聚类分析摘要属性和属 性值集;聚类分析摘要属性和属性值集优选采取分行存储的方式,每行存储的数据表示一 篇专利摘要的属性和属性值信息,并保证聚类分析摘要属性和属性值集中每行数据与聚类 分析摘要集相对应,即聚类分析摘要属性和属性值集和聚类分析摘要集在相同的行号所对 应的数据来自同一篇专利文献。
[0065]b3、专利摘要属性和属性值的向量表示:利用词向量技术将步骤b2得到的聚类分 析摘要属性和属性值集中词语表示为词向量形式,即遍历聚类分析摘要属性和属性值集的 每一行,在一行中从前往后逐次将每个词替换为对应的词向量形式,假如某个词没有对应 的词向量,则忽略该词。然后将每篇专利摘要所对应的聚类分析摘要属性和属性值集中的 词向量进行线性加和作为该专利摘要属性和属性值的向量表示;
[0066]b4、专利标题的向量表示:利用步骤bl,将聚类分析标题集中包含的专利标题特 征词替换成对应的词向量;即遍历聚类分析标题集中的每一行,在一行中从前往后逐次将 专利标题特征词替换成为对应的词向量,假如某个专利标题特征词没有对应的词向量,贝U 忽略该特征词。然后将聚类分析标题集中每一条专利标题所对应的所有专利标题特征词的 词向量进行线性相加,得到该条专利标题的向量表示;
[0067]b5、专利摘要文本的向量表示;利用步骤b4的方法得到专利摘要文本的向量表 示;遍历S2得到的完成特征词提取的聚类分析摘要集,遍历每一行数据,在一行中从前往 后逐次将专利摘要的特征词替换成对应的词向量,假如某个专利摘要的特征词没有对应的 词向量,则忽略该特征词;将每一篇摘要的所有词向量进行线性相加,每一篇摘要的和向量 就是该篇摘要文本对应的向量。
[006引 b6、加权融合;将步骤b3-b5得到专利摘要属性和属性值的向量表示、专利标题的 向量表示和专利摘要文本的向量表示进行加权线性求和,求和之后得到的和向量即为聚类 分析数据专利向量表示;加权融合的方法如下:
[0072] 其中,5为专利文档向量,;为一种形式的文档向量,?为特征词对应的词向量,Wi 为第i种信息形式对应文档向量的权重,qj第j个关键词在一篇文档中出现的次数,di表 示关键词对应的实数向量的一个维度。
[0073]S4、聚类;针对步骤S3得到的聚类分析数据专利向量,利用聚类分析法通过计算 聚类分析数据专利向量之间的相似度完成初次聚类;再结合具体的阔值,对初始聚类结果 进行不断调整,最后得到聚类分析数据中专利的聚类结果;
[0074] 聚类算法的思想是,从实验语料数据中选择k个文档向量作为中屯、,k为预定义 的聚类最终产生的类簇个数;分别计算实验语料数据中其他文档向量与该k个中屯、的相似 度,将实验语料数据中的所述其他文档向量划分到最相近的中屯、所在的类簇;重新选定k 个类簇计算每个类簇的中屯、,计算方法是计算每个类簇的平均值,将平均值作为聚类中屯、; 一直重复进行中屯、选择和类簇划分,一直到开始收敛。该里我们选择标准差作为测度函数, 但不限于标准差。
[00巧]具体地,聚类方法包括如下步骤:
[0076]cl、选定k个专利文献作为聚类中屯、;
[0077]c2、计算其他专利文献与所述聚类中屯、的距离,比较得到距离最近的中心将所述 其他专利文献标记为类别i,得到多个类簇;
[0078]c3、选定k个类簇并计算该K个类簇的中屯、,求出每个类簇的平均值,得到新的聚 类中屯、;
[0079]c4、重复步骤c2-c3,直到两次中屯、的差异度小于预设阔值。
[0080]S5、聚类结果评价:根据步骤S4,聚类分析数据被聚成k个类别,根据聚类结果的 准确率、召回率和F值对聚类结果进行评价。
[0081] 其中,聚类结果的准确率通过如下公式获得:
[0082]
[0083] P (Ci) = max {P成,Ci),P成,Ci),. . .,P (f j, Ci),. . .,P咕,Ci)}
[0084]
[0085] 其中,P为聚类结果的准确率,P(Ci)为第i个类簇的准确率,分别计算k个类别在 类簇i中的准确率,选择最大的准确率作为类簇i的准确率;"/*化为类簇i和类别k中相 同的专利的个数,为类簇i中专利的个数;
[0086] 聚类结果的召回率通过如下公式获得:
[0090] 其中,R为聚类结果的召回率,R(Ci)为第i个类簇的召回率,分别计算k个类别在 类簇i中的召回率,选择最大的召回率作为类簇i的召回率;为类簇i和类别k中相 同的专利的个数,M/i为类别k中专利的个数;
[0091] 聚类结果的F值通过如下公式获得:
[0092]
[0093] 实验结果如下;
[0094] 表1聚类结果评价
[0095]
[0096] 通过分析表1,我们聚类结果较对比实验的实验结果均有所提高。实验结果证明本 方法可W更好的实验专利数据的聚类。本实验效果提升的原因是,相比较对比实验选择奇 异值分解的方法,本发明选择更好的基于深度学习的词向量表示形式;对比实验只考虑了 专利摘要的信息,本发明将摘要信息通过两种形式进行表示,同时本文加入了专利标题信 息。本发明选择与类别个数相同的类簇个数,对聚类中屯、的选择没有做特殊的预处理,该些 因素使得本发明的聚类结果较对比实验的结果稍差。本发明考虑到对比实验选择110W上 的类簇个数,类别标签还是选择了IPC分类号,该样的聚类结果可解释性稍差,本发明没有 选择加到类簇个数来提升实验结果。
[0097]W上内容是结合具体的优选技术方案对本发明所作的进一步详细说明,不能认定 本发明的具体实施只局限于该些说明。对于本发明所属技术领域的普通技术人员来说,在 不脱离本发明构思的前提下,还可W做出若干简单推演或替换,都应当视为属于本发明的 保护范围。
【主权项】
1. 一种专利文献聚类方法,其特征在于,包括以下步骤: 51、 语料集采集及预处理: al、语料集采集:选定预定领域,从专利文献数据库中按照专利IPC分类号在每个类别 中采集专利文献信息组成语料集,所述专利文献信息包括专利文献的专利标题、IPC分类号 和专利摘要;从所述语料集中提取所有专利文献的专利摘要并存储为词向量训练语料集; 从语料集中提取部分专利文献的专利摘要并存储为属性和属性值模型训练语料集;从语料 集中提取部分专利文献的专利标题、专利摘要和IPC分类号并存储为聚类分析语料集;从 聚类分析语料集中抽取所有专利摘要并将其分成两个部分,一部分作为聚类分析摘要集, 另一部分作为聚类分析属性和属性值抽取集;从聚类分析语料集中抽取所有专利标题并存 储为聚类分析标题集; a2、分词处理及标注:采用分词模型对词向量训练语料集、聚类分析标题集、聚类分析 摘要集、属性和属性值模型训练语料集、聚类分析属性和属性值抽取集进行
分词处理分别 得到相对应的词向量训练词语集、聚类分析标题词语集、聚类分析摘要词语集、属性和属性 值模型训练词语集、聚类分析属性和属性值抽取词语集,同时对属性和属性值模型训练词 语集和属性值抽取词语集进行词性标注及属性标注;所述属性标注以属性和属性值组成的 数据组的形式进行标注; 52、 聚类分析语料的特征词提取:对步骤Sl中得到的与聚类分析摘要集相对应的聚类 分析摘要词语集,统计聚类分析摘要词语集中每个词语在聚类分析摘要集的每篇摘要中出 现的频率和聚类分析摘要集中包含该词语的专利摘要的数量,计算每个词语的TFIDF值:其中,N为聚类分析语料集的语料总数,nti为第k个词语在聚类分析摘要集中的第 i篇专利摘要中出现的次数,ntd为聚类分析摘要集中包含第k个词语的专利摘要的数量; 预设阈值,对于与聚类分析摘要集的每条摘要所对应的聚类分析摘要词语集中的词语将 TFIDF值大于阈值的词语作为与该专利摘要的特征词,每条专利摘要的特征词组成聚类分 析摘要特征词集合;遍历步骤Sl得到的聚类分析标题词语集,对于每一条专利标题,将属 于对应聚类分析摘要特征词集合中的词语提取并保存为聚类分析专利标题特征词集; 53、 基于词向量的聚类分析数据专利向量表示: 包括如下步骤: bl、获取词向量:利用词向量技术,得到所述词向量训练词语集中每个词语的词向量; b2、属性和属性值抽取:将属性和属性值作为命名实体,利用序列标注技术,通过步骤 a2得到的经过属性标注后的属性和属性值模型训练词语集所对应的属性和属性值模型训 练语料集训练得到的条件随机场模型,并将训练得到的条件随机场模型应用于聚类分析属 性和属性值抽取集,完成对聚类分析属性和属性值抽取集中的每个专利摘要的标签预测; 对于经过标签预测的聚类分析属性和属性值抽取集,提取聚类分析属性和属性值抽取集中 的每一篇专利摘要中被赋予标签的词语,并将上述词语保存为聚类分析摘要属性和属性值 集; b3、专利摘要属性和属性值的向量表示:利用词向量技术将步骤b2得到的聚类分析摘 要属性和属性值集中词语表示为词向量形式,将每篇专利摘要所对应的聚类分析摘要属性 和属性值集中的词向量进行线性加和作为该专利摘要属性和属性值的向量表示; b4、专利标题的向量表示:利用步骤bl,将聚类分析标题集中包含的专利标题特征词 替换成对应的词向量;将聚类分析标题集中每一调专利标题所对应的所有专利标题特征词 的词向量进行线性相加,得到该条专利标题的向量表示; b5、专利摘要文本的向量表示:利用步骤b4的方法得到专利摘要文本的向量表示; b6、加权融合:将步骤b3-b5得到专利摘要属性和属性值的向量表示、专利标题的向量 表示和专利摘要文本的向量表示进行加权线性求和,求和之后得到的和向量即为聚类分析 数据专利向量表示; 54、 聚类:针对步骤S3得到的聚类分析数据专利向量,利用聚类分析法通过计算聚类 分析数据专利向量之间的相似度完成初次聚类;再结合具体的阈值,对初始聚类结果进行 不断调整,最后得到聚类分析数据中专利的聚类结果; 55、 聚类结果评价:根据预设的评价指标对聚类结果进行评价。2. 根据权利要求1所述的一种专利文献聚类方法,其特征在于,步骤Sl中抽取属性和 属性值模型训练语料集和聚类分析语料集的方法为:按照专利IPC分类号在语料集中在每 个类别中分别抽取相同数量的专利摘要组成属性和属性值模型训练语料集;按照专利IPC 分类号在语料集中在每个类别中分别抽取相同数量的专利标题、专利摘要和IPC分类号组 成聚类分析语料集。3. 根据权利要求1所述的一种专利文献聚类方法,其特征在于,所述词向量训练语料 集、属性和属性值模型训练语料集和聚类分析语料集中的专利文献信息以分行形式进行存 储,其中每行专利文献信息对应一篇专利文献。4. 根据权利要求1所述的一种专利文献聚类方法,其特征在于,所述属性标注的具体 方法为:对于完成词性标注后的属性和属性值模型训练词语集,对于标注标签集合{属性 的开始部分,属性的中间部分,属性的结束部分,属性值的开始部分,属性值的中间部分,属 性值的结束部分,其他},判断完成词性标注后的属性和属性值模型训练词语集中每个词对 应于标注标签集合中的对应属性标签,并标记为相应的标签,而将无法在标注标签中对应 的词标记为{其他};将完成词性标注的聚类分析属性和属性值抽取词语集中的词语均标 注为{其他}。5. 根据权利要求1所述的一种专利文献聚类方法,其特征在于,分词处理的方法采用 隐马尔科夫模型。6. 根据权利要求1所述的一种专利文献聚类方法,其特征在于,步骤b6中加权融合的 方法如下:其中,5为专利文档向量,?为一种形式的文档向量,7为特征词对应的词向量,Wi为 第i种信息形式对应文档向量的权重,第j个关键词在一篇文档中出现的次数,d i表示 关键词对应的实数向量的一个维度。7. 根据权利要求1所述的一种专利文献聚类方法,其特征在于,步骤S4中的聚类方法 包括如下步骤: cl、选定k个专利文献作为聚类中心; c2、计算其他专利文献与所述聚类中心的距离,比较得到距离最近的中心,将所述其 他专利文献标记为类别i,得到多个类簇; c3、选定k个类簇并计算该K个类簇的中心,求出每个类簇的平均值,得到新的聚类中 心; c4、重复步骤c2-c3,直到两次中心的差异度小于预设阈值。8. 根据权利要求1所述的一种专利文献聚类方法,其特征在于,步骤S5中,预设的评价 指标包括聚类结果的准确率、召回率和F值;聚类结果的准确率通过如下公式获得:P (Ci) = max {P 的,Ci),P (f2, Ci),· · ·,P (fj,Ci),· · ·,P (fk,Ci)}其中,P为聚类结果的准确率,AG)为第i个类簇的准确率,分别计算k个类别在类簇 i中的准确率,选择最大的准确率作为类簇i的准确率;为类簇i和类别k中相同的专 利的个数,\为类簇i中专利的个数; 聚类结果的召回率通过如下公式获得:R(Ci) = max{R(f·!,Ci),R(f2, Ci),…,R(fj,Ci),…,R(fk,CiM其中,R为聚类结果的召回率,辦?)为第i个类簇的召回率,分别计算k个类别在类簇 i中的召回率,选择最大的召回率作为类簇i的召回率为类簇i和类别k中相同的专 利的个数,为类别k中专利的个数; 聚类结果的F值通过如下公式获得:
【专利摘要】一种专利文献聚类方法,包括以下步骤:S1、语料集采集及预处理;S2、聚类分析语料的特征词提取;S3、基于词向量的聚类分析数据专利向量表示;S4、聚类;S5、聚类结果评价。本发明的专利文献聚类方法综合考虑了专利文献的标题和摘要信息,通过将专利摘要信息从不同角度进行利用,考虑专利摘要文本的整体信息,同时考虑专利摘要中属性和属性值的信息,充分挖掘了专利文本摘要中隐含的语义信息;充分利用大规模语料中隐藏的信息,利用大规模的语料进行特征训练,将词语表示成低纬度的向量形式,避免了维灾难的同时更好地提取了文本中的信息;设置不同的权重,将标题、摘要和摘要的属性值对三种形式的数据进行融合,得到很好的专利聚类效果。
【IPC分类】G06F17/27
【公开号】CN104881401
【申请号】CN201510278103
【发明人】林鸿飞, 孙东普
【申请人】大连理工大学
【公开日】2015年9月2日
【申请日】2015年5月27日
转载请注明原文地址:https://www.famiwei.com/read-8138674.html