中文网络话题评论文本语义倾向分析的方法及装置的制造方法

xiaoxiao2020-10-23  20

中文网络话题评论文本语义倾向分析的方法及装置的制造方法
【技术领域】
[0001] 本发明实施例设及自然语言处理技术,尤其设及一种中文网络话题评论文本语义 倾向分析的方法及装置。
【背景技术】
[0002] 随着网络的飞速发展,网上的各种各样的文章和言论信息量越来越大,使文本倾 向性分析逐渐成为了近几年热口的研究课题。目前,在该个领域中主要有几个主要的研究 方向,其中观点提取和词汇倾向性分类为倾向分析核屯、技术,文本倾向性分类和主客观分 类也是倾向分析研究方向重要分支。而关于情感倾向分析中的研究思路主要为采用机器学 习的方法、基于语义的方法和结合语义和机器学习的方法。
[0003] 文本的情感倾向分析方法中,基于机器学习的方法需要大量的人工标注语料、建 立训练样本集和训练分类模型的工作,工作繁重而复杂,而取得的分类效果在部分领域与 语义分析的效果差距不大,对于网络文本的准确率和召回率各为86%和85. 2%。基于语义 的分析方法比较单一,大都基于比较固定的语法模式。其中语义的分析方法中处理最基本 的单位是情感词,随着网络文本的多样化,情感词提取并不能达到很高的准确率,对于网络 文本的准确率和召回率各为84. 2%和84. 1%。
[0004] 因此,现有技术中,文本语义倾向分析的方法或多或少都存在准确率和召回率低 的问题。

【发明内容】

[0005] 有鉴于此,本发明实施例提供一种中文网络话题评论文本语义倾向分析的方法及 装置,W提高网络话题评论文本的语义倾向分析的准确率和召回率。
[0006] 第一方面,本发明实施例提供了一种中文网络话题评论文本语义倾向分析的方 法,所述方法包括:
[0007] 对中文网络话题评论文本进行分词和分句,获得结果序列;
[0008] 对所述结果序列进行句法分析和语法分析,获得评价对象;
[0009] 对所述结果序列进行句式分析,确定所述评论文本中的单句和复句,并判断组成 复句的各个单句之间的关系,根据所述评论文本中的单句和组成复句的各个单句之间的关 系确定句式分析的第一情感倾向值;
[0010] 针对所述结果序列中的每个句子,根据所述评价对象和预设的短语搭配模式提取 每个句子中的情感短语,并根据所述短语搭配模式的权重计算所述情感短语的第二情感倾 向值;
[0011] 根据所述第一情感倾向值及第二情感倾向值,计算所述评论文本中的每个句子相 对于评价对象的第=情感倾向值;
[0012] 根据第=情感倾向值确定所述评论文本的文本情感倾向值。
[0013] 进一步地,还包括:
[0014] 基于预设篇数的网络话题,进行短语搭配模式的出现次数统计,W获取所述短语 搭配模式及其权重。
[0015] 进一步地,对所述结果序列进行句法分析和语法分析,获得评价对象,包括:
[0016] 利用LTP对所述评论文本中的句子进行句法分析,得到依存句法分析树,其中,所 述依存句法分析树包括SBV、V0B和/或ATT;
[0017] 查找句子中的SBV关系对,在所述SBV关系对中,当谓语为形容词时,主语为评价 对象;当谓语为动词时,查找句子中含有所述动词的V0B关系对,在所述V0B关系对中,当宾 语为名词或者名词短语时,宾语为评价对象;
[0018] 当句子中没有SBV关系对时,查找V0B关系对,在所述V0B关系对中,当谓语情感 倾向值不为0且宾语为名词时,宾语为评价对象;
[0019] 当句子中没有SBV关系对和V0B关系对时,查找ATT关系对,当所述ATT关系对修 饰的词语为名词,且定语的情感倾向值不为0时,所述定语修饰的词语为评价对象;
[0020] 当句子中没有SBV关系对、V0B关系对和ATT关系对时,利用语法分析提取出名词 或者名词短语,在该名词或者名词短语所在的句子中如果存在具有情感倾向的词语,则该 名词或者名词短语为评价对象。
[0021] 进一步地,根据所述第一情感倾向值及第二情感倾向值,计算所述评论文本中的 每个句子相对于评价对象的第=情感倾向值,具体包括:
[0022] 在一个句子中,该句子中所有情感短语的第二情感倾向值相加后的结果与第一情 感倾向值相乘,所得结果为该句子相对于评价对象的第=情感倾向值。
[0023] 进一步地,根据第立情感倾向值确定所述评论文本的文本情感倾向值,具体包 括:
[0024] 所述评论文本中的所有句子相对于评价对象的第=情感倾向值累加得到所述评 论文本的文本情感倾向值。
[0025] 第二方面,本发明实施例还提供了一种中文网络话题评论文本语义倾向分析的装 置,所述装置包括:
[0026] 分词分句模块,用于对中文网络话题评论文本进行分词和分句,获得结果序列;
[0027] 评价对象提取模块,用于对所述结果序列进行句法分析和语法分析,获得评价对 象;
[0028] 句式分析模块,用于对所述结果序列进行句式分析,确定所述评论文本中的单句 和复句,并判断组成复句的各个单句之间的关系,根据所述评论文本中的单句和组成复句 的各个单句之间的关系确定句式分析的第一情感倾向值;
[0029] 情感短语提取模块,用于针对所述结果序列中的每个句子,根据所述评价对象和 预设的短语搭配模式提取每个句子中的情感短语,并根据所述短语搭配模式的权重计算所 述情感短语的第二情感倾向值;
[0030]句子情感倾向计算模块,用于根据所述第一情感倾向值及第二情感倾向值,计算 所述评论文本中的每个句子相对于评价对象的第=情感倾向值;
[0031] 文本情感倾向计算模块,用于根据第=情感倾向值确定所述评论文本的文本情感 倾向值。
[0032] 进一步地,还包括:
[0033] 短语搭配模式获取模块,用于基于预设篇数的网络话题,进行短语搭配模式的出 现次数统计,W获取所述短语搭配模式及其权重。
[0034] 进一步地,所述评价对象提取模块包括:
[00巧]句法分析单元,用于利用LTP对所述评论文本中的句子进行句法分析,得到依存 句法分析树,其中,所述依存句法分析树包括SBV、V0B和/或ATT;
[0036] 第一查找单元,用于查找句子中的SBV关系对,在所述SBV关系对中,当谓语为形 容词时,主语为评价对象;当谓语为动词时,查找句子中含有所述动词的V0B关系对,在所 述V0B关系对中,当宾语为名词或者名词短语时,宾语为评价对象;
[0037] 第二查找单元,用于当句子中没有SBV关系对时,查找V0B关系对,在所述V0B关 系对中,当谓语情感倾向值不为0且宾语为名词时,宾语为评价对象;
[003引第S查找单元,用于当句子中没有SBV关系对和V0B关系对时,查找ATT关系对, 当所述ATT关系对修饰的词语为名词,且定语的情感倾向值不为0时,所述定语修饰的词语 为评价对象;
[0039] 语法分析单元,用于当句子中没有SBV关系对、V0B关系对和ATT关系对时,利用 语法分析提取出名词或者名词短语,在该名词或者名词短语所在的句子中如果存在具有情 感倾向的词语,则该名词或者名词短语为评价对象。
[0040] 进一步地,所述句子情感倾向计算模块具体用于:
[0041] 在一个句子中,该句子中所有情感短语的第二情感倾向值相加后的结果与第一情 感倾向值相乘,所得结果为该句子相对于评价对象的第=情感倾向值。
[0042] 进一步地,所述文本情感倾向计算模块具体用于:
[0043] 所述评论文本中的所有句子相对于评价对象的第=情感倾向值累加得到所述评 论文本的文本情感倾向值。
[0044] 本发明实施例提供的中文网络话题评论文本语义倾向分析的方法及装置,通过对 中文网络话题评论文本分词和分句后得到结果序列,对所述结果序列进行句法分析和语法 分析得到评价对象,对所述结果序列进行句式分析确定句式分析的第一情感倾向值,提取 每个句子中的情感短语,并确定所述情 感短语的第二情感倾向值,根据第一情感倾向值和 第二情感倾向值计算每个句子相对于评价对象的第=情感倾向值,根据第=情感倾向值确 定所述评论文本的文本情感倾向值,由于采用了情感短语与句式分析向结合的方式确定评 论文本的情感倾向值,提高了网络话题评论文本的语义倾向分析的准确率和召回率。
【附图说明】
[0045] 图1是本发明实施例一提供的一种中文网络话题评论文本语义倾向分析的方法 的流程图;
[0046] 图2是本发明实施例提供的中文网络话题评论文本语义倾向分析的方法中的获 得评价对象的流程图;
[0047] 图3是本发明实施例提供的中文网络话题评论文本语义倾向分析的方法中的利 用LTP进行句法分析的结果示意图;
[0048] 图4是本发明实施例提供的中文网络话题评论文本语义倾向分析的方法中的 Stan化rdParser进行语法分析后的结果示意图;
[0049] 图5是本发明实施例二提供的一种中文网络话题评论文本语义倾向分析的装置 的示意图。
【具体实施方式】
[0050] 下面结合附图和实施例对本发明作进一步的详细说明。可W理解的是,此处所描 述的具体实施例仅仅用于解释本发明,而非对本发明的限定。另外还需要说明的是,为了便 于描述,附图中仅示出了与本发明相关的部分而非全部内容。
[00川 实施例一
[0052] 图1是本发明实施例一提供的一种中文网络话题评论文本语义倾向分析的方法 的流程图,本实施例可适用于对中文网络话题中的评论文本进行语义倾向分析,该方法可 W由计算机来执行,具体包括如下步骤:
[0053] 步骤110,对中文网络话题评论文本进行分词和分句,获得结果序列。
[0054] 中文网络话题评论文本最基本的组成单位是词和句子,因此首先对评论文本进行 分词和分句,获得分词和分句处理后的结果序列。在所述结果序列中,评论文本分句后的各 个句子已经分隔开,每个句子中的各个词语通过空格分隔开。
[00巧]步骤120,对所述结果序列进行句法分析和语法分析,获得评价对象。
[0056] 在对网络话题评论文本的分析中,最重要的是对其中的句子进行分析,因此,首先 对所述结果序列中的每个句子进行句法分析,得到每个句子中的SBV(subject-verb,主谓 结构)关系对、V0B(verb-object,动宾结构)关系对和/或ATT(attribute,定中结构)关 系对,依次提取出每个关系对中的名词或者名词短语,该名词或者名词短语为评价对象;当 一个句子中同时不存在SBV关系对、V0B关系对和ATT关系对时,对该句子进行语法分析, 提取出该句子中的名词或者名词短语,该名词或者名词短语为评价对象。
[0057] 通过提取评价对象,判断网络文本相对于所述评价对象的情感倾向,可W进一步 提高情感倾向分析的准确率。
[005引图2是本发明实施例提供的中文网络话题评论文本语义倾向分析的方法中的获 得评价对象的流程图,如图2所示,对所述结果序列进行句法分析和语法分析,获得评价对 象,包括如下步骤:
[0059] 步骤121,利用LTP对所述评论文本中的句子进行句法分析,得到依存句法分析 树。
[0060] 其中,所述依存句法分析树包括SBV、V0B和/或ATT。
[0061] 其中,LTP(LanguageTechnologyPlatform,语言技术平台)是哈工大社会计算与 信息检索研究中屯、开发的一整套中文语言处理系统。
[0062] 利用LTP对待处理的句子进行句法分析后,得到一棵结构化的依存句法分析树, 所述依存句法分析树描述了各个词语之间的相互联系,利用LTP对待处理句子做句法分 析,可W有效地分析句子的内部语法结构并提取组成句子的词语间的语法关系。我不同 意楼主的意思,我们要勿W善小而不为!"为例,进行LTP依存句法分析后的结构如图3所 示。图3是本发明实施例提供的中文网络话题评论文本语义倾向分析的方法中的利用LTP 进行句法分析的结果示意图。在图3中,ROOT表示待处理文本的语句,肥D(head)表示核 屯、,SBV表示主谓结构,ADV(adverbial)表示状中结构,V0B表示动宾结构,ATT表示定中结 构,CNJ(conjunctive)表不关联结构,POB(preposition-object)表不介宾关系,DE表不 "的"字结构,IC(independentclause)表示独立分句。
[0063] 步骤122,查找句子中的SBV关系对,在所述SBV关系对中,当谓语为形容词时,主 语为评价对象;当谓语为动词时,查找句子中含有所述动词的V0B关系对,在所述V0B关系 对中,当宾语为名词或者名词短语时,宾语为评价对象。
[0064] 步骤123,当句子中没有SBV关系对时,查找V0B关系对,在所述V0B关系对中,当 谓语情感倾向值不为0且宾语为名词时,宾语为评价对象。
[006引步骤124,当句子中没有SBV关系对和V0B关系对时,查找ATT关系化当所述ATT关系对修饰的词语为名词,且定语的情感倾向值不为0时,所述定语修饰的词语为评价对 象。
[0066] 步骤125,当句子中没有SBV关系对、V0B关系对和ATT关系对时,利用语法分析提 取出名词或者名词短语,在该名词或者名词短语所在的句子中如果存在具有情感倾向的词 语,则该名词或者名词短语为评价对象。
[0067] 当句子中没有SBV关系对、V0B关系对和ATT关系对时,则利用StanfordParser 语法分析对句子进行分析,此类句子通常都是短小的句子,句子中紧急有情感词或名词。利 用Stan化rdParser语法分析提取出名词或者名词短语,对提取出的名词或者名词短语进 行过滤,在该名词或者名词短语所在的句子中,如果存在具有情感倾向的词语,则该名词或 者名词短语为评价对象。其中,具有情感倾向的词语是指情感词典中存在的词语。
[0068] 其中,Stan化rdParser是斯坦福大学自然语言研究小组推出的语法解析工具,包 括PCFG(Prob油ilisticContextRreeGrammar,概率上下文无关文法)解析器、词库PCFG 解析器和内容依赖解析器,实现语言为JAVA,并且对中文的语法分析相对于LTP句法分析 器来说更具优势。苹果手机用起来感觉真不错。"为例,用Stan化rdParser做语法分 析后的结果如图4所示。图4是本发明实施例提供的中文网络话题评论文本语义倾向分析 的方法中的Stan化rdParser进行语法分析后的结果示意图。在图4中,ROOT表示待处理 文本的语句,IP表示简单从句,NP表示名词短语,VP表示动词短语,PU表示断句符,通常是 句号、问号、感叹号等标点符号,順表示常用名词,W表示动词,VA表示表语形容词,ADVP 表示副词短语,AD表示副词,VCD表示动词基数词。
[0069] 步骤130,对所述结果序列进行句式分析,确定所述评论文本中的单句和复句,并 判断组成复句的各个单句之间的关系,根据所述评论文本中的单句和组成复句的各个单句 之间的关系确定句式分析的第一情感倾向值。
[0070] 其中,句式分析的第一情感倾向值是对每个句子单独定义的,即每个句子有一个 情感倾向值。组成复句的各个单句之间的关系包括并列、递进、转折、选择、假设、条件、因果 和否定等,假设P为所判断句子的情感倾向值,则复句的句子情感倾向值可W表示为表1。 从表1中可W看出,并列关系、选择关系、条件关系和因果关系的复句中的句子情感倾向值 与其包含的单句的情感倾向值相同;转折关系和否定关系的复句中的句子情感倾向值与其 包含的单句的情感倾向值相反;递进关系的复句中的句子情感倾向值是其包含的单句的情 感倾向值再加上0. 5 ;假设关系的复句的句子情感倾向值是无,即为0,即不具有情感倾向。 其中,具体的句子的情感倾向值的计算与其包含的情感短语的情感倾向值相关,上述的句 子情感倾向值P可W理解为该句子所包含的情感短语的情感倾向值之和。
[0071] 表1复句的句子情感倾向值
[0072]
[0073] 在单句中,句式分析的第一情感倾向值为1,在复句中,句式分析的第一情感倾向 值与其包含的单句的情感倾向值有关,如表1所示,可W得到并列关系、选择关系、条件关 系和因果关系的复句的句式分析的第一情感倾向值为1 ;转折关系和否定关系的复句的句 式分析的第一情感倾向值为-1 ;递进关系的复句的句式分析的第一情感倾向值为1. 5 ;假 设关系的复句的句式分析的第一情感倾向值是0。
[0074] 其中,情感倾向包括正向和负向,即对于网络论坛中楼主发起的帖子,回帖的情感 倾向为支持或者不支持。
[0075] 步骤140,针对所述结果序列中的每个句子,根据所述评价对象和预设的短语搭配 模式提取每个句子中的情感短语,并根据所述短语搭配模式的权重计算所述情感短语的第 二情感倾向值。
[0076] 在现有技术中的文本倾向分析中,仅仅依赖于单个情感词来判断文本倾向,由于 仅仅利用单个情感词来判断会忽略一些重要信息(如情感词所针对的评价对象等重要因 素),导致分析的准确率较低。
[0077] 本发明实施例对网络话题评论文本的情感倾向的判断采用包括评价对象的情感 短语来进行判断,其中,情感短语是指文本中能表达情感特征的短语。
[0078] 针对所述结果序列中的每个句子,根据一个句子中的评价对象和预设的短语搭配 模式提取出该句子中的情感短语,并根据所述短语搭配模式的权重计算该句子中的情感短 语的第二情感倾向值,所述短语搭配模式的权重即为相应的情感短语的第二情感倾向值。
[0079] 步骤150,根据所述第一情感倾向值及第二情感倾向值,计算所述评论文本中的每 个句子相对于评价对象的第=情感倾向值。
[0080] 根据句式分析的第一情感倾向值及情感短语的第二情感倾向值,计算所述评论文 本中的每个句子相对于该句子中的评价对象的第=情感倾向值。
[0081] 其中,根据第一情感倾向值及第二情感倾向值,计算所述评论文本中的每个句子 相对于评价对象的第=情感倾向值,具体包括:
[0082] 在一个句子中,该句子中所有情感短语的第二情感倾向值相加后的结果与第一情 感倾向值相乘,所得结果为该句子相对于该句子中的评价对象的第=情感倾向值。
[0083] 所述第S情感倾向值的计算公式如下:
[0084]
[0085] 其中,i为变量,表示评论文本中的第i个句子,P(i)为评论文本中的第i个句子 的第立情感倾向值,S(i)为评论文本中的第i个句子句式分析的第一情感倾向值,m为评论 文本中的第i个句子所包含的情感短语的数量,k为变量,表示评论文本中的第i个句子中 的第k个情感短语,dk为评论文本中的第i个句子所包含的第k个情感短语的第二情感倾 向值。
[0086] 步骤160,根据第立情感倾向值确定所述评论文本的文本情感倾向值。
[0087] 其中,根据第=情感倾向值确定所述评论文本的文本情感倾向值,具体包括:
[0088] 所述评论文本中的所有句子相对于评价对象的第=情感倾向值累加得到所述评 论文本的文本情感倾向值。
[0089] 选取1000篇网络话题文本,分别利用本实施例中描述的情感短语(即短语模式) 单独判断文本的语义倾向,句式分析(即句子模式)单独判断文本的语义倾向,结合情感短 语和句式分析判断文本的语义倾向,所得实验结果如表2所示。在表2中,S表示正确率,R 表示召回率。从表2可知,本实施例中采用情感短语和句式分析相结合进行情感倾向判断 的方式可W取得较高的准确率和召回率。
[0090] 表2实验结果 [00911
[0092] 其中,利用情感短语判断文本的语义倾向时,文本情感倾向值为该文本所包含的 所有情感短语的情感倾向值之和。
[0093] 本实施例通过对中文网络话题评论文本分词和分句后得到结果序列,对所述结果 序列进行句法分析和语法分析得到评价对象,对所述结果序列进行句式分析确定句式分析 的第一情感倾向值,提取每个句子中的情感短语,并确定所述情感短语的第二情感倾向值, 根据第一情感倾向值和第二情感倾向值计算每个句子相对于评价对象的第立情感倾向值, 根据第=情感倾向值确定所述评论文本的文本情感倾向值,由于采用了情感短语与句式分 析向结合的方式确定评论文本的情感倾向值,提高了网络话题评论文本的语义倾向分析的 准确率和召回率。
[0094] 在上述技术方案的基础上,还优选包括:
[0095] 基于预设篇数的网络话题,进行短语搭配模式的出现次数统计,W获取所述短语 搭配模式及其权重。
[0096] 基于预设篇数(如1000篇)的网络话题,对短语搭配模式的出现次数进行统计, 选取出现频率较高的短语搭配模式为预设的短语搭配模式,短语搭配模式在判断文本中出 现的频率即为权重。
[0097] 在针对网络话题的评论文本的倾向判断中,短语搭配模式在文本中出现的类型在 一定时期内变化不大。在计算短语搭配模式的情感倾向及其频率时,根据短语搭配模式分 别出现在正向和负向情感倾向文本中的次数进行计算,即通过比较同短语搭配模式在正向 情感倾向的文本中出现的次数和在负向情感倾向的文本中出现的次数,确定该短语搭配模 式的情感倾向及其频率。W1000篇热点新闻话题的帖子为例,选择正向和负向文本各500 篇,得到的短语搭配模式如表3所示。
[0098] 表3选取的短语搭配模式
[0099]
[0100]
[0101] 实施例二
[0102] 图5是本发明实施例二提供的一种中文网络话题评论文本语义倾向分析的装置 的示意图,如图5所示,本实施例提供的文网络话题评论文本语义倾向分析的装置包括:分 词分句模块510、评价对象提取模块520、句式分析模块530、情感短语提取模块540、句子情 感倾向计算模块550和文本情感倾向计算模块560。
[0103] 其中,分词分句模块510用于对中文网络话题评论文本进行分词和分句,获得结 果序列;
[0104] 评价对象提取模块520用于对所述结果序列进行句法分析和语法分析,获得评价 对象;
[0105] 句式分析模块530用于对所述结果序列进行句式分析,确定所述评论文本中的单 句和复句,并判断组成复句的各个单句之间的关系,根据所述评论文本中的单句和组成复 句的各个单句之间的关系确定句式分析的第一情感倾向值;
[0106] 情感短语提取模块540用于针对所述结果序列中的每个句子,根据所述评价对象 和预设的短语搭配模式提取每个句子中的情感短语,并根据所述短语搭配模式的权重计算 所述情感短语的第二情感倾向值;
[0107] 句子情感倾向计算模块550用于根据所述第一情感倾向值及第二情感倾向值,计 算所述评论文本中的每个句子相对于评价对象的第=情感倾向值;
[0108] 文本情感倾向计算模块560用于根据第S情感倾向值确定所述评论文本的文本 情感倾向值。
[0109] 优选的,还包括:
[0110] 短语搭配模式获取模块,用于基于预设篇数的网络话题,进行短语搭配模式的出 现次数统计,W获取所述短语搭配模式及其权重。
[0111] 优选的,所述评价对象提取模块包括:
[0112] 句法分析单元,用于利用LTP对所述评论文本中的句子进行句法分析,得到依存 句法分析树,其中,所述依存句法分析树包括SBV、V0B和/或ATT;
[0113] 第一查找单元,用于查找句子中的SBV关系对,在所述SBV关系对中,当谓语为形 容词时,主语为评价对象;当谓语为动词时,查找句子中含有所述动词的V0B关系对,在所 述V0B关系对中,当宾语为名词或者名词短语时,宾语为评价对象;
[0114] 第二查找单元,用于当句子中没有SBV关系对时,查找V0B关系对,在所述V0B关 系对中,当谓语情感倾向值不为0且宾语为名词时,宾语为评价对象;
[0115] 第S查找单元,用于当句子中没有SBV关系对和V0B关系对时,查找ATT关系对, 当所述A TT关系对修饰的词语为名词,且定语的情感倾向值不为0时,所述定语修饰的词语 为评价对象;
[0116] 语法分析单元,用于当句子中没有SBV关系对、V0B关系对和ATT关系对时,利用 语法分析提取出名词或者名词短语,在该名词或者名词短语所在的句子中如果存在具有情 感倾向的词语,则该名词或者名词短语为评价对象。
[0117] 优选的,所述句子情感倾向计算模块具体用于:
[0118] 在一个句子中,该句子中所有情感短语的第二情感倾向值相加后的结果与第一情 感倾向值相乘,所得结果为该句子相对于评价对象的第=情感倾向值。
[0119] 优选的,所述文本情感倾向计算模块具体用于:
[0120] 所述评论文本中的所有句子相对于评价对象的第S情感倾向值累加得到所述评 论文本的文本情感倾向值。
[0121] 上述产品可执行本发明任意实施例所提供的方法,具备执行方法相应的功能模块 和有益效果。
[0122] 注意,上述仅为本发明的较佳实施例及所运用技术原理。本领域技术人员会理解, 本发明不限于该里所述的特定实施例,对本领域技术人员来说能够进行各种明显的变化、 重新调整和替代而不会脱离本发明的保护范围。因此,虽然通过W上实施例对本发明进行 了较为详细的说明,但是本发明不仅仅限于W上实施例,在不脱离本发明构思的情况下,还 可W包括更多其他等效实施例,而本发明的范围由所附的权利要求范围决定。
【主权项】
1. 一种中文网络话题评论文本语义倾向分析的方法,其特征在于,所述方法包括: 对中文网络话题评论文本进行分词和分句,获得结果序列; 对所述结果序列进行句法分析和语法分析,获得评价对象; 对所述结果序列进行句式分析,确定所述评论文本中的单句和复句,并判断组成复句 的各个单句之间的关系,根据所述评论文本中的单句和组成复句的各个单句之间的关系确 定句式分析的第一情感倾向值; 针对所述结果序列中的每个句子,根据所述评价对象和预设的短语搭配模式提取每 个句子中的情感短语,并根据所述短语搭配模式的权重计算所述情感短语的第二情感倾向 值; 根据所述第一情感倾向值及第二情感倾向值,计算所述评论文本中的每个句子相对于 评价对象的第三情感倾向值; 根据第三情感倾向值确定所述评论文本的文本情感倾向值。2. 根据权利要求1所述的方法,其特征在于,还包括: 基于预设篇数的网络话题,进行短语搭配模式的出现次数统计,以获取所述短语搭配 模式及其权重。3. 根据权利要求1所述的方法,其特征在于,对所述结果序列进行句法分析和语法分 析,获得评价对象,包括: 利用语言技术平台LTP对所述评论文本中的句子进行句法分析,得到依存句法分析 树,其中,所述依存句法分析树包括主谓结构SBV、动宾结构VOB和/或定中结构ATT ; 查找句子中的SBV关系对,在所述SBV关系对中,当谓语为形容词时,主语为评价对象; 当谓语为动词时,查找句子中含有所述动词的VOB关系对,在所述VOB关系对中,当宾语为 名词或者名词短语时,宾语为评价对象; 当句子中没有SBV关系对时,查找VOB关系对,在所述VOB关系对中,当谓语情感倾向 值不为〇且宾语为名词时,宾语为评价对象; 当句子中没有SBV关系对和VOB关系对时,查找ATT关系对,当所述ATT关系对修饰的 词语为名词,且定语的情感倾向值不为0时,所述定语修饰的词语为评价对象; 当句子中没有SBV关系对、VOB关系对和ATT关系对时,利用语法分析提取出名词或者 名词短语,在该名词或者名词短语所在的句子中如果存在具有情感倾向的词语,则该名词 或者名词短语为评价对象。4. 根据权利要求1所述的方法,其特征在于,根据所述第一情感倾向值及第二情感倾 向值,计算所述评论文本中的每个句子相对于评价对象的第三情感倾向值,具体包括: 在一个句子中,该句子中所有情感短语的第二情感倾向值相加后的结果与第一情感倾 向值相乘,所得结果为该句子相对于评价对象的第三情感倾向值。5. 根据权利要求1所述的方法,其特征在于,根据第三情感倾向值确定所述评论文本 的文本情感倾向值,具体包括: 所述评论文本中的所有句子相对于评价对象的第三情感倾向值累加得到所述评论文 本的文本情感倾向值。6. -种中文网络话题评论文本语义倾向分析的装置,其特征在于,所述装置包括: 分词分句模块,用于对中文网络话题评论文本进行分词和分句,获得结果序列; 评价对象提取模块,用于对所述结果序列进行句法分析和语法分析,获得评价对象; 句式分析模块,用于对所述结果序列进行句式分析,确定所述评论文本中的单句和复 句,并判断组成复句的各个单句之间的关系,根据所述评论文本中的单句和组成复句的各 个单句之间的关系确定句式分析的第一情感倾向值; 情感短语提取模块,用于针对所述结果序列中的每个句子,根据所述评价对象和预设 的短语搭配模式提取每个句子中的情感短语,并根据所述短语搭配模式的权重计算所述情 感短语的第二情感倾向值; 句子情感倾向计算模块,用于根据所述第一情感倾向值及第二情感倾向值,计算所述 评论文本中的每个句子相对于评价对象的第三情感倾向值; 文本情感倾向计算模块,用于根据第三情感倾向值确定所述评论文本的文本情感倾向 值。7. 根据权利要求6所述的装置,其特征在于,还包括: 短语搭配模式获取模块,用于基于预设篇数的网络话题,进行短语搭配模式的出现次 数统计,以获取所述短语搭配模式及其权重。8. 根据权利要求6所述的装置,其特征在于,所述评价对象提取模块包括: 句法分析单元,用于利用LTP对所述评论文本中的句子进行句法分析,得到依存句法 分析树,其中,所述依存句法分析树包括SBV、VOB和/或ATT ; 第一查找单元,用于查找句子中的SBV关系对,在所述SBV关系对中,当谓语为形容词 时,主语为评价对象;当谓语为动词时,查找句子中含有所述动词的VOB关系对,在所述VOB 关系对中,当宾语为名词或者名词短语时,宾语为评价对象; 第二查找单元,用于当句子中没有SBV关系对时,查找VOB关系对,在所述VOB关系对 中,当谓语情感倾向值不为〇且宾语为名词时,宾语为评价对象; 第三查找单元,用于当句子中没有SBV关系对和VOB关系对时,查找ATT关系对,当所 述ATT关系对修饰的词语为名词,且定语的情感倾向值不为0时,所述定语修饰的词语为评 价对象; 语法分析单元,用于当句子中没有SBV关系对、VOB关系对和ATT关系对时,利用语法 分析提取出名词或者名词短语,在该名词或者名词短语所在的句子中如果存在具有情感倾 向的词语,则该名词或者名词短语为评价对象。9. 根据权利要求6所述的装置,其特征在于,所述句子情感倾向计算模块具体用于: 在一个句子中,该句子中所有情感短语的第二情感倾向值相加后的结果与第一情感倾 向值相乘,所得结果为该句子相对于评价对象的第三情感倾向值。10. 根据权利要求6所述的装置,其特征在于,所述文本情感倾向计算模块具体用于: 所述评论文本中的所有句子相对于评价对象的第三情感倾向值累加得到所述评论文 本的文本情感倾向值。
【专利摘要】本发明公开了一种中文网络话题评论文本语义倾向分析的方法及装置。该方法包括:对中文网络话题评论文本进行分词和分句,获得结果序列;对结果序列进行句法分析和语法分析,获得评价对象;对结果序列进行句式分析,确定评论文本中的单句和复句,并判断组成复句的各个单句之间的关系,并确定句式分析的第一情感倾向值;针对结果序列中的每个句子,根据评价对象和预设的短语搭配模式提取每个句子中的情感短语,并计算情感短语的第二情感倾向值;根据第一情感倾向值及第二情感倾向值,计算评论文本中的每个句子的第三情感倾向值;根据第三情感倾向值确定评论文本的文本情感倾向值。本发明提高了网络话题评论文本的语义倾向分析的准确率和召回率。
【IPC分类】G06F17/27, G06F17/30
【公开号】CN104881402
【申请号】CN201510296299
【发明人】刘姗
【申请人】北京京东尚科信息技术有限公司, 北京京东世纪贸易有限公司
【公开日】2015年9月2日
【申请日】2015年6月2日
转载请注明原文地址:https://www.famiwei.com/read-8138673.html

最新回复(0)