分词方法和装置的制造方法

xiaoxiao2020-10-23  11

分词方法和装置的制造方法
【技术领域】
[0001]本发明涉及互联网技术领域,尤其涉及一种分词方法和装置。
【背景技术】
[0002]语音合成,又称文语转换(Text to Speech)技术,能将任意文字信息实时转化为标准流畅的语音朗读出来,相当于给机器装上了人工嘴巴。对于语音合成系统,首先需要对输入的文本进行处理,包括文本预处理、分词、词性标注、注音和韵律层级预测等,然后再通过声学模型,预测各个单元对应的声学特征,最后利用声学参数直接通过声码器合成声音,或者从录音语料库中挑选单元进行拼接。
[0003]在语音合成系统中,分词是整个系统的基础。分词性能的好坏,直接影响后续处理模块及最终的输出语音效果。现有的分词算法主要有两种,一种是基于词典匹配的分词方法,另一种是基于机器学习的分词方法。
[0004]但是,基于词典匹配的分词方法,由于词典的规模有限,而且词频信息受到所用的统计语料规模的限制和影响,可能覆盖不够全面,或者语料不够均衡,在处理文本的时候,还是有很多不准确的情况,尤其是面对一些在海量语料统计中不常见的词语时,比如人名、地名、专属名等,往往导致投入了很多精力,结果却不尽理想。
[0005]而基于机器学习的分词方法,需要非常大量的标注数据,标注数据的数量、精度,也会对模型有很大影响。而且,由于不需要分词的词典,往往会出现一些非常不可接受的分词错误,造成分词结果不够稳定,用户体验较差。
[0006]综上所述,现有的分词方法在分词过程中,并不考虑当前文本的整体情况,只是逐句进行处理,所以难以利用更多的待处理文本信息,使得分词结果不准确,或者造成同一个词语(如人名、地名或专属名等)在不同的句子中切分差异很大。体现在语音合成系统中,往往让听者产生理解困难,舒适度严重下降,用户体验也较差。

【发明内容】

[0007]本发明的目的旨在至少在一定程度上解决相关技术中的技术问题之一。
[0008]为此,本发明的第一个目的在于提出一种分词方法。该方法,首先利用待合成文本进行搜索,获取更加匹配的分词词典或者模型,从而可以改善分词效果,进而可以改善合成语音的质量。
[0009]本发明的第二个目的在于提出一种分词装置。
[0010]为了实现上述目的,本发明第一方面实施例的分词方法,包括:将待合成文本发送给搜索引擎,以及对所述待合成文本进行文本预处理;获得搜索引擎根据所述待合成文本搜索获得的搜索结果,并获得所述搜索结果对应的词典或模型;根据所述搜索结果对应的词典或模型对进行文本预处理后的文本进行分词。
[0011]本发明实施例的分词方法,将待合成文本发送给搜索引擎,获得待合成文本对应的搜索结果,然后获得上述搜索结果对应的词典或模型,从而可以动态更新语音合成系统所需的词典或者模型,可以提升语音合成效果。并且由于待合成文本中包含了上述待合成文本所属领域的部分信息,通过搜索引擎的搜索功能,进一步得到了关于上述待合成文本的更全面的领域信息和资源,从而可以从大量的相关信息中获得了更大的信息量,远远超过只用很少的待合成文本自身所获得的信息量,因此获得的词典或者模型的准确度更高,分词效果更好。并且利用搜索引擎的搜索能力,使得分词所需的分词词典或者模型,可以及时动态更新,大大改善了词典或者模型的时效性,对于处理新的词语、热点人物或事件等,有非常好的效果。
[0012]为了实现上述目的,本发明第二方面实施例的分词装置,包括:发送模块,用于将待合成文本发送给搜索引擎;文本预处理模块,用于对所述待合成文本进行文本预处理;获得模块,用于获得搜索引擎根据所述待合成文本搜索获得的搜索结果,并获得所述搜索结果对应的词典或模型;分词模块,用于根据所述获得模块获得的所述搜索结果对应的词典或模型对所述文本预处理模块进行文本预处理后的文本进行分词。
[0013]本发明实施例的分词装置,发送模块将待合成文本发送给搜索引擎,获得模块获得待合成文本对应的搜索结果,然后获得上述搜索结果对应的词典或模型,从而可以动态更新语音合成系统所需的词典或者模型,可以提升语音合成效果。并且由于待合成文本中包含了上述待合成文本所属领域的部分信息,通过搜索引擎的搜索功能,进一步得到了关于上述待合成文本的更全面的领域信息和资源,从而可以从大量的相关信息中获得了更大的信息量,远远超过只用很少的待合成文本自身所获得的信息量,因此获得的词典或者模型的准确度更高,分词效果更好。并且利用搜索引擎的搜索能力,使得分词所需的分词词典或者模型,可以及时动态更新,大大改善了词典或者模型的时效性,对于处理新的词语、热点人物或事件等,有非常好的效果。
[0014]本发明附加的方面和优点将在下面的描述中部分给出,部分将从下面的描述中变得明显,或通过本发明的实践了解到。
【附图说明】
[0015]本发明上述的和/或附加的方面和优点从下面结合附图对实施例的描述中将变得明显和容易理解,其中:
[0016]图1为现有技术语音合成系统的处理流程示意图;
[0017]图2为本发明分词方法一个实施例的流程图;
[0018]图3为本发明语音合成系统的处理流程一个实施例的示意图;
[0019]图4为本发明语音合成系统的处理流程另一个实施例的示意图;
[0020]图5为本发明语音合成系统的处理流程再一个实施例的示意图;
[0021]图6为本发明分词装置一个实施例的结构示意图;
[0022]图7为本发明分词装置另一个实施例的结构示意图。
【具体实施方式】
[0023]下面详细描述本发明的实施例,所述实施例的示例在附图中示出,其中自始至终相同或类似的标号表示相同或类似的元件或具有相同或类似功能的元件。下面通过参考附图描述的实施例是示例性的,仅用于解释本发明,而不能理解为对本发明的限制。相反,本发明的实施例包括落入所附加权利要求书的精神和内涵范围内的所有变化、修改和等同物。
[0024]图1为现有技术语音合成系统的处理流程示意图,输入文本通过文本处理、韵律预测、声学参数生成和波形生成后,输出合成的语音。文本处理的过程,又可以细分为文本预处理、分词、词性标注和注音等。文本预处理,是将输入文本中的数字、符号等进行转换,分词是将连续的字符分割成词,词性标注是为每个词生成词性信息,注音是为每个字符生成发音序列。
[0025]对于语音合成系统来说,可能遇到很多不同领域的数据。其中,包括属于不同领域的各类新闻、各种题材的小说,这些文本由于覆盖的题材广泛,而且涉及到很多人名、地名、专属词等情况,往往导致分词错误,造成理解困难。如果为每个阅读题材,人工准备分词词典,或者标注新的标注语料更新模型,都会造成实施困难,语音合成效果难以保证。
[0026]为了解决上述问题,本发明提出一种分词方法,图2为本发明分词方法一个实施例的流程图,如图2所示,该分词方法可以包括:
[0027]步骤201,将待合成文本发送给搜索引擎,以及对上述待合成文本进行文本预处理。
[0028]步骤202,获得搜索引擎根据上述待合成文本搜索获得的搜索结果,并获得上述搜索结果对应的词典或模型。
[0029]步骤203,根据上述搜索结果对应的词典或模型对进行文本预处理后的文本进行分词。
[0030]本实施例中,在具体实现时,在对进行文本预处理后的文本进行分词时,可以仅根据上述搜索结果对应的词典或模型来进行分词,也可以既根据上述搜索结果对应的词典或模型,又结合通用的词典或模型来进行分词;本实施例对此不作限定。
[0031]本实施例的一种实现方式中,获得上述搜索结果对应的词典或模型之前, 还可以预先对上述搜索引擎抓取的网页的数据进行处理,根据处理后的网页的数据生成上述网页的数据对应的词典或模型。
[0032]本实施例的另一种实现方式中,获得上述搜索结果对应的词典或模型之前,还可以对上述搜索引擎抓取的网页进行聚类;对聚类后的网页的数据进行处理,并根据处理后的网页的数据生成上述网页的数据对应的词典或模型。
[0033]上述两种实现方式中,生成上述网页的数据对应的词典或模型之后,还可以将上述网页的数据对应的词典或模型存储在搜索引擎数据库中;这时,获得上述搜索结果对应的词典或模型可以为:根据上述搜索结果在搜索引擎数据库中进行查找,获得上述搜索结果对应的词典或模型。
[0034]另外,上述两种实现方式中,生成上述网页的数据对应的词典或模型之后,还可以将上述网页的数据对应的词典或模型的标识存储在搜索引擎数据库中,将上述网页的数据对应的词典或模型存储在词典数据库中;这时,获得上述搜索结果对应的词典或模型可以为:根据上述搜索结果在搜索引擎数据库中进行查找,获得上述搜索结果对应的词典或模型的标识;然后,根据获得的标识在上述词典数据库中进行查找,获得上述获得的标识对应的词典或模型。其中,上述词典或模型的标识可以为上述词典或模型的编号或索引等可以唯一标识该词典或模型的信息。
[0035]上述分词方法中,将待合成文本发送给搜索引擎,获得待合成文本对应的搜索结果,然后获得上述搜索结果对应的词典或模型,从而可以动态更新语音合成系统所需的词典或者模型,可以提升语音合成效果。并且由于待合成文本中包含了上述待合成文本所属领域的部分信息,通过搜索引擎的搜索功能,进一步得到了关于上述待合成文本的更全面的领域信息和资源,从而可以从大量的相关信息中获得了更大的信息量,远远超过只用很少的待合成文本自身所获得的信息量,因此获得的词典或者模型的准确度更高,分词效果更好。并且利用搜索引擎的搜索能力,使得分词所需的分词词典或者模型,可以及时动态更新,大大改善了词典或者模型的时效性,对于处理新的词语、热点人物或事件等,有非常好的效果。
[0036]使用了本发明图2所示实施例提供的分词方法进行分词之后,语音合成系统的处理流程可以如图3所示,图3为本发明语音合成系统的处理流程一个实施例的示意图。
[0037]从图3中可以看出,将待合成文本发送给搜索引擎,并且对上述待合成文本进行文本预处理,然后获得搜索引擎根据上述待合成文本搜索获得的搜索结果,进一步地,处理搜索引擎返回的搜索结果,这时获得上述搜索结果对应的词典或模型可以为根据上述搜索结果生成对应的词典或模型,这里生成的词典或模型作为网络词典/模型,与通用的词典/模型一起,用于对进行文本预处理后的文本进行分词。
[0038]进一步地,为了改善运行时的效率,还可以预先对上述搜索引擎抓取的网页的数据进行处理,根据处理后的网页的数据生成上述网页的数据对应的词典或模型,然后将生成的词典或模型存储在搜索引擎数据中,则合成语音的时候,可以直接根据待合成文本对应的搜索结果在搜索引擎数据库中进行查找,获得上述搜索结果对应的词典或模型,缩短时间消耗。这时,语音合成系统的处理流程可以如图4所示,图4为本发明语音合成系统的处理流程另一个实施例的示意图。
[0039]另外,也可以将上述网页的数据对应的词典或模型的标识存储在搜索引擎数据库中,将上述网页的数据对应的词典或模型存储在词典数据库中;则合成语音的时候,可以先根据上述搜索结果在搜索引擎数据库中进行查找,获得上述搜索结果对应的词典或模型的标识;然后,根据获得的标识在上述词典数据库中进行查找,获得上述获得的标识对应的词典或模型。
[0040]更进一步地,由于有些网页之间有较高的关联性,可以预先对上述搜索引擎抓取的网页进行聚类,对聚类后的网页的数据进行处理,并根据处理后的网页的数据生成上述网页的数据对应的词典或模型,然后可以将上述网页的数据对应的词典或模型的标识存储在搜索引擎数据库中,将上述网页的数据对应的词典或模型存储在词典数据库中;既简化了搜索引擎数据库,又改善了词典或者模型的描述能力。这时,语音合成系统的处理流程可以如图5所示,图5为本发明语音合成系统的处理流程再一个实施例的示意图。
[0041]本发明图2所示实施例提出的分词方法,可以快速获得一个基于网络信息的分词词典或模型,应用到语音合成系统中。在阅读不同的领域文本时,用户无需指定领域或者所使用的词典,系统可以自动结合搜索引擎数据库,生成或者提取最适合的分词词典,实现更加理想的分词效果,从而使合成的语音更加自然流畅,易于理解。这种动态词典或者模型的采用,既可以满足用户使用语音合成系统陆续阅读不同领域或题材的文本的要求,还可以减少使用通用词典或者模型所导致的词典或模型与文本不匹配,以及词典或模型不能适应新的热点或者未登录词的问题。此外,用户无需预先设定自己所阅读的文本所属的领域,也不需要指定特殊的词典,大大简化了用户的使用难度,改善了用户体验。
[0042]图6为本发明分词装置一个实施例的结构示意图,本实施例中的分词装置可以实现本发明图2所示实施例的流程,如图6所示,该分词装置可以包括:发送模块61、文本预处理模块62、获得模块63和分词模块64 ;
[0043]其中,发送模块61,用于将待合成文本发送给搜索引擎;
[0044]文本预处理模块62,用于对上述待合成文本进行文本预处理;
[0045]获得模块63,用于获得搜索引擎根据上述待合成文本搜索获得的搜索结果,并获得上述搜索结果对应的词典或模型;
[0046]分词模块64,用于根据获得模块63获得的上述搜索结果对应的词典或模型对文本预处理模块62进行文本预处理后的文本进行分词。
[0047]图7为本发明分词装置另一个实施例的结构示意图,与图6所示的分词装置相比,不同之处在于,图7所示的分词装置还可以包括:处理模块65和生成模块66 ;
[0048]本实施例的一种实现方式中,处理模块65,用于预先对搜索引擎抓取的网页的数据进行处理;
[0049]生成模块66,用于根据处理模块65处理后的网页的数据生成上述网页的数据对应的词典或模型。
[0050]本实施例的另一种实现方式中,上述分词装置还可以包括:聚类模块67 ;
[0051]其中,聚类模块67,用于对上述搜索引擎抓取的网页进行聚类;
[0052]处理模块65,用于对聚类模块67聚类后的网页的数据进行处理;
[0053]生成模块66,用于根据处理模块65处理后的网页的数据生成上述网页的数据对应的词典或模型。
[0054]进一步地,本实施例中的分词装置还可以包括:存储模块68 ;
[0055]存储模块68,用于在生成模块66生成上述网页的数据对应的词典或模型之后,将上述网页的数据对应的词典或模型存储在搜索引擎数据库中;这时,获得模块63,具体用于根据上述搜索结果在搜索引擎数据库中进行查找,获得上述搜索结果对应的词典或模型。
[0056]另外,存储模块68,用于在生成模块66生成上述网页的数据对应的词典或模型之后,将上述网页的数据对应的词典或模型的标识存储在搜索引擎数据库中,将上述网页的数据对应的词典或模型存储在词典数据库中;这时,获得模块63,具体用于根据上述搜索结果在搜索引擎数据库中进行查找,获得上述搜索结果对应的词典或模型的标识;并根据获得的标识在上述词典数据库中进行查找,获得上述获得的标识对应的词典或模型。
[0057]上述分词装置中,发送模块61将待合成文本发送给搜索引擎,获得模块63获得待合成文本对应的搜索结果,然后获得上述搜索结果对应的词典或模型,从而可以动态更新语音合成系统所需的词典或者模型,可以 提升语音合成效果。并且由于待合成文本中包含了上述待合成文本所属领域的部分信息,通过搜索引擎的搜索功能,进一步得到了关于上述待合成文本的更全面的领域信息和资源,从而可以从大量的相关信息中获得了更大的信息量,远远超过只用很少的待合成文本自身所获得的信息量,因此获得的词典或者模型的准确度更高,分词效果更好。并且利用搜索引擎的搜索能力,使得分词所需的分词词典或者模型,可以及时动态更新,大大改善了词典或者模型的时效性,对于处理新的词语、热点人物或事件等,有非常好的效果。
[0058]需要说明的是,在本发明的描述中,术语“第一”、“第二”等仅用于描述目的,而不能理解为指示或暗示相对重要性。此外,在本发明的描述中,除非另有说明,“多个”的含义是两个或两个以上。
[0059]流程图中或在此以其他方式描述的任何过程或方法描述可以被理解为,表示包括一个或更多个用于实现特定逻辑功能或过程的步骤的可执行指令的代码的模块、片段或部分,并且本发明的优选实施方式的范围包括另外的实现,其中可以不按所示出或讨论的顺序,包括根据所涉及的功能按基本同时的方式或按相反的顺序,来执行功能,这应被本发明的实施例所属技术领域的技术人员所理解。
[0060]应当理解,本发明的各部分可以用硬件、软件、固件或它们的组合来实现。在上述实施方式中,多个步骤或方法可以用存储在存储器中且由合适的指令执行系统执行的软件或固件来实现。例如,如果用硬件来实现,和在另一实施方式中一样,可用本领域公知的下列技术中的任一项或他们的组合来实现:具有用于对数据信号实现逻辑功能的逻辑门电路的离散逻辑电路,具有合适的组合逻辑门电路的专用集成电路,可编程门阵列(Programmable Gate Array ;以下简称:PGA),现场可编程门阵列(Field ProgrammableGate Array ;以下简称:FPGA)等。
[0061]本技术领域的普通技术人员可以理解实现上述实施例方法携带的全部或部分步骤是可以通过程序来指令相关的硬件完成,所述的程序可以存储于一种计算机可读存储介质中,该程序在执行时,包括方法实施例的步骤之一或其组合。
[0062]此外,本发明各个实施例中的各功能模块可以集成在一个处理模块中,也可以是各个模块单独物理存在,也可以两个或两个以上模块集成在一个模块中。上述集成的模块既可以采用硬件的形式实现,也可以采用软件功能模块的形式实现。所述集成的模块如果以软件功能模块的形式实现并作为独立的产品销售或使用时,也可以存储在一个计算机可读取存储介质中。
[0063]上述提到的存储介质可以是只读存储器,磁盘或光盘等。
[0064]在本说明书的描述中,参考术语“一个实施例”、“一些实施例”、“示例”、“具体示例”、或“一些示例”等的描述意指结合该实施例或示例描述的具体特征、结构、材料或者特点包含于本发明的至少一个实施例或示例中。在本说明书中,对上述术语的示意性表述不一定指的是相同的实施例或示例。而且,描述的具体特征、结构、材料或者特点可以在任何的一个或多个实施例或示例中以合适的方式结合。
[0065]尽管上面已经示出和描述了本发明的实施例,可以理解的是,上述实施例是示例性的,不能理解为对本发明的限制,本领域的普通技术人员在本发明的范围内可以对上述实施例进行变化、修改、替换和变型。
【主权项】
1.一种分词方法,其特征在于,包括: 将待合成文本发送给搜索引擎,以及对所述待合成文本进行文本预处理; 获得搜索引擎根据所述待合成文本搜索获得的搜索结果,并获得所述搜索结果对应的词典或模型; 根据所述搜索结果对应的词典或模型对进行文本预处理后的文本进行分词。2.根据权利要求1所述的方法,其特征在于,所述获得所述搜索结果对应的词典或模型之前,还包括: 预先对所述搜索引擎抓取的网页的数据进行处理,根据处理后的网页的数据生成所述网页的数据对应的词典或模型。3.根据权利要求1所述的方法,其特征在于,所述获得所述搜索结果对应的词典或模型之前,还包括: 对所述搜索引擎抓取的网页进行聚类; 对聚类后的网页的数据进行处理,并根据处理后的网页的数据生成所述网页的数据对应的词典或模型。4.根据权利要求2或3所述的方法,其特征在于,所述生成所述网页的数据对应的词典或模型之后,还包括: 将所述网页的数据对应的词典或模型存储在搜索引擎数据库中; 所述获得所述搜索结果对应的词典或模型包括: 根据所述搜索结果在所述搜索引擎数据库中进行查找,获得所述搜索结果对应的词典或模型。5.根据权利要求2或3所述的方法,其特征在于,所述生成所述网页的数据对应的词典或模型之后,还包括: 将所述网页的数据对应的词典或模型的标识存储在搜索引擎数据库中,将所述网页的数据对应的词典或模型存储在词典数据库中; 所述获得所述搜索结果对应的词典或模型包括: 根据所述搜索结果在所述搜索引擎数据库中进行查找,获得所述搜索结果对应的词典或模型的标识; 根据获得的标识在所述词典数据库中进行查找,获得所述获得的标识对应的词典或模型。6.一种分词装置,其特征在于,包括: 发送模块,用于将待合成文本发送给搜索引擎; 文本预处理模块,用于对所述待合成文本进行文本预处理; 获得模块,用于获得搜索引擎根据所述待合成文本搜索获得的搜索结果,并获得所述搜索结果对应的词典或模型; 分词模块,用于根据所述获得模块获得的所述搜索结果对应的词典或模型对所述文本预处理模块进行文本预处理后的文本进行分词。7.根据权利要求6所述的装置,其特征在于,还包括: 处理模块,用于预先对所述搜索引擎抓取的网页的数据进行处理; 生成模块,用于根据所述处理模块处理后的网页的数据生成所述网页的数据对应的词典或模型。8.根据权利要求6所述的装置,其特征在于,还包括: 聚类模块,用于对所述搜索引擎抓取的网页进行聚类; 处理模块,用于对所述聚类模块聚类后的网页的数据进行处理; 生成模块,用于根据所述处理模块处理后的网页的数据生成所述网页的数据对应的词典或模型。9.根据权利要求7或8所述的装置,其特征在于,还包括: 存储模块,用于在所述生成模块生成所述网页的数据对应的词典或模型之后,将所述网页的数据对应的词典或模型存储在搜索引擎数据库中; 所述获得模块,具体用于根据所述搜索结果在所述搜索引擎数据库中进行查找,获得所述搜索结果对应的词典或模型。10.根据权利要求7或8所述的装置,其特征在于,还包括: 存储模块,用于在所述生成模块生成所述网页的数据对应的词典或模型之后,将所述网页的数据对应的词典或模型的标识存储在搜索引擎数据库中,将所述网页的数据对应的词典或模型存储在词典数据库中; 所述获得模块,具体用于根据所述搜索结果在所述搜索引擎数据库中进行查找,获得所述搜索结果对应的词典或模型的标识;并根据获得的标识在所述词典数据库中进行查找,获得所述获得的标识对应的词典或模型。
【专利摘要】本发明提出一种分词方法和装置,上述分词方法可以包括:将待合成文本发送给搜索引擎,以及对所述待合成文本进行文本预处理;获得搜索引擎根据所述待合成文本搜索获得的搜索结果,并获得所述搜索结果对应的词典或模型;根据所述搜索结果对应的词典或模型对进行文本预处理后的文本进行分词。本发明首先利用待合成文本进行搜索,获取更加匹配的分词词典或者模型,从而可以改善分词效果,进而可以改善合成语音的质量。
【IPC分类】G06F17/30, G06F17/27
【公开号】CN104881403
【申请号】CN201510303053
【发明人】李秀林
【申请人】百度在线网络技术(北京)有限公司
【公开日】2015年9月2日
【申请日】2015年6月4日
转载请注明原文地址:https://www.famiwei.com/read-8138672.html

最新回复(0)