本发明涉及计算机信息处理,特别是指一种文本数据的处理方法、装置及设备。
背景技术:
1、在数据时代和大模型快速发展的背景下,数据内容安全保护机制的重要性不容忽视。通过实施有效的保护措施,可以确保数据的安全性和完整性,为大模型的训练和应用提供坚实的支撑。es(elastic search)是一个开源的分布式搜索和分析引擎,提供了一个分布式的全文搜索引擎,能够实时地存储、检索和分析大规模的数据。es将数据存储在称为“索引”的结构中。每个索引都可以包含多个文档,每个文档都有一个唯一的标识符和多个属性字段。对于文本数据,es会进行一系列的处理和分析,包括分词、去除停用词、词干提取等。es使用倒排索引来存储数据,倒排索引由两部分组成:一部分是单词词典,用来记录所有文档的单词,并记录每个单词对应的文档列表;另一部分是倒排列表,用来记录每个单词在每个文档中的具体出现位置。这种结构使得es能够快速地根据查询条件找到相关的文档,但由于索引信息带有原始文档的数据,可以通过索引数据还原出原文,容易暴露原始数据内容,导致数据泄漏。
技术实现思路
1、本发明提供了一种文本数据的处理方法、装置及设备,解决了基于es存储文档时,由于索引信息带有原始文档的数据,可以通过索引数据还原出原文,容易暴露原始数据内容,导致数据泄漏的问题。
2、为解决上述技术问题,本发明的技术方案如下:
3、本发明实施例提供一种文本数据的处理方法,包括:
4、获取待检索文本数据;
5、将所述待检索文本数据中的字符进行向量化处理,得到检索文本向量;
6、根据所述检索文本向量与多个文档向量的相似度,得到检索词表数据,其中,所述多个文档向量是对多个文本数据中的每个字符进行向量化处理得到;
7、将所述检索词表数据与词表文件进行映射转换处理,得到所述待检索文本数据的目标检索数据,其中,所述词表文件是对所述多个文档数据中的字符进行遍历处理得到。
8、可选的,将所述待检索文本数据中的字符进行向量化处理,得到检索文本向量,包括:
9、获取所述待检索文本数据中每个字符的位置向量并进行线性化处理,得到中间结果;
10、将所述中间结果输入文本转换模型进行处理,得到检索文本向量。
11、可选的,获取所述待检索文本数据中每个字符的位置向量并进行线性化处理,得到中间结果,包括:
12、根据
13、
14、得到每个字符的位置向量,其中,pepos为位置向量,pos为字符在文本中的绝对位置,i为正整数,dmodel为向量维度;
15、对每个字符的位置向量进行线性加权处理,得到中间结果。
16、可选的,将所述中间结果输入文本转换模型进行处理,得到检索文本向量,包括:
17、所述文本转换模型通过目标函数:
18、ffn(x)=max(0,xw1+b1)w2+b2,
19、对中间结果进行处理,得到检索文本向量,其中,x为中间结果,w1、w2、b1、b2为文本转换模型的预设参数。
20、可选的,根据所述检索文本向量与多个文档向量的相似度,得到检索词表数据,包括:
21、根据
22、
23、得到所述检索文本向量与多个文档向量的相似度数据,其中,a1,a2,…,an是向量a中的元素,b1,b2,…,bn是向量b中的元素,||a||和||b||分别是向量a和向量b的模长,向量a是所述检索文本向量,向量b是多个文档向量;
24、根据相似度数据,得到多个相似文档;
25、根据所述多个相似文档在所述词表文件中的标识数据,得到检索词表数据。
26、可选的,将所述检索词表数据与词表文件进行映射转换处理,得到所述待检索文本数据的目标检索数据,包括:
27、将所述检索词表数据依次与所述词表文件中的标识数据进行比对,当所述检索词表数据与所述标识数据相等时,获取所述词表文件中与所述标识数据相对应的字符;
28、将获取的字符依次输出,得到所述待检索文本数据的目标检索数据。
29、可选的,对所述多个文档数据中的字符进行遍历处理,包括:
30、获取所述多个文档数据中的每个字符,构建字符集;
31、对所述每个字符设置标识数据,构建标识数据集,其中,所述每个字符均唯一对应一个标识数据;
32、遍历所述多个文档数据中所有的字符组合,得到字符出现的频次数据;
33、将所述频次数据最大的两个字符进行组合,得到组合字符,并将所述组合字符追加到所述字符集中;
34、对所述组合字符设置组合字符标识数据,并将所述组合字符标识数据添加到所述标识数据集中;
35、将所述字符集与所述标识数据集进行组合,得到所述词表文件,其中,所述字符集中的每个字符均对应所述标识数据集中的一个标识数据。
36、本发明实施例还提供一种文本数据的处理装置,包括:
37、获取模块,用于获取待检索文本数据;
38、处理模块,用于将所述待检索文本数据中的字符进行向量化处理,得到检索文本向量;
39、生成模块,用于根据所述检索文本向量与多个文档向量的相似度,得到检索词表数据,其中,所述多个文档向量是对多个文本数据中的每个字符进行向量化处理得到;
40、转换模块,用于将所述检索词表数据与词表文件进行映射转换处理,得到所述待检索文本数据的目标检索数据,其中,所述词表文件是对所述多个文档数据中的字符进行遍历处理得到。
41、本发明实施例还提供一种计算设备,包括:处理器、存储有计算机程序的存储器,所述计算机程序被处理器运行时,执行上述的方法。
42、本发明实施例还提供一种计算机可读存储介质,存储有指令,当所述指令在计算机上运行时,使得计算机执行上述的方法。
43、本发明的技术方案至少包括以下效果:
44、本发明的上述方案通过获取待检索文本数据;将待检索文本数据中的字符进行向量化处理,得到检索文本向量;根据检索文本向量与多个文档向量的相似度,得到检索词表数据,其中,多个文档向量是对多个文本数据中的每个字符进行向量化处理得到;将检索词表数据与词表文件进行映射转换处理,得到待检索文本数据的目标检索数据,其中,词表文件是对多个文档数据中的字符进行遍历处理得到,可以将文本转换为向量和词表文件的形式,能够避免索引中存储原始文档内容,实现了对内容进行保护的同时又能够高效检索。
1.一种文本数据的处理方法,其特征在于,包括:
2.根据权利要求1所述的文本数据的处理方法,其特征在于,将所述待检索文本数据中的字符进行向量化处理,得到检索文本向量,包括:
3.根据权利要求2所述的文本数据的处理方法,其特征在于,获取所述待检索文本数据中每个字符的位置向量并进行线性化处理,得到中间结果,包括:
4.根据权利要求3所述的文本数据的处理方法,其特征在于,将所述中间结果输入文本转换模型进行处理,得到检索文本向量,包括:
5.根据权利要求4所述的文本数据的处理方法,其特征在于,根据所述检索文本向量与多个文档向量的相似度,得到检索词表数据,包括:
6.根据权利要求1所述的文本数据的处理方法,其特征在于,将所述检索词表数据与词表文件进行映射转换处理,得到所述待检索文本数据的目标检索数据,包括:
7.根据权利要求1所述的文本数据的处理方法,其特征在于,对所述多个文档数据中的字符进行遍历处理,包括:
8.一种文本数据的处理装置,其特征在于,所述处理装置包括:
9.一种计算设备,其特征在于,包括:处理器、存储有计算机程序的存储器,所述计算机程序被处理器运行时,执行如权利要求1至7任一项所述的方法。
10.一种计算机可读存储介质,其特征在于,存储有指令,当所述指令在计算机上运行时,使得计算机执行如权利要求1至7任一项所述的方法。
