本发明涉及智能办公,具体为一种基于大模型的事务过程处理方法与系统。
背景技术:
1、在现代信息处理与数据分析领域,事务过程处理是一项至关重要的任务,它涉及从复杂多变的数据集中提取有价值的信息,以支持决策制定和业务运营,然而,传统的事务处理方法在处理大规模数据集时往往面临诸多挑战,特别是数据缺失问题,这严重影响了数据的质量和后续分析结果的准确性。
2、目前,处理数据缺失的常用方法包括直接删除含有缺失值的记录、使用统计值(如均值、中位数)填充或者通过复杂的插值算法进行估算,但这些方法往往存在局限性,如删除记录可能导致信息损失,而简单的统计值填充可能无法反映数据的真实分布情况,插值算法则可能因计算复杂度高而不适用于大规模数据集。
3、为了解决上述问题,本发明提出了一种基于大模型的事务过程处理方法与系统,该方法通过综合考虑搜集到的数据总量、设定的所需数据量以及数据合格阈值等因素,利用一个动态计算公式来精确计算出第一阈值,该公式中的α值根据数据类型进行灵活调整,以确保计算的准确性和适用性,通过这种方法,系统能够科学、合理地判断并处理数据集中的缺失值问题,提高数据处理的效率和准确性,为后续的数据分析和决策制定提供更为可靠的数据支持。
技术实现思路
1、本发明的目的在于提供一种基于大模型的事务过程处理方法与系统,以解决上述背景技术中提出的问题。
2、为实现上述目的,本发明提供如下技术方案:
3、一种基于大模型的事务过程处理方法,包括有以下步骤:
4、s11:需求分析与目标设定,明确事务过程处理中的业务需求,其中,业务需求包括事务的类型、处理流程、关键节点以及预期的输出结果;
5、s12:数据收集与预处理,收集多种来源的与事务过程处理相关的数据,并对数据进行预处理;
6、s13:模型选择和训练,根据事务过程处理中的业务需求,选择相应的模型,并利用收集和预处理之后的数据对模型进行训练;
7、s14:prompt设计,根据事务处理的具体需求,设计合理的prompt模板,其中,prompt模板用于引导大模型生成期望的输出;
8、s15:事务过程处理实现,将待处理的事务数据输入至训练好的模型中,利用模型对事务数据进行处理,生成事务过程处理结果。
9、作为优选,所述需求分析与目标设定,明确事务过程处理中的业务需求的步骤,包括:
10、s21:对事务过程处理的相关信息进行收集,并根据搜集到的信息进行需求分析,再将分析的结果整理成需求文档,其中,需求文档的内容包括有事务处理的业务需求、流程描述、关键节点和预期输出;
11、s22:目标设定,根据业务需求,明确事务处理的具体目标,其中,事务处理的具体目标包括有提高处理效率、降低错误率和实现自动化处理;
12、s23:目标分解,将总体目标分解为若干个子目标,每个子目标对应事务处理流程中的一个环节;
13、s24:最终评估,评估实现目标所需的资源,并制定应对措施和预案,以应对潜在的风险和问题。
14、作为优选,所述收集多种来源的与事务过程处理相关的数据,并对数据进行预处理的步骤,包括:
15、s31:数据收集,首先明确数据的需求和来源,再根据数据源的特性选择合适的收集方式,再根据选择的收集方式和数据来源,执行数据收集操作,最后对收集到的数据进行储存;
16、s32:数据预处理,对收集并储存的数据进行预处理,具体的,对收集到的数据进行清洗,去除噪声、重复项和异常值,确保数据质量;
17、s33:数据转换与标准化,将数据进行格式转换和标准化处理,使其适合输入到模型中,其中,数据标准化处理包括有归一化处理和编码分类变量,其中,归一化处理的原理公式为:
18、;
19、其中,x为所搜集到的数据中的数值型特征的具体值,为经过归一化处理后,该数值型特征的新值,的取值区间为[0,1],为在数据集中,该数值型特征的所有值中的最大值,为在数据集中,该数值型特征的所有值中的最小值。
20、作为优选,所述对收集并储存的数据进行预处理的步骤,包括:
21、s41:使用唯一性检查和哈希表方法识别和删除重复的数据记录;
22、s42:根据数据的特性和业务需求,选择合适的填充策略对数据中的缺失值进行填补,且当缺失值所占比例低于设定的第一阈值时,选择直接删除含有缺失值的数据;
23、s43:采用分箱法、聚类方法和回归模型方法中的一种对存在噪声的数据进行平滑处理;
24、s44:对异常值进行检测识别,并根据业务需求对识别到的异常值进行处理,其中,采用的异常值处理方法包括保留异常值、修改异常值和删除异常值。
25、作为优选,根据数据的特性和业务需求,选择合适的填充策略对数据中的缺失值进行填补,且当缺失值所占比例低于设定的第一阈值时,选择直接删除含有缺失值的数据时,通过以下公式对第一阈值进行计算:
26、;
27、其中,q为第一阈值,为搜集到的数据总量,为设定的所需数据量,为设定的数据合格阈值,其中,的值与数据类型相关。
28、作为优选,在对异常值进行检测识别,并根据业务需求对识别到的异常值进行处理时,对异常值进行检测识别的原理公式为:
29、 iqr=q3−q1;
30、其中,q3是上四分位数,q1是下四分位数,其中,异常值定义为 q1−1.5×iqr以下以及q3+1.5×iqr以上的观测值。
31、作为优选,所述根据事务过程处理中的业务需求,选择相应的模型,并利用收集和预处理之后的数据对模型进行训练的步骤:
32、s51:模型选择,根据任务需求和数据特性选择合适的模型架构,其中,可选择的模型构架包括有transformer和gpt;
33、s52:数据划分,将经过预处理之后的数据划分为训练集、验证集和测试集,其中,训练集用于模型训练,验证集用于模型的超参数调优,测试集用于模型评估;
34、s53:设置损失函数和优化算法,并使用随机初始化和预训练初始化中的一种进行初始化模型参数;
35、s54:在训练集上进行迭代训练,再在验证集上评估模型性能,并根据验证集上的性能调整超参数,其中,每次迭代训练均包括前向传播、计算损失、反向传播和参数更新四个步骤;
36、s55:使用测试集对训练好的模型进行评估,计算模型在测试集上的性能指标,其中,模型的性能指标包括有准确率和f1-score。
37、作为优选,在训练集上进行迭代训练时,通过以下公式:
38、对损失进行计算;
39、其中,i代表第i个样本,c代表样本的第c个类别,n是样本数量,m是类别数,是指示变量,是模型预测样本i属于类别c的概率,其中,如果样本 i 属于类别 c 则为1,否则为0。
40、作为优选,在根据事务处理的具体需求,设计合理的prompt模板时,包括以下步骤:
41、s61:深入理解事务处理的具体需求,包括明确任务的目标、输入输出要求以及任何特定的业务规则;
42、s62:仔细分析任务所涉及的上下文信息,其中,上下文信息包括输入数据、历史记录和外部数据源;
43、s63:设计prompt模板,在考虑到模型的预训练目标和知识库的前提下,基于任务需求和上下文信息,设计能够引导模型生成期望输出的prompt模板;
44、s64:prompt模板优化,通过比较模型输出与期望输出之间的差异,分析模型输出的内容,并对prompt模板进行调整和优化,其中,对prompt模板进行调整和优化包括修改词汇选择、调整句子结构、增加信息点和删除信息点。
45、一种基于大模型的事务过程处理系统,包括有:
46、需求分析与目标设定模块,负责收集事务过程处理的相关信息,进行需求分析,并整理成需求文档;
47、数据收集与预处理模块,负责明确数据需求和来源,选择合适的收集方式,执行数据收集操作,并存储数据,并对收集到的数据进行清洗、转换和标准化处理;
48、模型选择与训练模块,用于选择合适的模型构架,并对模型进行训练;
49、prompt设计模块,负责深入理解事务处理的具体需求,分析任务涉及的上下文信息,并设计合理的prompt模板,以引导大模型生成期望的输出
50、事务过程处理实现模块,负责将待处理的事务数据输入到训练好的模型中,利用模型对事务数据进行处理,生成事务过程处理结果。
51、与现有技术相比,本发明的有益效果是:
52、1、在数据预处理阶段,首先,通过唯一性检查和哈希表方法,有效识别和删除了重复的数据记录,减少了数据冗余,接着,针对数据中的缺失值问题,我们根据数据的特性和业务需求,灵活选择填充策略进行填补,或当缺失值比例低于设定的第一阈值时,直接删除相关记录,以确保数据的完整性,对于存在噪声的数据,我们采用分箱法、聚类方法或回归模型等先进技术进行平滑处理,降低噪声干扰,最后,我们运用科学的方法检测并识别异常值,并依据业务需求采取保留、修改或删除的处理方式,进一步提升了数据的准确性和可靠性,此技术方案不仅有效解决了数据预处理中的关键问题,还显著提高了后续数据分析与建模的效率和精度;
53、2、本发明通过综合考虑搜集到的数据总量、设定的所需数据量以及数据合格阈值等因素,利用公式来动态计算出第一阈值,且α的值与数据类型紧密相关,确保了计算的准确性和适用性,能够科学、合理地判断并处理数据集中的缺失值问题;
54、3、本发明在数据预处理的关键环节,我们采用了基于四分位距的异常值检测识别技术,以确保数据集的纯净度和分析的准确性,该技术通过计算上四分位数与下四分位数之差来确定iqr值,即iqr = q3 - q1,这一差值反映了数据集中间50%数据的分散程度,是识别异常值的重要依据,不仅提高了数据清洗的效率和准确性,还增强了数据分析结果的可靠性和实用价值,为企业决策提供了更加坚实的数据支撑。
1.一种基于大模型的事务过程处理方法,其特征在于,包括有以下步骤:
2.根据权利要求1所述的一种基于大模型的事务过程处理方法,其特征在于:所述需求分析与目标设定,明确事务过程处理中的业务需求的步骤,包括:
3.根据权利要求1所述的一种基于大模型的事务过程处理方法,其特征在于:所述收集多种来源的与事务过程处理相关的数据,并对数据进行预处理的步骤,包括:
4.根据权利要求3所述的一种基于大模型的事务过程处理方法,其特征在于:所述对收集并储存的数据进行预处理的步骤,包括:
5.根据权利要求4所述的一种基于大模型的事务过程处理方法,其特征在于:根据数据的特性和业务需求,选择合适的填充策略对数据中的缺失值进行填补,且当缺失值所占比例低于设定的第一阈值时,选择直接删除含有缺失值的数据时,通过以下公式对第一阈值进行计算:
6.根据权利要求5所述的一种基于大模型的事务过程处理方法,其特征在于:在对异常值进行检测识别,并根据业务需求对识别到的异常值进行处理时,对异常值进行检测识别的原理公式为:
7.根据权利要求6所述的一种基于大模型的事务过程处理方法,其特征在于:所述根据事务过程处理中的业务需求,选择相应的模型,并利用收集和预处理之后的数据对模型进行训练的步骤:
8.根据权利要求7所述的一种基于大模型的事务过程处理方法,其特征在于:在训练集上进行迭代训练时,通过以下公式:
9.根据权利要求8所述的一种基于大模型的事务过程处理方法,其特征在于:在根据事务处理的具体需求,设计合理的prompt模板时,包括以下步骤:
10.一种基于大模型的事务过程处理系统,其特征在于,包括:
