一种基于大模型的事务过程处理方法与系统与流程

xiaoxiao2小时前  6


本发明涉及智能办公,具体为一种基于大模型的事务过程处理方法与系统。


背景技术:

1、在现代信息处理与数据分析领域,事务过程处理是一项至关重要的任务,它涉及从复杂多变的数据集中提取有价值的信息,以支持决策制定和业务运营,然而,传统的事务处理方法在处理大规模数据集时往往面临诸多挑战,特别是数据缺失问题,这严重影响了数据的质量和后续分析结果的准确性。

2、目前,处理数据缺失的常用方法包括直接删除含有缺失值的记录、使用统计值(如均值、中位数)填充或者通过复杂的插值算法进行估算,但这些方法往往存在局限性,如删除记录可能导致信息损失,而简单的统计值填充可能无法反映数据的真实分布情况,插值算法则可能因计算复杂度高而不适用于大规模数据集。

3、为了解决上述问题,本发明提出了一种基于大模型的事务过程处理方法与系统,该方法通过综合考虑搜集到的数据总量、设定的所需数据量以及数据合格阈值等因素,利用一个动态计算公式来精确计算出第一阈值,该公式中的α值根据数据类型进行灵活调整,以确保计算的准确性和适用性,通过这种方法,系统能够科学、合理地判断并处理数据集中的缺失值问题,提高数据处理的效率和准确性,为后续的数据分析和决策制定提供更为可靠的数据支持。


技术实现思路

1、本发明的目的在于提供一种基于大模型的事务过程处理方法与系统,以解决上述背景技术中提出的问题。

2、为实现上述目的,本发明提供如下技术方案:

3、一种基于大模型的事务过程处理方法,包括有以下步骤:

4、s11:需求分析与目标设定,明确事务过程处理中的业务需求,其中,业务需求包括事务的类型、处理流程、关键节点以及预期的输出结果;

5、s12:数据收集与预处理,收集多种来源的与事务过程处理相关的数据,并对数据进行预处理;

6、s13:模型选择和训练,根据事务过程处理中的业务需求,选择相应的模型,并利用收集和预处理之后的数据对模型进行训练;

7、s14:prompt设计,根据事务处理的具体需求,设计合理的prompt模板,其中,prompt模板用于引导大模型生成期望的输出;

8、s15:事务过程处理实现,将待处理的事务数据输入至训练好的模型中,利用模型对事务数据进行处理,生成事务过程处理结果。

9、作为优选,所述需求分析与目标设定,明确事务过程处理中的业务需求的步骤,包括:

10、s21:对事务过程处理的相关信息进行收集,并根据搜集到的信息进行需求分析,再将分析的结果整理成需求文档,其中,需求文档的内容包括有事务处理的业务需求、流程描述、关键节点和预期输出;

11、s22:目标设定,根据业务需求,明确事务处理的具体目标,其中,事务处理的具体目标包括有提高处理效率、降低错误率和实现自动化处理;

12、s23:目标分解,将总体目标分解为若干个子目标,每个子目标对应事务处理流程中的一个环节;

13、s24:最终评估,评估实现目标所需的资源,并制定应对措施和预案,以应对潜在的风险和问题。

14、作为优选,所述收集多种来源的与事务过程处理相关的数据,并对数据进行预处理的步骤,包括:

15、s31:数据收集,首先明确数据的需求和来源,再根据数据源的特性选择合适的收集方式,再根据选择的收集方式和数据来源,执行数据收集操作,最后对收集到的数据进行储存;

16、s32:数据预处理,对收集并储存的数据进行预处理,具体的,对收集到的数据进行清洗,去除噪声、重复项和异常值,确保数据质量;

17、s33:数据转换与标准化,将数据进行格式转换和标准化处理,使其适合输入到模型中,其中,数据标准化处理包括有归一化处理和编码分类变量,其中,归一化处理的原理公式为:

18、;

19、其中,x为所搜集到的数据中的数值型特征的具体值,为经过归一化处理后,该数值型特征的新值,的取值区间为[0,1],为在数据集中,该数值型特征的所有值中的最大值,为在数据集中,该数值型特征的所有值中的最小值。

20、作为优选,所述对收集并储存的数据进行预处理的步骤,包括:

21、s41:使用唯一性检查和哈希表方法识别和删除重复的数据记录;

22、s42:根据数据的特性和业务需求,选择合适的填充策略对数据中的缺失值进行填补,且当缺失值所占比例低于设定的第一阈值时,选择直接删除含有缺失值的数据;

23、s43:采用分箱法、聚类方法和回归模型方法中的一种对存在噪声的数据进行平滑处理;

24、s44:对异常值进行检测识别,并根据业务需求对识别到的异常值进行处理,其中,采用的异常值处理方法包括保留异常值、修改异常值和删除异常值。

25、作为优选,根据数据的特性和业务需求,选择合适的填充策略对数据中的缺失值进行填补,且当缺失值所占比例低于设定的第一阈值时,选择直接删除含有缺失值的数据时,通过以下公式对第一阈值进行计算:

26、;

27、其中,q为第一阈值,为搜集到的数据总量,为设定的所需数据量,为设定的数据合格阈值,其中,的值与数据类型相关。

28、作为优选,在对异常值进行检测识别,并根据业务需求对识别到的异常值进行处理时,对异常值进行检测识别的原理公式为:

29、 iqr=q3−q1;

30、其中,q3是上四分位数,q1是下四分位数,其中,异常值定义为 q1−1.5×iqr以下以及q3+1.5×iqr以上的观测值。

31、作为优选,所述根据事务过程处理中的业务需求,选择相应的模型,并利用收集和预处理之后的数据对模型进行训练的步骤:

32、s51:模型选择,根据任务需求和数据特性选择合适的模型架构,其中,可选择的模型构架包括有transformer和gpt;

33、s52:数据划分,将经过预处理之后的数据划分为训练集、验证集和测试集,其中,训练集用于模型训练,验证集用于模型的超参数调优,测试集用于模型评估;

34、s53:设置损失函数和优化算法,并使用随机初始化和预训练初始化中的一种进行初始化模型参数;

35、s54:在训练集上进行迭代训练,再在验证集上评估模型性能,并根据验证集上的性能调整超参数,其中,每次迭代训练均包括前向传播、计算损失、反向传播和参数更新四个步骤;

36、s55:使用测试集对训练好的模型进行评估,计算模型在测试集上的性能指标,其中,模型的性能指标包括有准确率和f1-score。

37、作为优选,在训练集上进行迭代训练时,通过以下公式:

38、对损失进行计算;

39、其中,i代表第i个样本,c代表样本的第c个类别,n是样本数量,m是类别数,是指示变量,是模型预测样本i属于类别c的概率,其中,如果样本 i 属于类别 c 则为1,否则为0。

40、作为优选,在根据事务处理的具体需求,设计合理的prompt模板时,包括以下步骤:

41、s61:深入理解事务处理的具体需求,包括明确任务的目标、输入输出要求以及任何特定的业务规则;

42、s62:仔细分析任务所涉及的上下文信息,其中,上下文信息包括输入数据、历史记录和外部数据源;

43、s63:设计prompt模板,在考虑到模型的预训练目标和知识库的前提下,基于任务需求和上下文信息,设计能够引导模型生成期望输出的prompt模板;

44、s64:prompt模板优化,通过比较模型输出与期望输出之间的差异,分析模型输出的内容,并对prompt模板进行调整和优化,其中,对prompt模板进行调整和优化包括修改词汇选择、调整句子结构、增加信息点和删除信息点。

45、一种基于大模型的事务过程处理系统,包括有:

46、需求分析与目标设定模块,负责收集事务过程处理的相关信息,进行需求分析,并整理成需求文档;

47、数据收集与预处理模块,负责明确数据需求和来源,选择合适的收集方式,执行数据收集操作,并存储数据,并对收集到的数据进行清洗、转换和标准化处理;

48、模型选择与训练模块,用于选择合适的模型构架,并对模型进行训练;

49、prompt设计模块,负责深入理解事务处理的具体需求,分析任务涉及的上下文信息,并设计合理的prompt模板,以引导大模型生成期望的输出

50、事务过程处理实现模块,负责将待处理的事务数据输入到训练好的模型中,利用模型对事务数据进行处理,生成事务过程处理结果。

51、与现有技术相比,本发明的有益效果是:

52、1、在数据预处理阶段,首先,通过唯一性检查和哈希表方法,有效识别和删除了重复的数据记录,减少了数据冗余,接着,针对数据中的缺失值问题,我们根据数据的特性和业务需求,灵活选择填充策略进行填补,或当缺失值比例低于设定的第一阈值时,直接删除相关记录,以确保数据的完整性,对于存在噪声的数据,我们采用分箱法、聚类方法或回归模型等先进技术进行平滑处理,降低噪声干扰,最后,我们运用科学的方法检测并识别异常值,并依据业务需求采取保留、修改或删除的处理方式,进一步提升了数据的准确性和可靠性,此技术方案不仅有效解决了数据预处理中的关键问题,还显著提高了后续数据分析与建模的效率和精度;

53、2、本发明通过综合考虑搜集到的数据总量、设定的所需数据量以及数据合格阈值等因素,利用公式来动态计算出第一阈值,且α的值与数据类型紧密相关,确保了计算的准确性和适用性,能够科学、合理地判断并处理数据集中的缺失值问题;

54、3、本发明在数据预处理的关键环节,我们采用了基于四分位距的异常值检测识别技术,以确保数据集的纯净度和分析的准确性,该技术通过计算上四分位数与下四分位数之差来确定iqr值,即iqr = q3 - q1,这一差值反映了数据集中间50%数据的分散程度,是识别异常值的重要依据,不仅提高了数据清洗的效率和准确性,还增强了数据分析结果的可靠性和实用价值,为企业决策提供了更加坚实的数据支撑。


技术特征:

1.一种基于大模型的事务过程处理方法,其特征在于,包括有以下步骤:

2.根据权利要求1所述的一种基于大模型的事务过程处理方法,其特征在于:所述需求分析与目标设定,明确事务过程处理中的业务需求的步骤,包括:

3.根据权利要求1所述的一种基于大模型的事务过程处理方法,其特征在于:所述收集多种来源的与事务过程处理相关的数据,并对数据进行预处理的步骤,包括:

4.根据权利要求3所述的一种基于大模型的事务过程处理方法,其特征在于:所述对收集并储存的数据进行预处理的步骤,包括:

5.根据权利要求4所述的一种基于大模型的事务过程处理方法,其特征在于:根据数据的特性和业务需求,选择合适的填充策略对数据中的缺失值进行填补,且当缺失值所占比例低于设定的第一阈值时,选择直接删除含有缺失值的数据时,通过以下公式对第一阈值进行计算:

6.根据权利要求5所述的一种基于大模型的事务过程处理方法,其特征在于:在对异常值进行检测识别,并根据业务需求对识别到的异常值进行处理时,对异常值进行检测识别的原理公式为:

7.根据权利要求6所述的一种基于大模型的事务过程处理方法,其特征在于:所述根据事务过程处理中的业务需求,选择相应的模型,并利用收集和预处理之后的数据对模型进行训练的步骤:

8.根据权利要求7所述的一种基于大模型的事务过程处理方法,其特征在于:在训练集上进行迭代训练时,通过以下公式:

9.根据权利要求8所述的一种基于大模型的事务过程处理方法,其特征在于:在根据事务处理的具体需求,设计合理的prompt模板时,包括以下步骤:

10.一种基于大模型的事务过程处理系统,其特征在于,包括:


技术总结
本发明涉及智能办公技术领域,具体为一种基于大模型的事务过程处理方法与系统,包括有通过需求分析与目标设定明确业务需求,收集并预处理多样化数据源,以确保数据质量,随后,根据业务需求选择合适的模型架构进行训练,设计精准的Prompt模板以引导大模型生成期望输出,最终实现事务数据的自动化处理;本发明通过综合考虑搜集到的数据总量、设定的所需数据量以及数据合格阈值等因素,利用公式来动态计算出第一阈值,且α的值与数据类型紧密相关,确保了计算的准确性和适用性,能够科学、合理地判断并处理数据集中的缺失值问题。

技术研发人员:郭云昌
受保护的技术使用者:万洲嘉智信息科技有限公司
技术研发日:
技术公布日:2024/9/23

最新回复(0)