本发明涉及生物医学工程领域,尤其是涉及一种基于迭代填补法的生精障碍分型预测方法和装置。
背景技术:
1、精子发生障碍(生精障碍)是男性不育中的疑难重症,是由环境、遗传、内分泌、炎症、免疫、生活方式等因素独立或交互影响,损伤生精细胞或生精微环境,导致生精细胞自我更新、增殖与分化障碍,临床表现为严重少精子症、隐匿精子症,甚至非梗阻性无精子症。生精障碍临床发病率高,已然成为严重影响我国人口生殖健康和人口安全的重大疾病。但生精障碍病因复杂,需要建立生精障碍分型诊治体系,将生精障碍分为三种亚型:1)睾丸生精小管中有局灶性精子发生的“局灶型”;2)生精小管中生精细胞阻滞于精子发生某一特定阶段的“阻滞型”;3)生精小管中仅存支持细胞或偶见生精细胞的“衰竭型”。其分型主要依据显微取精手术术中细胞学和术后病理学检查。目前缺乏基于病史特征、体格检查、超声影像、生殖激素等临床数据,建立术前临床预测模型,用于指导临床开展后续显微取精手术、判断患者生育预后及开发新的临床诊疗手段。
2、由于临床预测模型纳入参数较多,不仅存在生精障碍患者就诊不同医院时临床检测项目不统一的情况,而且受限于人力物力,统计人员和数据管理人员,常常难以完整获取到所有患者的临床特征信息,这将不可避免地导致患者临床特征资料常存在一部分无法填补的缺失值,这将严重影响了计算机技术的泛用性,同时关键特征的缺失对预测模型准确性的影响也不可忽视。
技术实现思路
1、本发明的目的就是为了克服上述现有技术存在的准确性低、泛用性差的缺陷而提供一种基于迭代填补法的生精障碍分型预测方法和装置。
2、本发明的目的可以通过以下技术方案来实现:
3、一种基于迭代填补法的生精障碍分型预测方法,包括以下步骤:
4、s1:获取患者的临床数据;
5、s2:对临床数据进行数据清洗,得到缺失值,并采用迭代填补法对缺失值进行填补,得到待预测数据;
6、s3:将待预测数据输入至预测网络模型中,输出分型预测结果。
7、进一步地,迭代填补法具体包括以下步骤:
8、s21:将缺失值初始化为临床数据中该缺失值对应的特征的均值;
9、s22:对每一个含有缺失值的特征,设其为响应变量y,将其他特征集x作为解释变量,使用解释变量构建预测模型,更新响应变量中的缺失值,使用解释变量构建预测模型,更新响应变量中的缺失值,表达式为:
10、
11、式中,t为迭代次数,为第t次迭代对缺失值的预测值,x为解释变量,f为预测模型;
12、s23:更新响应变量ymiss的估计值:
13、
14、式中,是t+1次迭代中缺失值的更新值;
15、s24:迭代继续进行,直到满足变化率阈值或达到最大迭代次数。
16、进一步地,预测网络模型的预测过程包括:
17、通过特征转换增强输入特征的表达能力;
18、利用学习到的权重系数掩码完成特征选择;
19、生成当前步的输出向量;
20、将所有步的输出向量累加,通过全连接层变换输出分型预测结果。
21、进一步地,特征转换具体为:将特征转换为两个串行的部分,一部分为共享层,另一部分为独立层。
22、进一步地,共享层的输出与独立层的输出均需要经过分割,分割结果均包括第一部分与第二部分,定义为:
23、第一部分:d1[i],为特征转换输出,表示第i步上,输出维度为
24、第二部分:d2[i],为特征选择输入,表示第i步上,输出维度为
25、其中,i为当前的迭代步数,r为实数域,b为批量大小,nd为第i步输出向量的维度,na表示第i步特征选择部分的输出向量维度。
26、进一步地,特征转换后,通过学习到的权重系数的掩码矩阵完成特征选择,权重系数的掩码矩阵的计算表达式为:
27、m[i]=sparsemax(p[i-1]×hi(a[i-1]))
28、式中,m[i]为第i步生成的掩码矩阵,sparsemax是激活函数,p[i-1]为第i-1步的加权缩放因子,hi为第i步的特征变换函数,a[i-1]为前一步生成的特征激活向量。
29、进一步地,加权缩放因子的计算表达式为:
30、
31、式中,p[i]为第i步的加权缩放因子,∏为累积乘积符号,γ为常数,当γ>1时,特征在后续的步中再次以更高的权重被使用,在第0步时,p[0]=1b×d,m[j]为第j步生成的掩码矩阵。
32、进一步地,分型预测结果的表达式为:
33、
34、output=fc(dout)=wfinddout
35、式中,dout为所有步骤输出的累积和,∑为求和操作,n为总步骤数,relu为激活函数,d1[i]为第i步的特征转换输出,output为模型最终输出,即分型预测结果,fc为全连接层,wfind为全连接层的权重矩阵。
36、进一步地,临床数据包括定性特征和数值特征,定性特征包括特发性、azf c区缺失、青春期后腮腺炎性睾丸炎、azf非c区缺失和精索静脉曲张史,数值特征包括平均睾丸体积、卵泡刺激素、黄体生成素、抑制素b和抗缪勒氏管激素。
37、本发明的第二方面,一种基于迭代填补法的生精障碍分型预测装置,包括存储器、处理器,以及存储于存储器中的程序,处理器执行程序时实现如上任一的一种基于迭代填补法的生精障碍分型预测方法。
38、与现有技术相比,本发明具有以下有益效果:
39、1)本发明采用迭代填补法处理缺失数据,通过逐步精化预测值来接近真实数据分布,以预测缺失值,补充数据的完整性和准确性,弥补临床条件的数据获取缺失项,保证了模型在应用过程中的泛用性,保障模型预测精度。
40、2)本发明通过多步特征选择和权重调整,采用掩码生成和加权缩放因子优化输入特征的表达和选择过程,逐步累积形成最终的预测结果,具有计算量小、复杂度低、可重复性好的特点,能够有效提高诊断的精确度和效率。
1.一种基于迭代填补法的生精障碍分型预测方法,其特征在于,包括以下步骤:
2.根据权利要求1所述的一种基于迭代填补法的生精障碍分型预测方法,其特征在于,所述迭代填补法具体包括以下步骤:
3.根据权利要求1所述的一种基于迭代填补法的生精障碍分型预测方法,其特征在于,所述预测网络模型的预测过程包括:
4.根据权利要求3所述的一种基于迭代填补法的生精障碍分型预测方法,其特征在于,所述特征转换具体为:将特征转换为两个串行的部分,一部分为共享层,另一部分为独立层。
5.根据权利要求4所述的一种基于迭代填补法的生精障碍分型预测方法,其特征在于,所述共享层的输出与独立层的输出均需要经过分割,分割结果均包括第一部分与第二部分,定义为:
6.根据权利要求3所述的一种基于迭代填补法的生精障碍分型预测方法,其特征在于,所述特征转换后,通过学习到的权重系数的掩码矩阵完成特征选择,所述权重系数的掩码矩阵的计算表达式为:
7.根据权利要求6所述的一种基于迭代填补法的生精障碍分型预测方法,其特征在于,所述加权缩放因子的计算表达式为:
8.根据权利要求3所述的一种基于迭代填补法的生精障碍分型预测方法,其特征在于,所述分型预测结果的表达式为:
9.根据权利要求1所述的一种基于迭代填补法的生精障碍分型预测方法,其特征在于,所述临床数据包括定性特征和数值特征,所述定性特征包括特发性、azf c区缺失、青春期后腮腺炎性睾丸炎、azf非c区缺失和精索静脉曲张史,所述数值特征包括平均睾丸体积、卵泡刺激素、黄体生成素、抑制素b和抗缪勒氏管激素。
10.一种基于迭代填补法的生精障碍分型预测装置,包括存储器、处理器,以及存储于所述存储器中的程序,其特征在于,所述处理器执行所述程序时实现如权利要求1-9中任一所述的一种基于迭代填补法的生精障碍分型预测方法。
