本发明涉及生成式人工智能,具体地说涉及面向可控人类图像生成的姿态修正方法及计算机设备。
背景技术:
::1、可控人类图像生成的本质上是一个根据文本生成图像的过程。现有的大型图像生成模型可以根据包含人类描述的自然语言文本提示,来实现高质量的以人为中心的图像生成。然而这些普适型的大模型无法控制生成图像中的人类的姿态。可控人类图像目标在于在给定例如人体姿态和文本等条件时生成以人为中心的图像。它有许多应用,例如动画、游戏制作和虚拟试穿,引起了学术界和工业界的极大关注。2、对于可控人类图像生成问题,现有研究通常建立在预训练的大型图像生成模型stable diffusion(sd)上,以充分利用大模型的图像生成能力。一种解决方法是:冻结sd模型权重的同时引入一个额外的可学习的姿态条件分支。额外的条件分支使得模型在图像生成过程中能够考虑姿态条件,提高了原始sd模型的姿态可控性,从而获得了广泛的关注和认可。另一种解决方法是:分析冻结分支的弊端,使用一种热图引导去噪损失来微调原始sd模型,而不是使用双分支扩散,在精确的姿势控制和图像质量方面优于引入额外分支的方法。但是,在面对非常拥挤的场景以及复杂、罕见的动作条件时,上述两种解决方法依旧会出现生成失败的情况。技术实现思路1、本发明提供的一种有效提高姿态控制精确度的面向可控人类图像生成的姿态修正方法及计算机设备,可至少解决上述技术问题之一。2、为了解决上述技术问题,本发明采用如下技术方案:3、一种面向可控人类图像生成的姿态修正方法,包括以下步骤:4、s1:记预训练的可控人类图像生成模型中噪音预测网络unet输出的预测噪音张量为noutput,记预训练的可控人类图像生成模型中提取后的文本特征张量为tclip;5、s2:将文本特征张量tclip输入一维最大池化网络进行最大池化,池化后进行裁剪、展平,得到一维文本张量t;6、s3:将一维文本张量t与预训练的可控人类图像生成模型中的扩散步张量t相加,得到条件张量c;7、s4:将预测噪音张量noutput做切片处理,得到噪音张量n'output;8、s5:将位置编号张量p与噪音张量n'output相加,得到新噪音张量n;9、s6:将新噪音张量n按序输入至层归一化网络及多头自注意力网络sa中,再输入至一层层归一化网络中,得到输出张量n4;10、s7:将输出张量n4与条件张量c同时输入至多头交叉注意力网络ca中,并将结果按序输入至层归一化网络及位置逐元素前馈网络中,得到最终预测噪音张量n';11、s8:将最终预测噪音张量n'输入回预训练的可控人类图像生成模型的后续过程,生成姿态控制精度更高的最终图像。12、进一步地,所述s1中,预测噪音张量noutput大小为64×64×4,文本特征张量tclip大小为77×1024。13、进一步地,所述s2中,池化的具体方法为:将文本特征张量tclip输入至一维最大池化网络中进行最大池化,将特征维度的大小从1024缩小至16,所得池化后的文本特征张量tmaxpooling的大小为77×16。14、进一步地,所述s2中,展平的具体方法为:将池化后的文本特征张量tmaxpooling沿长度维裁剪成大小为72×16的张量,再展平得到大小为1×1152的一维文本张量t。15、进一步地,所述s3中,条件张量c的大小为1×1152。16、进一步地,所述s4中,切片处理的具体方法为:以2×2的切片尺度将长宽为64×64的预测噪音张量noutput切割成1024个2×2的小块,将2×2的小块沿通道维堆叠,此时每个小块的大小为1×1×16,再将大小为16的通道维映射成1152。17、进一步地,所述s6中,得到输出张量n4的方法为:将新噪音张量n输入层归一化网络ln1中,得到输出张量n1,将输出张量n1输入至多头自注意力网络sa中,得到输出张量n2,将新噪音张量n与输出张量n2相加得到输出张量n3,将输出张量n3输入至层归一化网络ln2中,得到输出张量n4。18、进一步地,所述s7中,得到最终预测噪音张量n'的方法为:将输出张量n4与条件张量c同时输入至多头交叉注意力网络ca中,得到输出张量n5,将输出张量n5与输出张量n3相加得到输出张量n6,将输出张量n6输入至层归一化网络lh3中,得到输出张量n7,将输出张量n7输入至位置逐元素前馈网络pf中,得到输出张量n8,将输出张量n8与输出张量n6相加,得到最终预测噪音张量n'。19、进一步地,所述s6中,多头自注意力网络sa为16个注意力头。20、进一步地,所述s7中,多头交叉注意力网络ca为16个注意力头。21、一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,所述计算机程序被所述处理器执行时,使得所述处理器执行上述面向可控人类图像生成的姿态修正方法的步骤。22、本发明的有益效果体现在:23、1、本发明利用池化、裁剪和展平的方法,对原预训练的姿态可控人类图像生成模型中的文本特征进行进一步的处理,使其能够合理的输入到姿态控制过程中去。24、2、本发明利用自注意力机制和交叉注意力机制,让模型能够更好的学习姿态图像块的上下文信息,从而达到姿态修正的目的,使得模型能够生成姿态控制精度更高的人类图像。25、3、本发明能够被合理用于不同的基于扩散模型的预训练的姿态可控人类图像生成模型,使用起来轻量、便捷,能够有效提升模型的性能。26、4、本发明充分学习了姿态控制信息,可以在当前先进的预训练姿态可控人类图像生成模型以及人类图像的公开数据上取得优异的效果,在对姿态控制精确度要求较高的场景中具有良好的应用前景和实用价值。技术特征:1.面向可控人类图像生成的姿态修正方法,其特征在于,包括以下步骤:2.如权利要求1所述的面向可控人类图像生成的姿态修正方法,其特征在于,所述s1中,预测噪音张量noutput大小为64×64×4,文本特征张量tclip大小为77×1024。3.如权利要求1所述的面向可控人类图像生成的姿态修正方法,其特征在于,所述s2中,池化的具体方法为:将文本特征张量tclip输入至一维最大池化网络中进行最大池化,将特征维度的大小从1024缩小至16,所得池化后的文本特征张量tmaxpooling的大小为77×16。4.如权利要求1所述的面向可控人类图像生成的姿态修正方法,其特征在于,所述s2中,展平的具体方法为:将池化后的文本特征张量tmaxpooling沿长度维裁剪成大小为72×16的张量,再展平得到大小为1×1152的一维文本张量t。5.如权利要求1所述的面向可控人类图像生成的姿态修正方法,其特征在于,所述s3中,条件张量c的大小为1×1152。6.如权利要求1所述的面向可控人类图像生成的姿态修正方法,其特征在于,所述s4中,切片处理的具体方法为:以2×2的切片尺度将长宽为64×64的预测噪音张量noutput切割成1024个2×2的小块,将2×2的小块沿通道维堆叠,此时每个小块的大小为1×1×16,再将大小为16的通道维映射成1152。7.如权利要求1所述的面向可控人类图像生成的姿态修正方法,其特征在于,所述s6中,得到输出张量n4的方法为:将新噪音张量n输入层归一化网络ln1中,得到输出张量n1,将输出张量n1输入至多头自注意力网络sa中,得到输出张量n2,将新噪音张量n与输出张量n2相加得到输出张量n3,将输出张量n3输入至层归一化网络ln2中,得到输出张量n4。8.如权利要求1所述的面向可控人类图像生成的姿态修正方法,其特征在于,所述s7中,得到最终预测噪音张量n'的方法为:将输出张量n4与条件张量c同时输入至多头交叉注意力网络ca中,得到输出张量n5,将输出张量n5与输出张量n3相加得到输出张量n6,将输出张量n6输入至层归一化网络lh3中,得到输出张量n7,将输出张量n7输入至位置逐元素前馈网络pf中,得到输出张量n8,将输出张量n8与输出张量n6相加,得到最终预测噪音张量n'。9.如权利要求1所述的面向可控人类图像生成的姿态修正方法,其特征在于,所述s6中,多头自注意力网络sa为16个注意力头,所述s7中,多头交叉注意力网络ca为16个注意力头。10.计算机设备,其特征在于,包括存储器和处理器,所述存储器存储有计算机程序,所述计算机程序被所述处理器执行时,使得所述处理器执行如权利要求1-9中任一项所述方法的步骤。技术总结本发明公开了面向可控人类图像生成的姿态修正方法及计算机设备,其中方法包括:S1:对可控人类图像生成模型提取文本特征张量;S2:将文本特征张量池化后进行裁剪、展平,得到一维文本张量;S3:将一维文本张量与扩散步张量相加,得到条件张量;S4:将预测噪音张量做切片处理,得到噪音张量;S5:将位置编号张量与噪音张量相加,得到新噪音张量;S6:将新噪音张量按序输入至层归一化网络及多头自注意力网络中,得到输出张量;S7:将输出张量与条件张量同时输入至多头交叉注意力网络中,得到最终预测噪音张量;S8:生成姿态控制精度更高的最终图像。本发明能够提高姿态控制的精确度。技术研发人员:徐小龙,许逸非受保护的技术使用者:南京邮电大学技术研发日:技术公布日:2024/9/23
转载请注明原文地址:https://www.famiwei.com/read-9024851.html