本公开涉及图像处理领域。特定实施例涉及一种通过对数字图像的一个或多个视觉参数进行的改变来增强数字图像的方法,这些改变使用实施机器学习解决方案的计算机或计算机系统来识别。其他实施例涉及配置成执行这样的方法的计算机处理系统或计算机可读存储。
背景技术:
1、数字图像,例如作为数据而存储的照片或视频,在现代社会中无处不在。它们可以并且经常使用数码相机生成。除了专用相机之外,现在数码相机可得性很高,包括在诸如智能电话的多功能设备上的数码相机。数码相机具有各种规格,包括与镜头尺寸、镜头数量和图像捕获硬件有关的规格。数字图像可以通过其他机制来生成,例如使用计算机应用程序,并且近来已对使用人工智能来生成数字图像(包括艺术品)进行了大量讨论。
2、软件或固件可以自动处理数字图像数据,例如由数码相机的图像捕获硬件生成的数字图像数据或者从或通过另一个源接收的数字图像数据。软件或固件还可以或替代地允许对数字图像数据的视觉参数进行手动调整,包括例如响应于手动输入来处理数字图像以调整亮度、饱和度和对比度中的一项或多项。软件或固件可以形成数码相机或其他图像生成器的一部分,或者可以在与数码相机或其他图像生成器分离的计算机系统上运行,该计算机系统已接收用于处理的数字图像数据。
3、可以部署用于处理数字图像的软件或固件以增强图像。增强可以旨在使图像更美观。增强还可以或替代地旨在使图像更清晰或使得来自图像的信息能够更容易地辨别。本公开涉及用于将基于机器学习的解决方案用于图像处理以例如允许图像增强的方法。
技术实现思路
1、描述了训练机器学习模型的方法的实施例。实施例特别适用于训练机器学习模型以执行图像处理,例如图像增强。
2、在一些实施例中,训练的方法包括利用以下两者的组合的减少或最小化作为学习目标:i)第一损失,其中,第一损失是应用至少一个视觉参数的机器学习模型的输出图像与目标训练图像之间的损失,以及ii)第二损失,其中,第二损失是分类输出与目标训练图像的已知分类之间的损失。在一些实施例中,训练的方法包括减少或最小化第一损失和第二损失两者的组合以及利用如下所述的训练无监督图像对。
3、在一些实施例中,训练的方法包括利用一个或多个无监督图像对,其中,无监督图像对是其中已基于无监督图像对的目标图像通过计算过程生成退化图像的图像对。计算过程包括将所选退化模型应用于目标图像,对用于生成无监督的退化模型的选择是基于与无监督对的目标图像相关联的分类信息。
4、描述了用于生成用于训练用于图像处理的机器学习模型的图像对的方法的实施例。
5、在一些实施例中,用于生成图像对的方法包括接收训练图像集和该训练图像集的场景信息,以及选择多个退化模型中的一个退化模型并将其应用于该训练图像集,以形成与该训练图像集相对应的退化图像集,其中,所述选择基于场景信息。每个退化图像和对应的训练图像形成用于训练机器学习模型的图像对。
6、还描述了利用所生成的图像对的训练用于图像处理的机器学习模型的实施例。
7、还描述了图像处理的方法的实施例。这些实施例包括利用已根据本文描述的训练方法的实施例之一训练的机器学习模型的实施例。
8、还描述了计算机处理系统和存储用于计算机处理系统的指令的非暂态计算机可读存储器,它们配置成执行本文公开的方法。
9、从以下通过示例并参考附图给出的描述中,进一步的实施例将变得显而易见。
1.一种图像处理方法,所述方法包括:
2.根据权利要求1所述的方法,其中,所述图像特性定义所述输入图像的颜色和亮度语义。
3.根据权利要求1所述的方法,其中,所述图像特性包括表示所述输入图像的颜色直方图的数据,例如rgb直方图。
4.根据权利要求1所述的方法,其中,所述第一分类输出包括由另一个经训练的机器学习模型确定的特征向量。
5.根据权利要求1所述的方法,其中,所述经训练的机器学习模型是第一经训练的机器学习模型,并且所述第一分类输出包括不同于所述第一经训练的机器学习模型的第二经训练的机器学习模型的输出,其中,所述第二经训练的机器学习模型被训练成将图像分类成多个场景类中的一个场景类。
6.根据权利要求5所述的方法,其中,所述多个场景类包括至少三个不同的场景类。
7.根据权利要求1所述的方法,其中,所述输入图像的图像特性和针对所述输入图像的第一分类输出的组合是定义所述输入图像的图像特性和所述输入图像的第一分类输出的数据的级联。
8.根据权利要求1所述的方法,其中,所述至少一个视觉参数包括以下各项中的一项或多项:(i)亮度、(ii)对比度、(iii)饱和度、(iv)鲜艳度、(v)白色、(vi)黑色、(vii)阴影和(viii)高光。
9.根据权利要求1所述的方法,其中,所述至少一个视觉参数包括来自以下集合的多个视觉参数:(i)亮度、(ii)对比度、(iii)饱和度、(iv)鲜艳度、(v)白色、(vi)黑色、(vii)阴影和(viii)高光。
10.根据权利要求9所述的方法,其中,所述多个视觉参数包括来自所述集合的至少三个视觉参数。
11.根据权利要求1所述的方法,其中,所述第一损失是所述输出图像与所述目标训练图像之间的均方误差损失。
12.根据权利要求1所述的方法,其中,所述第二损失是所述第二分类输出与所述目标训练图像的已知分类之间的多类交叉熵损失。
13.根据权利要求1所述的方法,其中,所述学习目标是所述第一损失和所述第二损失的数学组合。
14.根据权利要求13所述的方法,其中,所述数学组合是所述第一损失和所述第二损失的和或加权和。
15.根据权利要求1所述的方法,其中,所述机器学习模型包括配置成提供所述至少一个视觉参数的第一多层感知器和配置成提供所述第二分类输出的第二多层感知器。
16.根据权利要求15所述的方法,其中,所述机器学习模型包括第三多层感知器,所述第三多层感知器配置成减少对所述经训练的机器学习模型的输入的维度,其中,所述第一多层感知器和所述第二多层感知器均附接到所述第三多层感知器。
17.根据权利要求15所述的方法,其中,所述第一多层感知器和所述第二多层感知器包括神经网络。
18.根据权利要求15所述的方法,其中,所述第一多层感知器和所述第二多层感知器包括常规神经网络。
19.根据权利要求16所述的方法,其中,所述第三多层感知器包括神经网络。
20.根据权利要求16所述的方法,其中,所述第一多层感知器、所述第二多层感知器和所述第三多层感知器包括卷积神经网络。
21.根据权利要求1所述的方法,其中,所述至少一个视觉参数对应于能由照片编辑应用程序中的滑块调整的视觉参数。
22.根据权利要求1所述的方法,进一步包括由所述计算机处理系统应用所述至少一个视觉参数以生成相对于所述输入图像的经处理的图像。
23.根据权利要求22所述的方法,进一步包括由所述计算机处理系统使得在显示设备上显示图形用户界面,其中,所述图形用户界面配置成允许用户进一步调整所述经处理的图像的至少一个所述视觉参数。
24.根据权利要求1所述的方法,其中,基于多个图像对训练所述机器学习模型,每个图像对包括目标训练图像和退化图像,所述退化图像用于在训练期间生成所述机器学习模型的输出图像。
25.根据权利要求24所述的方法,其中:
26.根据权利要求25所述的方法,其中,由于所述第一图像对与所述第一类关联而不与所述第二类关联,为所述第一图像对选择所述第一退化模型而不选择所述第二退化模型,并且由于所述第二图像对与所述第二类关联而不与所述第一类关联,为所述第二图像对选择所述第二退化模型而不选择所述第一退化模型。
27.一种包括一个或多个计算机处理器和计算机可读存储的计算机处理系统,所述计算机处理系统配置成执行根据权利要求1至26中任一项所述的方法。
28.一种存储用于计算机处理系统的指令的非暂态计算机可读存储,其中,所述指令在由所述计算机处理系统执行时使所述计算机处理系统执行根据权利要求1至26中任一项所述的方法。
