一种模型与特征联合学习的多任务学习方法

xiaoxiao2020-10-23  15

一种模型与特征联合学习的多任务学习方法
【技术领域】
[0001] 本发明设及机器学习技术领域,尤其设及一种模型与特征联合学习的多任务学习 方法。
【背景技术】
[0002] 在互联网高速发展的今天,尤其是图像视屏的普及,使得我们处于一个大数据的 时代。怎样从数据中挖掘更多的有用信息,是我们要面对的一个严峻问题。在机器学习领 域中,单任务学习方法已经得到足够的重视与发展,比如支持向量机,线性回归等。但是单 任务学习自身存在着一定的缺陷。当需要同时学习几个任务的时候,任务之间往往存在一 定的联系。单任务学习往往只考虑任务本身的信息量,没有考虑到与其他任务的联系,因此 学习能力受到了一定的局限性。而多任务学习正是针对单任务学习的该种局限性,希望挖 掘出不同任务之间的联系,同时学习多个任务,提高数据挖掘的效果。
[0003] 目前,多任务学习的方法主要有两种,其中一种方法是通过共有模型来衡量任务 之间的关系,另一种方法是通过共有部分特征来衡量任务之间的关系。但是该两种学习方 法都有一定的局限性。具体来说,第一种方法往往是在原始特征空间中衡量模型之间的关 系,但是在现实生活中,原始特征空间中任务之间模型的关系可能并不是很明显,在该种情 况下,多任务学习不仅不会带来效果上的提升,有时候还会使结果变得更差。第二种方法假 设所有的任务共有部分特征,但是该种方法忽略了模型之间可能存在的关系。

【发明内容】

[0004] 本发明的目的是提供一种模型与特征联合学习的多任务学习方法,使得多任务学 习方法更加合理,更适应现实生活中的数据。
[0005] 本发明的目的是通过W下技术方案实现的:
[0006] (与权利要求相对应)。
[0007] 由上述本发明提供的技术方案可W看出,该方案结合了多任务学习中共享模型与 共享特征的方法,该使得多任务学习方法更加合理,更适应现实生活中的数据,其学习效果 远远优于传统学习方案的效果。
【附图说明】
[0008] 为了更清楚地说明本发明实施例的技术方案,下面将对实施例描述中所需要使用 的附图作简单地介绍,显而易见地,下面描述中的附图仅仅是本发明的一些实施例,对于本 领域的普通技术人员来讲,在不付出创造性劳动的前提下,还可W根据该些附图获得其他 附图。
[0009] 图1为本发明实施例提供的一种模型与特征联合学习的多任务学习方法的示意 图;
[0010] 图2为本发明实施例提供的一种模型与特征联合学习的多任务学习方法的流程 图。
【具体实施方式】
[0011] 下面结合本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完整 地描述,显然,所描述的实施例仅仅是本发明一部分实施例,而不是全部的实施例。基于本 发明的实施例,本领域普通技术人员在没有做出创造性劳动前提下所获得的所有其他实施 例,都属于本发明的保护范围。
[0012] 本发明实施例提供一种模型与特征联合学习的多任务学习方法(Multi-化sk ModelandFea化re化intLearning,MUL)。本发明的主要思想就是同时学习不同任务之 间共有的模型与共有的特征,如图1所示。现实生活中由于数据的复杂性和噪声的存在,不 同任务之间的关系可能并不是那么明显,也就是说不同任务在原始特征空间中的联系非常 弱或者说他们之间的模型差别很大。本发明的方案通过学习一个特征映射矩阵U,通过特征 映射矩阵U的映射,不同的任务之间有着紧密的联系,并且让他们共有一个超平面a。,用来 弥补特征映射矩阵U学习能力的不足,同时保持每个任务独有的特征at(即第t个任务的 偏置)。
[0013] 本发明实施例所提供的方法如图2所示,其主要包括如下步骤:
[0014] 步骤21、获取T个不同的学习任务,每一学习任务t中均包含一个数据集Dt。
[001引本发明实施例中,数据集:Dt= {托1,於1),0口,y口), 其中,Xti为 第i个输入特征,yu为相对应的输出;Xu为一个d维的列向量Rd,YtiGR,tG(1, 2,...,T},iG(1,2,...,mt}。
[0016] 步骤22、将每一学习任务中的数据集共同学习一个正交的特征映射矩阵U,通过 该特征映射矩阵U,使得所有任务都能够分享一个中屯、平面a。,并保持每个任务特有的模型 特征at,从而实现模型与特征联合学习的多任务学习。
[0017] 本发明实施例的目标是利用上面T个不同的学习任务化1,〇2,...,町}学习T个不 同的线性方程:
[001 引ft(x")=v' (1)
[0019] 传统的单任务学习方法只利用自身的数据学习该T个不同的线性方程(比如线性 回归,支持向量机等),多任务学习方法通过挖掘不同任务之间的关系同时学习该T个不同 的线性方程。
[0020] 本发明实施例使用所有学习任务中的数据集共同学习一个正交的特征映射矩阵 U,通过该特征映射矩阵U,使得所有任务都能够分享一个中屯、平面a。,并保持每个任务特有 的模型特征at:
[0021] ft(Xu) =〈at+a〇,U' (2)
[0022] 中屯、平面a。为一个d维的向量,其代表任务之间的相互信息,偏置at保持每个任 务独有的特征。a。和at都是在新的特征空间学习得到的。
[0023] 本发明实施例求解下述目标函数获得特征映射矩阵U、中屯、平面a。^及每个任务 特有的模型特征at的最优解:
[0024]
[00巧]其中,1为一损失函数(例如,最小方差),其用于代表真实值yu与预测值〈Vt,U'X。〉之间的损失函数;〈Vt,U'X。〉表示向量Vt与向量U'X。之间的内积,本发明实施例 中所有的上标'均表示矩阵的转置,例如,此处的U'表示特征映射矩阵U的转置。矩阵V= [Vi,V2,. . .,Vt].1代表了其中的元素都为1的1XT的向量,Vt为矩阵V中的第t列;从图1 可W看出,Vt是由数据集Dt学习得到的,乂,=3。+3,,从而可^根据求解出的矩阵¥计算出所 有的at。丫和0为惩罚因子,用来调整每项的惩罚程度,其最佳数值可W通过训练来确定。 Ia。II2表示a。的2范式,用于保证中屯、平面a。的平滑性,表示为
其 中,是向量a。中的第i个元素,该公式的含义是将a。中的所有元素求平方和然后开方。 |V-a〇*l|Li代表矩阵(V-a〇*l)的(2,1)范式,用来学习不同任务之间共享的特征,可W表 示天
代表矩阵V的第i行。
[0026] 由于上述式(3)是一个非凸的优化问题,直接求解该样一个非凸问题比较困难, 本发明实施例中将式(3)转化为一个凸优化问题求解。
[0027] 将式做等价转化为如式(4)所示的凸优化问题:
[0028]
[002引其中,W= [Wi,W2,...,Wt] ;DG巧隶示矩阵D属于半正定对称矩阵,护表示矩阵D 的伪逆,trace(D)表示矩阵D的迹。range(W)表示集合{xGRn;x=Wz,对于某个ZG, 即,range(W)表示的是一类n维向量X的集合,只要满足X=Wz,对于某个T维的z成立即 可,此处的Wz可W看成前述的参数W。
[0030] 所述参数W,W。,D均为将非凸的优化问题向凸优化问题转化时,用于求取所述非 凸的优化问题最优解巧,卸,0)的中间参数(本发明实施例中,带上标-的参数表示该参 数的最优解);若式做最优解为巧,斬,巧,A=杠,32,…,aj,则式(4)的最优解为
为对角元素 的对角阵,其中,护代表最优解矩降A的第i行;若(斯w〇,巧:为所述式(4)的最优解,当矩 阵0的列是矩阵D的特征向量时,A二UW,斬二Uw〇为所述式(3)的最优解。
[0031] 本发明实施例中,通过迭代优化算法求取式(4)的最优解0兩w〇,巧,其步骤如 下:
[0032] 步骤A、固定参数D,优化参数(W,W。);优化问题如下:
[0033]
[0034] 本发明实施例中,只考虑损失函数为方差的情况,做一些变形解决式巧)的问题。 [00对首先,々Xt= [Xn,Xt2,…,XtmJ巨代表任务t中的所有的输入特征,Yt= yti,yt2,....eR?t代表任务t中所有输入特征的输出,第t个任务的输入特征的个数 可W用mt来表述,则可用M代表T个任务中总的输入特征的个数:
[0036] M二mi+m2+m3+…+mt
[0037] 其次,令X=bdiag狂l,X2,...,XT)GRdTXM和Y=[Yl',Y2',...,Y'T]ERM, Y中的元素Yt'表示Yt的转置,X代表一个对角块矩阵,对角线上是T个不同任务的数据, Y是将T个任务的所有数据的输出点排列起来的一个向量;
[0038] 再令
表示参 数W。的转置;Wi=[w' 1,W' 2,...,W'T]' 冲的元素Wt'表示参数Wt的转置, 其中的元素是把所有的T个向量Wi,*2, . . .,Wt按列排列得到,是一个dXT维列向量;则前 述优化问题(即式5)转化为:
[0039]
[0040]令I为一个dXd维的单位阵,< br>[I,I,...,I]'表示[I, I,...,I]的转置,则有W〇=InXw。。
[0041] 通过引入一些新的变量,可将式(6)表示成一个标准的2范数约束问题。
[004引其中,Z= 口' 1,Z' 2],Z' 1与Z' 2分别表示Zi与Z2的转置,Z'表示Z的转 置
[0046] 最终该优化问题表示为:
[0047]
[004引上式为一个标准的2范式约束的凸优化问题,有显示解,从而获得(\^,w0):
[0049] Z= (P'XX'P+I)-ip'XY
[0050] 其中,P'表示P的转置,X'表示X的转置;
[0051] 步骤B、根据获得的(兩,w〇)来优化参数D,通过求解下述优化问题:
[005引其中,r表示W的转置。
[0057] 通过上述的步骤A~步骤B则可求解出式(4)的最优解0而w〇,巧,从而当矩阵巧| 的列是矩阵6|的特征向量时,式(3)的最优解为為=日'兩,a〇=u巧0。
[0058] 本发明实施例的上述方案结合了多任务学习中共享模型与共享特征的方法,该使 得多任务学习方法更加合理,更适应现实生活中的数据,其学习效果远远优于传统学习方 案的效果。
[0059] 为了验证本发明实施例提供的模型与特征联合学习的多任务学习方法(MUL),我 们将在=个数据集上作对比试验,给出实验结果;并和两个单任务学习方法,五个多任务学 习方法进行效果的比较。两个单任务学习方法分别是ridgeregression化idge)和Lasso; 五个多任务学习方法是leastsquareswithtracenorm,leastsquareswithlow-rank andsparsestructuresregularization(Sparse-LowRank),convexmulti-task featurelearning,robustmulti-tasklearningwithlow-rankandgroup-sparse structures(RMTL)和dirtymodelmulti-taskregressionlearning(DirtyMTL)。上述 方法都使用方差作为损失函数。
[0060] S个数据集均为现有的数据集分别是Schoolda化set,SARC0Sdataset和Isolet dataset。Schooldataset包含了 139个预测分数的任务,总共有15362个数据点,每个数 据点有27维的特征。SARC0S数据集是预测机器人手臂7个自由度的问题,总共有48933个 数据点,每个数据点被描述为21维的特征,那么总共有7个任务,每个任务就是预测一个机 器手臂的一个自由度。Isolet数据集是一个语音数据集,收集来自5个组的语音,每个组的 人数为1560,1560,1560,1558和1559,所W总共有5个任务,每个任务表示预测该些组里 的人的发音是什么字母。结果的评价标准使用normalizedmeamsquareerror(nMS巧和 averagedmeansquarederror(aMSE),该两种评价方法和均方差类似,仅进行了变形,其评 价结果可W看成一种误差,结果越小表明效果越好。实验结果如表1-表3所示。
[0061]
[0066] 表3Isolet数据集上的结果
[0067] 从上面表格的结果可W看出本发明提供的的MF化有着明显的优点,在S个数据 集上的效果都比其他方法要好,该就证明了本发明所提供方法的有效性。
[0068] 通过W上的实施方式的描述,本领域的技术人员可W清楚地了解到上述实施例可 W通过软件实现,也可W借助软件加必要的通用硬件平台的方式来实现。基于该样的理解, 上述实施例的技术方案可软件产品的形式体现出来,该软件产品可W存储在一个非易 失性存储介质(可W是CD-ROM,U盘,移动硬盘等)中,包括若干指令用W使得一台计算机 设备(可W是个人计算机,服务器,或者网络设备等)执行本发明各个实施例所述的方法。
[0069] W上所述,仅为本发明较佳的【具体实施方式】,但本发明的保护范围并不局限于此, 任何熟悉本技术领域的技术人员在本发明披露的技术范围内,可轻易想到的变化或替换, 都应涵盖在本发明的保护范围之内。因此,本发明的保护范围应该W权利要求书的保护范 围为准。
【主权项】
1. 一种模型与特征联合学习的多任务学习方法,其特征在于,该方法包括: 获取T个不同的学习任务,每一学习任务t中均包含一个数据集Dt; 将每一学习任务中的数据集共同学习一个正交的特征映射矩阵U,通过该特征映射矩 阵U,使得所有任务都能够分享一个中心平面%,并保持每个任务特有的模型特征at,从而 实现模型与特征联合学习的多任务学习。2. 根据权利要求1所述的方法,其特征在于,所述的特征映射矩阵U、中心平面a ^以及 每个任务特有的模型特征at通过求解下述目标函数获得:其中,数据集〇1 = {〇[1以1),〇[2以2),~,(1加^加 !£.)},1?为第1个输入特征,7?为 相对应的输出,xtie Rd,ytie R,t e {1,2, "·,Τ},i e {1,2,;1 为一损失函数;U' 表示特征映射矩阵U的转置,矩阵V = [V1, v2,…,vT]. 1代表了其中的元素都为1的IXT的 向量,vt为矩阵V中的第t列;γ和β为惩罚因子;Il a C1 Il 2表示a C1的2范式,Il V-a'l Il 2,ι 代表矩阵(V-aQ*l)的(2, 1)范式。3. 根据权利要求2所述的方法,其特征在于,该方法还包括: 所述目标函数为一个非凸的优化问题,将其转化为一个凸优化问题:s.t. D E S+,trace(D) < I, range(W) ^ range(D) 其中,W= [Wi,W2,…,Wt] ;DES〖表示矩阵D属于半正定对称矩阵,D+表示矩阵D的伪 逆,trace (D)表示矩阵D的迹; 所述参数W,W(I,D均为将非凸的优化问题向凸优化问题转化时,用于求取所述 非凸的优化问题最优解(足知,〇;)的中间参数;若所述非凸的优化问题最优解为 知,0),A = Iia1, a2,…,aT],则所述凸优化问题的最优解为W = 0?, %> = 〇δ〇,为对角元素的对角阵,其中,纪代表 最优解矩阵Sl的第i行;若0故%),β)为所述凸优化问题的最优解,当矩阵0的列是矩阵D 的特征向量时,S = O'w,^ = 0'%)为所述非凸的优化问题最优解。4. 根据权利要求3所述的方法,其特征在于,该方法还包括:通过迭代优化算法求取所 述凸优化问题最优解.(成%, β),其步骤如下: 步骤Α、固定参数D,优化参数(W,Wtl);优化问题如下:S.t. range(W) ^ range(D) 令Xt = [xtl,xt2,xtmt] e Rdxmt代表任务t中的所有的输入特征; Yt = [yti,yt2, e Rmt代表任务t中所有输入特征的输出;M代表τ个任务中总的输 入特征的个数: M = 1?+!?+!?+."+!? 令X = bdiag(X1,X2,…,Xτ)eRdτXM和γ=[γ, 1,γ,2,…,γ,τ]eRM,γ中的元素 Y' t表示Y t的转置,X代表一个对角块矩阵,对角线上是T个不同任务的数据,Y是将T个 任务的所有数据的输出点排列起来的一个向量;' ^表示参数Wci的 转置;W1=Iiw' w' 2,…,w' T] ' e RdT,%中的元素W' t表示参数《1的转置; 则前述优化问题转化为:令 I 为一个 dxd 维的单位阵,eRdTxd' [Ι,Ι,···,ΙΓ 表示[Ι,Ι,···,Ι] T 的转置,则有Wtl= IciXwci;其中,Z = [Z' W2],与t 2分别表示21与22的转置,Z'表示Z的转置; I最终该优化问题表示为: IninIlY-XiPZl^ +Z1Z 上式为一个标准的2范式约束的凸优化问题,有显示解,从而获得(你,说〇): Z= (Pr XXr P+I)_1P, XY 其中W表示P的转置,表示X的转置; 步骤B、根据获得的(成%)来优化参数D,通过求解下述优化问题: T其中,r表示w的转置。
【专利摘要】本发明公开了一种模型与特征联合学习的多任务学习方法,该方法包括:获取T个不同的学习任务,每一学习任务t中均包含一个数据集Dt;将每一学习任务中的数据集共同学习一个正交的特征映射矩阵U,通过该特征映射矩阵U,使得所有任务都能够分享一个中心平面a0,并保持每个任务特有的模型特征at,从而实现模型与特征联合学习的多任务学习。本发明所提供的方法结合了多任务学习中共享模型与共享特征的方法,这使得多任务学习方法更加合理,更适应现实生活中的数据,其学习效果远远优于传统学习方案的效果。
【IPC分类】G06K9/62, G06F17/30
【公开号】CN104881678
【申请号】CN201510236447
【发明人】田新梅, 李亚, 刘同亮, 陶大程
【申请人】中国科学技术大学
【公开日】2015年9月2日
【申请日】2015年5月11日
转载请注明原文地址:https://www.famiwei.com/read-8138398.html

最新回复(0)