一种多标签主动学习分类方法及系统的制作方法

xiaoxiao2020-10-23  18

一种多标签主动学习分类方法及系统的制作方法
【技术领域】
[0001] 本发明设及机器学习技术领域,更具体地说,设及一种多标签主动学习分类方法 及系统。
【背景技术】
[0002] 随着信息技术的发展,多标签数据分类技术的重要性逐渐突显,W至于对应的多 标签数据分类技术的应用也在不断增加,例如,图像视频的语义标注、生物基因功能分类、 文本分类等。作为一种多义性对象的建模工具,多标签学习是一种更符合真实客观世界规 律的学习方法,在此框架下,每个对象不再对应唯一的标签,多标签学习的目的是为未见的 对象赋予合适的标签集。由于多标签分类问题的复杂性,在构建分类器模型时需要耗费发 亮的时间和精力来收集带标签的样本。但在真实世界中,我们能够获取的标注数据是非常 少的,而且像在多标签学习框架下,每个对象都对应多个标签,依据与此便增加了获取标注 数据的难度。
[0003] 现有的多标签数据分类技术在获取标注数据的过程中仅仅考虑了单个待测样本 标签的不确定性,但并没有设及到待测样本标签间的不确定性,W至于在对标注后的待标 注样本标签进行标注时,影响了标注的准确性,进行影响了分类器分类的准确率。
[0004] 综上所述,如何提供一种分类准确率高的分类器,是目前本领域技术人员亟待解 决的问题。

【发明内容】

[0005] 有鉴于此,本发明的目的是提供一种多标签主动学习分类方法及系统,W提高分 类准确率。
[0006] 为了实现上述目的,本发明提供如下技术方案:
[0007] 一方面,本发明提供了一种多标签主动学习分类方法,包括:
[000引分别采用对数似然获取已标注样本标签对的似然度及采用滴的方式获取待标注 样本标签对的不确定性;
[0009] 分别计算多个相同样本的不同标签间的化距离及多个所述不同标签间的权重因 子;
[0010] 将每个所述化距离和与之相应的所述权重因子进行乘法运算,获取相应的结果, 将多个所述结果进行相加,获取与待标注样本标签对相关的待标注样本标签对的化距离 和,采用所述化距离和确定交叉标签不确定性;
[0011] 确定待标注样本标签对的最终不确定性;所述待标注样本标签对的最终不确定性 为依据所述交叉标签不确定性和所述待标注样本标签对的不确定性确定的;
[0012] 依据所述似然度和所述待标注样本标签对的最终不确定性获取得分函数,并依据 所述得分函数确定最优待标注样本标签对,并对所述最优待标注样本标签对进行标注;
[0013] 将标注完成的所述最优待标注标签对添加到样本标签对训练集W获取新的所述 样本标签对训练集,并采用新的所述样本标签对训练集训练分类器。
[0014] 优选的,所述分别采用对数似然获取已标注样本标签对的似然度及采用滴的方式 获取待标注样本标签对的不确定性前所述方法还包括:
[0015] 构建样本标签树,所述样本标签树是依据所述样本标签对训练集训练获取的。
[0016] 优选的,所述计算多个所述不同标签间的权重因子包括:
[0017] 定义标签距离矩阵;所述标签距离矩阵为通过所述样本标签树获取的;
[0018] 定义共现矩阵;所述共现矩阵为通过所述样本标签对训练集中的所述样本标签对 构建的;
[0019] 依据所述标签距离矩阵和所述共现矩阵构建代价标签矩阵,并采用所述代价标签 矩阵获取每个所述待标注样本标签对的权重因子。
[0020] 优选的,所述依据所述标签距离矩阵和所述共现矩阵构建代价标签矩阵,并采用 所述代价标签矩阵获取每个所述待标注样本标签对的权重因子包括:
[0021] 计算所述共现矩阵中任意两个位置处所述待标注样本标签对的内积和,获取所述 任意两个位置处所述待标注样本标签对出现的频率,并依据所述频率构建共现频率矩阵;
[0022] 结合所述标签距离矩阵和所述共现频率矩阵按照下式获取每个所述待标注样本 标签的权重因子:
[002引 5。日=0。日.5。0
[0024] 其中,a与P分别表示任意两个待标注样本标签;是标签a和标签P之间 的距离;Sa,p是标签a和标签P共同出现的频率。
[0025] 另一方面,本发明还提供了一种多标签主动学习分类系统,包括:
[0026] 第一获取模块,用于分别采用对数似然获取已标注样本标签对的似然度及采用滴 的方式获取待标注样本标签对的不确定性;
[0027] 计算模块,用于分别计算多个相同样本的不同标签间的化距离及多个所述不同 标签间的权重因子;
[002引第二获取模块,用于将每个所述化距离和与之相应的所述权重因子进行乘法运 算,获取相应的结果,将多个所述结果进行相加,获取与待标注样本标签对相关的待标注样 本标签对的化距离和,采用所述化距离和确定交叉标签不确定性;
[0029] 第一确定模块,用于确定待标注样本标签对的最终不确定性;所述待标注样本标 签对的最终不确定性为依据所述交叉标签不确定性和所述待标注样本标签对的不确定性 确定的;
[0030] 第二确定模块,用于依据所述似然度和所述待标注样本标签对的最终不确定性获 取得分函数,并依据所述得分函数确定最优待标注样本标签对,并对所述最优待标注样本 标签对进行标注;
[0031] 训练模块,用于将标注完成的所述最优待标注标签对添加到样本标签对训练集W 获取新的所述样本标签对训练集,并采用新的所述样本标签对训练集训练分类器。
[0032] 优选的,所述系统还包括:
[0033] 构建模块,用于构建样本标签树,所述样本标签树是依据所述样本标签对训练集 训练获取的。
[0034] 优选的,计算模块包括:
[0035] 第一定义单元,用于定义标签距离矩阵;所述标签距离矩阵为通过所述样本标签 树获取的;
[0036] 第二定义单元,用于定义共现矩阵;所述共现矩阵为通过所述样本标签对训练集 中的所述样本标签构建的;
[0037] 构建单元,用于依据所述标签距离矩阵和所述共现矩阵构建代价标签矩阵,并采 用所述代价标签矩阵获取每个所述待标注样本标签对的权重因子。
[003引优选的,所述构建单元包括:
[0039] 计算单元,用于计算所述共现矩阵中任意两个位置处所述待标注样本标签对的内 积和,获取所述任意两个位置处所述待标注样本标签对出现的频率,并依据所述频率构建 共现频率矩阵;
[0040] 获取单元,用于结合所述标签距离矩阵和所述共现频率矩阵按照下式获取每个所 述待标注样本标签的权重因子:
[0041] 5。日=C。日?Sap
[0042] 其中,a与P分别表示任意两个待标注样本标签;是标签a和标签P之间 的距离;Sa,p是标签a和标签P共同出现的频率。
[0043] 与现有技术相比,本发明的优点如下:
[0044] 本发明提供了一种多标签主动学习分类方法及系统,首先,分别采用对数似然获 取已标注样本标签对的似然度及采用滴的方式获取待标注样本标签对的不确定性;其次, 通过化距离和权重因子的关系获取化距离和W确定交叉标签不确定性;再者,根据交叉标 签不确定性和待标注样本标签对的不确定性确定待标注样本标签对的最终不确定性,最后 依据似然度和待标注样本标签对的最终不确定性确定得分函数,并依据得分函数确定最优 待标注样本标签对,并对最优待标注样本标签对进行标注;最后将标注完成的最优待标注 标签对添加到样本标签对训练集W获取新的样本标签对训练集,并采用样本标签对训练集 训练分类器。与现有技术相比,本发明提供的多标签主动学习分类方法及系统,通过综合交 叉标签不确定性和待标注样本标签对的不确定性确定待标注样本标签对的最终不确定性, 进而依据待标注样本标签对的最终不确定性和似然度获取最优的待标注样本标签对,并对 最优待标注样本标签对进行标注;最后将标注完成的最优待标注标签对添加到样本标签对 训练集W获取新的样本标签对训练集,并采用样本标签对训练集训练分类器,进而有效的 提高了分类的准确率。
【附图说明】
[0045] 为了更清楚地说明本发明实施例或现有技术中的技术方案,下面将对实施例或现 有技术描述中所需要使用的附图作简单地介绍,显而易见地,下面描述中的附图仅仅是本 发明的实施例,对于本领域普通技术人员来讲,在不付出创造性劳动的前提下,还可W根据 提供的附图获得其他的附图。
[0046] 图1为本发明实施例提供一种多标签主动学习分类方法的流程图;
[0047] 图2为本发明实施例提供另一种多标签主动学习分类方法的流程图
[0048] 图3为本发明实施例提供的一种样本标签树的示意图;
[0049] 图4为本发明实施例提供一种多标签主动学习分类系统的结构示意图;
[0化0] 图5为本发明实施例提供另一种多标签主动学习分类系统的结构示意图 。
【具体实施方式】
[0051] 下面将结合本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完 整地描述,显然,所描述的实施例仅仅是本发明一部分实施例,而不是全部的实施例。基于 本发明中的实施例,本领域普通技术人员在没有做出创造性劳动前提下所获得的所有其他 实施例,都属于本发明保护的范围。
[0052] 由于多标签分类问题的复杂性,在构建分类器模型时需要耗费大量的时间和精力 来说收集带标签的样本。但是在真实世界中,获取标注样本标签是非常少的,而且像在多标 签学习框架下,每个对象都对应着多个类别,该就更增加了获取标注样本的难度。面对存在 大量未标注样本的机器学习问题,主动学习是一种有效的解决方法。
[0053] 基于主动学习的多标签分类方法是基于启发式学习策略的。首先,从海量的未标 注样本集中挑选出少量的高价值的样本标签进行标注,然后利用标注的高价值样本标签得 到较高性能的分类器模型。
[0化4] 多标签主动学习分类方法目前主要分为两类:一类是基于样本的方法,一类是基 于样本-标签对的方法。对一个给定的样本,由于内在的标签关系,不同的标签对提高分类 器性能是不一样的。在多标签学习问题中,学习者不仅需要选择样本而且还要挑选样本标 签进行标注。所W为了获得更有效的主动学习算法,需要将采样粒度提升到样本-标签对 的级别。发现有价值的样本标签关系是很有意义的工作,挖掘有价值的样本标签关系能够 提升算法的性能,有效地降低样本标注的工作量。因此,选择合适的方法来度量样本标签 间的关系是至关重要的。而且,发现样本标签关系的过程必须有效,因为当样本标签数增加 时,样本标签关系的捜索工作量将会呈指数级增长。
[0化5] 基于主动学习的多标签分类方法,本发明实施例提供了一种基于概念层次树标签 关系推导的多标签主动学习分类方法,首先,构造一棵概念层次树用来对标签关系进行建 模。然后为样本-标签对信息含量的度量设计了一个采样标准,采样标准的设计思路是最 大化已标注数据的似然性W及最小化未标注数据的不确定性,并在原先不确定性考虑的基 础上引入交叉标签不确定性用W表征样本-标签对的标签关系强弱,并根据交叉标签不确 定性的重要程度,定义了相应权重因子进行调节的采样标准。再根据采样标准挑选最优的 样本-标签对进行人工标注,最后将标注的样本加入训练集,训练分类器。
[0化6] 请参考图1,其示出了本发明实施例提供的一种多标签主动学习分类方法的流程 图,可W包括W下步骤:
[0057] 步骤S101 ;分别采用对数似然获取已标注样本标签对的似然度及采用滴的方式 获取待标注样本标签对的不确定性。
[0化引主动学习在迭代过程中每次选择最有信息含量的未标注样本标签进行人工标注, 因此,在每次挑选完样本标签后,更新后的分类器应该能够最大化已标注样本标签的似然 度W及最小化未标注样本标签的不确定性,便可W用更少的标注代价获得更精准的分类 器。
[0化9] 具体的,现有的基于多标签主动学习分类方法中可W定义如下的得分函数来衡量 被选样本标签的信息含量:
[0060]
[006U其中,Xi是样本,yi是标签,uc是不确定性度量准则,X,是待选样本。wt是新的样 本标签对训练集上获得的参数向量。
[0062]基于上述的得分函数,在已标注样本标签上用对数似然,在未标注样本标签上用 滴的方式定义了得分函数。因此,上述的得分函数很容易在多标签分类问题中衡量样本标 签对的信息含量:
[0065]其中,A(乃Ix,,、如表示样本标签对(Xj,yi)的滴,与化康示样本Xj具有类 别标签yi的概率,&(乃U,壤示样本X;具有类别标签yk的概率。
[0066] 然而W上式子的扩展,仅仅考虑了单个待标注样本标签对不确定性,并未考虑到 交叉标签不确定性。故本发明在上述考虑单个待标注样本标签不确定性的基础上,又考虑 了交叉标签不确定性对建立分类器的影响。
[0067] 步骤S102 ;分别计算多个相同样本的不同标签间的KL距离及多个不同标签间的 权重因子。
[0068]由于训练集中包括多个样本,同时每个样本具有多种标签,故在计算化距离是对 同一样本的不同标签而言的。
[0069] 其中,交叉标签不确定性为实际观察到的标签关系与分类器预测得到的标签关系 的信息的不一致。例如,当一个图片中同时存在大海和沙滩时,观察到图片的大海和沙滩两 个标签是高度相关的,故当该两个标签的预测概率相冲突时,该两个标签之间的不确定性 就产生了。
[0070] 为了衡量交叉标签的不确定性,我们采用KuUback-Leibler距离。而对于每个标 签,一定存在与之相关度较高的那些标签。对于该部分标签,我们应该着重考虑它们的影 响。因此,考虑利用权重因子来度量标签相关度的高低。
[007U步骤S103 ;将每个化距离和与之相应的权重因子进行乘法运算,获取相应的结 果,将多个结果进行相加,获取与待标注样本标签对相关的待标注样本标签对的化距离 和,采用化距离和确定交叉标签不确定性。
[0072]在本发明实施例中采用KuUback-Leibler距离来衡量交叉标签不确定性。对一 个待标注样本标签对来说,除了训练得到的分类器模型,观察到的标签关系也可W对该待 标注样本标签对的预测工作提供帮助。对于上述图片中既包含大海又包含沙滩的实例而 言,由于大海和沙滩两个标签高度相关,故预测对大海标签的预测也可W作为对沙滩标签 的预测。其中,大海标签和沙滩标签的不一致性可W用化距离来衡量,即可W按照下式获 取标签大海与标签沙滩的不一致性:
[007引其中,今V,0,JX)为样本X具有标签ysaw的概率,成句为样本X具有标签ysea的概率Dki^是KuUback-Leibler距离。
[0076] 因此,对于某个待标注样本标签对的交叉标签不确定性可W用该标签与其他所有 相关标签的化距罔和来衡量。
[0077] 需要说明的是,虽然某个待标注样本标签对的交叉标签不确定可W用该标签与其 他所有相关标签的化距离和来衡量。然而待标注样本标签对的相关标签的发现过程是一 个比较困难的过程。虽然可W通过一些现有的数据挖掘方法实现,但该需要一定的前提条 件,如一些阔值的设定,但阔值设定的方法的精度无法得到保障。
[007引针对上述情况,本发明实施例提供可W种通过调整权重来平衡标签间的相关程 度。在实际计算中,给每组标签间的化距离加上一个权重因子,其中该权重因子是用来衡 量相关标签间的关系程度的。
[0079] 步骤S104 ;确定待标注样本标签对的最终不确定性。
[0080] 待标注样本标签对的最终不确定性为依据交叉标签不确定性和待标注样本标签 对的不确定性确定的。
[0081] 步骤S105 ;依据似然度和待标注样本标签对的最终不确定性获取得分函数,并依 据得分函数确定最优待标注样本标签对,并对最优待标注样本标签对进行标注。
[0082] 利用上述的似然度/待标注样本标签对的最终不确定性便可W按照下式获取得 分函数:
[0083]
[0084] 其中,是权重因子。
[0085] 同时可W根据得分函数确定最优待标注样本标签对,进而通过对最优待标注样本 标签对进行人工标注。
[0086] 其中,最优待标注样本标签对可W按照下述公式获取:
[0087]
[00蝴其中,S巧/最优样本集,Y%最优标签集,f做为得分函数。
[0089] 需要说明的是,在本发明实施例中所公开的标注方式与现有技术中的标注方式可 W相同,在此不再进行详细的阐述。
[0090] 可W理解的是,最优待标注样本标签对通过得分函数可W确定信息含量高的待标 注样本标签。
[OOW] 步骤S106 ;将标注完成的最优待标注标签对添加到样本标签对训练集w获取新 的样本标签对训练集,并采用新的样本标签对训练集训练分类器。
[0092] 其中,本发明实施例中将标注完成后的最优待标注样本标签对添加到样本标签对 训练集中W得到新的样本标签对训练集,并利用该样本标签集训练分类器,由于本发明实 施例在获取得分函数的过程中综合考虑了已标注样本标签对的似然度、待标注样本标签对 的不确定性W及交叉标签不确定性,因此,采用得分函数获取的最优待标注样本标签对的 信息含量较高,故提高了待标注样本标签对标注的效率,同时利用标注后的最优样本标签 对训练得到的分类器的分类准确率度也明显提高,
[0093]本发明实施例提供了一种多标签主动学习分类方法,首先,分别采用对数似然获 取已标注样本标签对的似然度及采用滴的方式获取待标注样本标签对的不确定性;其次, 通过化距离和权重因子的关系获取化距离和W确定交叉标签不确定性;再者,根据交叉标 签不确定性和待标注样本标签对的不确定性确定待标注样本标签对的最终不确定性,最后 依据似然度和待标注样本标签对的最终不确 定性确定得分函数,并依据得分函数确定最优 待标注样本标签对,并对最优待标注样本标签对进行标注;最后将标注完成的最优待标注 标签对添加到样本标签对训练集W获取新的样本标签对训练集,并采用样本标签对训练集 训练分类器。与现有技术相比,本发明实施例提供的多标签主动学习分类方法,通过综合交 叉标签不确定性和待标注样本标签对的不确定性确定待标注样本标签对的最终不确定性, 进而依据待标注样本标签对的最终不确定性和似然度获取最优的待标注样本标签对,并对 最优待标注样本标签对进行标注;最后将标注完成的最优待标注标签对添加到样本标签对 训练集W获取新的样本标签对训练集,并采用样本标签对训练集训练分类器,进而有效的 提高了分类的准确率。
[0094] 请参考图2,其示出了本发明实施例提供的另一种多标签主动学习分类方法的流 程图,在图1的基础上,还可W包括步骤:
[0095] 步骤S100 ;构建样本标签树。其中,样本标签树是依据样本标签对训练集训练获 取的。
[0096] 标签关系的发掘有助于学习器性能的提升,提高分类准确率。因此,如何挖掘标签 间的依赖关系是研究的重点。为了更好地发现标签的内在联系,我们建立一棵标签树,显示 地反映标签间的相互关系。标签树是标签的树形表示,能够清晰地反映标签间的相互关系, 便于标签依赖关系的发现。下面主要介绍标签树的构建过程。
[0097] 树是一种递归的数据结构,因此标签树的构建遵循分而治之的思想。构造标签 树具体来说是将标签数目大的集合转换成若干个规模较小的标签集合的过程。前者对应 树的父结点,而划分出的标签子集合则为该父结点对应的子树。该里假设所有的标签集为 L。树中的每个结点n包含L的子集L。。定义该棵树总共有|L|个叶子结点,每个叶结点 对应一个单独的标签{y,.}。树中每一个内部结点是它所有孩子结点标签集的联合,L"= UL。,CGchil化en(n)。特别地,根结点包含所有标签,L。
[009引定义y。为结点n的meta-1油el,其表示结点n包含的所有标签的集合,其中;
[0099] yn=Vyj, YjGLn
[0100]Meta-1油el还有W下的语义;一个样本可W被标注y。标签的条件是它至少含有 L。中的一个标签。图3展示了一棵带有8个标签的层次样本标签树。下面说明训练层次 样本标签树的具体过程。假设已存在先验知识,即可W利用已有的训练集D= {(Xi,Yi)|i=1...D}来训练得到标签树。在该方法中标签树的构造主要依赖于数据集的标签部分 KeL。我们从上到下递归地构建标签树。从树根开始进行深度优先遍历。当经过某个结 点n时,首先构建该结点的k个孩子结点(除非山。| <k,在该种情况下孩子结点数量是 山。|)。每个孩子结点分割其父亲结点下包含的数据,该些数据满足下面条件:
[0101] D"= {(x"Y,)I(x"Y,)GD"("),Y,n 4)}
[0102] 根结点用整个训练集,D。因此下面最主要的工作是将当前结点对应的标 签集分割成k个不相关的子集合。该个过程会重复进行直到每个孩子结点都只含有单个标 签。
[0103] 下面我们讨论如何将结点L。分成k个子集的问题。首先应该将父结点标签集尽量 均匀分成k个子集,该样使得属于相同子集的标签尽可能相似。该样的问题可W看作是带 有额外限制的聚类问题(聚簇的大小尽可能相同)。针对带限制的聚类问题,现有的方法已 经可W很好地解决。该里引用已有的balancedkmeans聚类算法。Balancedkmeans算 法扩展了传统的kmeans算法,在其基础上增加了聚簇大小的限制。
[0104] 需要说明的是,在本发明实施例中,步骤102中计算多个待标注样本标签对的相 关标签的权重因子中权重因子的计算过程是基于步骤101中建立的样本标签树的。其具体 过程为:
[01化](1)定义标签距离矩阵;标签距离矩阵为通过样本标签树获取的;
[0106] (2)定义共现矩阵;共现矩阵为通过样本标签对训练集中的样本标签对构建的;
[0107] (3)依据标签距离矩阵和共现矩阵构建代价标签矩阵,并采用代价标签矩阵获取 每个待标注样本标签对的权重因子。
[0108] 具体的,依据标签距离矩阵和共现矩阵构建代价标签矩阵,并采用代价标签矩阵 获取每个待标注样本标签的权重因子可W通过W下方式实现:
[0109] 首先,计算共现矩阵中任意两个位置处待标注样本标签对的内积和,获取任意两 个位置处待标注样本标签对出现的频率,并依据频率构建共现频率矩阵;其次,结合标签距 离矩阵和共现频率矩阵按照下式获取每个待标注样本标签对的权重因子:
[0110] 5。日=C。日?Sap
[0111] 其中,a与0分别表示任意两个待标注样本标签对;是标签a和标签P之 间的距离;Sa,p是标签a和标签P共同出现的频率。
[0112] 该里采用上述构造的标签树来处理该个问题。标签树是用来显示描述标签关系的 数据结构。在该棵树中,与树中某个结点不相关的标签不会出现在W该结点为根的子树中。 由于树的特殊结构,在处理过程中,不相关的分支会被舍弃,因此标签树适合处理数据集和 标签集都比较大的情况。下面说明我们如何通过标签树来获得标签的关系矩阵。
[0113] 在获得该棵标签树T= (V,巧之后,定义任意两个标签间的关系程度。首先定义 标签距离矩阵CGRmxm,其中可W按照下式获取〇。,0,需要说明的是,C",p是标签a和标 签0之间的距离。
[0114]
[0115] 该个距离矩阵可W通过标签树获得。其中,定义的两个待标注样本标签对间的距 离是样本标签树中两个结点的最短路径。对于训练集合中的示例,可W获得标签与样本所 构成的一个共现矩阵M,具体如下表所示。
[0116] 表1共现矩阵M
[0117]
[0118] 在表1中,Xi(l《i《n)用来表示样本标签对训练集中的第i个示例,设 mj(1《j《q)表示矩阵M第j行的所有数据,则通过下式来计算矩阵M的第U行(用向量 m。表示)和第V行(用向量mV表示)的内积和。
[0121] 通过上式来对计算结果进行归一化的处理,得到向量m。和向量my共同出现的频率 ,,即标签y。和yV的共现频率大小。
[0122] 定义标签的代价矩阵SCGRmxm,用c",pS",p来估计标签a和标签P间的相关 性大小。通过该个标签代价矩阵,经过简单的计算很容易按照下式得到所有的权重因子 5a日。
[0123] 5。日=Ca日?S。P
[0124] 其中,其中,a与P分别表示任意两个待标注样本标签;C。^是标签a和标签 0之间的距离;S",p是标签a和标签P共同出现的频率。
[01巧]与上述方法的实施例相对应,本发明实施例还提供了一种多标签主动学习分类系 统,请参考图4,其示出了本发明实施例提供的一种多标签主动学习分类系统的结构示意 图,可W包括;第一获取模块11、计算模块12、第二获取模块13、第一确定模块14、第二确定 模块15和训练模块16,其中:
[0126] 第一获取模块11,用于分别采用对数似然获取已标注样本标签对的似然度及采用 滴的方式获取待标注样本标签对的不确定性;
[0127] 计算模块12,用于分别计算多个相同样本的不同标签间的化距离及多个不同标 签间的权重因子;
[0128] 优选的,计算模块12还可W包括;第一定义单元、第二定义单元和构建单元,其 中:
[0129] 第一定义单元,用于定义标签距离矩阵;标签距离矩阵为通过样本标签树获取 的;
[0130] 第二定义单元,用于定义共现矩阵;共现矩阵为通过样本标签对训练集中的样本 标签构建的;
[0131] 构建单元,用于依据标签距离矩阵和共现矩阵构建代价标签矩阵,并采用代价标 签矩阵获取每个待标注样本标签对的权重因子。
[0132] 优选的,构建单元还可W进一步包括;计算单元和获取单元,其中:
[0133] 计算单元,用于计算共现矩阵中任意两个位置处待标注样本标签对的内积和,获 取2任意两个位置处待标注样本标签对出现的频率,并依据频率构建共现频率矩阵;
[0134] 获取单元,用于结合标签距离矩阵和共现频率矩阵按照下式获取每个待标注样本 标签的权重因子:
[013 引 5。日=0。日.5。0
[0136] 其中,a与P分别表示任意两个待标注样本标签;C",p是标签a和标签P之间 的距离;是标签a和标签P共同出现的频率。
[0137] 第二获取模块13,用于将每个化距离和与之相应的权重因子进行乘法运算,获取 相应的结果,将多个结果进行相加,获取与待标注样本标签对相关的待标注样本标签对的 化距离和,采用化距离和确定交叉标签不确定性;
[0138] 第一确定模块14,用于确定待标注样本标签对的最终不确定 性;待标注样本标签 对的最终不确定性为依据交叉标签不确定性和待标注样本标签对的不确定性确定的;
[0139] 第二确定模块15,用于依据似然度和待标注样本标签对的最终不确定性获取得 分函数,并依据得分函数确定最优待标注样本标签对,并对最优待标注样本标签对进行标 注;
[0140] 训练模块16,用于将标注完成的最优待标注标签对添加到样本标签对训练集W获 取新的样本标签对训练集,并采用新的样本标签对训练集训练分类器。
[0141] 本发明实施例提供了一种多标签主动学习分类系统,首先,分别采用对数似然获 取已标注样本标签对的似然度及采用滴的方式获取待标注样本标签对的不确定性;其次, 通过化距离和权重因子的关系获取化距离和W确定交叉标签不确定性;再者,根据交叉标 签不确定性和待标注样本标签对的不确定性确定待标注样本标签对的最终不确定性,最后 依据似然度和待标注样本标签对的最终不确定性确定得分函数,并依据得分函数确定最优 待标注样本标签对,并对最优待标注样本标签对进行标注;最后将标注完成的最优待标注 标签对添加到样本标签对训练集W获取新的样本标签对训练集,并采用样本标签对训练集 训练分类器。与现有技术相比,本发明实施例提供的多标签主动学习分类系统,通过综合交 叉标签不确定性和待标注样本标签对的不确定性确定待标注样本标签对的最终不确定性, 进而依据待标注样本标签对的最终不确定性和似然度获取最优的待标注样本标签对,并对 最优待标注样本标签对进行标注;最后将标注完成的最优待标注标签对添加到样本标签对 训练集W获取新的样本标签对训练集,并采用样本标签对训练集训练分类器,进而有效的 提高了分类的准确率。
[0142] 请参考图5,其示出了本发明实施例提供的另一种多标签主动学习分类系统的结 构示意图,在图4的基础上,该系统还可W包括;构建模块10,其中:
[0143] 构建模块10,用于构建样本标签树。其中,样本标签树是依据样本标签对训练集训 练获取的。
[0144] 最后,还需要说明的是,在本文中,诸如第一和第二等之类的关系术语仅仅用来将 一个实体或者操作与另一个实体或操作区分开来,而不一定要求或者暗示该些实体或操作 之间存在任何该种实际的关系或者顺序。而且,术语"包括"、"包含"或者其任何其他变体 意在涵盖非排他性的包含,从而使得包括一系列要素的过程、方法、物品或者设备不仅包括 那些要素,而且还包括没有明确列出的其他要素,或者是还包括为该种过程、方法、物品或 者设备所固有的要素。在没有更多限制的情况下,由语句"包括一个……"限定的要素,并 不排除在包括所述要素的过程、方法、物品或者设备中还存在另外的相同要素。
[0145] 对所公开的实施例的上述说明,使本领域技术人员能够实现或使用本发明。对该 些实施例的多种修改对本领域技术人员来说将是显而易见的,本文中所定义的一般原理可 W在不脱离本发明的精神或范围的情况下,在其它实施例中实现。因此,本发明将不会被限 制于本文所示的该些实施例,而是要符合与本文所公开的原理和新颖特点相一致的最宽的 范围。
【主权项】
1. 一种多标签主动学习分类方法,其特征在于,包括: 分别采用对数似然获取已标注样本标签对的似然度及采用熵的方式获取待标注样本 标签对的不确定性; 分别计算多个相同样本的不同标签间的KL距离及多个所述不同标签间的权重因子; 将每个所述KL距离和与之相应的所述权重因子进行乘法运算,获取相应的结果,将多 个所述结果进行相加,获取与待标注样本标签对相关的待标注样本标签对的KL距离和,采 用所述KL距离和确定交叉标签不确定性; 确定待标注样本标签对的最终不确定性;所述待标注样本标签对的最终不确定性为依 据所述交叉标签不确定性和所述待标注样本标签对的不确定性确定的; 依据所述似然度和所述待标注样本标签对的最终不确定性获取得分函数,并依据所述 得分函数确定最优待标注样本标签对,并对所述最优待标注样本标签对进行标注; 将标注完成的所述最优待标注标签对添加到样本标签对训练集以获取新的所述样本 标签对训练集,并采用新的所述样本标签对训练集训练分类器。2. 根据权利要求1所述的多标签主动学习分类方法,其特征在于,所述分别采用对数 似然获取已标注样本标签对的似然度及采用熵的方式获取待标注样本标签对的不确定性 前所述方法还包括: 构建样本标签树,所述样本标签树是依据所述样本标签对训练集训练获取的。3. 根据权利要求2所述的多标签主动学习分类方法,其特征在于,所述计算多个所述 不同标签间的权重因子包括: 定义标签距离矩阵;所述标签距离矩阵为通过所述样本标签树获取的; 定义共现矩阵;所述共现矩阵为通过所述样本标签对训练集中的所述样本标签对构建 的; 依据所述标签距离矩阵和所述共现矩阵构建代价标签矩阵,并采用所述代价标签矩阵 获取每个所述待标注样本标签对的权重因子。4. 根据权利要求3所述的多标签主动学习分类方法,其特征在于,所述依据所述标签 距离矩阵和所述共现矩阵构建代价标签矩阵,并采用所述代价标签矩阵获取每个所述待标 注样本标签对的权重因子包括: 计算所述共现矩阵中任意两个位置处所述待标注样本标签对的内积和,获取所述任意 两个位置处所述待标注样本标签对出现的频率,并依据所述频率构建共现频率矩阵; 结合所述标签距离矩阵和所述共现频率矩阵按照下式获取每个所述待标注样本标签 的权重因子: - C a g * S a g 其中,a与0分别表示任意两个待标注样本标签是标签a和标签e之间的距 离;Sa,P是标签a和标签0共同出现的频率。5. -种多标签主动学习分类系统,其特征在于,包括: 第一获取模块,用于分别采用对数似然获取已标注样本标签对的似然度及采用熵的方 式获取待标注样本标签对的不确定性; 计算模块,用于分别计算多个相同样本的不同标签间的KL距离及多个所述不同标签 间的权重因子; 第二获取模块,用于将每个所述KL距离和与之相应的所述权重因子进行乘法运算,获 取相应的结果,将多个所述结果进行相加,获取与待标注样本标签对相关的待标注样本标 签对的KL距离和,采用所述KL距离和确定交叉标签不确定性; 第一确定模块,用于确定待标注样本标签对的最终不确定性;所述待标注样本标签对 的最终不确定性为依据所述交叉标签不确定性和所述待标注样本标签对的不确定性确定 的; 第二确定模块,用于依据所述似然度和所述待标注样本标签对的最终不确定性获取得 分函数,并依据所述得分函数确定最优待标注样本标签对,并对所述最优待标注样本标签 对进行标注; 训练模块,用于将标注完成的所述最优待标注标签对添加到样本标签对训练集以获取 新的所述样本标签对训练集,并采用新的所述样本标签对训练集训练分类器。6. 根据权利要求5所述的多标签主动学习分类系统,其特征在于,所述系统还包括: 构建模块,用于构建样本标签树,所述样本标签树是依据所述样本标签对训练集训练 获取的。7. 根据权利要求6所述的多标签主动学习分类方法,其特征在于,计算模块包括: 第一定义单元,用于定义标签距离矩阵;所述标签距离矩阵为通过所述样本标签树获 取的; 第二定义单元,用于定义共现矩阵;所述共现矩阵为通过所述样本标签对训练集中的 所述样本标签构建的; 构建单元,用于依据所述标签距离矩阵和所述共现矩阵构建代价标签矩阵,并采用所 述代价标签矩阵获取每个所述待标注样本标签对的权重因子。8. 根据权利要求7所述的多标签主动学习分类方法,其特征在于,所述构建单元包括: 计算单元,用于计算所述共现矩阵中任意两个位置处所述待标注样本标签对的内积 和,获取所述任意两个位置处所述待标注样本标签对出现的频率,并依据所述频率构建共 现频率矩阵; 获取单元,用于结合所述标签距离矩阵和所述共现频率矩阵按照下式获取每个所述待 标注样本标签的权重因子: - C a g * S a g 其中,a与0分别表示任意两个待标注样本标签是标签a和标签e之间的距 离;Sa,P是标签a和标签0共同出现的频率。
【专利摘要】本发明提供了一种多标签主动学习分类方法及系统,包括:分别采用对数似然获取已标注样本标签对的似然度及采用熵的方式获取待标注样本标签对的不确定性;分别计算多个相同样本的不同标签间的KL距离及多个不同标签间的权重因子;将每个KL距离和与之相应的权重因子进行乘法运算,获取相应的结果,将多个结果进行相加,获取与待标注样本标签对相关的待标注样本标签对的KL距离和,采用KL距离和确定交叉标签不确定性;确定待标注样本标签对的最终不确定性;进而依据似然度和待标注样本标签对的最终不确定新的样本标签对训练集,并采用新的样本标签对训练集训练分类器。
【IPC分类】G06K9/66, G06F17/30, G06K9/62
【公开号】CN104881689
【申请号】CN201510337187
【发明人】赵朋朋, 焦阳, 吴健, 崔志明
【申请人】苏州大学张家港工业技术研究院
【公开日】2015年9月2日
【申请日】2015年6月17日
转载请注明原文地址:https://www.famiwei.com/read-8138387.html

最新回复(0)