基于捷径深度神经网络的视频分类方法

xiaoxiao2020-10-23  18

基于捷径深度神经网络的视频分类方法
【技术领域】
[0001] 本发明设及计算机多媒体技术领域,特别设及一种基于捷径深度神经网络的视频 分类方法。
【背景技术】
[0002] 在近年多媒体技术飞速发展,W及国家文化大发展大繁荣的要求下,视频已经成 为主流的内容传播途径。同时,随着视频制作技术的普及,越来越多的普通大众参与到视频 的制作和上传工作上来,使得视频内容日渐多元化。
[0003] 该一现象在使得W视频为基础的媒体及平台大发展的同时,也给视频内容的管理 带来的更高的要求和挑战。如何给众多视频依据内容等特征进行正确的分类成为了一个非 常突出的问题。显然,由平台和媒体来分类是不现实的,庞大的视频数量使得对视频逐一审 查的代价过大;然而,让视频的上传者来进行分类也存在一定的问题,即其可能并不能准确 把握视频平台对各类别的定义,该使得分类过程变得困难。
[0004] 视频自动分类需要首先需要借助特征工程中方法将视频中的特征抽取出来,再将 特征和对应的视频类别标签输入到合适的分类器中训练,最后将训练好的分类器用来给新 的视频分类。视频的特征抽取方法主要有基于视频中文本的方法,基于音频的方法和基于 视觉图像的方法,该些方法可W单独使用,也可W同时使用。对于每一个视频来说,其特征 最终W-个向量的形式来表示,但不同视频其向量的维度可能不同,还需要使用主成分分 析法(PrincipalComponentAnalysis,PCA)对其进行特征降维和对齐。
[0005] 另外,在现今的各种视频网站或者媒体中,往往都存在对视频进行评论、评分等功 能,该些属于视频之外但又与视频存在强烈对应关系的数据可W称之为异构数据。异构数 据又往往能为视频分类提供大量的信息,例如在某视频基础上人为加工过的视频,单从视 频本身的特征来分析,很有可能将其和原视频归为同一类别,然而事实上并不一定如此。因 此应该将异构数据作为视频的重要特征予W考虑。W评论为例,可W使用潜在狄利克雷分 配(LatentDirichletAllocation,LDA)模型对其进行特征抽取。为了区分从视频中抽取 的特征和从异构数据中抽取的特征,之后将用"视频特征"和"异构特征"该两个词来加W 区别。
[0006] 在获得特征的前提下,可W使用深度神经网络值eepNeuralNetwork,DNN)作为 分类器,利用特征和其对应的类别标签进行训练,从而获得最终为视频分类的分类器。深度 信赖网络值eepBeliefNetwork,DBN)是近年来提出的较为成功的D順之一,广泛被应用 在物体识别,语音识别,信号识别,自然语言处理等多个机器学习领域。在传统做法中,可W 将异构特征看作是视频特征的简单扩充,即将表示视频特征的向量和表示异构特征的向量 简单连结成一个更大的特征向量作为DBN的输入。利用DBN给视频分类的过程包括W下步 骤:
[0007] (1)将视频转化为RGB值向量。
[000引 (2)使用PCA方法将RGB值向量转化为视频特征。
[0009] (3)使用LDA方法将视频对应的评论转化为异构特征。
[0010] (4)将视频特征、异构特征W及视频的类别标签输入DBN中进行训练。
[0011] (5)对于未分类的视频,同样经(1) (2) (3)步处理后得到表示其特征的向量,并将 其输入到训练好的DBN中,最后输出视频的类别标签。
[0012] 具体示例如图1所示,各种特征的构建相当于对数据的预处理,因此在图中省略。 虽然使用DBN对视频进行分类的方法达到了一定的效果,然而该种做法会使得网络中存在 大量冗余的计算过程,降低训练的效率,且导致分类精度下降。更具体地来说,深度神经网 络中隐藏层可W看作是对原始数据(特征)的不同层次的抽象,越高层越抽象。同时异构数 据,例如文本,本身也存在着对原始数据不同层次的抽象,其中不同只在于异构数据的抽象 层次并不是显式的,而深度神经网络的层次相当于显式表示了数据的抽象程度。而传统的 深度神经网络用于视频分类的方法将视频特征和异构特征看作具有相同抽象程度的数据, 即将高抽象程度的数据当作低抽象程度的数据来进行处理,该种做法将会导致两个可能的 结果;(1)低层神经网络对异构数据不做任何处理,直接将其当作高抽象程度数据传递到 高层,该其实就是计算过程的冗余。(2)低层神经网络由于无法处理异构数据,因为其有更 高抽象程度,而影响神经网络的分类效果。

【发明内容】

[0013] 本发明的目的旨在至少解决上述的技术缺陷之一。
[0014] 为此,本发明的目的在于提出一种基于捷径深度神经网络的视频分类方法。该方 法具有分类过程简单,分类精度高的优点。
[0015] 为了实现上述目的,本发明的实施例公开了一种基于捷径深度神经网络的视频分 类方法,所述捷径深度神经网络包括;第一输入层、第二输入层、开关节点层、多个隐藏层和 一个输出层,所述第一输入层、所述多个隐藏层和所述输出层依次相连,所述第二输入层通 过所述开关节点层与所述多个隐藏层相连,所述第一输入层、第二输入层、开关节点层、多 个隐藏层和一个输出层分别设有预定的节点数,所述方法包括;训练分类器的步骤,包括: 获取训练数据的类别标签,并从所述训练数据中提取视频特征和异构特征,并设定开关节 点数值,W及将所述训练数据的类别标签、视频特征和异构特征输入所述捷径深度神经网 络,W训练得到用于对视频进行分类的分类器,所述视频的类别由所述类别标签表示;视 频分类的步骤,包括;获取测试数据,并从所述测试数据中提取视频特征和异构特征,并将 所述测试数据的视频特征和异构特征输入所述分类器,W得到所述测试数据对应的类别标 签;其中,所述视频特征由所述第一输入层输入,并依次通过所述多个隐藏层进行训练,所 述异构特征由所述第二输入层输入,并根据所述开关节点数值通过相应的隐藏层进行训 练。
[0016] 另外,根据本发明上述实施例的基于捷径深度神经网络的视频分类方法还可W具 有如下附加的技术特征:
[0017] 在一些示例中,根据PCA方法提取所述视频特征,根据LDA方法提取所述异构特 征。
[001引在一些示例中,在得到所述分类器之后,还包括;利用BP算法对所述分类器进行 优化。
[0019] 在一些示例中,所述训练分类器的步骤,具体包括:
[0020] S1 ;获取所述视频特征和异构特征,其中,所述视频特征和所述异构特征为1000 维的向量,所述视频特征和所述异构特征表示为;UG化ixiwn.aeIRixiwa;
[0021] S2 ;设定开关节点数值,其中,开关节点结构为矩阵ZG{0, 胃,如果隐藏层i 与异构特征连结,则另Zu= 1,否则另Zu= 0 ;
[002引 S3 ;随机初始化第一输入层与第一隐藏层之间的权值矩阵WG肪igddxsm、第一输 入层偏置向量6G収1X1DW、隐藏层偏置向量Ce肪1XSW、第二输入层与第一隐藏层之间的 权值矩W'G胺1000X日00,第二输入层偏置向量deIR1X1000;
[0023] S4 ;将所述V,a输入到所述捷径深度神经网络网络中,并计算所述多个隐藏层的 节点激活概率值;
[0024] S5 ;根据隐藏层的节点的激活概率值对其进行抽样得到h?,并根据抽取出的样本 计算重构输入层的概率值;
[002引 S6 ;根据所述重构输入层的概率值对其进行抽样得到vW,W,并根据所述yW, 重复S4和S5,得到h(";
[0026] S7 ;计算参数的梯度;
[0027]S8 ;每计算预定数量的梯度,对所述参数进行更新,直到所有训练数据处理完成;
[0028] S9 ;重复所述S4至所述S8预定次数;
[0029] S10;对于剩余的层次,将前一层网络的输出值作为所述第一输入层的输入,所述 第二输入层的输入不变,根据所述S3至S9进行训练;
[0030] S11 ;利用BP算法对所述捷径深度神经网络进行微调。
[0031] 在一些示例中,将所述V ,a输入到所述捷径深度神经网络网络中,并通过如下公 式计算所述多个隐藏层的节点激活概率值,所述公式为:
[0034] 在一些示例中,所述根据隐藏层的节点的激活概率值对其进行抽样得到h?,并根 据抽取出的样本利用如下公式计算重构输入层的概率值,所述公式为:
[003引 p(Vi= l|h做,a,口=。也+Wi.h做),
[0036] P(ai=l|v,h(。),幻=。狂"ri.h做+中)。
[0037] 在一些示例中,根据如下公式计算所述参数的梯度,所述公式为:
[0042]
[0043] 在一些示例中,所述每计算预定数量的梯度,通过如下公式对所述参数进行更新, 直到所有训练数据处理完成,所述公式为:
[0044]
[0045] 其中,0为更新前的参数,0 '为更新后的参数,A0i为参数的第i个梯度,G= 0.9为冲量,n= 0. 1为学习率。
[0046] 根据本发明实施例的基于捷径深度神经网络的视频分类方法,能够充分利用异构 数据中本来存在的对原始数据的抽象信息,直接将异构数据参与到高层次的运算当中,能 够提升方法的计算效率和分类精度。本方法采用开关节点对异构数据与隐藏层之间的关系 进行控制,该使得异构数据与隐藏层之间的连结情况能够根据训练数据及应用的实际情况 来做出调整。在设定好开关节点的值之后,SDBN的训练方法与传统DBN的训练方法相似, 只需要根据开关节点值的情况,在将异构特征的影响加入到对应网络中去,而不会在网络 中引入新的约束关系,也不需要额外的数学推导,该使得网络的训练变的非常方便。再次, 捷径深度神经网络并不限定异构数据的类型,W及存在与否,在最坏的情况下,即不存在异 构数据的情况下,捷径深度神经网络依然可W对视频进行分类。
[0047] 本发明附加的方面和优点将在下面的描述中部分给出,部分将从下面的描述中变 得明显,或通过本发明的实践了解到。
【附图说明】
[0048] 本发明上述的和/或附加的方面和优点从下面结合附图对实施例的描述中将变 得明显和容易理解,其中,
[0049] 图1为相关技术中通过深度信赖网络进行视频分类的方法的示意图;
[0050] 图2为本发明实施例的捷径深度神经网络SDBN的结构图;
[0051] 图3为本发明实施例的基于捷径深度神经网络的视频分类方法的流程图。
【具体实施方式】
[0052] 下面详细描述本发明的实施例,实施例的示例在附图中示出,其中自始至终相同 或类似的标号表示相同或类似的元件或具有相同或类似功能的元件。下面通过参考附图描 述的实施例是示例性的,仅用于解释本发明,而不能理解为对本发明的限制。
[005引在本发明的描述中,需要理解的是,术语"中屯、V纵向V横向V上V吓V前"、 "后"、"左"、"右"、"竖直"、"水平"、"顶"、"底"、"内"、"外"等指示的方位或位置关系为基于 附图所示的方位或位置关系,仅是为了便于描述本发明和简化描述,而不是指示或暗示所 指的装置或元件必须具有特定的方位、W特定的方位构造和操作,因此不能理解为对本发 明的限制。此外,术语"第一"、"第二"仅用于描述目的,而不能理解为指示或暗示相对重要 性。
[0054] 在本发明的描述中,需要说明的是,除非另有明确的规定和限定,术语"安装"、"相 连"、"连接"应做广义理解,例如,可W是固定连接,也可W是可拆卸连接,或一体地连接;可W是机械连接,也可W是电连接;可W是直接相连,也可W通过中间媒介间接相连,可W是 两个元件内部的连通。对于本领域的普通技术人员而言,可w具体情况理解上述术语在本 发明中的具体含义。
[0055] W下结合附图描述根据本发明实施例的基于捷径深度神经网络的视频分类方法。
[0056] 本发明的实施例的捷径深度神经网络(ShodcutDeepBeliefNetwork,SDBN) 可W在异构数据和高层隐藏层之间"跨层次连接",从而使得异构数据能够跳过部分低层神 经网络,直接参与高层计算,进而降低冗余度。SDBN与DBN的不同在于跨层次连接的有无, 且跨层次连接能够通过开关节点来进行控制。该样,能够有效地根据训练数据或者应用的 实际情况通过改变开关节点的数值来改变跨层次连接的连结情况,使得异构数据可能因为 环境的不同而导致其抽象程度不同的问题得到解决。例如,多音字或者多义词在不同的上 下文中所表达的意思,或者抽象程度,可能不同,需要根据实际情况将不同的隐藏层与其连 结。而开关节点的引入则可W很好地解决了该个问题。而在开关节点的值确定之后,网络 的训练方法和传统方法相似,又使得训练过程变的简便。
[0化7] 如图3所示,根据本发明一个实施例的基于捷径深度神经网络的视频分类方法, 捷径深度神经网络包括;第一输入层、第二输入层、开关节点层、多个隐藏层和一个输出层, 第一输入层、多个隐藏层和输出层依次相连,第二输入层通过开关节点层与多个隐藏层相 连,第一输入层、第二输入层、开关节点层、多个隐藏层和一个输出层分别设有预定的节点 数,该方法包括:
[005引 S101 ;训练分类器的步骤,包括;获取训练数据的类别标签,并从所述训练数据中 提取视频特征和异构特征,并设定开关节点数值,W及将所述训练数据的类别标签、视频特 征和异构特征输入所述捷径深度神经网络,W训练得到用于对视频进行分类的分类器,所 述视频的类别由所述类别标签表示;
[0059]S102 ;视频分类的步骤,包括;获取测试数据,并从所述测试数据中提取视频特征 和异构特征,并将所述测试数据的视频特征和异构特征输入所述分类器,W得到所述测试 数据对应的类别标签;
[0060] 其中,所述视频特征由所述第一输入层输入,并依次通过所述多个隐藏层进行训 练,所述异构特征由所述第二输入层输入,并根据所述开关节点数值通过相应的隐藏层进 行训练。
[0061] 如图2所示,在本发明的一个实施例中,采用6层节点4层网络及1层开关节点的 结构,即2层输入层(节点数均为1000,分别用于输出视频特征和异构特征),3层隐藏层 (节点数由低层到高层为500, 500, 2000),1层输出层(节点数为10,代表一共有10个类 另IJ),1层开关节点层(节点数1000),其中最高层为Softmax,是一种常用的多分类回归模 型,其余层均为受限玻尔兹曼机化estrictedBoltzmannMachine,RBM)。
[0062] 则本发明实施例的方法的具体步骤包括:
[0063] (1)将视频转化为RGB值向量。
[0064] (2)使用PCA方法将RGB值向量转化为视频特征。即根据PCA方法提取所述视频 特征。
[00化](3)使用LDA方法将视频对应的评论转化为异构特征。即根据LDA方法提取所述 异构特征。
[0066] (4)设定开关节点数值。
[0067] (5)将视频特征、异构特征W及视频的类别标签输入SDBN中进行训练。
[0068] 做对于未分类的视频,同样经(1)似做步处理后得到表示其特征的向量,并将 其输入到训练好的SDBN中,最后输出视频的类别标签。
[0069] 其中步骤巧),SDBN的训练方法又包括W下步骤:
[0070] (1)初始化参数。
[0071] (2)非监督逐层训练网络。
[0072] (3)使用反向传播炬ackPropagation,B巧算法全局训练网络。即利用BP算法对 所述分类器进行优化。
[007引利用SDBN为视频分类的方法具体包括W下步骤:
[0074] (1)每个视频经预处理后的视频特征和异构特征作为1000维的向量 U巨化1X1000,aG蚊1X1000。
[0075] (2)设定开关节点的数值。开关节点结构为矩阵ZG{0, 如果隐藏层i与 异构特征连结,则ZU二1,其余情况Zu= 0。
[0076] 做随机初始化输入层与隐藏层1间权值矩阵WGlRiwnxSM,输入层1偏 置向量阪1" 胃,隐藏层偏置向量CG胺1XSW,输入层2与隐藏层1之间的权值矩 W'e化1000X500,输入层2偏置向量de化1X1000。
[0077] (4)将V,a输入到SDBN网络中,根据公式1计算出各隐藏层节点激活概率值。
[0080] (5)根据隐藏层节点的激活概率值对其进行抽样得到h?,并用抽取出的样本根据 公式(2) (3)计算出重构输入层的概率值。
[00川 p(Vi=l|hw,a,幻=。也+Wi.hW)公式(2)
[00間 p(ai=l|v,h做,幻=。狂"ri.h做+中)公式(3)
[008引做根据重构输入层的概率值对其进行抽样得到vW,aW,再用vW,aW重复(4) (5)得到hW。
[0084] (7)根据W下公式计算各参数的梯度。
[0090] 做之后每计算100个(预设数量)梯度再利用公式(4)更新一次网络参数,直到 所有视频都处理完成。
[0091]
[0092]其中0为更新前的参数,0 '为更新后的参数,A0i为参数的第i个梯度,G=0.9为冲量,n= 0. 1为学习率。
[009引 (9)重复(4)~做步骤50遍(预定次数)。
[0094] (10)对于其他层次(除最高层W外)的网络,将前一层网络的输出值看作输入层 1的输入,输出层2的输入不变,训练方法同做~(9)步骤。
[00巧](11)利用BP算法对SDBN进行微调。至此网络训练完成。
[0096](。)测试过程则将预处理好的特征输入到训练好的SDBN中,最后输出为一个10 维向量,其中值最大的维度的序号对应其类别标签。
[0097]根据本发明实施例的基于捷径深度神经网络的视频分类方法,能够充分利用异构 数据中本来存在的对原始数据的抽象信息,直接将异构数据参与到高层次的运算当中,能 够提升方法的计算效率和分类精度。本方法采用开关节点对异构数据与隐藏层之间的关系 进行控制,该使得异构数据与隐藏层之间的连结情况能够根据训练数据及应用的实际情况 来做出调整。在设定好开关节点的值之后,SDBN的训练方法与传统DBN的训练方法相似, 只需要根据开关节点值的情况,在将异构特征的影响加入到对应网络中去,而不会在网络 中引入新的约束关系,也不需要额外的数学推导,该使得网络的训练变的非常方便。再次, 捷径深度神经网络并不限定异构数据的类型,W及存在与否,在最坏的情况下,即不存在异 构数据的情况下,捷径深度神经网络依然可W对视频进行分类。
[009引尽管上面已经示出和描述了本发明的实施例,可W理解的是,上述实施例是示例 性的,不能理解为对本发明的限制,本领域的普通技术人员在不脱离本发明的原理和宗旨 的情况下在本发明的范围内可W对上述实施例进行变化、修改、替换和变型。
【主权项】
1. 一种基于捷径深度神经网络的视频分类方法,其特征在于,所述捷径深度神经网络 包括:第一输入层、第二输入层、开关节点层、多个隐藏层和一个输出层,所述第一输入层、 所述多个隐藏层和所述输出层依次相连,所述第二输入层通过所述开关节点层与所述多个 隐藏层相连,所述第一输入层、第二输入层、开关节点层、多个隐藏层和一个输出层分别设 有预定的节点数,所述方法包括: 训练分类器的步骤,包括:获取训练数据的类别标签,并从所述训练数据中提取视频特 征和异构特征,并设定开关节点数值,以及将所述训练数据的类别标签、视频特征和异构特 征输入所述捷径深度神经网络,以训练得到用于对视频进行分类的分类器,所述视频的类 别由所述类别标签表示; 视频分类的步骤,包括:获取测试数据,并从所述测试数据中提取视频特征和异构特 征,并将所述测试数据的视频特征和异构特征输入所述分类器,以得到所述测试数据对应 的类别标签; 其中,所述视频特征由所述第一输入层输入,并依次通过所述多个隐藏层进行训练, 所述异构特征由所述第二输入层输入,并根据所述开关节点数值通过相应的隐藏层进行训 练。2. 根据权利要求1所述的基于捷径深度神经网络的视频分类方法,其特征在于,根据 PCA方法提取所述视频特征,根据LDA方法提取所述异构特征。3. 根据权利要求1所述的基于捷径深度神经网络的视频分类方法,其特征在于,在得 到所述分类器之后,还包括:利用BP算法对所述分类器进行优化。4. 根据权利要求1所述的基于捷径深度神经网络的视频分类方法,其特征在于,所述 训练分类器的步骤,具体包括: 51 :获取所述视频特征和异构特征,其中,所述视频特征和所述异构特征为1000维的 向量,所述视频特征和所述异构特征表示为:V e JRlxltiTa e IRixwm; 52 :设定开关节点数值,其中,开关节点结构为矩阵Z e {〇, 1}3X1°°°,如果隐藏层i与异 构特征a」连结,则另Z U= 1,否则另Z U= 0 ; 53 :随机初始化第一输入层与第一隐藏层之间的权值矩阵Mimqx5'第一输入层 偏置向量e 隐藏层偏置向量C e 第二输入层与第一隐藏层之间的权值 矩W e M1000x500,第二输入层偏置向量d e Mlx100 0; 54 :将所述V,a输入到所述捷径深度神经网络网络中,并计算所述多个隐藏层的节点 激活概率值; S5:根据隐藏层的节点的激活概率值对其进行抽样得到h(tl),并根据抽取出的样本计算 重构输入层的概率值; 56 :根据所述重构输入层的概率值对其进行抽样得到v(1),a(1),并根据所述v (1),a(1)重 复S4和S5,得到h(1); 57 :计算参数的梯度; 58 :每计算预定数量的梯度,对所述参数进行更新,直到所有训练数据处理完成; 59 :重复所述S4至所述S8预定次数; SlO :对于剩余的层次,将前一层网络的输出值作为所述第一输入层的输入,所述第二 输入层的输入不变,根据所述S3至S9进行训练; Sll :利用BP算法对所述捷径深度神经网络进行微调。5. 根据权利要求4所述的基于捷径深度神经网络的视频分类方法,其特征在于,将所 述v,a输入到所述捷径深度神经网络网络中,并通过如下公式计算所述多个隐藏层的节点 激活概率值,所述公式为:6. 根据权利要求4所述的基于捷径深度神经网络的视频分类方法,其特征在于,所述 根据隐藏层的节点的激活概率值对其进行抽样得到h (tl),并根据抽取出的样本利用如下公 式计算重构输入层的概率值,所述公式为: P(Vi=Ilhto^ajZ)= 〇 (bj+ffi .h(〇)), Ρ(&?=?|ν,1ι(0),Ζ) = 0?, i.h^+cQo7. 根据权利要求4所述的基于捷径深度神经网络的视频分类方法,其特征在于,根据 如下公式计算所述参数的梯度,所述公式为:8. 根据权利要求4所述的基于捷径深度神经网络的视频分类方法,其特征在于,所述 每计算预定数量的梯度,通过如下公式对所述参数进行更新,直到所有训练数据处理完成, 所述公式为:其中,Θ为更新前的参数,Θ '为更新后的参数,Δ Θ i为参数的第i个梯度,e = 〇. 9 为冲量,η = 〇. 1为学习率。
【专利摘要】本发明公开了一种基于捷径深度神经网络的视频分类方法,包括:训练分类器的步骤,包括:获取训练数据的类别标签,提取视频特征和异构特征,并设定开关节点数值,将训练数据的类别标签、视频特征和异构特征输入所述捷径深度神经网络,以训练得到用于对视频进行分类的分类器,视频的类别由所述类别标签表示;视频分类的步骤,包括:获取测试数据,提取视频特征和异构特征,并将测试数据的视频特征和异构特征输入分类器,以得到测试数据对应的类别标签;其中,视频特征由第一输入层输入,并依次通过多个隐藏层进行训练,异构特征由第二输入层输入,并根据开关节点数值通过相应的隐藏层进行训练。本发明具有分类简单、分类精确的优点。
【IPC分类】G06F17/30, G06K9/62
【公开号】CN104881685
【申请号】CN201510280574
【发明人】靳晓明, 万程
【申请人】清华大学
【公开日】2015年9月2日
【申请日】2015年5月27日
转载请注明原文地址:https://www.famiwei.com/read-8138391.html

最新回复(0)