一种基于随机投影和Fisher向量的人物行为识别方法
【技术领域】
[0001] 本发明设及信号处理技术领域,特别是一种基于随机投影和Fisher向量的人物 行为识别方法。
【背景技术】
[0002] 行为识别技术被广泛运用到视频监控、视频检索、军事检测、医疗诊断和监护等领 域,具有广阔的应用前景和经济价值。传统的行为识别方法是将提取到的轨迹特征嵌入到 视觉词袋炬ag-of-Words,BoW)模型中,通过提取视频中的局部轨迹特征来构建一个丰富 的视觉词典,并利用中屯、聚类的方式分别统计出局部特征向量相对于中屯、单词出现的频 率,通过视觉词频构成的直方图来表征一类视频最终达到人物行为识别的目的。BoW模型最 关键的就是要构造出一个非常庞大的视觉词典,因而行为识别的准确率在很大程度上取决 于所构造特征词典的规模的大小,局部轨迹特征描述子越丰富,人物行为识别就越准确,但 同时行为轨迹向量维度就越高,该样在一定程度上就增加了计算成本和时间的消耗,同时 给分类器的学习和训练的过程也带来了巨大的挑战,因此在保证原始高维轨迹信息的前提 下寻找有效的措施来降低该些轨迹特征向量的维度就势在必行。
[0003] 主成份分析法是在均方误差最小的意义下对原始信号实现线性降维。它用方差的 大小来衡量信息量的贡献的多少,即方差越大的分量其所含有用信息越多,于是擬弃那些 贡献小的分量上的信息,原始信号就映射到由前K个最大的主成分张成的线性子空间上, W达到降低数据的维度的目的。但是该方法无法处理非线性流形上的数据且计算过程相当 耗时,需占用大量的存储空间,严重影响分类器训练和分类的效率。
【发明内容】
[0004] 本发明所要解决的技术问题是克服现有技术的不足而提供一种基于随机投影和 Fisher向量的人物行为识别方法,本发明采用GMM-Fisher向量混合模型对轨迹特征向量 进行软划分,它融合了Fisher核生成模式和判别模式的特点,不仅能计算出每个特性描述 子出现的频率,还能从统计学的意义上描述该些特征描述子的概率分布情况,既丰富了行 为动作的特征表达又提高了行为识别的效率。
[0005] 本发明为解决上述技术问题采用W下技术方案:
[0006] 根据本发明提出的一种基于随机投影和Fisher向量的人物行为识别方法,包括 W下步骤:
[0007] 步骤(1)、在固定帖数前提下提取和跟踪视频中局部行为特征,在最小误差允许范 围内提取其特征轨迹,然后融合各类特征轨迹描述子信息,得到一个高维轨迹特征向量,组 成该类行为视频的特征轨迹矩阵空间;
[000引步骤(2)、将步骤(1)得到的矩阵空间采用随机投影的方法投影到低维子空间中, 然后采用高斯混合模型对投影降维后的轨迹特征信号的生成过程进行建模,求得轨迹特征 的Fisher向量;
[0009]步骤(3)、将步骤似得到的Fisher向量再次利用随机投影的方法将其二次投影 到一个低维子空间中,用SVM分类器通过添加类别标签的方式训练出用于区别各种行为的 一个超平面;
[0010]步骤(4)、根据步骤(3)训练好的分类器对待测试视频的轨迹特征的Fisher向量 进行行为分类预测,实现行为分类识别。
[0011] 作为本发明所述的一种基于随机投影和Fisher向量的人物行为识别方法进一步 优化方案,具体包括W下步骤:
[0012] 步骤一、遍历所有m个训练视频S= [Si,S2,. . .Sm],针对每个训练视频Si提取其特 征轨迹描述子,形成轨迹特征^ =h,…,.r.,,y,得到高维轨迹特征矩阵X=技1,. . .,Xm]; 其中,Ti为第I个行为视频中轨迹的数目,I为整数且1《I《m,上标T为转置,X。为训练 视频中提取到的特征轨迹描述子,a为整数且1《a《Ti;
[0013] 步骤二、将步骤一中的高维轨迹特征矩阵用随机投影的方法投影到一个低维子空 间中,即
[0014]
[0015] 其中,d表示轨迹特征经随机降维处理后的维度,D为原始轨迹维度,Rd表示降维 后的低维子空间,vt表示降维后的一个行为视频的轨迹特征,yw表示投影降维后所有行为 视频轨迹特征的集合;
[0016] 步骤是关于参数集入=EU的概率密度函数,用来对经随 机投影降维后的轨迹特征信号的生成过程进行建模,其中,Wi表示第i个高斯单元的混合 权重,Ui表示第i个高斯单元的均值向量,Ei表示第i个高斯单元的协方差矩阵,i= 1,. . .,K;设VtGRd都服从独立同分布,对含有K个高斯单元的GMM的参数集A的高斯混 合模型的定义如下:
[0017]
[001引其中
表示降维后的轨迹特征Vt的第i个高斯单 元的概率密度函数;协方差矩阵为对角矩阵,由贝叶斯公式可知,降维后的轨迹特征Vt分配 到第i个高斯单元的概率为:
[0019]
[0020] 步骤四、
是经随机投影后所有轨迹特征的集合V 关于A的对数似然函数,则经过降维后的轨迹特征Vt关于GMM参数集A= Ei} 的梯度分别表示为:
[0021]
[0024] 其中,uf表示含k个主成分的第i个高斯单元的均值向量,of表示含k个主成分 的第i个高斯单元的协方差向量;
[0025] 归一化梯度向量后级联各个梯度值,最后求出轨迹特征的Fisher向量;
[0026] 步骤五、将步骤四中得到的Fisher向量再次利用随机投影的方法将其二次投影 到一个低维子空间中,即
[0027]
[002引其中,d'表示Fisher向量经过随机投影二次降维后维度,Rd'表示二次降维后的 低维子空间,Vt'表示二次降维后的一个Fisher向量,yw表示二次降维后所有Fisher向 量的集合;
[0029] 步骤六、训练SVM分类器,将m个训练视频降维编码后的轨迹特征
分别贴上m个对应特征行为的标签,训练出能区分不同行为动 作的一个超平面;
[0030] 步骤心选取n个测试集Z= [Zi,Z2,...Z",l《J《n]中的一个新的行为视频Zj, 提取测试视频的轨迹特征v'2.其中,n表示测试集视频的个数,T,表示第J个 测试集行为视频Z,中轨迹的数目;
[0031] 步骤八、对Y,利用随机投影定理对其进行特征降维,将其投影到一个的低维子空 间沪中,即
[0032]
[0033] 其中,htt表示测试视频降维后的轨迹特征,dd表示降维后的维度,Rdd表示测试集 轨迹特征降维后的值域;
[0034] 步骤九、令
其中H是经随机投影后所有轨迹特 征的集合,根据步骤四中得到的关于GMM参数集A= Ei},计算测试集行为视频 的轨迹特征的相关的梯度向量,即
[0037]
[003引归一化梯度向量后级联各个梯度值,最后求出测试集行为视频轨迹特征的Fisher向量;
[0039] 步骤十、利用随机投影定理对测试集行为视频轨迹特征的Fisher向量进行二次 特征降维;
[0040] 步骤十一、根据步骤六训练好的分类器对经过二次特征降维后的测试集行为视频 轨迹特征的Fisher向量进行行为分类预测,完成行为测试集视频的识别。
[0041] 作为本发明所述的一种基于随机投影和Fisher向量的人物行为识别方法进一步 优化方案,所述步骤二中随机投影的方法,具体如下:
[0042] 对原始D维轨迹特征空间XtGR°,作用一个列单元长度的随机矩阵〇,将其投影 到一个低维子空间VtGRd中,其中d?D,其公式表达如下:
[0043]
[0044] 其中,表示轨迹特征的原始D维空间,vf表示轨迹特征被降为d维的低维子空 间;
[0045] 随机矩阵〇满足化引理,将XfG最小误差从VtGRd重构出来,即投影后的 低维子空间Vt包含了原始的轨迹特征X t中的近似全部信息。
[0046] 作为本发明所述的一种基于随机投影和Fisher向量的人物行为识别方法进一步 优化方案,所述随机矩阵为满足约束等距性质的随机矩阵。
[0047] 作为本发明所述的一种基于随机投影和Fisher向量的人物行为识别方法进一步 优化方案,所述d= 100,dd=d' = 48。
[0048] 作为本发明所述的一种基于随机投影和Fisher向量的人物行为识别方法进一步 优化方案,所述步骤六中的SVM分类器的核函数采用Linear线性核函数来实现一个多类输 出。
[0049] 本发明采用W上技术方案与现有技术相比,具有W下技术效果;本发明采用随机 投影定理的方法替代主成份分析法进行特征降维,W解决其时间消耗大,主成份保留不明 确等问题,随机投影定理表明,通过一个压缩测量矩阵,可W把具有稀疏性质的原始信号 投影到某个低维子空间上,该映射后的向量与原始高维特征向量间点距离基本保持不变, 即整个压缩过程不会产生数据的曲解。此外不同于BoW模型的硬划分,本发明采用GMM- Fisher向量混合模型对轨迹特征向量进行软划分,它融合了Fisher核生成模式和判别模 式的特点,不仅能计算出每个特性描述子出现的频率,还能从统计学的意义上描述该些特 征描述子的概率分布情况,既丰富了行为动作的特征表达又提高了行为识别的效率。
【附图说明】
[0050] 图1是本发明采用密集取样对视频集进行轨迹行为动作提取的可视化效果图,其 中;(a)是KTH数据集人物挥手行为动作的可视化效果图;化)是KTH数据集人物快跑行为 动作的可视化效果图;(C)是KTH数据集人物拳击行为动作的可视化效果图;(d)是UCF50 数据集人物打篮球行为动作的可视化效果图;(e)是UCF50数据集人物举重行为动作的可 视化效果图;(f)是UCF50数据集人物高尔夫球摆行为动作的可视化效果图。
[0051] 图2是本发明所述基于随机投影和Fisher向量的人物行为识别方法的流程图。
【具体实施方式】
[0化2] 下面结合附图对本发明的技术方案做进一步的详细说明:
[0化引本发明实验所用计算机的配置为内存8GB,CPU是IntelCorei3 3. 4GHz的台式 计算机,所用代码是在visuals化dio2013上用C++语言开发的。两种数据集设定W下相 同的缺省参数,在稠密轨迹跟踪算法中,取N= 32,n。= 2,nT= 3,轨迹跟踪长度L= 15 帖,取样步长W= 5像素,随机投影中降维后的特征轨迹维度d= 100,d' = 48,SVM分类器 的核函数采用Linear
线性核函数来实现一个多类输出。
[0化4]如图1所示,一种对视频集稠密取样进行轨迹行为动作提取的可视化效果图。本 发明通过提取稠密的轨迹来表征一类行为运动,利用光流场对兴趣点进行多层次稠密采样 来实现跟踪。该些兴趣点沿一个密集的网格被重复采样且被跟踪在一个固定长度帖的范围 内,行为轨迹就是该些固定帖数内的特征描述子连续性表达的结果。轨迹的形状用来区别 不同的人物行为变化,它表现在视频中就是人物目标在视频中的运动位置在时间和空间上 的改变,即位移矢量。考虑到人物行为在每个视频中出现的位置的不同,本发明通过对提取 到的所有位置信息进行求和运算,实现位置矢量的归一化。对于任意一条轨迹来说除了提 取其位置信息外,还要各个描述子信息来丰富它的表达。如方向直方图(HOG)用来描述人 物外在的静态信息,光流直方图化0巧用来描述轨迹的局部运动信息,而运动边界直方图 (MBH)用来描述像素之间的相对运动。因此最终的轨迹是位置信息、方向梯度、光流和运动 边界直方图信息的集合。图1中的(a)是KTH数据集人物挥手行为动作的可视化效果图; 图1中的化)是KTH数据集人物快跑行为动作的可视化效果图;图1中的(C)是KTH数据 集人物拳击行为动作的可视化效果图;图1中的(d)是UCF50数据集人物打篮球行为动作 的可视化效果图;图1中的(e)是UCF50数据集人物举重行为动作的可视化效果图;图1中 的(f)是UCF50数据集人物高尔夫球摆行为动作的可视化效果图。从图1中可W直观的看 到所提取到的有效轨迹能够形象的描述出视频人物行为的连续运动。
[0化5] 如图2所示,一种基于Fisher向量和投影定理的人物行为识别的流程图。本发明 针对一类行为视频,首先在固定帖数前提下提取和跟踪局部行为特征,再在最小误差允许 范围内提取有效轨迹,然后融合各类描述子信息形成一个高维轨迹特征向量,组成该类行 为视频的特征轨迹矩阵空间,最后嵌入到高斯混合-Fisher向量模型框架中,用一个SVM分 类器通过添加类别标签的方式训练出用于区别各种行为的一个超平面,通过该个超平面实 现最终的行为分类,期间我们采用随机投影的方式对高维特征进行二次投影降维来降低计 算复杂度。
[0化6] 如表一所示是本发明在KTH数据集下人物行为的识别率。KTH数据集包括6种人 物行为动作;散步、慢跑、快跑、拳击、挥手和拍手,每一个动作是在四个不同的场景中实现 的;户内,户外,户外尺寸改变,在户外搭配不同的服装。在大部分场景中背景单一且静态, 但背景噪声大。结果表明,本发明方法可W有效的识别出KTH数据集中不同的人物行为动 作。
[0化7]表一
[005引
[0化9] 如表二所示是UCF50数据集下人物行为的识别率。UCF50数据集有50个动作类, 包括打篮球、跳水、高尔夫摆臂、举重、单杠、骑马等体育项目W及从化uTube选取的现实生 活的视频片段。该数据集背景复杂,场景不一,视觉角度各异,相对于行为识别难度较大。结 果表明,本发明方法可W有效的识别出UCF500数据集中不同的人物行为动作。
[0060] 表二
[0061]
[0062] 如表=所示是随机投影和主成分分析法两种降维方法的计算时间的比较(单位:S)。结果表明随机投影的降维方法大大提高了行为识别算法的效率,运行时间相对于主成 分分析法提高了近200倍。
[006引表S[0064]
[00化]W上只是对本发明的优选实施方式进行了描述。对该技术领域的普通技术人员来 说,根据W上实施方式可W很容易地联想到其它的优点和变形。因此,本发明并不局限于上 述实施方式,其仅仅作为例子对本发明的一种形态进行详细、示范性的说明。在不背离本 发明宗旨的范围内,本领域普通技术人员在本发明技术的方案范围内进行的通常变化和替 换,都应包含在本发明的保护范围之内。
【主权项】
1. 一种基于随机投影和Fisher向量的人物行为识别方法,其特征在于,包括以下步 骤: 步骤(1)、在固定帧数前提下提取和跟踪视频中局部行为特征,在最小误差允许范围内 提取其特征轨迹,然后融合各类特征轨迹描述子信息,得到一个高维轨迹特征向量,组成该 类行为视频的特征轨迹矩阵空间; 步骤(2)、将步骤(1)得到的矩阵空间采用随机投影的方法投影到低维子空间中,然 后采用高斯混合模型对投影降维后的轨迹特征信号的生成过程进行建模,求得轨迹特征的 Fisher 向量; 步骤(3)、将步骤(2)得到的Fisher向量再次利用随机投影的方法将其二次投影到一 个低维子空间中,用SVM分类器通过添加类别标签的方式训练出用于区别各种行为的一个 超平面; 步骤(4)、根据步骤(3)训练好的分类器对待测试视频的轨迹特征的Fisher向量进行 行为分类预测,实现行为分类识别。2. 根据权利要求1所述的一种基于随机投影和Fisher向量的人物行为识别方法,其特 征在于,具体包括以下步骤: 步骤一、遍历所有m个训练视频S = [S1, S2,... SJ,针对每个训练视频S1提取其特征 轨迹描述子,形成轨迹特征A = ?,得到高维轨迹特征矩阵X = [X1, X2,. . .,Xm];其 中,T1为第I个行为视频中轨迹的数目,I为整数且1彡I彡m,上标T为转置,X 3为训练视 频中提取到的特征轨迹描述子,a为整数且1彡a彡T1; 步骤二、将步骤一中的高维轨迹特征矩阵用随机投影的方法投影到一个低维子空间 中,即其中,d表示轨迹特征经随机降维处理后的维度,D为原始轨迹维度,Rd表示降维后的 低维子空间,Vt表示降维后的一个行为视频的轨迹特征,V KP表示投影降维后所有行为视频 轨迹特征的集合; 步骤三、ρλ (Vt)是关于参数集λ = {Wi,Ui,Σ i}的概率密度函数,用来对经随机投影 降维后的轨迹特征信号的生成过程进行建模,其中,Wi表示第i个高斯单元的混合权重,u i 表示第i个高斯单元的均值向量,Σ i表示第i个高斯单元的协方差矩阵,i = 1,. . .,K ;设 vte Rd都服从独立同分布,对含有K个高斯单元的GMM的参数集λ的高斯混合模型的定 义如下:表示降维后的轨迹特征Vt的第i个高斯单元的 概率密度函数;协方差矩阵为对角矩阵,由贝叶斯公式可知,降维后的轨迹特征^分配到第 i个高斯单元的概率为:m Jm 步骤四、ι=ΣΓ/,则是经随机投影后所有轨迹特征的集合V关于 I=I /-1 λ的对数似然函数,则经过降维后的轨迹特征Vt关于GMM参数集λ = {w E i}的梯度 分别表不为:其中,^表示含k个主成分的第i个高斯单元的均值向量,of表示含k个主成分的第 i个高斯单元的协方差向量; 归一化梯度向量后级联各个梯度值,最后求出轨迹特征的Fisher向量; 步骤五、将步骤四中得到的Fisher向量再次利用随机投影的方法将其二次投影到一 个低维子空间中,即其中,d'表示Fisher向量经过随机投影二次降维后维度,Rd'表示二次降维后的低维 子空间,ν' t表示二次降维后的一个Fisher向量,Vkp表示二次降维后所有Fisher向量的 集合; 步骤六、训练SVM分类器,将m个训练视频降维编码后的轨迹特征 m Kw" =[vf e =1,···,Σ7;分别贴上m个对应特征行为的标签,训练出能区分不同行为动 / 二1 作的一个超平面; 步骤七、选取η个测试集Z = [Z1, Z2,... Zn, 1彡J彡η]中的一个新的行为视频Zt,提 取测试视频的轨迹特征^ = ]7 ;其中,η表示测试集视频的个数,Tt表示第J个测 试集行为视频&中轨迹的数目; 步骤八、对I利用随机投影定理对其进行特征降维,将其投影到一个的低维子空间Hkp 中,即其中,htt表示测试视频降维后的轨迹特征,dd表示降维后的维度,R dd表示测试集轨迹 特征降维后的值域; 步骤九、令,其中H是经随机投影后所有轨迹特征 的集合,根据步骤四中得到的关于GMM参数集λ = {Wi,Ui,Σ i},计算测试集行为视频的 轨迹特征的相关的梯度向量,即归一化梯度向量后级联各个梯度值,最后求出测试集行为视频轨迹特征的Fisher向 量; 步骤十、利用随机投影定理对测试集行为视频轨迹特征的Fisher向量进行二次特征 降维; 步骤十一、根据步骤六训练好的分类器对经过二次特征降维后的测试集行为视频轨迹 特征的Fisher向量进行行为分类预测,完成行为测试集视频的识别。3. 根据权利要求2所述的一种基于随机投影和Fisher向量的人物行为识别方法,其特 征在于,所述步骤二中随机投影的方法,具体如下: 对原始D维轨迹特征空间xte RD,作用一个列单元长度的随机矩阵Φ,将其投影到一 个低维子空间vte R,其中d〈〈D,其公式表达如下: vf = Φλ;;); 其中,xf表示轨迹特征的原始D维空间,vf表示轨迹特征被降为d维的低维子空间; 随机矩阵Φ满足几引理,将Xte Rd以最小误差从Vte 1^重构出来,即投影后的低维 子空间Vt包含了原始的轨迹特征X t中的近似全部信息。4. 根据权利要求3所述的一种基于随机投影和Fisher向量的人物行为识别方法,其特 征在于,所述随机矩阵为满足约束等距性质的随机矩阵。5. 根据权利要求2所述的一种基于随机投影和Fisher向量的人物行为识别方法,其特 征在于,所述 d = 100, dd = d' = 48。6. 根据权利要求2所述的一种基于随机投影和Fisher向量的人物行为识别方法,其 特征在于,所述步骤六中的SVM分类器的核函数采用Linear线性核函数来实现一个多类输 出。
【专利摘要】本发明公开了一种基于随机投影和Fisher向量的人物行为识别方法,采用随机投影定理的方法替代主成份分析法进行特征降维,以解决其时间消耗大,主成份保留不明确等问题,随机投影定理表明,通过一个压缩测量矩阵,可以把具有稀疏性质的原始信号投影到某个低维子空间上,该映射后的向量与原始高维特征向量间点距离基本保持不变,即整个压缩过程不会产生数据的曲解。此外不同于BoW模型的硬划分,本发明采用GMM—Fisher向量混合模型对轨迹特征向量进行软划分,它融合了Fisher核生成模式和判别模式的特点,不仅能计算出每个特性描述子出现的频率,还能从统计学的意义上描述这些特征描述子的概率分布情况,既丰富了行为动作的特征表达又提高了行为识别的效率。
【IPC分类】G06K9/00, G06K9/62
【公开号】CN104881651
【申请号】CN201510289260
【发明人】何军, 薛莹, 周媛, 胡昭华
【申请人】南京信息工程大学
【公开日】2015年9月2日
【申请日】2015年5月29日
转载请注明原文地址:https://www.famiwei.com/read-8138425.html