一种基于多特征时空关系融合的人类行为识别方法

xiaoxiao2020-10-23  13

一种基于多特征时空关系融合的人类行为识别方法
【技术领域】
[0001] 本发明设及计算机视觉领域,尤其是设及一种基于多特征时空关系融合的人类行 为识别方法。
【背景技术】
[0002] 随着计算机科学的发展,视频开始成为人们生活的一部分,如何让计算机"理解" 视频中的人类行为,对基于内容的视频检索、智能监控、人机交互和虚拟现实等领域都具有 重要作用。
[0003] -般而言,一个经典的人类行为识别框架主要包括=个步骤:特征抽取、视频编码 W及分类器的训练和识别,此外,对于采用多种特征的情况,还包括一个可选的多特征前期 融合或后期融合步骤,其中的视频编码是决定识别准确率的关键步骤。
[0004] 目前,被广泛使用和改进的编码方法之一是词袋(BagofWords,简称BoW)方法,经 典的BoW方法首先对特征进行聚类,接着把视频表示成特征出现在每一个质屯、中的频次直 方图向量,虽然BoW编码已经在很多文献中显示了很好的泛化能力和健壮性,但该方法也 有很多缺点;比如费时的特征聚类过程,KMEANS算法的有监督参数kW及质屯、之间时空关 系f目息的丢失。
[0005] 为了消除KMEANS算法的参数k依赖经验确定的问题,"LiuJ,ShahM.Learning humanactionsviainformationmaximization[C].ComputerVisionandPatternRecogniti on,2008.CVPR2008.IE邸Conferenceon.I邸E,2008:l-8."使用互信息最大化聚类算法无 监督的确定最合适的质屯、数量,该算法首先用一个较大的k进行KMEANS聚类,W减少由于 KMEANS聚类造成的信息丢失,之后通过互信息最大化聚类算法在尽可能少的丢失信息的前 提下减少质屯、数量,W此提高后续步骤的计算速度。
[0006] 为了解决时空关系信息丢失的问题,许多研究者们提出了基于BoW的扩展方法, 按照所保留信息的不同,该些方法被分为两类;保留绝对时空信息的BoW表示和保留相对 时空信息的BoW表示。前者通常需要对视频的时空体进行全局分割,该使得计算得到的视 频编码与特征的绝对时空坐标相关,缺乏平移不变性。"LaptevI,MarszalekM,SchmidC,e tal.Learningrealistichumanactionsfrommovies[C].ComputerVisionandPatternRecog nition, 2008.CVPR2008.IE邸Conferenceon.I邸E, 2008:1-8."把视频的时空体积分割成 预定义的时空网格,之后分别在每个网格中计算BoW并把所有网格的BoW向量串联起来作 为最终的视频编码。然而,为了确定最佳的网格组合,该方法需要用交叉验证进行贪屯、捜 索,而该个步骤是非常费时的,此外,通过串联不同网格的BoW得到的超长向量进一步增 方口了 计算复杂度。"SunJ,WuX,YanS,etal.Hierarchicalspatio-temporalcontextmodeli ngforactionrecognition[C].ComputerVisionandPatternRecognition, 2009.CVPR2009. I邸EConferenceon.IE邸,2009:2004-2011. "W-种层级的方式获取S层时空上下文信息。 而后者,即保留相对时空信息的方法,通常是利用BoW质屯、或特征之间的相对时空距离进 行视步巧编石马。"KovashkaA,GraumanK.Learningahierarchyofdiscriminativespace-timen eighborhoodfeaturesforhumanactionrecognition[C].ComputerVisionandPatternRecog nition(CVPR),20101 邸EConferenceon.IE邸,2010:2046-2053."首先用原特征点周围的点 构造新特征,之后结合新特征所属质屯、信息和新特征方向信息构造视频编码。由于需要构 造多层级的质屯、,该方法的计算复杂度相对较高。"WangJ,化enZ,WuY.Actionreco即itionw ithmultiscalespatio-temporalcontexts[C].ComputerVisionandPatternRecognition(C VPR), 20111邸EConferenceon.IE邸,2011:3185-3192."通过在原特征的多个时空尺度中获 取特征之间的时空上下文交互信息进行视频编码。。

【发明内容】

[0007] 本发明主要解决的技术问题是提供一种基于多特征时空关系融合的人类行为识 别方法,该方法对两种特征对应质屯、之间的时空关系信息进行显式编码,能够更好的挖掘 不同特征的有效信息进行人类行为识别。
[0008] 为解决上述技术问题,本发明采用的一个技术方案是;一种基于多特征时空关系 融合的人类行为识别方法,具体步骤包括: 步骤1 ;对视频进行密集轨迹特征抽取,并W光流直方图和运动边界直方图两种方法 对抽取的轨迹特征进行表示,得到两种特征表示; 步骤2 ;用KMEANS算法构建两种特征对应质屯、之间的时空二部图; 步骤3 ;采用K路二部图分割技术将步骤2中的时空二部图分割为具有强时空关系的 质屯、和具有弱时空关系的质屯、,将分割后具有强时空关系的质屯、融合起来,将具有弱时空 关系的质屯、分开; 步骤4;计算具有强时空关系的质屯、之间的时空距离矩阵,并采用基于条件概率的表 示方法对距离矩阵进行压缩,得到两种特征融合后的视频级编码; 步骤5 ;训练分类器并进行识别。
[0009] 在本发明一个较佳实施例中,所述步骤2中KMEANS算法将所述步骤1中得到的两 种特征进行聚类,从而得到若干个质屯、,通过计算每个视频中任意两个特征对应时空坐标 之间的L1距离来衡量两个特征之间的时空关系,利用两种特征之间的时空关系计算其质 屯、之间的时空关系,并得到两种特征对应质屯、之间的时空二部图。
[0010] 在本发明一个较佳实施例中,所述的步骤4中所述条件概率表示方法首先对质屯、 之间的距离向量进行离散化,然后W条件概率描述任意两个融合后质屯、之间的时空距离分 布信息。
[0011] 本发明的有益效果是;本发明一种基于多特征时空关系融合的人类行为识别方 法,该方法通过计算每个视频中特征之间的时空距离,从而构建两种特征对应质屯、之间的 时空二部图,并采用K路二部图分割技术对时空二部图进行分割,W此将具有强时空关系 的质屯、融合,更好的挖掘了不同特征的有效信息,提升了识别准确率。
【附图说明】
[0012] 图1为一种基于多特征时空关系融合的人类行为识别方法的流程图。
【具体实施方式】
[0013] 下面对本发明的较佳实施例进行详细阐述,W使本发明的优点和特征能更易于被 本领域技术人员理解,从而对本发明的保护范围做出更为清楚明确的界定。
[0014] 本发明实施例包括;一种基于多特征时空关系融合的人类行为识别方法,具体步 骤包括: 步骤1;对视频进行密集轨迹特征抽取,首先在一个密集型网格中进行特征点采样。为 了使得采集的特征点能适应尺度变换,将同时在多个不同空间尺度的网格中进行采样,然 后密集轨迹特征通过估计每一帖的光流场对每个采样点进行跟踪,并且每个采样点只在其 对应的空间尺度内跟踪L帖,最后分别对特征计算光流直方图和运动边界直方图作为两种 不同的特征; 步骤2;设所述步骤1中抽取的两种特征为feal和fea2,对该两种特征分别 进行KMEANS聚类得到的质屯、分别为

由得到的该两种特征的质屯、构造时空二部图 G(V,巧。
[001引其牛
,E为二部图的邻接矩阵,即;
其中,S为整个训练集中两种特征之间时空距离矩阵之和,即;
其中,01?,,.化)0时,,化0为两种特征对应质屯、在视频¥中的时空距离矩阵,通过计算每 个视频中任意两个特征对应时空坐标之间的L1距离来衡量两个特征之间的时空关系,L1 距离计算公式为:
步骤3 ;采用K路二部图分割技术将步骤2中的时空二部图分割为具有强时空关系的 质屯、和具有弱时空关系的质屯、给定一个二部图G(V,E),二部图的K路分割将顶点集合V分 割成k个子集扔担1化度1,目的是最小化平衡代价函数:
并使用奇异值分解求出L的1 =fbg;kll=flog^kl个次大奇异值对应的左奇异向量UP 和右奇异向量踩皆,其中设U= (1%…,U!)IJ= (U2,'..,Ui),¥=(咕...,Vi)¥=(咕...,耐,%I!。到UlU|分别对应L的第二大到第1大奇异值对应左奇异向量,到巧巧分别对应L的第 二大到第1大奇异值对应右奇异向量;
对班的行向量进行KMEANS聚类,得到的K个质屯、为融合质心设kfealkfeal为特征1的 质屯、数量,护为特征2的质屯、数量,则矩阵提的行数为护"卡护&=护al+护心,通 过聚类,Z2的前护"护"个行向量所属质屯、分别对应特征1的护"护"个质屯、所属类别,Z 乙的后护心护》2个行向量所属质屯、分别对应特征2的护aSkfeaS个质屯、所属类别. 步骤4;设融合前视频V的距离矩阵为DM,rDM,,,进行融合的两种特征为feal和fea2,两种特征对应质屯、集合分别为

,且原质屯、到融合质屯、的映射函数为巧巧甘 f州)刪; 其中

则质屯、融合后视频V的距离矩阵为DM許M(,,其中DM(,a扫=S时片的片DMy任,也
首先计算/eai的质屯、诚在视频V中与/eaJ觀所有质屯、W距离左g左g相关的条 件概率为:
其中,His(Wfeai,左s)His(机fMi,左S)表示在视频V中/eai的质屯、WfeaiwfMi与觀 所有质屯、相距.£,£,的次数, 然后,对称的计算fea2的质屯、W/[email protected]在视频V中与/eai的所有质屯、W距离丈^尤。 相关的条件概率为:
最后,整个视频V可W被编码成2m*k的矩阵:

步骤5 ;最后,利用获得的融合后视频级编码,训练一个多类支持向量机用于新视频的 识别。
[0016] 与现有技术相比,本发明一种基于多特征时空关系融合的人类行为识别方法,该 方法通过计算每个视频中特征之间的时空距离,从而构建两种特征对应质屯、之间的时空二 部图,并采用K路二部图分割技术对时空二部图进行分割,W此将具有强时空关系的质屯、 融合,更好的挖掘了不同特征的有效信息,提升了识别准确率。
[0017] W上所述仅为本发明的实施例,并非因此限制本发明的专利范围,凡是利用本发 明说明书所作的等效结构或等效流程变换,或直接或间接运用在其他相关的技术领域,均 同理包括在本发明的专利保护范围内。
【主权项】
1. 一种基于多特征时空关系融合的人类行为识别方法,其特征在于,具体步骤包括: 步骤1:对视频进行密集轨迹特征抽取,并以光流直方图和运动边界直方图两种方法 对抽取的轨迹特征进行表示,得到两种特征表示; 步骤2 :用KMEANS算法构建两种特征对应质心之间的时空二部图; 步骤3 :采用K路二部图分割技术将步骤2中的时空二部图分割为具有强时空关系的 质心和具有弱时空关系的质心,将分割后具有强时空关系的质心融合起来,将具有弱时空 关系的质心分开; 步骤4:计算具有强时空关系的质心之间的时空距离矩阵,并采用基于条件概率的表 示方法对距离矩阵进行压缩,得到两种特征融合后的视频级编码; 步骤5 :训练分类器并进行识别。2. 根据权利要求1所述的一种基于多特征时空关系融合的人类行为识别方法,其特征 在于:所述步骤2中KMEANS算法将所述步骤1中得到的两种特征进行聚类,从而得到若干 个质心,通过计算每个视频中任意两个特征对应时空坐标之间的Ll距离来衡量两个特征 之间的时空关系,利用两种特征之间的时空关系计算其质心之间的时空关系,并得到两种 特征对应质心之间的时空二部图。3. 根据权利要求1所述的一种基于多特征时空关系融合的人类行为识别方法,其特征 在于:所述的步骤4中所述条件概率表示方法首先对质心之间的距离向量进行离散化,然 后以条件概率描述任意两个融合后质心之间的时空距离分布信息。
【专利摘要】本发明公开了一种基于多特征时空关系融合的人类行为识别方法,具体步骤包括:通过光流直方图和运动边界直方图对视频抽取的密集轨迹特征进行表示,然后用KMEANS算法构建两种特征对应质心之间的时空二部图,采用K路二部图分割技术将时空二部图分割,采用基于条件概率的表示方法得到两种特征融合后的视频级编码,最后训练分类器并进行识别,通过上述方式,本发明一种基于多特征时空关系融合的人类行为识别方法,该方法通过计算每个视频中特征之间的时空距离,从而构建两种特征对应质心之间的时空二部图,采用K路二部图分割技术对时空二部图进行分割,将具有强时空关系的质心融合,更好的挖掘了不同特征的有效信息,提升了识别准确率。
【IPC分类】G06K9/62, G06K9/00
【公开号】CN104881655
【申请号】CN201510298003
【发明人】姚莉
【申请人】东南大学
【公开日】2015年9月2日
【申请日】2015年6月3日
转载请注明原文地址:https://www.famiwei.com/read-8138421.html

最新回复(0)