一种获取向量的方法及装置的制造方法

xiaoxiao2020-10-23  15

一种获取向量的方法及装置的制造方法
【技术领域】
[0001] 本发明设及视频识别技术领域,特别设及一种获取向量的方法及装置。
【背景技术】
[0002] 随着视频信息的爆炸式的增长,人工处理大量视频信息已经变得越来越不现实, 然而视频监控、视频检索等需求变得越来越大,如何让计算机能够正确理解视频的内容,是 一件有挑战也有意义的工作。
[0003] 在视频识别领域中,识别视频中的人、物的动作和行为等技术,是需求比较广泛 的。比如在对视频进行检索和分类时,通常需要对视频中人的行为动作进行比较准确的分 类,再比如在监控领域中,需要对被监控的人的行为动作进行分析,该也设及到对视频中的 人的动作行为进行的识别问题,因此动作识别在近几年一直是研究中的热点问题。
[0004] 在进行视频识别时,一般需要对视频中的运动区域进行分析,得到相应的运动向 量,再将得到的运动向量送入分类器进行分类,W得到识别结果。那么首要的就是先得到该 个运动向量,而在现有技术中,尚无较好地得到该种运动向量的方法。

【发明内容】

[0005] 本发明实施例提供一种获取向量的方法及装置,用于提供一种获取视频中的运动 向量的方式。
[0006] 本发明的第一方面,提供一种获取向量的方法,包括W下步骤:
[0007] 对视频的X个视频帖按照第一算法进行处理,得到N个像素点一一对应的N条运 动轨迹;其中,一条运动轨迹描述了一个像素点在所述X个视频帖中位置的变化;所述N个 像素点是按照预设规则在所述X个视频帖中选择出来的;
[000引采用预设的深度神经网络对所述X个视频帖进行处理,得到所述X个视频帖的深 度特征;
[0009] 确定组成每条运动轨迹的像素点在所述X个视频帖中的位置,并从所述深度特征 中获取每个位置的子深度信息,根据所述每个位置的子深度信息得到轨迹深度特征向量; 所述轨迹深度特征向量用于表征所述N条运动轨迹在所述X个视频帖中的深度信息;
[0010] 其中,X、N为正整数。
[0011] 结合第一方面,在第一方面的第一种可能的实现方式中,当X不小于2时,所述X 个视频帖是连续的。
[0012] 结合第一方面或第一方面的第一种可能的实现方式,在第一方面的第二种可能的 实现方式中,所述对视频的X个视频帖按照第一算法进行处理,得到N个像素点一一对应的 N条运动轨迹,包括;
[0013] 对于所述X个视频帖中每相邻的两个视频帖,均执行如下操作;获取所述相邻的 两个视频帖对应的第一光流场;所述第一光流场用于表示在所述相邻的两个视频帖中,同 一个像素点的速度矢量;通过中值滤波器对所述第一光流场进行处理,获取第二光流场,所 述第二光流场用于表示,所述相邻的两个视频帖中,前一个视频帖中的像素点在后一个视 频帖中的位置;
[0014] 根据获取的所述X个视频帖中每相邻的两个视频帖之间的第二光流场,获得所述 N个像素点对应的所述N条运动轨迹。
[0015] 结合第一方面的第二种可能的实现方式,在第一方面的第=种可能的实现方式 中,
[0016] 所述在获取所述相邻的两个视频帖对应的第一光流场之前,所述方法还包括:
[0017] 对所述X个视频帖中的每个视频帖做如下处理:
[001引在一个视频帖中,将每隔预设数量个普通像素点的一个普通像素点取为目标像素 点,计算获取的所有目标像素点的自相关矩阵;其中,所述普通像素点为所述一个视频帖中 的任意一个像素点;
[0019] 在所述一个视频帖中,丢弃所述自相关矩阵中的特征值小于预设值的元素对应的 普通像素点;
[0020] 所述获取所述相邻的两个视频帖对应的第一光流场,包括:
[0021] 根据处理后的X个视频帖,获取所述相邻的两个视频帖对应的所述第一光流场。
[0022] 结合第一方面的第二种可能的实现方式或第=种可能的实现方式,在第一方面的 第四种可能的实现方式中,
[0023] 在所述获取第二光流场之后,所述方法还包括;对于所述X个视频帖中每相邻的 两个视频帖,均执行如下操作:
[0024] 获取所述相邻的两个视频帖中的至少一组待匹配点对;所述待匹配点对为;所述 相邻的两个视频帖中,前一个视频帖的任意一个像素点和所述任意一个像素点在相邻的后 一个视频帖中得到的对应点构成的点对;其中,每组待匹配点对中包括一对或多对待匹配 点对;
[0025] 针对所述至少一组待匹配点对中的每组,分别获得一个仿射变换矩阵;
[0026] 通过得到的每一个仿射变换矩阵分别确定每一组待匹配点对中的每一对待匹配 点对是否匹配;
[0027] 将确定出的相匹配的待匹配点对数量最多的仿射变换矩阵确定为与所述相邻的 两个视频帖对应的第一仿射变换矩阵,并通过所述第一仿射变换矩阵,对所述相邻的两个 视频帖中的前一个视频帖作仿射变换,获得所述前一个视频帖中的像素点在所述相邻的两 个视频帖中的后一个视频帖中的实际位置;
[002引根据所述第二光流场,W及所述前一个视频帖中的像素点在所述后一个视频帖中 的实际位置,获取所述相邻的两个视频帖之间的第=光流场;所述第=光流场用于表示,所 述相邻的两个视频帖中,前一个视频帖中的像素点在后一个视频帖中的实际位置;
[0029] 所述根据获取的所述X个视频帖中每相邻的两个视频帖之间的第二光流场,获得 所述N个像素点对应的所述N条运动轨迹,包括:
[0030] 根据获取的所述X个视频帖中每相邻的两个视频帖之间的第=光流场,获得所述 N个像素点对应的所述N条运动轨迹。
[0031] 结合第一方面的第四种可能的实现方式,在第一方面的第五种可能的实现方式 中,获得所述N个像素点对应的所述N条运动轨迹,包括:
[0032] 根据获得的各像素点的运动轨迹,分别获取其中每个像素点的位移;
[0033] 丢弃其中位移大于预设位移的像素点对应的运动轨迹,获得所述N个像素点对应 的所述N条运动轨迹。
[0034] 结合第一方面的第五种可能的实现方式,在第一方面的第六种可能的实现方式 中,所述采用预设的深度神经网络对所述X个视频帖处理,得到所述X个视频帖的深度特 征,包括:
[0035] 将所述X个视频帖、W及所述X个视频帖对应的第=光流场输入到所述深度神经 网络中;
[0036] 获取所述深度神经网络输出的所述X个视频帖对应的所述深度特征。
[0037] 结合第一方面的第六种可能的实现方式,在第一方面的第走种可能的实现方式 中,在所述获取所述深度神经网络输出的所述X个视频帖对应的所述深度特征之后,还包 括:
[003引对所述深度特征进行归一化处理,得到归一化后的深度特征。
[0039] 结合第一方面的第走种可能的实现方式,在第一方面的第八种可能的实现方式 中,所述对所述深度特征进行归一化处理,得到归一化后的深度特征,包括:
[0040] 对所述深度特征中包括的每个元素,分别在所述深度神经网络中该元素所在的通 道上进行归一化,得到每个元素的单通道归一化结果;
[0041] 将每个元素的单通道归一化结果分别在所述深度神经网络中的所有通道上进行 归一化,得到每个元素的多通道归一化结果;
[0042] 根据每个元素的多通道归一化结果得到所述归一化后的深度特征。
[0043] 结合第一方面的第八种可能的实现方式,在第一方面的第九种可能的实现方式 中,
[0044] 所述对所述深度特征中包括的每个元素,分别在所述深度神经网络中该元素所在 的通道上进行归一化,得到每个元素的单通道归一化结果,包括:
[0045] 对所述深度特征中包括的每个元素,分别除W该元素在所述深度神经网络中该元 素所在的通道内的第一给定值,得到每个元素的单通道归一化结果;
[0046] 所述将每个元素的单通道归一化结果分别在所述深度神经网络中的所有通道上 进行归一化,得到每个元素的多通道归一化结果,包括:
[0047] 将每个元素的单通道归一化结果分别除W所述深度神经网络中的所有通道内与 该元素位于同一位置的元素对应的第二给定值,得到每个元素的多通道归一化结果。
[0048] 结合第一方面的第走种可能的实现方式至第九种可能的实现方式中的任一种可 能的实现方式,在第一方面的第十种可能的实现方式中,所述从所述深度特征中获取所述 每个位置的子深度信息,包括:
[0049] 从所述归一化后的深度特征中获取所述每个位置的子深度信息。
[0050] 本发明的第二方面,提供一种获取向量的装置,包括:
[0化1] 第一获取模块,用于对视频的X个视频帖按照第一算法进行处理,得到N个像素点 一一对应的N条运动轨迹;其中,一条运动轨迹描述了一个像素点在所述X个视频帖中位置 的变化;所述N个像素点是按照预设规则在所述X个视频帖中选择出来的;
[0化2] 第二获取模块,用于采用预设的深度神经网络对所述X个视频帖进行处理,得到 所述X个视频帖的深度特征;
[0053] 第=获取模块,用于确定组成所述第一获取模块得到的每条运动轨迹的像素点在 所述X个视频帖中的相应位置,并从所述第二获取模块得到的所述深度特征中获取每个位 置的子深度信息,根据所述每个位置的子深度信息得到轨迹深度特征向量;所述轨迹深度 特征向量用于表征所述N条运动轨迹在所述X个视频帖中的深度信息;
[0054] 其中,X、N为正整数。
[0055] 结合第二方面,在第二方面的第一种可能的实现方式中,当X不小于2时,所述X 个视频帖是连续的。
[0化6] 结合第二方面或第二方面的第一种可能的实现方式,在第二方面的第二种可能的 实现方式中,所述第一获取模块具体用于:
[0化7] 对于所述X个视频帖中每相邻的两个视频帖,均执行如下操作;获取所述相邻的 两个视频帖对应的第一光流场;所述第一光流场用于表示在所述相邻的两个视频帖中,同 一个像素点的速度矢量;通过中值滤波器对所述第一光流场进行处理,获取第二光流场,所 述第二光流场用于表示,所述相邻的两个视频帖中,前一个视频帖中的像素点在后一个视 频帖中的位置;
[005引根据获取的所述X个视频帖中每相邻的两个视频帖之间的第二光流场,获得所述N个像素点对应的所述N条运动轨迹。
[0059] 结合第二方面的第二种可能的实现方式,在第二方面的第=种可能的实现方式 中,所述装置还包括处理模块;
[0060] 所述处理模块用于在所述第一获取模块获取所述相邻的两个视频帖对应的第一 光流场之前,对所述X个视频帖中的每个视频帖做如下处理:
[0061] 在一个视频帖中,将每隔预设数量个普通像素点的一个普通像素点取为目标像素 点,计算获取的所有目标像素点的自相关矩阵;其中,所述普通像素点所述一个视频帖中的 任意一个像素点;
[0062] 在所述一个视频帖中,丢弃所述自相关矩阵中的特征值小于预设值的元素对应的 普通像素点;
[0063] 所述第一获取模块具体用于获取所述相邻的两个视频帖对应的第一光流场,包 括:
[0064] 根据所述处理模块处理后的X个视频帖,获取所述相邻的两个视频帖对应的所述 第一光流场。
[00化]结合第二方面的第二种可能的实现方式或第=种可能的实现方式,在第二方面的 第四种可能的实现方式中,
[0066] 所述第一获取模块在获取第二光流场之后,还用于对于所述X个视频帖中每相邻 的两个视频帖,均执行如下操作:
[0067] 获取所述相邻的两个视频帖中的至少一组待匹配点对;所述待匹配点对为;所述 相邻的两个视频帖中,前一个视频帖的任意一个像素点和所述像素点在相邻的后一个视频 帖中得到的对应点构成的点对;其中,每组待匹配点对中包括一对或多对待匹配点对;
[0068] 针对所述至少一组待匹配点对中的每组,分别获得一个仿射变换矩阵;
[0069] 通过得到的每一个仿射变换矩阵分别确定每一组待匹配点对中的每一对待匹配 点对是否匹配;
[0070] 将确定出的相匹配的待匹配点对数量最多的仿射变换矩阵确定为与所述相邻的 两个视频帖对应的第一仿射变换矩阵,并通过所述第一仿射变换矩阵,对所述相邻的两个 视频帖中的前一个视频帖作仿射变换,获得所述前一个视频帖中的像素点在所述相邻的两 个视频帖中的后一个视频帖中的实际位置;
[0071] 根据所述第二光流场,W及所述前一个视频帖中的像素点在所述后一个视频帖中 的实际位置,获取所述相邻的两个视频帖之间的第=光流场;所述第=光流场用于表示,所 述相邻的两个视频帖中,前一个视频帖中的像素点在后一个视频帖中的实际位置;
[0072] 所述第一获取模块具体用于,包括:
[0073] 根据获取的所述X个视频帖中每相邻的两个视频帖之间的第=光流场,获得所述 N个像素点对应的所述N条运动轨迹。
[0074] 结合第二方面的第四种可能的实现方式,在第二方面的第五种可能的实现方式 中,所述第一获取模块具体用于:
[0075] 根据获得的各像素点的运动轨迹,分别获取其中每个像素点的位移;
[0076] 丢弃其中位移大于预设位移的像素点对应的运动轨迹,获得所述N个像素点对应 的所述N条运动轨迹。
[0077] 结合第二方面的第五种可能的实现方式,在第二方面的第六种可能的实现方式 中,所述第二获取模块具体用于:
[007引将所述X个视频帖、W及所述第一获取模块获取的所述X个视频帖对应的第=光 流场输入到所述深度神经网络中;
[0079] 获取所述深度神经网络输出的所述X个视频帖对应的所述深度特征。
[0080] 结合第二方面的第六种可能的实现方式,在第二方面的第走种可能的实现方式 中,所述装置还包括归一化模块,所述归一化模块用于:
[0081] 在所述第二获取模块获取所述深度神经网络输出的、所述X个视频帖对应的所述 深度特征之后,对所述第二获取模块获取的所述深度特征进行归一化处理,得到归一化后 的深度特征。
[0082] 结合第二方面的第走种可能的实现方式,在第二方面的第八种可能的实现方式 中,所述归一化模块具体用于:[0083] 对所述第二获取模块获取的所述深度特征中包括的每个元素,分别在所述深度神 经网络中该元素所在的通道上进行归一化,得到每个元素的单通道归一化结果;
[0084] 将每个元素的单通道归一化结果分别在所述深度神经网络中的所有通道上进行 归一化,得到每个元素的多通道归一化结果;
[0085] 根据每个元素的多通道归一化结果得到所述归一化后的深度特征。
[0086] 结合第二方面的第八种可能的实现方式,在第二方面的第九种可能的实现方式 中,所述归一化模块具体用于:
[0087] 对所述第二获取模块获取的所述深度特征中包括的每个元素,分别除W该元素在 所述深度神经网络中该元素所在的通道内的第一给定值,得到每个元素的单通道归一化结 果;
[008引将每个元素的单通道归一化结果分别除W所述深度神经网络中的所有通道内与 该元素位于同一位置的元素对应的第二给定值,得到每个元素的多通道归一化结果。
[0089] 结合第二方面的第走种可能的实现方式至第九种可能的实现方式中的任一种可 能的实现方式,在第二方面的第十种可能的实现方式中,所述第=获取模块具体用于:
[0090] 从所述归一化模块根据所述第二获取模块得到的所述深度特征得到的归一化后 的深度特征中获取所述每个位置的子深度信息。
[0091] 本发明的第=方面,提供一种获取向量的装置,包括存储器、W及与所述存储器连 接的处理器;
[0092] 所述存储器,用于存储指令;
[0093] 所述处理器,用于执行所述指令,对视频的X个视频帖按照第一算法进行处理,得 到N个像素点一一对应的N条运动轨迹;其中,一条运动轨迹描述了一个像素点在所述X个 视频帖中位置的变化;所述N个像素点是按照预设规则在所述X个视频帖中选择出来的; 采用预设的深度神经网络对所述X个视频帖进行处理,得到所述X个视频帖的深度特征;W 及,确定组成每条轨迹的像素点在所述X个视频帖中的相应位置,并从所述深度特征中获 取每个位置的子深度信息,根据所述每个位置的子深度信息得到轨迹深度特征向量;所述 轨迹深度特征向量用于表征所述N条运动轨迹在所述X个视频帖中的深度信息;其中,X、N 为正整数。
[0094] 结合第=方面,在第=方面的第一种可能的实现方式中,当X不小于2时,所述X 个视频帖是连续的。
[0095] 结合第=方面或第一种可能的实现方式,在第=方面的第二种可能的实现方式 中,所述处理器具体用于:
[0096] 对于所述X个视频帖中每相邻的两个视频帖,均执行如下操作;获取所述相邻的 两个视频帖对应的第一光流场;所述第一光流场用于表示在所述相邻的两个视频帖中,同 一个像素点的速度矢量;通过中值滤波器对所述第一光流场进行处理,获取第二光流场,所 述第二光流场用于表示,所述相邻的两个视频帖中,前一个视频帖中的像素点在后一个视 频帖中的位置;
[0097] 根据获取的所述X个视频帖中每相邻的两个视频帖之间的第二光流场,获得所述 N个像素点对应的所述N条运动轨迹。
[009引结合第=方面的第二种可能的实现方式,在第=方面的第=种可能的实现方式 中,
[0099] 所述处理器在获取所述相邻的两个视频帖对应的第一光流场之前,还用于对所述 X个视频帖中的每个视频帖做如下处理:在一个视频帖中,将每隔预设数量个普通像素点 的一个普通像素点取为目标像素点,计算获取的所有目标像素点的自相关矩阵;其中,所述 普通像素点为所述一个视频帖中的任意一个像素点;在所述一个视频帖中,丢弃所述自相 关矩阵中的特征值小于预设值的元素对应的普通像素点;
[0100] 所述处理器具体用于;根据处理后的X个视频帖,获取所述相邻的两个视频帖对 应的所述第一光流场。
[0101] 结合第=方面的第二种可能的实现方式或第=种可能的实现方式,在第=方面的 第四种可能的实现方式中,
[0102] 所述处理器在获取第二光流场之后,还用于:对于所述X个视频帖中每相邻的两 个视频帖,均执行如下操作:
[0103] 获取所述相邻的两个视频帖中的至少一组待匹配点对;所述待匹配点对为;所述 相邻的两个视频帖中,前一个视频帖的任意一个像素点和所述任意一个像素点在相邻的后 一个视频帖中得到的对应点构成的点对;其中,每组待匹配点对中包括一对或多对待匹配 点对;
[0104] 针对所述至少一组待匹配点对中的每组,分别获得一个仿射变换矩阵;
[01化]通过得到的每一个仿射变换矩阵分别确定每一组待匹配点对中的每一对待匹配 点对是否匹配;
[0106] 将确定出的相匹配的待匹配点对数量最多的仿射变换矩阵确定为与所述相邻的 两个视频帖对应的第一仿射变换矩阵,并通过所述第一仿射变换矩阵,对所述相邻的两个 视频帖中的前一个视频帖作仿射变换,获得所述前一个视频帖中的像素点在所述相邻的两 个视频帖中的后一个视频帖中的实际位置;
[0107] 根据所述第二光流场,W及所述前一个视频帖中的像素点在所述后一个视频帖中 的实际位置,获取所述相邻的两个视频帖之间的第=光流场;所述第=光流场用于表示,所 述相邻的两个视频帖中,前一个视频帖中的像素点在后一个视频帖中的实际位置;
[0108] 所述处理器具体用于:
[0109] 根据获取的所述X个视频帖中每相邻的两个视频帖之间的第=光流场,获得所述 N个像素点对应的所述N条运动轨迹。
[0110] 结合第S方面的第四种可能的实现方式,在第S方面的第五种可能的实现方式 中,所述处理器具体用于:
[0111] 根据获得的各像素点的运动轨迹,分别获取其中每个像素点的位移;
[0112] 丢弃其中位移大于预设位移的像素点对应的运动轨迹,获得所述N个像素点对应 的所述N条运动轨迹。
[0113] 结合第=方面的第五种可能的实现方式,在第=方面的第六种可能的实现方式 中,所述处理器具体用于:
[0114] 将所述X个视频帖、W及所述X个视频帖对应的第=光流场输入到所述深度神经 网络中;
[0115] 获取所述深度神经网络输出的所述X个视频帖对应的所述深度特征。
[0116] 结合第S方面的第六种可能的实现方式,在第S方面的第走种可能的实现方式 中,所述处理器在获取所述深度神经网络输出的所述X个视频帖对应的所述深度特征之 后,还用于:
[0117] 对所述深度特征进行归一化处理,得到归一化后的深度特征。
[0118] 结合第S方面的第走种可能的实现方式,在第S方面的第八种可能的实现方式 中,所述处理器具体用于:
[0119] 对所述深度特征中包括的每个元素,分别在所述深度神经网络中该元素所在的通 道上进行归一化,得到每个元素的单通道归一化结果;
[0120] 将每个元素的单通道归一化结果分别在所述深度神经网络中的所有通道上进行 归一化,得到每个元素的多通道归一化结果;
[0121] 根据每个元素的多通道归一化结果得到所述归一化后的深度特征。
[0122] 结合第S方面的第八种可能的实现方式,在第S方面的第九种可能的实现方式 中,所述处理器具体用于:
[0123] 对所述深度特征中包括的每个元素,分别除W该元素在所述深度神经网络中该元 素所在的通道内的第一给定值,得到每个元素的单通道归一化结果;
[0124] 将每个元素的单通道归一化结果分别除W所述深度神经网络中的所有通道内与 该元素位于同一位置的元素对应的第二给定值,得到每个元素的多通道归一化结果。
[01巧]结合第S方面的第走种可能的实现方式至第九种可能的实现方式中的任一种可 能的实现方式,在第=方面的第十种可能的实现方式中,所述处理器具体用于:
[0126] 从所述归一化后的深度特征中获取所述每个位置的子深度信息。
[0127] 本发明实施例中,可W获取X个视频帖中的像素点对应的运动轨迹,W及通过深 度神经网络获取X个视频帖的深度特征,从而根据运动轨迹和深度特征获得X个视频帖对 应的轨迹深度特征向量(因为轨迹深度特征向量是视频中的运动物体对应的,因此也可W 称为运动向量),该轨迹深度特征向量可W用于表示视频中的运动物体的轨迹W及轨迹上 的每个点对应的深度特征,即,本发明实施例提供了一种较好地获取视频中的运动向量的 方式。
[0128] 本发明实施例中,视频帖的深度特征是通过深度神经网络获取的,因此准确度较 高,且本发明实施例中的深度神经网络只需要获取深度特征,而无需对所有视频帖从头进 行识别,因此本发明实施例中的深度神经网络在进行训练时的训练方式较为简单,也无需 大量的复杂样本进行训练,减少了训练深度神经网络所带来的工作量。本发明实施例中的 轨迹深度特征向量既可W体现出像素点的运动轨迹,也可W体现出像素点在每个位置时的 深度信息,从而便于后续对轨迹深度特征向量加W利用,例如可W将轨迹深度特征向量应 用到动作识别、视频检索、视频监控分析等等不同的场景中。
【附图说明】
[0129] 图1为本发明实施例中获取向量的方法的主要流程图;
[0130] 图2A为本发明实施例中运动轨迹与与视频帖之间的交点的示意图;
[0131] 图2B为本发明实施例中相邻的两帖图像中像素点的移动情况示意图;
[0132] 图3A为本发明实施例中获取向量的装置的一种结构框图;
[0133] 图3B为本发明实施例中获取向量的装置的另一种结构框图;
[0134] 图4为本发明实施例中获取向量的装置的结构示意图。
【具体实施方式】
[01巧]为使本发明实施例的目的、技术方案和优点更加清楚,下面将结合本发明实施例 中的附图,对本发明实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施例是 本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员 在没有作出创造性劳动前提下所获得的所有其他实施例,都属于本发明保护的范围。
[0136] 首先介绍一下本发明实施例的应用场景。
[0137] 例如有一个视频,该视频包括多个视频帖。在该视频帖中包括有一个或多个运动 物体,现在需要对该视频中的运动物体所在的运动区域进行分析,得到相应的运动向量,具 体的,可w对该视频中包括的所有视频帖进行分析,或者也可w对该视频中包括的部分视 频帖进行分析。具体的,可W采用本发明实施例中的方法来得到运动向量。
[0138]下面结合说明书附图对本发明实施例作进一步详细描述。
[0139]请参见图1,本发明实施例提供一种获取向量的方法,所述方法的主要流程描述如 下。
[0140]步骤101;对视频的X个视频帖按照第一算法进行处理,得到N个像素点一一对应 的N条运动轨迹;其中,一条运动轨迹描述了一个像素点在X个视频帖中位置的变化;N个 像素点是按照预设规则在X个视频帖中选择出来的。
[0141] 本发明实施例中,N个像素点可W是X个视频帖中的运动物体对应的像素点,即, 该里的预设规则可W是指;从X个视频帖中选择位移不为0的像素点。当然,N个像素点可 W是X个视频帖中的位移不为0的全部像素点或部分像素点。因为该N个像素点都是运动 物体对应的像素点,那么,在下文中可W将该N个像素点中的每个都称为运动像素点,即,N 个像素点也可W描述为N个运动像素点。
[014引本发明实施例中,X和N均为正整数。
[0143]本发明实施例中,当X大于等于2时,X个视频帖可W是连续的视频帖,当然也可W是不连续的视频帖。
[0144]本发明实施例中,例如对于运动像素点1对应的运动轨迹为运动轨迹1,那么,运 动轨迹1与X个视频帖中的每个视频帖都可W有交点,即X个视频帖中的每个视频帖中都 有运动像素点1对应的位置,或者,运动轨迹1只与X个视频帖中的部分视频帖有交点,而 与剩余部分的视频帖没有交点,即X个视频帖中只有部分视频帖中有运动像素点1对应的 位置。其中,运动像素点1为N个运动像素点中的任意一个运动像素点。另外,对于不同的 运动像素点,与其有交点的视频帖可W不同。
[0145]本发明实施例中,例如运动轨迹A与视频帖A有一个交点,那么该个交点就是运动 轨迹A在视频帖A中对应的位置。
[0146]例如请参见图2A,为本发明实施例中一种可能的运动轨迹与视频帖之间的交点的 示意图。图2A中X= 5,即共有5个视频帖,分别为视频帖A(即图2A中的A)、视频帖B(即 图2A中的B)、视频帖C(即图2A中的C)、视频帖D(即图2A中的D)和视频帖E(即图2A 中的巧,W及共有五个运动像素点,分别为运动像素点1、运动像素点2、运动像素点3、运动 像素点4和运动像素点5,运动像素点1对应于运动轨迹1 (即图2A中的1),运动像素点2 对应于运动轨迹2 (即图2A中的2),运动像素点3对应于运动轨迹3 (即图2A中的3),运 动像素点4对应于运动轨迹4 (即图2A中的4),W及运动像素点5对应于运动轨迹5 (即图 2A中的5)。其中,运动轨迹1与5个视频帖均有交点,运动轨迹2与其中的3个视频帖有 交点,运动轨迹3与其中的四个视频帖有交点,运动轨迹4与其中的3个视频帖有交点,运 动轨迹5也与其中的3个视频帖有交点。其中,与运动像素点2有交点的视频帖分别为视 频帖A、视频帖B和视频帖C,与运动像素点3有交点的视频帖分别为视频帖A、视频帖C、视 频帖D和视频帖E,与运动像素点4有交点的视频帖分别为视频帖A、视频帖C和视频帖E, 与运动像素点5有交点的视频帖分别为视频帖A、视频帖B和视频帖C。
[0147]图2A中,对于每条运动轨迹,如果一个视频帖与它没有交点,则用虚线表示出来, 即图2A中的虚线是一个示意,表示运动轨迹与相应的视频帖没有交点。另外,图2A中的运 动轨迹都是w直线进行示意的,该只是为了举例,在实际应用中,运动轨迹可能是各种不同 的形状。
[0148] 可W看到,在图2A中,各个运动像素点有交点的视频帖可能相同也可能不同,W及,与一个运动像素点有交点的各个视频帖可能是连续的视频帖,也可能是不连续的视频 帖。
[0149] 例如,X个视频帖中有一个运动物体A,该运动物体A可能对应一条或多条运动轨 迹,例如其对应的一条运动轨迹为运动轨迹1。例如运动物体A是用户的一只手,在拍摄视 频的设备进行拍摄时,用户在进行甩手动作,在设备拍摄X个视频帖中的第一个视频帖、第 二个视频帖和第=个视频帖时,用户的手位于设备的拍摄范围内,而从设备拍摄X个视频 帖中的第四个视频帖开始,用户的运动出了设备的拍摄范围,例如用户可能将手向上甩,贝U 设备拍摄不到了,而在设备拍摄X个视频帖中的第八个视频帖时,用户的手又回到了设备 的拍摄范围内,那么,在X个视频帖中的第一个视频帖、第二个视频帖、第=个视频帖和第 八个视频帖中(当然还可能有后面的视频帖,该里不多举例)都有与运动轨迹1对应的位 置,即运动轨迹1与该几个视频帖都有交点,而在第四个视频帖、第五个视频帖、第六个视 频帖和第走个视频帖(当然还可能有后面的视频帖,该里不多举例)中,都没有与运动轨迹 1对应的位置,即运动轨迹1与该几个视频帖都没有交点,在该种情况下,就出现了与一个 运动像素点有交点的各个视频帖不是连续视频帖的情况。
[0150] 获取X个视频帖中的N个运动像素点对应的N个运动轨迹,即可W认为是提取X个视频帖中的运动轨迹。原则上来讲,本发明实施例中的该步骤可W使用多种不同的提取 运动轨迹的方式,例如可W采用Kanade-Lucas-TomasitrajecotiT化LT轨迹)方法、dense trajectory(稠密轨迹)方法、ImprovedTrajectories(优化轨迹)方法等等不同的方法, 即本发明实施例中的第一算法可W是指多种不同的算法。具体的,本发明实施例W第一算 法是优化轨迹方法为例。
[0151] 可选的,本发明实施例中,对视频的X个视频帖按照第一算法进行处理,得到N个 像素点--对应的N条运动轨迹,包括;
[0152] 对于X个视频帖中每相邻的两个视频帖,均执行如下操作;获取相邻的两个视频 帖对应的第一光流场;第一光流场用于表示在相邻的两个视频帖中,同一个像素点的速度 矢量;通过中值滤波器对第一光流场进行处理,获取第二光流场,第二光流场用于表示,相 邻的两个视频帖中,前一个视频帖中的像素点在后一个视频帖中的位置;
[0153] 根据获取的X个视频帖中每相邻的两个视频帖之间的第二光流场,获得N个像素 点对应的N条运动轨迹。
[0154] 本发明实施例中,可W认为X个视频帖中包括的各个视频帖中,所包括的普通像 素点都是相同的,即,例如,若X个视频帖中的第一个视频帖包括普通像素点1、普通像素点 2和普通像素点3,则X个视频帖中包括的其他视频帖中也包括普通像素点1、普通像素点2 和普通像素点3。其中,普通像素点可W是指X个视频帖中的任意一个像素点。本发明实施 例中,可按照普通像素点对应的对象是否处于运动状态,而将普通像素点分为运动像素点 和非运动像素点,即,普通像素点中包括了运动像素点和非运动像素点。
[0155] 本发明实施例中,第一光流场中可W考虑所有的普通像素点,或者也可W只考虑 运动像素点。
[0156] 本发明实施例中,每相邻的两个视频帖中,同一个运动像素点可W对应一个速度 矢量,该个速度矢量用于描述该运动像素点的在X方向和y方向上的位移量,那么每相邻的 两个视频帖中,所有运动像素点的速度矢量就形成了该相邻的两个视频帖的光流场。目P,光 流场用于表明相邻两个视频帖中,对应的运动像素点的运动速率和运动方向。
[0157] 光流场可W描述空间运动物体在观察成像平面上的各个运动像素点运动的瞬时 速度,是利用图像序列中运动像素点在时间域上的变化W及相邻两个视频帖之间的相关性 来找到上一个视频帖跟当前视频帖之间存在的对应关系,从而计算出相邻两个视频帖之间 物体的运动信息的一种方法。简单的说,把每相邻的两个视频帖中每个运动像素点的运动 速率和运动方向找出来,就是该相邻的两个视频帖之间的光流场。
[0158] 例如请参见图2B,图2B中的两幅图像表示相邻的两个视频帖,左边的表示其中的 前一个视频帖,右边的表示其中的后一个视频帖,该两个视频帖中的每个格子代表一个普 通像素点。可W看到,在该两个视频帖中,左边有一个格子用斜线填充,右边也有一个格子 用斜线填充,该用于表示,左边的该个运动像素点,在下一个视频帖中分别在X方向和y方 向上移动了一个单位,则,该两个视频帖之间的光流场可W用表1来表示:
[0159] 表 1
[0160]
[0161]
[0162] 表1中的(0,0)表示运动像素点没有移动,(1,1)表示运动像素点在X方向和y方 向上各移动了一个单位。目P,表1中的值表示的是运动像素点的移动情况,而不用于表示运 动像素点的位置坐标。
[0163] 在获得该视频中每相邻的两个视频帖之间的光流场后,可W采用中值滤波器对获 得的每个光流场进行处理,处理方式例如可W是滤波,该样就可W获取每相邻的两个视频 帖中,前一个视频帖中的每个运动像素点在后一个视频帖中的位置,通过对多个光流场进 行滤波,则对于X个视频帖中的每个视频帖中包括的运动像素点,都可W得到其在每个视 频帖中对应的位置,该样也就相当于得到了运动像素点的运动轨迹。
[0164] 本发明实施例中,为了便于区分,将初次获得的光流场称为第一光流场,将采用中 值滤波器对第一光流场进行滤波之后得到的光流场称为第二光流场。
[0165] 具体的,使用中值滤波器对第一光流场滤波,可W采用如下公式:
[0166]
( 1 )
[0167]公式(1)中,(X。yt)是X个视频帖中第t个视频帖的运动像素点的坐标,M是中 值滤波器的核,*是卷积运算,Wt= (u^Vt)是第t个视频帖中的运动像素点(Xt,yt)在第 一光流场中的矢量,I表示在(Xt,yt)坐标处,0,,_y,)是(Xt,yt)四舍五入后的坐标值。在使 用中值滤波器对X个视频帖中每两个视频帖之间的第一光流场进行滤波后,根据第二光流 场,把X个视频帖中同一个运动像素点的位置组合起来,就得到了该运动像素点的运动轨 迹。
[0168] 可选的,本发明实施例中,
[0169]在获取相邻的两个视频帖对应的第一光流场之前,所述方法还包括:
[0170]对X个视频帖中的每个视频帖做如下处理:
[0171]在一个视频帖中,将每隔预设数量个普通像素点的一个普通像素点取为目标像素 点,计算获取的所有目标像素点的自相关矩阵;其中,普通像素点为一个视频帖中的任意一 个像素点;
[0172]在一个视频帖中,丢弃自相关矩阵中的特征值小于预设值的元素对应的普通像素 占. '?、、?
[0173] 获取相邻的两个视频帖对应的第一光流场,包括:
[0174]根据处理后的X个视频帖,获取相邻的两个视频帖对应的第一光流场。
[0175]例如,对于X个视频帖中的每个视频帖,都每隔5个普通像素点取一个普通像素 点,本发明实施例中将取出的普通像素点称为目标像素点,将获取的目标像素点组成一个 矩阵,求得该个矩阵的自相关矩阵,即,对于每个视频帖,都可W得到一个自相关矩阵,自相 关矩阵中的元素与目标像素点为一一对应的关系。例如对于一个视频帖来说,该视频帖中 所有目标像素点在时间序列上的二阶导数组成的矩阵就是该视频帖对应的自相关矩阵。
[0176]预设值可W是根据经验值设定的值,或者也可W是系统预先设定的值,在得到自 相关矩阵后,可W获得每个自相关矩阵的特征值,自相关矩阵的每个特征值都对应于自相 关矩阵中的一个或多个元素。因为一般认为特征值小于预设值的像素点属于噪点,因此对 于一个自相关矩阵来说,如果该自相关矩阵的一个或多个特征值小于预设值,那么可W从 该自相关矩阵中确定出与该些特征值对应的元素,再从该自相关矩阵对应的视频帖中确定 该些元素对应的目标像素点,从而可W从该视频帖中,删除该些像素点,对X个视频帖中的 每个视频帖都可W进行同样的处理,那么在后续,计算运动像素点的运动轨迹时,可W不再 计算该些已删除的普通像素点的运动轨迹,即,在进行运动轨迹提取时,不再考虑该些已删 除的普通像素点,即去除了噪点的影响,使得计算结果更为准确。
[0177] 另外,在计算运动像素点的运动轨迹时,除了要考虑到运动像素点本身的移动情 况,较佳的,还要考虑到拍摄该视频的设备的移动情况,例如,用户在使用设备进行拍摄的 过程中可能进行了移动,或者手可能发生了抖动,等等,那么为了使得到的运动像素点的运 动轨迹能够更为真实地反映运动像素点本身的移动情况,就需要去除设备的位移。
[0178] 为了进一步考虑设备本身的移动情况,本发明实施例可W采用RANSAC(Random Sample Consensus,随机样本一致)算法来去除设备位移的影响,当然也可W采用其他算 法,本发明实施例只是WRANSAC算法进行举例。具体的,如下:
[0179] 可选的,本发明实施例中,
[0180]在获取第二光流场之后,所述方法还包括;对于X个视频帖中每相邻的两个视频 帖,均执行如下操作:
[0181] 获取相邻的两个视频帖中的至少一组待匹配点对;待匹配点对为;相邻的两个视 频帖中,前一个视频帖的任意一个像素点和该任意一个像素点在相邻的后一个视频帖中得 到的对应点构成的点对;其中,每组待匹配点对中包括一对或多对待匹配点对;
[0182] 针对至少一组待匹配点对中的每组,分别获得一个仿射变换矩阵;
[0183] 通过得到的每一个仿射变换矩阵分别确定每一组待匹配点对中的每一对待匹配 点对是否匹配;
[0184] 将确定出的相匹配的待匹配点对数量最多的仿射变换矩阵确定为与相邻的两个 视频帖对应的第一仿射变换矩阵,并通过第一仿射变换矩阵,对相邻的两个视频帖中的前 一个视频帖作仿射变换,获得前一个视频帖中的像素点在相邻的两个视频帖中的后一个视 频帖中的实际位置;
[0185] 根据第二光流场,W及前一个视频帖中的像素点在后一个视频帖中的实际位置, 获取相邻的两个视频帖之间的第=光流场;第=光流场用于表示,相邻的两个视频帖中,前 一个视频帖中的像素点在后一个视频帖中的实际位置;
[0186] 根据获取的所述X个视频帖中每相邻的两个视频帖之间的第二光流场,获得N个 像素点对应的N条运动轨迹,包括:
[0187] 根据获取的X个视频帖中每相邻的两个视频帖之间的第S光流场,获得N个像素 点对应的N条运动轨迹。
[0188] 本发明实施例中,将去除设备位移影响之后得到的光流场称为第S光流场。
[0189] 本发明实施例中,凡是称为像素点的,可W认为是运动像素点。
[0190] 本发明实施例中,第S光流场是根据第二光流场得到的,因此,根据第二光流场获 取运动像素点的运动轨迹,可W进一步认为具体是根据第立光流场获取运动像素点的运动 轨迹。
[0191] 例如,对于相邻的两个视频帖,可W将其中的全部运动像素点或者部分运动像素 点作为待匹配点对。说是"点对",其实对应的是一个对象,即,是一个对象在前后两个视频 帖中对应的两个位置,因此就将其称为"点对"。本发明实施例中将其称为待匹配点对,是因 为该些点对是尚未去除设备位移影响的点对,并不是说该些点对没有对应同一对象。
[0192] 例如,对于相邻的两个视频帖,视频帖1和视频帖2,根据其中的若干组待匹配点 对分别获得仿射变换矩阵,则,获得的仿射变换矩阵的数量与其中的待匹配点对的组的数 量相同。通过每个仿射变换矩阵分别对所有的待匹配点对进行处理,例如对于任意一个待 匹配点对,处理方式可W是;将该运动像素点在前一个视频帖中的位置通过仿射变换矩阵 进行映射,判断得到的位置与该运动像素点在后一个视频帖中的位置是否相匹配,该里的 相匹配可W是指完全相同,或者也可W是指两个位置之间的距离小于预设距离。若得到的 位置与该运动像素点在后一个视频帖中的位置相匹配,则确定该待匹配点对在通过该仿射 变换矩阵进行处理时得到了匹配,否则,若得到的位置与该运动像素点在后一个视频帖中 的位置不相匹配,则确定该待匹配点对在通过该仿射变换矩阵进行处理时得不到匹配。
[0193] 那么,将视频帖1和视频帖2中的所有待匹配点对分别采用仿射变换矩阵1进行 处理,就可W得到该仿射变换矩阵1对应的、能够匹配的待匹配点对的数量,进一步,将视 频帖1和视频帖2中的所有待匹配点对分别采用每个仿射变换矩阵进行处理,就可W得到 每个仿射变换矩阵分别对应的、能够匹配的待匹配点对的数量。从而,也就可W从中确定, 究竟哪个仿射变换矩阵所对应的能够匹配的待匹配点对的数量最多,从而确定采用该个仿 射变换矩阵来确定用于拍摄视频的设备对应于视频帖1和视频帖2中每个运动像素点的设 备位移。
[0194]例如一共选出4个待匹配点对组,分别为点对组1、点对组2、点对组3和点对组4, 其中,每个待匹配点对组中包括一个或多个待匹配点对,且不同的待匹配点对组中包括的 待匹配点对的数量可W相同也可W不同。通过该4个待匹配点对组中的每组,分别得到一 个仿射变换矩阵,共得到4个仿射变换矩阵,分别为矩阵1、矩阵2、矩阵3和矩阵4。则,通 过矩阵1对所有待匹配点对进行处理,通过矩阵2对所有待匹配点对进行处理,通过矩阵3 对所有待匹配点对进行处理,W及通过矩阵4对所有待匹配点对进行处理,其中,点对组1 包括2对待匹配点化点对组2包括1对待匹配点化点对组3包括3对待匹配点化点对 组4包括4对待匹配点对,即共有10对待匹配点对。例如处理结果为;通过矩阵1进行处 理时,有4对待匹配点对能够相匹配,有6对待匹配点对不能匹配,通过矩阵2进行处理时, 有2对待匹配点对能够相匹配,有8对待匹配点对不能匹配,通过矩阵3进行处理时,有7 对待匹配点对能够匹配,有3对待匹配点对不能匹配,通过矩阵4进行处理时,有5对待匹 配点对能够匹配,有5对待匹配点对不能匹配。贝ij,显然可W确定出矩阵3所对应的能够匹 配的待匹配点对的数量最多。
[0195] 本发明实施例中,将确定出的仿射变换矩阵称为第一仿射变换矩阵。通过第一仿 射变换矩阵对相邻的两个视频帖中的前一个视频帖中的运动像素点进行处理,就可W得到 后一个视频帖中的每个运动像素点的实际位置,该里所说的相邻的两个视频帖,是指与第 一仿射变换矩阵对应的两个视频帖。
[0196] 例如仿射变换矩阵1是对应于视频帖1和视频帖2的仿射变换矩阵,那么,通过仿 射变换矩阵1对视频帖1中的运动像素点进行处理,就可W得到视频帖2中每个运动像素 点的实际位置,相当于得到了新的视频帖2, 而该个新的视频帖2,可W认为是去除了设备 位移影响的视频帖2。
[0197] 具体的,通过第一仿射变换矩阵对相邻的两个视频帖中的前一个视频帖中的运动 像素点进行处理,可W是令前一个视频帖中的运动像素点的值与第一仿射变换矩阵相乘, 那么对于后一个视频帖中的每个运动像素点都会得到一个新的位置,该个新的位置就可W 认为是相应运动像素点在后一视频帖中的实际位置。
[0198] 可选的,本发明实施例中,获得N个像素点对应的N条运动轨迹,包括:
[0199]根据获得的各像素点的运动轨迹,分别获取其中每个像素点的位移;
[0200] 丢弃其中位移大于预设位移的像素点对应的运动轨迹,获得N个像素点对应的N 条运动轨迹。
[0201] 本发明实施例中,获取的运动轨迹的数量可能大于等于N,其中包括了所述N条运 动轨迹。
[0202] 本发明实施例中,对于每相邻的两个视频帖,都可W通过去除设备位移的方式确 定其中后一个视频帖中的运动像素点的实际位置,那么,对于该X个视频帖,可W根据去除 设备位移后的视频帖来确定其中的运动像素点的位置,从而确定运动像素点的运动轨迹。
[0203]在得到运动像素点的运动轨迹后,可W获得每个运动像素点的实际位移,预设位 移可W是根据经验值设定的,或者可W是由系统设定的,或者也可W是通过其他方式设定 的,总之可W认为,位移大于预设位移的运动像素点属于噪点,因此,可W将位移大于预设 位移的运动像素点删除,从而剩下的运动像素点就是所述N个,所述N个运动像素点就对应 于所述N个运动轨迹,该样可W进一步去除噪点的影响。
[0204] 可W认为,X个视频帖中的每个视频帖中原本共包括有Y个运动像素点(Y为正整 数),通过计算自相关矩阵,可能从Y个运动像素点中删除了部分运动像素点,例如共删除 了K个运动像素点化为小于等于Y的正整数),之后,将位移大于预设位移的运动像素点删 除,即可能又从K个运动像素点中删除了部分运动像素点,即,例如共删除了H个运动像素 点化为小于等于K的正整数),即,K-H=N。
[0205] 步骤102 ;采用预设的深度神经网络对X个视频帖进行处理,得到X个视频帖的深 度特征。
[0206] 本发明实施例中,因为采用的是深度神经网络对X个视频帖进行处理,因此将得 到的信息称为X个视频帖的深度特征。深度特征里深度的含义,是指该信息是通过深度神 经网络得到的,一般来说,将层数大于3的神经网络称为深度神经网络。
[0207] 可选的,本发明实施例中,采用预设的深度神经网络对X个视频帖处理,得到X个 视频帖的深度特征,包括:
[020引将X个视频帖、W及X个视频帖对应的第=光流场输入到深度神经网络中;
[0209] 获取深度神经网络输出的X个视频帖对应的深度特征。
[0210] 在实际应用中,本发明实施例中可W使用任何深度神经网络,下面WConvNets( - 种深度神经网络)为例。
[0211] 本发明实施例采用了双输入的ConvNets结构;其中第一组输入是针对每一个视 频帖,即把每一个视频帖缩放到一定大小(例如推荐224*224*3)后输入到ConvNets中,我 们把ConvNets中处理该一组数据的网络叫做空间网络;其中另一组输入是针对时间上连 续的一组视频帖的光流场(位移矢量),本发明实施例将该些连续视频帖的光流场缩放到 一定大小上作为输入,例如本发明实施例中可将光流场缩放到224*224*2F,其中F是预先 给定的一个数,我们把ConvNets中处理该一组数据的网络叫做时间网络。其中,在一次输 入中,第二组输入的光流场是第一组输入的视频帖所对应的光流场。例如,在一次输入中, 第一组输入了一个视频帖,那么在第二组中输入的可能是该一个视频帖的前m个视频帖或 后m个视频帖所对应的光流场,m为正整数。
[0212] 传统的ConvNets的各层的参数如表2所示。在本发明实施例中,暂时没有使用从 Conv5到fulls的各层。
[021引表2
[0214]
[0215] 其中,表2中,Layer表示ConvNets中的层,size表示卷积核的大小,stride表示 卷积步长,channel表示卷积核的个数,mapsizeratio表示影射比率,即输入矩阵和输出 矩阵大小的比值,rec巧tivefield表示感受野,conv表示卷积层,pool层需要做取最大值 的操作,化11为全连接层。
[0216] 在使用深度神经网络对X个视频帖中各个视频帖和各段连续视频帖的光流场进 行处理之后,我们就可W得到一组特征: 悦 17]
(2)
[021引其中,M表示深度神经网络的层数(该里的层即表2中所表示的层),公式中的第i个元素Cf,是空间网络处理时得到的第i层输出矩阵,其大小为HmXWmXLXNm,其中瓦, Wm分别是空间网络第i层输出的高和宽,L是视频长度(帖数),Nm是表2中的通道数(卷 积核的个数),公式中的第i个元素C,是时间网络处理时得到的第i层输出矩阵,其大小 为HmXWmXLXNm,其中Hm,Wm分别是时间网络第i层输出的高和宽,L是视频长度(帖数), 在处理的时候每预先设定数目的光流场放在一起组成一个volume(卷)作为时间网络的输 入,Nm是表2中的通道数,V是给定的视频。本发明实施例中,将C(V)称为深度特征。
[0219] 其中,对应于输入到ConvNets的空间网络中的每个视频帖,都会得到如公式(2) 所示的一组特征。
[0220] 可选的,本发明实施例中,在获取深度神经网络输出的X个视频帖对应的深度特 征之后,还包括:
[0221] 对深度特征进行归一化处理,得到归一化后的深度特征。
[0222] 可选的,本发明实施例中,对深度特征进行归一化处理,得到归一化后的深度特 征,包括:
[0223] 对深度特征中包括的每个元素,分别在深度神经网络中该元素所在的通道上进行 归一化,得到每个元素的单通道归一化结果;
[0224] 将每个元素的单通道归一化结果分别在深度神经网络中的所有通道上进行归一 化,得到每个元素的多通道归一化结果;
[02巧]根据每个元素的多通道归一化结果得到归一化后的深度特征。
[0226] 该里的通道指的是表2中的通道。目P,对深度特征进行归一化处理,首先是在单通 道进行归一化,之后是在所有通道进行归一化。
[0227] 可选的,本发明实施例中,
[022引对深度特征中包括的每个元素,分别在深度神经网络中该元素所在的通道上进行 归一化,得到每个元素的单通道归一化结果,包括:
[0229] 对深度特征中包括的每个元素,分别除W该元素在深度神经网络中该元素所在的 通道内的第一给定值,得到每个元素的单通道归一化结果;
[0230] 将每个元素的单通道归一化结果分别在深度神经网络中的所有通道上进行归一 化,得到每个元素的多通道归一化结果,包括:
[0231] 将每个元素的单通道归一化结果分别除W深度神经网络中的所有通道内与该元 素位于同一位置的元素对应的第二给定值,得到每个元素的多通道归一化结果。
[0232] 具体的,本发明实施例中,对深度特征中的每个元素进行归一化处理,包括两个步 骤:
[0233] 第一步,对于C(V)的每一个元素C,使用下面的公式做时空归一化(即单通道归一 化):
[0234]
(3)
[023引公式(:)>)中,I化化C=1化化、,_(C'(-V,>',z,")),X,y,z,n是元素C(即C(V)中的任 一个元素)在空间HmXWmXLXNm中的坐标,maxfC表示元素C在通道n上的最大值(该里 是W第一给定值是最大值为例),通道n,可W是指表2中的任一通道。C(X,y,Z,n)是C(V) 中的元素,X,y,Z,n是其在深度神经网络特征空间中的坐标。
[0236] 公式做即表示,对深度特征中包括的每个元素,可W分别在相应的元素对应的 通道上进行归一化,因为该一步对于每个元素都只在一个通道上进行归一化,因此该一步 得到的结果为元素在单通道上的归一化结果,本发明实施例中将其称为单通道归一化结 果。
[0237] 第二步,全通道归一化。
[0238] 我们把第一步归一化也可W称为时空归一化。在做完时空归一化之后再做第二步 归一化,我们把第二步归一化也可W叫做通道归一化。通道归一化的公式如下: 悦39]
( 4 )
[0240] 公式(少中,=max,,(C〇,y,z,/7)) ,x,y,z,n是元素C在空间 咕XWmXLXNm中的坐标,表示在深度神经网络的所有通道上与元素C位于同一位 置处的最大值(该里是W第二给定值是最大值为例)。且公式(4)中,C(x,y,z,n)可W是 公式(3)中的C(A',.r,z,")。
[0241] 公式(4)即表示,对深度特征中包括的每个元素,在根据公式(3)得到单通道归一 化结果后,可W继续将每个元素的单通道归一化结果在所有通道上进行归一化。因为该一 步对于每个元素都是在所有通道上进行归一化,因此该一步得到的结果为元素在多通道上 的归一化结果,本发明实施例中将其称为多通道归一化结果。
[0242] 在获得各个元素的多通道归一化结果后,可W把得到的各个元素的多通道归一化 结果组合起来,例如就是将各个元素的多通道归一化结果首尾拼接起来,构成X个视频帖 的深度特征。
[0243] 本发明实施例中所述的将得到的各个元素的多通道归一化结果组合起来,可W是 指每个元素的多通道归一化结果进行简单拼接,例如,如果将每个多通道归一化结果看做 一个向量,那么将两个向量首尾相连构成一个向量,就可W看做是将两个多通道归一化结 果进行组合。
[0244] 步骤103 ;确定组成每条运动轨迹的像素点在X个视频帖中的相应位置,并从深度 特征中获取每个位置的子深度信息,根据每个位置的子深度信息得到轨迹深度特征向量; 轨迹深度特征向量用于表征N条运动轨迹在X个视频帖中的深度信息。
[0245] 可选的,本发明实施例中,从深度特征中获取每个位置的子深度信息,包括:
[0246] 从归一化后的深度特征中获取每个位置的子深度信息。
[0247] 本发明实施例中,在步骤101中获得了N个运动像素点的运动轨迹,W及在步 骤102中获得了X个视频帖的归一化后的深度特征,则可W进一步获得X个视频帖对应 的运动向量,本发明实施例中,将该样获得的运动向量也称为TDD(Trajecto巧-poo1ed Deep-convolutionalDescriptor,轨道层深度卷机码描述符),即如前所述的轨迹深度特 征向量。
[0248] 具体的,在做完第二步多通道归一化之后,沿每个运动轨迹在每个视频帖中的位 置,使用如下公式对深度特征进行编码: 悦例
(5)
[0250] 例如本发明实施例中用T(V)表示任意一条运动轨迹,公式巧)中,X;;,y;;,是T(V)中第P个位置的坐标,r。是第m层的深度特征相对于输入的比率(即中的mapsize ratio的值),巧.是四舍五入操作,本发明实施例把公(7;,(?:;)称为TDD。其中,Tk表示第k 个运动像素点的运动轨迹,旬可W认为是第m层的深度特征,其中的a即为公式(2)中的S或t。
[0巧1] 每个运动轨迹都是由相应的运动像素点与多个视频帖的交点(即相应的运动像 素点在视频帖中的许多相应位置)构成的,那么可W分别确定出每个运动轨迹在X个视频 帖中的位置,对于其中的每个位置,分别在归一化后的深度特征中确定该位置对应的深度 信息(本发明实施例中将其称为子深度信息),最后,沿每个运动轨迹中每个位置对应的子 深度信息进行编码,就构成了轨迹深度特征向量。该就是公式巧)的含义。
[0巧2]另外,如前面介绍的,例如对于一个运动轨迹A来说,可能是在X个视频帖上都有 相应位置,即与X个视频帖中的每个视频帖都有交点,或者也可能只在X个视频帖中的部分 视频帖上有相应位置,即只与X个视频帖中的部分视频帖有交点。那么,在确定运动轨迹A 对应的每个位置的子深度信息时,若运动轨迹A与X个视频帖都有交点,那么就是根据公式 (5)确定X个视频帖中与运动轨迹A相应的X个位置的子深度信息,而,若运动轨迹A只与 X个视频帖中的部分视频帖有交点,那么就是根据公式(5)确定X个视频帖中与运动轨迹A 有交点的P个视频帖中的P个位置的子深度信息,P个位置为与运动轨迹A相应的位置,P 为小于X的正整数,则对于剩余的X-P个视频帖,其中没有与运动轨迹A相应的位置,即运 动轨迹A与剩余的X-P个视频帖没有交点,那么在确定运动轨迹A的深度特征时,也就不考 虑该X-P个视频帖,即,X-P个视频帖中没有与运动轨迹A对应的位置的子深度信息,自然 也就无需采用公式(5)去确定X-P个视频帖中与运动轨迹A对应的位置的子深度信息。 [0253] 需要注意的是,W上描述的方法中,只在每个视频帖的原始尺度上提取了特征,在 实际处理中,也可W把X个视频帖中的每个视频帖缩放到不同尺度上来提取TOD,例如对于 一帖500*500的视频帖,可W分别将其缩放到250*250、120*120等不同的尺度上,该样,对 于X个视频帖,可能在每个尺度上会对应于一个TOD,最后可W把各个尺度对应的TDD进行 组合,W形成X个视频帖对应的TDD。该里对于组合方式并不限定,例如可W是将每个TDD 的首尾相接,或者也可W是其他可能的组合方式。
[0巧4] 在得到TDD之后,可W有多种应用,例如可W利用TDD进行动作识别、视频检索、拷 贝视频检测、视频监控分析等等,本发明对于TDD的具体应用方式不作限制。
[0巧5] 例如,若要利用TDD进行动作识别,那么可W对TDD进行高级编码,再将编码后 得到的特征输入到分类器中。本发明实施例中对于高级编码方式不做限定,例如可W 使用FV(FisherVector,菲西矢量)方式进行高级编码,之后可W把得到的特征输入到SVM(SuppcxrtVectorMachine,支持向量机)中即可完成识别。对TOD进行高级编码、W及 将得到的特征送入分类器的方式,均可参照现有技术,本发明对此不作限制。
[0256] W下结合附图介绍本发明实施例中的装置。
[0257] 请参见图3A,基于同一发明构思,本发明实施例提供一种获取向量的装置,所述装 置可W包括第一获取模块301、第二获取模块302和第=获取模块303。
[0巧引第一获取模块301,用于对视频的X个视频帖按照第一算法进行处理,得到N个像 素点一一对应的N条运动轨迹;其中,一条运动轨迹描述了一个像素点在所述X个视频帖中 位置的变化;所述N个像素点是按照预设规则在所述X个视频帖中选择出来的;
[0巧9] 第二获取模块302,用于采用预设的深度神经网络对所述X个视频帖进行处理,得 到所述X个视频帖的深度特征;
[0%0] 第立获取模块303,用于确定组成第一获取模块301得到的每条运动轨迹的像素 点在所述X个视频帖中的相应位置,并从第二获取模块302得到的所述深度特征中获取每 个位置的子深度信息,根据所述每个位置的子深度信息得到轨迹深度特征向量;所述轨迹 深度特征向量用于表征所述N条运动轨迹在所述X个视频帖中的深度信息;其中,X、N为正 整数。
[0261] 可选的,本发明实施例中,当X不小于2时,所述X个视频帖是连续的。
[0%2] 可选的,本发明实施例中,第一获取模块301具体用于:
[0%3] 对于所述X个视频帖中每相邻的两个视频帖,均执行如下操作;获取所述相邻的 两个视频帖对应的第一光流场;所述第一光流场用于表示在所述相邻的两个视频帖中,同 一个像素点的速度矢量;通过中值滤波器对所述第一光流场进行处理,获取第二光流场,所 述第二光流场用于表示,所述相邻的两个视频帖中,前一个视频帖中的像素点在后一个视 频帖中的位置;
[0264] 根据获取的所述X个视频帖中每相邻的两个视频帖之间的第二光流场,获得所述N个像素点对应的所述N条运动轨迹。
[02化]可选的,请参见图3B,本发明实施例中,所述装置还包括处理模块304,处理模块 304用于在第一获取模块301获取所述相邻的两个视频帖对应的第一光流场之前,对所述X 个视频帖中的每个视频帖做如下处理:
[0%6] 在一个视频帖中,将每隔预设数量个普通像素点的一个普通像素点取为目标像素 点,计算获取的所有目标像素点的自相关矩阵;其中,所述普通像素点所述一个视频帖中的 任意一个像素点;
[0%7] 在所述一个视频帖中,丢弃所述自相关矩阵中的特征值小于预设值的元素对应的 普通像素点;
[0268] 第一获取模块301具体用于:
[0269] 根据所述处理模块处理后的X个视频帖,获取所述相邻的两个视频帖对应的所述 第一光流场。
[0270] 可选的,本发明实施例中,第一获取模块301在获取第二光流场之后,还用于对于 所述X个视频帖中每相邻的两个视频帖,均执行如下操作:
[0271] 获取所述相邻的两个视频帖中的至少一组待匹配点对;所述待匹配点对为;所述 相邻的两个视频帖中,前一个视频帖的任意一个像素点和所述运动像素点在相邻的后一 个视频帖中得到的对应点构成的点对;其中,每组待匹配点对中包括一对或多对待匹配点 对;
[0272] 针对所述至少一组待匹配点对中的每组,分别获得一个仿射变换矩阵;
[0273] 通过得到的每一个仿射变换矩阵分别确定每一组待匹配点对中的每一对待匹配 点对是否匹配;
[0274] 将确定出的相匹配的待匹配点对数量最多的仿射变换矩阵确定为与所述相邻的 两个视频帖对应的第一仿射变换矩阵,并通过所述第一仿射变换矩阵,对所述相邻的两个 视频帖中的前一个视频帖作仿射变换,获得所述前一个视频帖中的像素点在所述相邻的两 个视频帖中的后一个视频帖中的实际位置;
[0275] 根据所述第二光流场,W及所述前一个视频帖中的运动像素点在所述后一个视频 帖中的实际位置,获取所述相邻的两个视频帖之间的第=光流场;所述第=光流场用于表 示,所述相邻的两个视频帖中,前一个视频帖中的像素点在后一个视频帖中的实际位置;
[0276] 第一获取模块301具体用于:
[0277] 根据获取的所述X个视频帖中每相邻的两个视频帖之间的第=光流场,获得所述 N个像素点对应的所述N条运动轨迹。
[0278] 可选的,本发明实施例中,第一获取模块301具体用于:
[0279] 根据获得的各像素点的运动轨迹,分别获取其中每个像素点的位移;
[0280] 丢弃其中位移大于预设位移的像素点对应的运动轨迹,获得所述N个像素点对应 的所述N条运动轨迹。
[0281] 可选的,本发明实施例中,第二获取模块302具体用于:
[0282] 将所述X个视频帖、W及第一获取模块301获取的所述X个视频帖对应的第=光 流场输入到所述深度神经网络中;
[0283] 获取所述深度神经网络输出的所述X个视频帖对应的所述深度特征。
[0284] 可选的,请继续参见图3B,本发明实施例中,所述装置还包括归一化模块305,归 一化模块305用于;
[0285] 在第二获取模块302获取所述深度神经网络输出的、所述X个视频帖对应的所述 深度特征之后,对第二获取模块302获取的所述深度特征进行归一化处理,得到归一化后 的深度特征。
[0286] 可选的,本发明实施例中,归一化模块305具体用于:
[0287] 对第二获取模块302获取的所述深度特征中包括的每个元素,分别在所述深度神 经网络中该元素所在的通道上进行归一化,得到每个元素的单通道归一化结果;
[028引将每个元素的单通道归一化结果分别在所述深度神经网络中的所有通道上进行 归一化,得到每个元素的多通道归一化结果;
[0289] 根据每个元素的多通道归一化结果得到所述归一化后的深度特征。
[0290] 可选的,本发明实施例中,
[0291] 归一化模块305具体用于;
[0292] 对第二获取模块302获取的所述深度特征中包括的每个元素,分别除W该元素在 所述深度神经网络中该元素所在的通道内的第一给定值,得到每个元素的单通道归一化结 果;
[0293] 将每个元素的单通道归一化结果分别除W所述深度神经网络中的所有通道内与 该元素位于同一位置的元素对应的第二给定值,得到每个元素的多通道归一化结果。
[0294] 可选的,本发明实施例中,第S获取模块303具体用于:
[0295] 从归一化模块305根据第二获取模块302得到的所述深度特征得到的归一化后的 深度特征中获取所述每个位置的子深度信息。
[0296] 请参见图4,基于同一发明构思,本发明实施例提供另一种获取向量的装置,所述 装置可W包括存储器401,W及与存储器401相连的处理器402。
[0297] 存储器401,用于存储处理器402执行任务所需的指令;
[029引处理器402,用于执行存储器401存储的指令,对视频的X个视频帖按照第一算法 进行处理,得到N个像素点一一对应的N条运动轨迹;其中,一条运动轨迹描述了一个运动 像素点在所述X个视频帖中位置的变化;所述N个运动像素点是按照预设规则在所述X个 视频帖中选择出来的;采用预设的深度神经网络对所述X个视频帖进行处理,得到所述X个 视频帖的深度特征;W及,确定组成每条运动轨迹的像素点在视频帖中的位置,并从所述深 度特征中获取每个位置的子深度信息,根据所述每个位置的子深度信息得到轨迹深度特征 向量;所述轨迹深度特征向量用于表征所述N条运动轨迹在所述X个视频帖中的深度信息; 其中,X、N为正整数。
[0299] 可选的,本发明实施例中,当X不小于2时,所述X个视频帖是连续的。
[0300] 可选的,本发明实施例中,处理器402具体用于:
[0301] 对于所述X个视频帖中每相邻的两个视频帖,均执行如下操作;获取所述相邻的 两个视频帖对应的第一光流场;所述第一光流场用于表示在所述相邻的两个视频帖中,同 一个运动像素点的速度矢量;通过中值滤波器对所述第一光流场进行处理,获取第二光流 场,所述第二光流场用于表示,所述相邻的两个视频帖中,前一个视频帖中的像素点在后一 个视频帖中的位置;
[0302] 根据获取的所述X个视频帖中每相邻的两个视频帖之间的第二光流场,获得所述 N个像素点对应的所述N条运动轨迹。
[0303] 可选的,本发明实施例中,
[0304] 处理器402在获取所述相邻的两个视频帖对应的第一光流场之前,还用于对所述 X个视频帖中的每个视频帖做如下处理:在一个视频帖中,将每隔预设数量个普通像素点 的一个普通像素点取为目标像素点,计算获取的所有目标像素点的自相关矩阵;其中,所述 普通像素点为所述一个视频帖中的任意一个像素点;在所述一个视频帖中,丢弃所述自相 关矩阵中的特征值小于预设值的元素对应的普通像素点;
[03化]处理器402具体用于;根据处理后的X个视频帖,获取所述相邻的两个视频帖对应 的所述第一光流场。
[0306] 可选的,本发明实施例中,处理器402在获取第二光流场之后,还用于:对于所述X 个视频帖中每相邻的两个视频帖,均执行如下操作:
[0307] 获取所述相邻的两个视频帖中的至少一组待匹配点对;所述待匹配点对为;所述 相邻的两个视频帖中,前一个视频帖的任意一个像素点和所述任意一个像素点在相邻的后 一个视频帖中得到的对应点构成的点对;其中,每组待匹配点对中包括一对或多对待匹配 点对;
[0308] 针对所述至少一组待匹配点对中的每组,分别获得一个仿射变换矩阵;
[0309] 通过得到的每一个仿射变换矩阵分别确定每一组待匹配点对中的每一对待匹配 点对是否匹配;
[0310] 将确定出的相匹配的待匹配点对数量最多的仿射变换矩阵确定为与所述相邻的 两个视频帖对应的第一仿射变换矩阵,并通过所述第一仿射变换矩阵,对所述相邻的两个 视频帖中的前一个视频帖作仿射变换,获得所述前一个视频帖中的像素点在所述相邻的两 个视频帖中的后一个视频帖中的实际位置;
[0311] 根据所述第二光流场,W及所述前一个视频帖中的像素点在所述后一个视频帖中 的实际位置,获取所述相邻的两个视频帖之间的第=光流场;所述第=光流场用于表示,所 述相邻的两个视频帖中,前一个视频帖中的像素点在后一个视频帖中的实际位置;
[0312] 处理器402具体用于;
[0313] 根据获取的所述X个视频帖中每相邻的两个视频帖之间的第=光流场,获得所述 N个像素点对应的所述N条运动轨迹。
[0314] 可选的,本发明实施例中,处理器402具体用于:
[0315] 根据获得的各像素点的运动轨迹,分别获取其中每个像素点的位移;
[0316] 丢弃其中位移大于预设位移的像素点对应的运动轨迹,获得所述N个像素点对应 的所述N条运动轨迹。
[0317] 可选的,本发明实施例中,处理器402具体用于:
[0318] 将所述X个视频帖、W及所述X个视频帖对应的第=光流场输入到所述深度神经 网络中;
[0319] 获取所述深度神经网络输出的所述X个视频帖对应的所述深度特征。
[0320] 可选的,本发明实施例中,处理器402在获取所述深度神经网络输出的所述X个视 频帖对应的所述深度特征之后,还用于:
[0321] 对所述深度特征进行归一化处理,得到归一化后的深度特征。
[0322] 可选的,本发明实施例中,处理器402具体用于:
[0323] 对所述深度特征中包括的每个元素,分别在所述深度神经网络中该元素所在的通 道上进行归一化,得到每个元素的单通道归一化结果;
[0324] 将每个元素的单通道归一化结果分别在所述深度神经网络中的所有通道上进行 归一化,得到每个元素的多通道归一化结果;
[03巧]根据每个元素的多通道归一化结果得到所述归一化后的深度特征。
[0326] 可选的,本发明实施例中,处理器402具体用于:
[0327] 对所述深度特征中包括的每个元素,分别除W该元素在所述深度神经网络中该元 素所在的通道内的第一给定值,得到每个元素的单通道归一化结果;
[0328] 将每个元素的单通道归一化结果分别除W所述深度神经网络中的所有通道内与 该元素位于同一位置的元素对应的第二给定值,得到每个元素的多通道归一化结果。
[0329] 可选的,本发明实施例中,处理器402具体用于:
[0330] 从所述归一化后的深度特征中获取所述每个位置的子深度信息。
[0331] 本发明实施例中,可W获取X个视频帖中的像素点对应的运动轨迹,W及通过深 度神经网络获取X个视频帖的深度特征,从而根据运动轨迹和深度特征获得X个视频帖对 应的轨迹深度特征向量(因为轨迹深度特征向量是视频中的运动物体对应的,因此也可W 称为运动向量),该轨迹深度特征向量可W用于表示视频中的运动物体的轨迹W及轨迹上 的每个点对应的深度信息,即,本发明实施例提供了一种较好地获取视频中的运动向量的 方式。
[0332] 本发明实施例中,视频帖的深度特征是通过深度神经网络获取的,因此准确度较 高,且本发明实施例中的深度神经网络只需要获取深度特征,而无需对所有视频帖从头进 行识别,因此本发明实施例中的深度神经网络在进行训练时的训练方式较为简单,也无需 大量的复杂样本进行训练,减少了训练深度神经网络所带来的工作量。本发明实施例中的 轨迹深度特征向量既可W体现出像素点的运动轨迹,也可W体现出像素点在每个位置时的 深度信息,从而便于后续对轨迹深度特征向量加W利用。
[0333] 所属领域的技术人员可W清楚地了解到,为描述的方便和简洁,仅W上述各功能 单元的划分进行举例说明,实际应用中,可W根据需要而将上述功能分配由不同的功能单 元完成,即将装置的内部结构划分成不同的功能单元,W完成W上描述的全部或者部分功 能。上述描述的系统,装置和单元的具体工作过程,可W参考前述方法实施例中的对应过 程,在此不再寶述。
[0334] 在本申请所提供的几个实施例中,应该理解到,所揭露的系统,装置和方法,可W 通过其它的方式实现。例如,W上所描述的装置实施例仅仅是示意性的,例如,所述单元或 单元的划分,仅仅为一种逻辑功能划分,实际实现时可W有另外的划分方式,例如多个单元 或组件可W结合或者可W集成 到另一个系统,或一些特征可W忽略,或不执行。另一点,所 显示或讨论的相互之间的禪合或直接禪合或通信连接可W是通过一些接口,装置或单元的 间接禪合或通信连接,可W是电性,机械或其它的形式。
[03巧]所述作为分离部件说明的单元可W是或者也可W不是物理上分开的,作为单元显 示的部件可W是或者也可W不是物理单元,即可W位于一个地方,或者也可W分布到多个 网络单元上。可W根据实际的需要选择其中的部分或者全部单元来实现本实施例方案的目 的。
[0336] 另外,在本申请各个实施例中的各功能单元可W集成在一个处理单元中,也可W 是各个单元单独物理存在,也可W两个或两个W上单元集成在一个单元中。上述集成的单 元既可W采用硬件的形式实现,也可W采用软件功能单元的形式实现。
[0337] 所述集成的单元如果W软件功能单元的形式实现并作为独立的产品销售或使用 时,可W存储在一个计算机可读取存储介质中。基于该样的理解,本申请的技术方案本质 上或者说对现有技术做出贡献的部分或者该技术方案的全部或部分可软件产品的形 式体现出来,该计算机软件产品存储在一个存储介质中,包括若干指令用W使得一台计算 机设备(可W是个人计算机,服务器,或者网络设备等)或processor(处理器)执行本 申请各个实施例所述方法的全部或部分步骤。而前述的存储介质包括;U盘、移动硬盘、 ROM巧ead-OnlyMemoir,只读存储器)、RAM巧andomAccessMemoir,随机存取存储器)、磁 碟或者光盘等各种可W存储程序代码的介质。
[0338] W上所述,W上实施例仅用W对本申请的技术方案进行了详细介绍,但W上实施 例的说明只是用于帮助理解本发明的方法及其核屯、思想,不应理解为对本发明的限制。本 技术领域的技术人员在本发明揭露的技术范围内,可轻易想到的变化或替换,都应涵盖在 本发明的保护范围之内。
【主权项】
1. 一种获取向量的方法,其特征在于,包括以下步骤: 对视频的X个视频帧按照第一算法进行处理,得到N个像素点一一对应的N条运动轨 迹;其中,一条运动轨迹描述了一个像素点在所述X个视频帧中位置的变化;所述N个像素 点是按照预设规则在所述X个视频帧中选择出来的; 采用预设的深度神经网络对所述X个视频帧进行处理,得到所述X个视频帧的深度特 征; 确定组成每条运动轨迹的像素点在所述X个视频帧中的位置,并从所述深度特征中获 取每个位置的子深度信息,根据所述每个位置的子深度信息得到轨迹深度特征向量;所述 轨迹深度特征向量用于表征所述N条运动轨迹在所述X个视频帧中的深度信息; 其中,X、N为正整数。2. 如权利要求1所述的方法,其特征在于,当X不小于2时,所述X个视频帧是连续的。3. 如权利要求1或2所述的方法,其特征在于,所述对视频的X个视频帧按照第一算法 进行处理,得到N个像素点 对应的N条运动轨迹,包括: 对于所述X个视频帧中每相邻的两个视频帧,均执行如下操作:获取所述相邻的两个 视频帧对应的第一光流场;所述第一光流场用于表示在所述相邻的两个视频帧中,同一个 像素点的速度矢量;通过中值滤波器对所述第一光流场进行处理,获取第二光流场,所述第 二光流场用于表示,所述相邻的两个视频帧中,前一个视频帧中的像素点在后一个视频帧 中的位置; 根据获取的所述X个视频帧中每相邻的两个视频帧之间的第二光流场,获得所述N个 像素点对应的所述N条运动轨迹。4. 如权利要求3所述的方法,其特征在于, 所述在获取所述相邻的两个视频帧对应的第一光流场之前,所述方法还包括: 对所述X个视频帧中的每个视频帧做如下处理: 在一个视频帧中,将每隔预设数量个普通像素点的一个普通像素点取为目标像素点, 计算获取的所有目标像素点的自相关矩阵;其中,所述普通像素点为所述一个视频帧中的 任意一个像素点; 在所述一个视频帧中,丢弃所述自相关矩阵中的特征值小于预设值的元素对应的普通 像素点; 所述获取所述相邻的两个视频帧对应的第一光流场,包括: 根据处理后的X个视频帧,获取所述相邻的两个视频帧对应的所述第一光流场。5. 如权利要求3或4所述的方法,其特征在于, 在所述获取第二光流场之后,所述方法还包括:对于所述X个视频帧中每相邻的两个 视频帧,均执行如下操作: 获取所述相邻的两个视频帧中的至少一组待匹配点对;所述待匹配点对为:所述相邻 的两个视频帧中,前一个视频帧的任意一个像素点和所述任意一个像素点在相邻的后一 个视频帧中得到的对应点构成的点对;其中,每组待匹配点对中包括一对或多对待匹配点 对; 针对所述至少一组待匹配点对中的每组,分别获得一个仿射变换矩阵; 通过得到的每一个仿射变换矩阵分别确定每一组待匹配点对中的每一对待匹配点对 是否匹配; 将确定出的相匹配的待匹配点对数量最多的仿射变换矩阵确定为与所述相邻的两个 视频帧对应的第一仿射变换矩阵,并通过所述第一仿射变换矩阵,对所述相邻的两个视频 帧中的前一个视频帧作仿射变换,获得所述前一个视频帧中的像素点在所述相邻的两个视 频帧中的后一个视频帧中的实际位置; 根据所述第二光流场,以及所述前一个视频帧中的像素点在所述后一个视频帧中的实 际位置,获取所述相邻的两个视频帧之间的第三光流场;所述第三光流场用于表示,所述相 邻的两个视频帧中,前一个视频帧中的像素点在后一个视频帧中的实际位置; 所述根据获取的所述X个视频帧中每相邻的两个视频帧之间的第二光流场,获得所述 N个像素点对应的所述N条运动轨迹,包括: 根据获取的所述X个视频帧中每相邻的两个视频帧之间的第三光流场,获得所述N个 像素点对应的所述N条运动轨迹。6. 如权利要求5所述的方法,其特征在于,所述获得所述N个像素点对应的所述N条运 动轨迹,包括: 根据获得的各像素点的运动轨迹,分别获取其中每个像素点的位移; 丢弃其中位移大于预设位移的像素点对应的运动轨迹,获得所述N个像素点对应的所 述N条运动轨迹。7. 如权利要求6所述的方法,其特征在于,所述采用预设的深度神经网络对所述X个视 频帧处理,得到所述X个视频帧的深度特征,包括: 将所述X个视频帧、以及所述X个视频帧对应的第三光流场输入到所述深度神经网络 中; 获取所述深度神经网络输出的所述X个视频帧对应的所述深度特征。8. 如权利要求7所述的方法,其特征在于,在所述获取所述深度神经网络输出的所述X 个视频帧对应的所述深度特征之后,还包括: 对所述深度特征进行归一化处理,得到归一化后的深度特征。9. 如权利要求8所述的方法,其特征在于,所述对所述深度特征进行归一化处理,得到 归一化后的深度特征,包括: 对所述深度特征中包括的每个元素,分别在所述深度神经网络中该元素所在的通道上 进行归一化,得到每个元素的单通道归一化结果; 将每个元素的单通道归一化结果分别在所述深度神经网络中的所有通道上进行归一 化,得到每个元素的多通道归一化结果; 根据每个元素的多通道归一化结果得到所述归一化后的深度特征。10. 如权利要求9所述的方法,其特征在于, 所述对所述深度特征中包括的每个元素,分别在所述深度神经网络中该元素所在的通 道上进行归一化,得到每个元素的单通道归一化结果,包括: 对所述深度特征中包括的每个元素,分别除以该元素在所述深度神经网络中该元素所 在的通道内的第一给定值,得到每个元素的单通道归一化结果; 所述将每个元素的单通道归一化结果分别在所述深度神经网络中的所有通道上进行 归一化,得到每个元素的多通道归一化结果,包括: 将每个元素的单通道归一化结果分别除以所述深度神经网络中的所有通道内与该元 素位于同一位置的元素对应的第二给定值,得到每个元素的多通道归一化结果。11.如权利要求8-10任一所述的方法,其特征在于,所述从所述深度特征中获取所述 每个位置的子深度信息,包括: 从所述归一化后的深度特征中获取所述每个位置的子深度信息。12. -种获取向量的装置,其特征在于,包括: 第一获取模块,用于对视频的X个视频帧按照第一算法进行处理,得到N个像素点一一 对应的N条运动轨迹;其中,一条运动轨迹描述了一个像素点在所述X个视频帧中位置的变 化;所述N个像素点是按照预设规则在所述X个视频帧中选择出来的; 第二获取模块,用于采用预设的深度神经网络对所述X个视频帧进行处理,得到所述X 个视频帧的深度特征; 第三获取模块,用于确定组成所述第一获取模块得到的每条运动轨迹的像素点在所述 X个视频帧中的位置,并从所述第二获取模块得到的所述深度特征中获取每个位置的子深 度信息,根据所述每个位置的子深度信息得到轨迹深度特征向量;所述轨迹深度特征向量 用于表征所述N条运动轨迹在所述X个视频帧中的深度信息; 其中,X、N为正整数。13.如权利要求12所述的装置,其特征在于,当X不小于2时,所述X个视频帧是连续 的。14.如权利要求12或13所述的装置,其特征在于,所述第一获取模块具体用于: 对于所述X个视频帧中每相邻的两个视频帧,均执行如下操作:获取所述相邻的两个 视频帧对应的第一光流场;所述第一光流场用于表示在所述相邻的两个视频帧中,同一个 像素点的速度矢量;通过中值滤波器对所述第一光流场进行处理,获取第二光流场,所述第 二光流场用于表示,所述相邻的两个视频帧中,前一个视频帧中的像素点在后一个视频帧 中的位置; 根据获取的所述X个视频帧中每相邻的两个视频帧之间的第二光流场,获得所述N个 像素点对应的所述N条运动轨迹。15.如权利要求14所述的装置,其特征在于,所述装置还包括处理模块; 所述处理模块用于在所述第一获取模块获取所述相邻的两个视频帧对应的第一光流 场之前,对所述X个视频帧中的每个视频帧做如下处理: 在一个视频帧中,将每隔预设数量个普通像素点的一个普通像素点取为目标像素点, 计算获取的所有目标像素点的自相关矩阵;其中,所述普通像素点所述一个视频帧中的任 意一个像素点; 在所述一个视频帧中,丢弃所述自相关矩阵中的特征值小于预设值的元素对应的普通 像素点; 所述第一获取模块具体用于: 根据所述处理模块处理后的X个视频帧,获取所述相邻的两个视频帧对应的所述第一 光流场。16.如权利要求14或15所述的装置,其特征在于,所述第一获取模块在获取第二光流 场之后,还用于对于所述X个视频帧中每相邻的两个视频帧,均执行如下操作: 获取所述相邻的两个视频帧中的至少一组待匹配点对;所述待匹配点对为:所述相邻 的两个视频帧中,前一个视频帧的任意一个像素点和所述像素点在相邻的后一个视频帧中 得到的对应点构成的点对;其中,每组待匹配点对中包括一对或多对待匹配点对; 针对所述至少一组待匹配点对中的每组,分别获得一个仿射变换矩阵; 通过得到的每一个仿射变换矩阵分别确定每一组待匹配点对中的每一对待匹配点对 是否匹配; 将确定出的相匹配的待匹配点对数量最多的仿射变换矩阵确定为与所述相邻的两个 视频帧对应的第一仿射变换矩阵,并通过所述第一仿射变换矩阵,对所述相邻的两个视频 帧中的前一个视频帧作仿射变换,获得所述前一个视频帧中的像素点在所述相邻的两个视 频帧中的后一个视频帧中的实际位置; 根据所述第二光流场,以及所述前一个视频帧中的像素点在所述后一个视频帧中的实 际位置,获取所述相邻的两个视频帧之间的第三光流场;所述第三光流场用于表示,所述相 邻的两个视频帧中,前一个视频帧中的像素点在后一个视频帧中的实际位置; 所述第一获取模块具体用于: 根据获取的所述X个视频帧中每相邻的两个视频帧之间的第三光流场,获得所述N个 像素点对应的所述N条运动轨迹。17. 如权利要求16所述的装置,其特征在于,所述第一获取模块具体用于: 根据获得的各像素点的运动轨迹,分别获取其中每个像素点的位移; 丢弃其中位移大于预设位移的像素点对应的运动轨迹,获得所述N个像素点对应的所 述N条运动轨迹。18. 如权利要求17所述的装置,其特征在于,所述第二获取模块具体用于: 将所述X个视频帧、以及所述第一获取模块获取的所述X个视频帧对应的第三光流场 输入到所述深度神经网络中; 获取所述深度神经网络输出的所述X个视频帧对应的所述深度特征。19. 如权利要求18所述的装置,其特征在于,所述装置还包括归一化模块,所述归一化 模块用于: 在所述第二获取模块获取所述深度神经网络输出的、所述X个视频帧对应的所述深度 特征之后,对所述第二获取模块获取的所述深度特征进行归一化处理,得到归一化后的深 度特征。20. 如权利要求19所述的装置,其特征在于,所述归一化模块具体用于: 对所述第二获取模块获取的所述深度特征中包括的每个元素,分别在所述深度神经网 络中该元素所在的通道上进行归一化,得到每个元素的单通道归一化结果; 将每个元素的单通道归一化结果分别在所述深度神经网络中的所有通道上进行归一 化,得到每个元素的多通道归一化结果; 根据每个元素的多通道归一化结果得到所述归一化后的深度特征。21. 如权利要求20所述的装置,其特征在于,所述归一化模块具体用于: 对所述第二获取模块获取的所述深度特征中包括的每个元素,分别除以该元素在所述 深度神经网络中该元素所在的通道内的第一给定值,得到每个元素的单通道归一化结果; 将每个元素的单通道归一化结果分别除以所述深度神经网络中的所有通道内与该元 素位于同一位置的元素对应的第二给定值,得到每个元素的多通道归一化结果。22.如权利要求19-21任一所述的装置,其特征在于,所述第三获取模块具体用于: 从所述归一化模块根据所述第二获取模块得到的所述深度特征得到的所述归一化后 的深度特征中获取所述每个位置的子深度信息。
【专利摘要】本发明公开了一种获取向量的方法,用于提供一种获取视频中的运动向量的方式。所述方法包括:对视频的X个视频帧按照第一算法进行处理,得到N个像素点一一对应的N条运动轨迹;其中,一条运动轨迹描述了一个像素点在X个视频帧中位置的变化;N个像素点是按照预设规则在X个视频帧中选择出来的;采用预设的深度神经网络对X个视频帧进行处理,得到X个视频帧的深度特征;确定组成每条运动轨迹的像素点在X个视频帧中的位置,并从深度特征中获取每个位置的子深度信息,根据每个位置的子深度信息得到轨迹深度特征向量,轨迹深度特征向量用于表征N条运动轨迹在X个视频帧中的深度信息。本发明还公开了相应的装置。
【IPC分类】G06N3/02, G06K9/00
【公开号】CN104881640
【申请号】CN201510249856
【发明人】王利民, 乔宇, 鞠汶奇, 刘健庄, 汤晓鸥
【申请人】华为技术有限公司
【公开日】2015年9月2日
【申请日】2015年5月15日
转载请注明原文地址:https://www.famiwei.com/read-8138436.html

最新回复(0)