一种单幅图像行人检测方法

xiaoxiao2020-10-23  12

一种单幅图像行人检测方法
【技术领域】
[0001] 本发明属于计算机视觉和图像处理技术领域,特别的设及单幅图像的行人检测方 法。
【背景技术】
[0002] 行人检测是计算机视觉技术中的热点和难点,可理解为判断输入图像是否包含行 人,如果包含行人,则给出行人的位置信息,近年来,行人检测技术在人体行为分析、视频监 控、车辆辅助驾驶及灾难营救等领域发挥了作用。
[0003] 行人检测技术中最为核屯、的问题可W归结为特征提取,分类和定位=个方面。现 有技术中对该=个方面的研究可归结为两类;基于背景建模的方法和基于统计学习的方 法,都取得了一定的成果,然而基于背景建模的方法鲁椿性不高,抗干扰能力较差,而基于 统计学习的方法受训练样本的影响较大,且应对真实场景的能力不够。
[0004] 为克服现有技术的上述不足之处,本发明提出了一种多层次的基于快速和精细行 人检测器的行人检测方法,利用梯度幅值特征和线性支持向量机,训练得到粗的行人检测 器,实现非行人窗口的快速过滤,在快速过滤的结果上,利用加速的窗口扫描方法,得到更 为精确的窗口正例样本的反例样本,W此训练得到作为精细检测器的自动编码机,基于层 叠的自动编码机,区分行人和非行人窗口,实现对输入图像的行人检测,本发明提供的多层 次的基于训练实现的行人检测方法具有更好的鲁椿性,能够快速且准确的实现图像中行人 的检测。

【发明内容】

[0005] 在本发明要解决的问题是提供一种单幅图像行人检测方法,W解决现有技术中行 人检测易受环境影响,不够准确的缺陷。
[0006] 为了实现W上目的,本发明提供了一种单幅图像行人检测方法,其特征在于: (1) 数据准备,设置行人数据集和背景数据集; (2) 训练快速行人检测器; (3) 利用快速行人检测器进行快速行人检测与行人样本提取; (4) 利用快速检测结果训练精细行人检测器; (5) 利用训练得到的快速行人检测器和精细行人检测器对输入图像进行行人检测。
[0007] 优选的,其中步骤(1)具体为: (1.1) 设置行人数据集并标记人体矩形框; (1.2) 设置背景数据集。
[0008] 优选的,其中步骤(1.1)具体为: 义集M幅图像组成行人数据集,记为/=L./j,/y.../j,....1/,图 像馬上包含有禹个行人样本,A; > 1,标记图像/;:上第j个行人样本的位置为: Z,U,,r.rj,其中|,v,_r.)为矩形框左上顶点坐标,r为矩形框宽度,A为矩 形框长度,所述矩形框为表示完全包含该行人样本轮廓的人体矩形框,采集的每幅图像的 宽均大于20像素,高均大于50像素。
[0009] 优选的,其中步骤(1. 2)具体为: 采集N幅不包含行人的图像组成背景数据集,记为:浸,,皮。
[0010] 优选的,其中步骤(2)具体为: (2. 1)利用行人数据集获取正例样本的特征表示; (2. 2)利用背景数据集获取反例样本的特征表示; (2. 3)利用W上获取的正例样本和反例样本的特征表示训练线性分类器作为快速行人 检测器。
[0011] 优选的,其中步骤化1)具体为: (2. 1. 1)对行人数据集I中的每一幅图像i;,根据图像上每个人体矩形框的位置,经过 截取,获得对应的人体子图像,行人数据集I中所有图像的所有人体子图像构成了正例样 本; (2. 1. 2)将截取的正例人体子图像转换为对应的人体灰度子图像,经过归一化处理得 至IJ10*25像素大小的标准人体灰度子图像; (2. 1. 3)计算该10*25像素大小的标准人体灰度子图像的梯度幅值特征Fe公将 该特征拉直,该拉直后的梯度幅值特征为一个250维的列向量; (2. 1.4)将所有正例样本的特征记为:巧,朽.f 其中
巧表示第i幅图像的第j个人体矩形框的拉直梯度幅值特征。
[0012] 优选的,其中步骤化2)具体为: (2. 2. 1)在训练集B中的图像上,选择宽高比例为10:25的背景矩形框共10T个,经过 截取,获得对应的背景子图像,则该10T个背景子图像构成了反例样本; (2. 2. 2)将截取的反例背景子图像转换为对应的背景灰度子图像,经过归一化处理得 至IJ10*25像素大小的标准背景灰度子图像; (2. 2. 3)计算该10*25像素大小的标准背景灰度子图像的梯度幅值特征/应,将 该特征拉直,该拉直后的梯度幅值特征为一个250维的列向量; (2. 2. 4)将所有反例样本的特征记为: ;/:. £,.....如]& 其中表示第a个反例样本的拉直梯度幅值特征。
[0013] 优选的,其中步骤化3)具体为: (2. 3. 1)将所有正例样本的标签设置为1,反例样本的标签设置为0,训练一个二类线 性分类的SVM,得到判别投影W6 5^4; (2. 3. 2)设置得分函数J:::::々:切'知酱》=r;' *ir,其中g表示任意10*25大小的灰度图 像样本经过拉直后的梯度幅值特征,该拉直后的梯度幅值特征是一个250维的列向量; (2. 3. 3)计算每个正例样本的标准人体灰度子图像的得分函数值,进行排序,设置检测 阔值ff,使得该阔值大于99%的正例样本的标准人体灰度子图像的得分函数值。
[0014] 优选的,其中步骤(3)具体为: (3. 1)将行人训练集I中的每幅图像进行灰度处理,得到灰度图像,对其进行高斯金字 塔处理,缩放比例为1. 日' < 化巧> 1,直到最小尺寸的灰度图像的 宽大于10个像素且高大于25个像素; (3. 2)将上述D+1个尺度作为主尺度,计算每个主尺度灰幅图像的梯度幅值特征图像; (3. 3)通过双=次Bi-化bic插值在每两个相邻主尺度之间获得中间尺度的梯度幅值 特征图像; (3. 4)在所有尺度的梯度幅值特征图像上进行窗口扫描,窗口大小为10*25像素,水平 和垂直方向的步长都是1; (3. 5)对扫描得到的每个10*25像素大小的梯度幅值特征窗口,将其拉直为一个250维 的列向量,计算其得分函数值; (3. 6)对得分函数值大于检测阔值^的窗口,W该窗口所在的比例为的梯度幅值 特征图像的比例倒数2 =缩放该图像,并W该窗口在该尺度的梯度幅值特征图像上的相对位 置进行还原,还原得到该窗口在行人训练集I中的对应图像的灰度图像上的相对位置,该 灰度图像的尺度为1,该位置为一个宽高比为10:25的矩形框; (3. 7)计算还原得到的每个矩形框与行人训练集I中对应图像上的所有人体矩形框之 间的重合度,重合度具体计算方法为
,即该两个矩形框.1. 的面积重合 部分除W两个矩形框的平均面积; (3. 8)将与对应图像上的所有人体矩形框之间的重合度都低于0. 5的矩形框作为反 例,将与所有人体矩形框中任意一个的重合度大于0. 8的矩形框作为正例。
[0015] 优选的,其中步骤化3)具体为:在相邻的两个主尺度之间等间隔的插入四个中 间尺度,上述四个尺度由距离其最近的主尺度的梯度幅值特征图像插值得到。
[0016] 优选的,其中在相邻的两个主尺度之间等间隔的插入四个中间尺度具体为;在1-^ 尺度图像和^,尺度图像之间等间隔的插入四个中间尺度,则每个中间尺度可W表示为:
其申巧表示.1.尺度图像和^尺 -,- I.]二-- 度图像之间第q个中间尺度的缩放比例。
[0017] 优选的,其中步骤(4)具体为: (4. 1)对步骤3. 8中得到的正例矩形框和反例矩形框,统一缩放为10*25像素大小的灰 度图像,组成精细行人检测器的训练样本集合,记为Z= [?,,%.],其中正 例矩形框有C个,反例矩形框有V个,r>Lr> '!; (4. 2)设置一个包含=个隐层的自动编码机作为精细行人检测器; (4. 3)逐层进行预训练Pre-Train; (4. 4)进行微调Fine-tune,将正例样本的输出设置为1,反例样本的输出设置为 0,利用BP算法对层级编码机S个隐层的参数ff-,,r:.N':,W及sofwmax层的参数fi,;进行 Fine-tune,W此训练得到具有上述参数的自动编码机作为精细行人检测器。
[0018] 优选的,其中步骤(4. 3)具体为: (4.3. 1)基于去噪自动编码机De-noisingAutoEncoder!^无监督的方式训练神经网 络的第一层,将其输出作为原始输入的最小化重构误差; (4. 3. 2)将每个隐含层的输出作为下一层神经网络的输入,进行无监督训练; (4. 3. 3)重复步骤4. 3. 2,直到 完成所有隐含层的预训练为止,得到ir,,r;,rs的初始 值; (4. 3. 4)将最后一个隐含层的输出作为softmax层的输入,并且初始化softmax层的参 数。
[0019] 优选的,其中步骤(5)具体为: (5.1)对输入图形E进行灰度图像转换,得到输入灰度图像,对其进行高斯金字塔缩 放,缩放比例为L,f) <。r;试,直到最小的灰度图像的宽大于10 个像素且高大于25个像素,共得到0+1个主尺度,输入图像E的宽大于20像素,高大于50 像素; (5. 2)在该0+1个主尺度灰度图像上分别计算其对应的梯度幅值特征图像; (5. 3)通过Bi-化bic插值在该0+1个主尺度梯度幅值图像的0个间隔中,W等间隔方 式在每个间隔中进行中间尺度插入,每个间隔插入四个中间尺度,共得到0*5+1个尺度的 梯度幅值特征图像,上述四个中间尺度由距离其最近的主尺度的梯度幅值特征图像插值得 到; (5. 4)在每个尺度的梯度幅值特征图像上进行快速窗口扫描,使用10*25大小的窗口 在每个梯度幅值特征图像上扫描,对扫描得到的每个10*25像素大小的梯度幅值特征窗 口,将其拉直为一个250维的列向量,计算其得分函数值; (5. 5)输出大于检测阔值的窗口,W该窗口所在的比例为的梯度幅值特征图像 的比例倒数1T缩放该图像,并W该窗口在该尺度的梯度幅值特征图像上的相对位置进行还 原,还原得到该窗口在输入图像E的灰度图像上的相对位置,该灰度图像的尺度为1,该位 置为一个宽高比为10:25的矩形框; (5. 6)将还原得到的所有该些矩形框缩放为10*25像素大小的灰度窗口图像,输入到 训练得到的作为精细行人检测器的自动编码机进行分类; (5. 7)保留输出层输出的置信度a的f大于0. 5的灰度窗口图像,将其作为候选人体 框; (5. 8)为每个候选人体框标记一个五元组标签.1',4 ?.斯/),分别对应该候选人 体框左上顶点的横坐标,纵坐标,该候选人体框的宽度,高度W及置信度; (5. 9)对该些候选人体框进行聚类,输出人体检测框。
[0020] 优选的,其中步骤(5. 9)具体为: (5. 9. 1)将所有候选人体框按照置信度排序,每个框标记设置为0,形成候选人体框集 合H,设置集合R表示真实候选框集合,初始化R为空集; (5. 9.。在集合肿选择置信度最大的候选人体框,记为露-U-I:,,.1'"》?,.,,為:,-CO巧/::,], 将焉从H中移除,加入集合R后将其标记设置为1; (5. 9. 3)计算H中所有候选人体框和A的重合度,重合度的计算方法为;
即该两个矩形框.'!,4的面积重合部分除W两个矩形框的平均面积; (5. 9. 4)将重合度大于0. 8的候选人体框从H中移除并加入到集合R中,且将该些候选 人体框的标记设置为1,此时集合R中的候选人体框可W记为:《[爲,巧,...馬,...馬.!, 其中A- 山耸?['巧 > 0; (5.9.5)计算3中每个候选人体框的权重,= ^:^对这化1个候选人体框进行 加权融合,输出人体检测框位置记为
(5. 9. 6)判断集合H中是否还有候选人体框,如果没有,结束检测;如果集合H中还有 候选人体框,将集合R清空,在集合H中重复步骤巧.9. 2)-巧.9. 5)。
【附图说明】
[0021] 图1为行人数据集及行人样本标注示例图 图2为不包括行人的背景数据集图片示例 图3为主尺度梯度幅值特征图像和加速的相邻尺度插值实现示意图 图4为快速检测器输出的正例和反例样本示例图 图5为自动编码机结构图 图6为逐层无监督Pre-Train示例图 图7为行人检测流程图。
【具体实施方式】
[0022] 为了使本发明的目的、技术方案和优点更加清楚,下面将结合附图及具体实施例 对本发明做出进一步地详细描述。本发明提出的单幅图像行人检测方法由两部分组成,第 一部分是行人检测器训练,第二部分是行人检测。
[0023] 首先,介绍行人检测器训练部分。
[0024] 步骤1;数据准备,设置行人数据集和背景数据集 1. 1;设置行人数据集并标记人体矩形框 采集M幅图像组成行人数据集,每幅图像的宽均大于20像素,高均大于50像素,记为 ^ U乂i-….^自,…若#-,J' !二…J/,图像上包含有A'j.个行人样本,> 1,标记图像ii. 上第j个行人样本的位置为:/j= ;A.,.r,;r,Aj,其中,J-)为矩形框左上顶点 坐标,?为矩形框宽度,WA为矩形框长度,表示完全包含该行人样本轮廓的人体矩形 框。
[00巧]图1所示为行人数据集及行人样本标注示例图 1. 2;设置背景数据集 采集N幅不包含行人的图像组成背景数据集,记为# :各致与=UV.-.V,图 2所示为不包括行人的背景数据集图片示例 步骤2;训练快速行人检测器 2. 1;利用行人数据集获取正例样本的特征表示,具体为: 2. 1. 1;对行人数据集I中的每一幅图像/,,根据图像上每个人体矩形框的位置,截取 获得对应的人体子图像,行人数据集I中所有图像的所有人体子图像构成了正例样本; 2. 1. 2;将截取的正例人体子图像转换为对应的人体灰度子图像,经过归一化处理得到 10*25像素大小的标准人体灰度子图像; 2. 1. 3;计算该10*25像素大小的标准人体灰度子图像的梯度幅值特征F e及"'-'>,将 该特征拉直为250维的列向量; 2.1.4;将所有正例样本的特征记为:16^;,.#';..#-,,|61;?^,真中7' = |>,,/;表示 第i幅图像的第j个人体矩形框的拉直梯度幅值特征; 2. 2;利用背景数据集获取反例样本的特征表示,具体为: 2. 2. 1;在训练集B中的图像上,选择宽高比例为10:25的背景图像矩形框共10T个,截 取后获得对应的背景子图像,则该10T个背景子图像构成了反例样本; 2. 2. 2;将截取的背景子图像转换为对应的背景灰度子图像,经过归一化处理得到10*25像素大小的标准背景灰度子图像; 2. 2. 3;计算该10*25像素大小的标准背景灰度子图像的梯度幅值特征/E 将 该特征拉直为250维的列向量; 2. 2. 4;将所有反例样本的特征记为:
其中表示第a个反例样本的拉直梯度幅值特 征; 2. 3;训练线性分类器作为快速行人检测器 2. 3. 1;将所有正例样本的标签设置为1,反例样本的标签设置为0,训练一个二类线性 分类的SVM,得到判别投影!r6度39; 2. 3. 2;设置得分函数r =原>〇|'户(是》= *寂,其中g表示任意10*25大小的灰度图 像样本经过拉直后的梯度幅值特征,该拉直后的梯度幅值特征是250维的列向量; 2. 3. 3;计算每个正例样本的标准人体灰度子图像的得分函数值,进行排序,设置检测 阔值C7,使得该阔值大于99%的正例样本的标准人体灰度子图像的得分函数值。
[0026]步骤3;利用快速行人检测器进行快速行人检测与行人样本提取 3. 1;将行人训练集I中的每幅图像进行灰度处理,得到灰度图像,对其进行高斯金字 塔处理,缩放比例为L^'I: , 0 < ,/ <化C3 !,直到最小尺寸的灰度图像 的宽大于10个像素且高大于25个像素,由于每幅图像的宽都大于20像素,高都大于50像 素,因此每图图像至少经过一次缩放,有两个主尺度; 3. 2将上述D+1个尺度作为主尺度,计算每个主尺度灰幅图像的梯度幅值特征图像; 3. 3通过Bi-化bic插值在每两个相邻主尺度之间获得中间尺度的梯度幅值特征图像, 具体为: 3. 3. 1在相邻的两个主尺度之间等间隔的插入四个中间尺度,上述四个尺度可W由距 离其最近的主尺度的梯度幅值特征图像插值得到,可W由距离其最近的相对大尺度的主尺 度下采样得到,或者由距离其最近的相对小尺度的主尺度上采样得到。
[0027] 例如,在尺度图像和;尺度图像之间等间隔的插入四个中间尺度,则每个中 -* ^ 间尺度可W表示为:
爲申表示丄尺度图像和........*........ -.>i -1 尺度图像之间第q个中间尺度的缩放比例,0<<!<〇。
[0028] 图3为主尺度梯度幅值特征图像和加速的相邻尺度插值实现示意图,如图3所示, 在1,1/2, 1/4该=个主尺度之间,存在两个尺度间隔,在每个间隔中分别插入四个中间尺 度,即得到11个尺度的梯度幅值特征图像; 3. 4在所有尺度的梯度幅值特征图像上进行窗口扫描,窗口大小为10*25像素,水平和 垂直方向的步长都是1; 3. 5对扫 描得到的每个10*25像素大小的梯度幅值特征窗口,将其拉直为250维的列向 量,计算其得分函数值; 3. 6对得分函数值大于阔值的窗口,W该窗口所在的比例为> .0引kD的梯度幅 值特征图像的比例倒数2*^缩放该图像,并W该窗口在该尺度的梯度幅值特征图像上的相对 位置进行还原,还原得到该窗口在行人训练集I中的对应图像的灰度图像上的相对位置, 该灰度图像的尺度为1,该位置为一个宽高比为10:25的矩形框; 3. 7计算还原得到的每个矩形框与行人训练集I中其所在的图像上的所有人体矩形框 之间的重合度,重合度具体计算方法为:
即该两个矩形框的面积重合部分 除W两个矩形框的平均面积。
[0029] 将与对应图像上所有人体矩形框之间的重合度都低于0. 5的矩形框作为反例,将 与所有人体矩形框中任意一个的重合度大于0. 8的矩形框作为正例。
[0030] 图4所示为快速检测器输出的正例和反例样本示例图,如图4所示,实线框标注的 是正例,虚线框标注的是反例。
[0031] 步骤4;利用快速检测结果训练精细行人检测器 4. 1对步骤3. 8中得到的正例矩形框和反例矩形框,统一缩放为10*25像素大小的灰度 图像,组成精细行人检测器的训练样本集合,记为-[巧,而,…《,..衣,;,…足,其中正例 矩形框有C个,反例矩形框有V个,t- >Isi- 3 !; 4. 2设置一个包含=个隐层的自动编码机作为精细行人检测器,自动编码器的结构如 图5所示; 4. 3逐层进行预训练Pre-Train 4.3. 1基于无噪声编码机De-noisingAutoEncoder!^无监督的方式训练神经网络的 第一层,将其输出作为原始输入的最小化重构误差,其基本原理见图6所示; 4. 3. 2将每个隐含层的输出作为下一层神经网络的输入,进行无监督训练; 4. 3. 3重复步骤4.3. 2,直到完成所有隐含层的预训练为止,得到IfI,r;,ir:;的初始值. 4. 3. 4将最后一个隐含层的输出作为softmax层的输入,并且初始化softmax层的参数 资;。
[0032]进行微调Fine-tune 将正例样本的输出设置为1,反例样本的输出设置为0,利用BP算法对层级编码机S个 隐层的参数 >自-1,W及softmax层的参数进行Fine-tune。W此训练得到具有上述参 数的自动编码机作为精细行人检测器。
[0033] 下面将介绍行人检测部分: 步骤5;利用训练得到的快速行人检测器和精细行人检测器对输入图像进行行人检 巧。,如图7所示,具体为: 5.1;对输入图形E进行灰度图像转换,得到输入灰度图像,输入图像的宽大于20像素, 高大于50像素,对其进行高斯金字塔缩放,缩放比例为I. ^ …2^,0 ;;A0 ,直到 最小的灰度图像的宽大于10个像素且高大于25个像素,共得到0+1个主尺度; 5. 2;在该0+1个主尺度灰度图像上分别计算其对应的梯度幅值特征图像; 5. 3;通过Bi-化bic插值在该0+1个主尺度梯度幅值图像的0个间隔中,W等间隔方 式在每个间隔中进行中间尺度插入,每个间隔插入四个中间尺度,共得到0*5+1个尺度的 梯度幅值特征图像,上述四个中间尺度由距离其最近的主尺度的梯度幅值特征图像插值得 到; 5. 4;在每个尺度的梯度幅值特征图像上进行快速窗口扫描,使用10*25大小的窗口在 每个梯度幅值特征图像上扫描,对扫描得到的每个10*25像素大小的梯度幅值特征窗口, 将其拉直为250维的列向量,计算其得分函数值; 5. 5;输出大于阔值綠的窗口,W该窗口所在的比例为勺梯度幅值特征图像的比例 - 倒数:T缩放该图像,并W该窗口在该尺度的梯度幅值特征图像上的相对位置进行还原,还 原得到该窗口在输入图像E的灰度图像上的相对位置,该灰度图像的尺度为1,该位置为一 个宽高比为10:25的矩形框; 5. 6;将还原得到的所有该些矩形框缩放为10*25像素大小的灰度窗口图像,输入到训 练得到的作为精细行人检测器的自动编码机进行分类; 5. 7;保留输出层输出的置信度《的/大于0. 5的灰度窗口图像,将其作为候选人体框; 5. 8;为每个候选人体框标记一个五元组标签.r,n',么aw/'),分别对应该候选人体 框左上顶点的横坐标,纵坐标,该候选人体框的宽度,高度W及置信度。
[0034] :对该些候选人体框进行聚类,输出人体检测框,过程具体为: 5. 9. 1将所有候选人体框按照置信度排序,每个框标记设置为0,形成候选人体框集合H,设置集合R表示真实候选框集合,初始化R为空集; 5. 9. 2在集合H中选择置信度最大的候选人体框,记为祭=U-J,..IT,,. 将 馬从H中移除,加入集合R后将其标记设置为1; 5. 9.3计算H中所有候选人体框和J的重合度,重合度的计算方法为:
即该两个矩形框的面积重合部分除W两个矩形框的平均面积; 5. 9. 4将重合度大于0. 8的候选人体框从H中移除并加入到集合R中,且将该些候选人 体框的标记设置为1,此时集合R中的候选人体框可W记为:齊二[心巧,,..憑。,。..4],其 中渾,,=L、,J*,,, £|> 4'>n妍> 0; 5. 9. 5计算R中每个候选人体框的权重,
对该化1个候选人体框进行加 权融合,输出人体检测框位置记为
5. 9. 6判断集合H中是否还有候选人体框,如果没有,结束检测;如果集合H中还有候 选人体框,将集合R清空,在集合H中重复步骤5. 9. 2-5. 9. 5。
[0035] 显然,本领域的技术人员可W对本发明进行各种改动和变形而不脱离本发明的精 神和范围,该样,倘若本发明的该些修改和变形属于本发明权利要求及其等同技术的范围 之内,则本发明也意图包含该些改动和变形在内。
【主权项】
1. 一种单幅图像行人检测方法,其特征在于: (1) 数据准备,设置行人数据集和背景数据集; (2) 训练快速行人检测器; (3) 利用快速行人检测器进行快速行人检测与行人样本提取; (4) 利用快速检测结果训练精细行人检测器; (5) 利用训练得到的快速行人检测器和精细行人检测器对输入图像进行行人检测。2. 如权利要求1所述的方法,其中步骤(1)具体为: (1. 1)设置行人数据集并标记人体矩形框; (1.2)设置背景数据集。3. 如权利要求2所述的方法,其中步骤(I. 1)具体为: 采集M幅图像组成行人数据集,记为/ =;/r/::.……/,Ui = iA…,V,图像./;上包含 有身,个行人样本,4 kl,标记图像A上第j个行人样本的位置为:::iL 其中(λ· ..Γ」为矩形框左上顶点坐标,3为矩形框宽度,A为矩形框长度,所述矩形框为 完全包含该行人样本轮廓的人体矩形框,采集的每幅图像的宽均大于20像素,高均大于50 像素。4. 如权利要求2或3所述的方法,其中步骤(1. 2)具体为: 采集娜畐不包含行人的图像组成背景数据集,记为5。14為,…4…/i,:. λ +:+ V。5. 如权利要求4所述的方法,其中步骤(2)具体为: (2. 1)利用行人数据集获取正例样本的特征表示; (2. 2)利用背景数据集获取反例样本的特征表示; (2. 3)利用以上获取的正例样本和反例样本的特征表示训练线性分类器作为快速行人 检测器。6. 如权利要求5所述的方法,其中步骤(2. 1)具体为: (2. I. 1)对行人数据集I中的每一幅图像&,根据图像上每个人体矩形框的位置,经过 截取,获得对应的人体子图像,行人数据集I中所有图像的所有人体子图像构成了正例样 本; (2. 1.2)将截取的正例人体子图像转换为对应的人体灰度子图像,经过归一化处理得 到10*25像素大小的标准人体灰度子图像; (2. 1. 3)计算该10*25像素大小的标准人体灰度子图像的梯度幅值特征F e 弋将 该特征拉直,该拉直后的梯度幅值特征为一个250维的列向量; (2. 1. 4)将所有正例样本的特征记为:- ….Fv,a ] C'其中 I 4表示第i幅图像的第j个人体矩形框的拉直梯度幅值特征。7. 如权利要求6所述的方法,其中步骤(2. 2)具体为: (2.2. 1)在训练集i?中的图像上,选择宽高比例为10:25的背景矩形框共川7个,经过 截取,获得对应的背景子图像,则这川7个背景子图像构成了反例样本; (2. 2. 2)将截取的反例背景子图像转换为对应的背景灰度子图像,经过归一化处理得 到10*25像素大小的标准背景灰度子图像; (2. 2. 3)计算该10*25像素大小的 标准背景灰度子图像的梯度幅值特征/ € ,将 该特征拉直,该拉直后的梯度幅值特征为一个250维的列向量; (2. 2. 4)将所有反例样本的特征记为: 其中/;表示第a个反例样本的拉直梯度幅值特 征。8. 如权利要求7所述的方法,其中步骤(2. 3)具体为: (2. 3. 1)将所有正例样本的标签设置为1,反例样本的标签设置为0,训练一个二类线 性分类的支持向量机SVM,得到判别投影胃€ ; (2.3.2)设置得分函数;T n sme(茗,)=* g,其中g表不任意10*25大小的 灰度图像样本经过拉直后的梯度幅值特征,该拉直后的梯度幅值特征是一个250维的列向 量; (2. 3. 3)计算每个正例样本的标准人体灰度子图像的得分函数值,进行排序,设置检测 阈值CT,使得该阈值大于99%的正例样本的标准人体灰度子图像的得分函数值。9. 如权利要求8所述的方法,其中步骤(3)具体为: (3. 1)将行人训练集I中的每幅图像进行灰度处理,得到灰度图像,对其进行高斯金字 塔处理,缩放比例为丨〇 < d < ΛΑ >〗,直到最小尺寸的灰度图像的 宽大于10个像素且高大于25个像素; (3. 2)将上述D+1个尺度作为主尺度,计算每个主尺度灰幅图像的梯度幅值特征图像; (3. 3)通过双三次Bi-Cubic插值在每两个相邻主尺度之间获得中间尺度的梯度幅值 特征图像; (3.4)在所有尺度的梯度幅值特征图像上进行窗口扫描,窗口大小为10*25像素,水平 和垂直方向的步长都是1 ; (3. 5)对扫描得到的每个10*25像素大小的梯度幅值特征窗口,将其拉直为一个250维 的列向量,计算其得分函数值; (3.6)对得分函数值大于检测阈值σ的窗口,以该窗口所在的比例为的梯度幅值 特征图像的比例倒数缩放该图像,并以该窗口在该尺度的梯度幅值特征图像上的相对 位置进行还原,还原得到该窗口在行人训练集I中的对应图像的灰度图像上的相对位置, 该灰度图像的尺度为1,该位置为一个宽高比为10:25的矩形框; (3. 7)计算还原得到的每个矩形框与行人训练集I中对应图像上的所有人体矩形框之 间的重合度,重合度具体计算方法为:即这两个矩形框.4, J2的面积重合 部分除以两个矩形框的平均面积;(3. 8)将与对应图像上的所有人体矩形框之间的重合度都低于0. 5的矩形框作为反 例,将与所有人体矩形框中任意一个的重合度大于〇. 8的矩形框作为正例。10. 如权利要求9所述的方法,其中步骤(3. 3)具体为:在相邻的两个主尺度之间等间 隔的插入四个中间尺度,上述四个尺度由距离其最近的主尺度的梯度幅值特征图像插值得 到。11. 如权利要求10所述的方法,其中在相邻的两个主尺度之间等间隔的插入四个中间 尺度具体为:在.1尺度图像和k尺度图像之间等间隔的插入四个中间尺度,则每个中间 尺度可以表示为:己度图像和.........尺度图 r) J -L 像之间第q个中间尺度的缩放比例。12. 如权利要求11所述的方法,其中步骤(4)具体为: (4. 1)对步骤3. 8中得到的正例矩形框和反例矩形框,统一缩放为10*25像素大小的灰 度图像,组成精细行人检测器的训练样本集合,记为£二[r:. & ... I. 其中 正例矩形框有c个,反例矩形框有V个,r I, r :? I ; (4.2) 设置一个包含三个隐层的自动编码机作为精细行人检测器; (4.3) 逐层进行预训练Pre-Train; (4.4) 进行微调Fine-tune,将正例样本的输出设置为1,反例样本的输出设置为 〇,利用BP算法对层级编码机三个隐层的参数Ir 1Wi, r?以及softmax层的参数R进行 Fine-tune,以此训练得到具有上述参数的自动编码机作为精细行人检测器。13. 如权利要求12所述的方法,其中步骤(4. 3)具体为: (4. 3. 1)基于去噪自动编码机De-noising Auto Encoder以无监督的方式训练神经网 络的第一层,将其输出作为原始输入的最小化重构误差; (4. 3. 2)将每个隐含层的输出作为下一层神经网络的输入,进行无监督训练; (4. 3. 3)重复步骤4. 3. 2,直到完成所有隐含层的预训练为止,得到『η, Iri, r3的初始 值; (4. 3. 4)将最后一个隐含层的输出作为softmax层的输入,并且初始化softmax层的参 数『4。14. 如权利要求13所述的方法,其中步骤(5)具体为: (5. 1)对输入图形E进行灰度图像转换,得到输入灰度图像,对其进行高斯金字塔缩 放,缩放比例为3 < ο < Afi > I,直到最小的灰度图像的宽大于10个 像素且高大于2b个僳系,兴侍到U+1个主尺度,输入图像E的宽大于20像素,高大于50像 素; (5. 2)在这0+1个主尺度灰度图像上分别计算其对应的梯度幅值特征图像; (5. 3)通过Bi-Cubic插值在这0+1个主尺度梯度幅值图像的0个间隔中,以等间隔方 式在每个间隔中进行中间尺度插入,每个间隔插入四个中间尺度,共得到0*5+1个尺度的 梯度幅值特征图像,上述四个中间尺度由距离其最近的主尺度的梯度幅值特征图像插值得 到; (5.4)在每个尺度的梯度幅值特征图像上进行快速窗口扫描,使用10*25大小的窗口 在每个梯度幅值特征图像上扫描,对扫描得到的每个10*25像素大小的梯度幅值特征窗 口,将其拉直为一个250维的列向量,计算其得分函数值; (5. 5)输出大于检测阈值σ的窗口,以该窗口所在的比例为的梯度幅值特征图像 的比例倒数缩放该图像,并以该窗口在该尺度的梯度幅值特征图像上的相对位置进行还 原,还原得到该窗口在输入图像E的灰度图像上的相对位置,该灰度图像的尺度为1,该位 置为一个宽高比为10:25的矩形框; (5.6)将还原得到的所有这些矩形框缩放为10*25像素大小的灰度窗口图像,输入到 训练得到的作为精细行人检测器的自动编码机进行分类; (5. 7)保留输出层输出的置信度大于0. 5的灰度窗口图像,将其作为候选人体 框; (5. 8)为每个候选人体框标记一个五元组标签(λ% _r, r, A, ecwf j,分别对应该候选 人体框左上顶点的横坐标,纵坐标,该候选人体框的宽度,高度以及置信度; (5.9)对这些候选人体框进行聚类,输出人体检测框。15.如权利要求14所述的方法,其中步骤(5. 9)具体为: (5.9. 1)将所有候选人体框按照置信度排序,每个框标记设置为0,形成候选人体框集 合H,设置集合R表示真实候选框集合,初始化R为空集; (5. 9. 2)在集合H中选择置信度最大的候选人体框,记为& = U1,, Α:,,?:?Λ厂J, 将A从H中移除,加入集合R后将其标记设置为1 ; (5.9.3)计算H中所有候选人体框和&的重合度,重合度的计算方法为:,即这两个矩形框4.4的面积重合部分除以两个矩形框的平均面积; (5. 9. 4)将重合度大于0. 8的候选人体框从H中移除并加入到集合R中,且将这些候 选人体框的标记设置为1,此时集合R中的候选人体框可以记为:Λ? =丨為,.…尤,…辱i ,其中《丨.·ν-£/ 5·〔!; COi^f (5. 9. 5)计算R中每个候选人体框的权重,-彳,对这U+1个候选人体框进行加 权融合,输出人体检测框位置记为(5. 9. 6)判断集合H中是否还有候选人体框,如果没有,结束检测;如果集合H中还有 候选人体框,将集合R清空,在集合H中重复步骤(5. 9. 2) - (5. 9. 5)。
【专利摘要】本发明公开了一种单幅图像行人检测方法,包括:采集一个真实场景下的行人数据集,标注行人位置,同时采集一个不包含行人的背景数据集,以此作为训练数据,利用梯度幅值特征和线性支持向量机,训练一个“粗”的行人检测器,快速过滤非行人窗口。利用该快速行人检测器,在行人数据集上进行检测,纪录所有输出窗口的位置,根据标注好的行人位置,分别保存为正例窗口和反例窗口。利用这些窗口样本,基于层叠自动编码机,训练一个深度网络,区分行人窗口和非行人窗口。输出最终的由“粗”到“精”的行人检测器,以此实现对输入图像的行人检测。
【IPC分类】G06K9/00, G06K9/62
【公开号】CN104881662
【申请号】CN201510360321
【发明人】不公告发明人
【申请人】北京畅景立达软件技术有限公司
【公开日】2015年9月2日
【申请日】2015年6月26日
转载请注明原文地址:https://www.famiwei.com/read-8138414.html

最新回复(0)