基于声谱图双特征的动物声音识别方法

xiaoxiao2020-10-23  18

基于声谱图双特征的动物声音识别方法
【技术领域】
[0001] 本发明设及一种基于声谱图双特征的动物声音识别方法。
【背景技术】
[0002] 生态环境与我们的生活密切相关,生态环境下的动物叫声包含丰富的信息。通过 对动物声音的识别,可W对其生活习性和分布做一定的了解与分析,从而可W有效地对其 进行监控和保护。近年来,动物声音识别受到越来越多的关注。
[0003] 动物声音识别,一般W声谱图、时间序列、Me1频率倒谱系数(Me1化equency CepstrumCoefficient,MFCC)、声音库索引W及小波包分解为基础,通过支持向量机 (SuppodVectorMachine,SVM)等分类识别。比较典型方法包括,基于声谱图相关 系数(SpectrogramCorrelation)识别动物声音,对平滑处理的声谱图使用边缘检测 ('edge'detector)提取特征进行露脊嫁化i曲tWhale)叫声检测,基于时间序列特征的动 物声音识别,Mel频率倒谱系数结合支持向量机的鸟类声音分类等。此外,也借助于经典的 基于文本(Text-based)数据库查询方法,采用基于索引(index-based)的动物声音检索, W及基于上下文变量(contextvari油les)的动物声音检索。近期,Exadakt^os等通过 声音识别确定动物的状态,用于畜牧业生产优化。Potamitis等提出在连续和真实的现场录 音中,识别特定的鸟类声音。我们也在最近的工作中,提出经过自适应能量检测(AED)后, 基于Mel尺度的小波包分解子带倒谱系数(MWSCC)特征和MFCC,结合支持向量机(SVM)的 鸟声检测方法。
[0004] 由于真实环境中存在各种各样的噪声,因此对动物声音的识别带来一定的挑战。 尤其,实时获取的声音信号,当信噪比很低时,对动物声音的识别尤为困难。对于低信噪比 情况下,声音信号的分析、分类和识别,目前已有一定的研究。对于低信噪比声音识别的特 征,常见的有基于时间与频率相结合的特征和基于声谱图及其相关的特征。
[0005] 关于时间与频率相结合的特征,主要有时间、频率特征,小波域特征,G油or字典匹 配追踪算法提取的特征等。近期的研究还包括,小波包(Wavelet化ckets)过滤的低信噪 比声音事件识别,基于高通滤波的MFCC扩展特征的声音事件识别,基于多个交叉超级帖的 随机回归森林的声音事件识别和检测。其中,利用匹配追踪算法从G油or字典中选择重要 的原子,用主成分分析(PCA)和线性判别分析(LDA)确定声音事件的特征,最后采用SVM分 类器进行分类识别,对于低信噪比声音事件的识别效果明显。
[0006] 关于声谱图及其相关的特征,主要是声音信号经过短时傅里叶变换(Shod-Time FourierTransform,STFT)得到声谱图,借助图像特征,一些图像识别的方法可W用于低 信噪比声音识别。如,化unarsal等提出利用声谱图模式匹配结合前馈神经网络和k近 邻化-NN)的环境声音分类方法。我们也对声谱图提取灰度共生矩阵特征,并结合随机 森林分类器识别鸟类声音。在非平稳的噪声环境中,Duan等提出基于非负声谱图分解 (non-negativespectrogramdecomposition)的声音增强算法。Dennis等提出基于声 谱图特征的声音事件识别方法。Czarnecki和Moszyfiski使用集中摄谱(Concentrated Spectrograph)的方法进行声音信号的时频分析。Dennis等提出局部声谱图特征(Local SpectrogramFea1:ures)使用广义的霍夫变换(GeneralisedHou曲Transform)投票 系统识别重叠的声音事件。McLou曲lin等提出谱图基于图像的前端特征(Spectrogram Image-basedRrontE;ndFea1:ures)使用SVM和深度神经网络分离器值eepNeural Network)分类器分类声音事件。尤其,Dennis等提出的子带功率分布(sub-bandpower distribution,SPD)特征,在谱图中将可靠的声音事件与噪声分开,并用最近邻居分类器 (kNN)对特征进行识别。该种方法能在信噪比低至0地时,也可能识别相关的声音事件。然 而,对于不同的声音环境,对于各种低信噪比声音信号,整体识别精度依然很低。

【发明内容】

[0007] 本发明的目的在于提供一种基于声谱图双特征的动物声音识别方法,改善不同声 音环境下各种低信噪比动物声音的识别率。
[0008] 为实现上述目的,本发明采用如下技术方案;一种基于声谱图双特征的动物声音 识别方法,其特征在于包括W下步骤:
[0009] 步骤S1 ;建立一声音样本库,用W预存声音样本;
[0010] 步骤S2 ;采集待识别的声音信号;
[0011] 步骤S3 ;将所述预存声音样本及待识别的声音信号转化成声谱图;
[0012] 步骤S4 ;将所述声谱图进行规范化,并对所述规范化后的声谱图进行特征值分解 和投影,将其转化得到一投影特征Xk;
[0013] 步骤S5 ;将所述声谱图转化成等价LBP值矩阵U,统计每一个等价LBP值对应的像 素与周围像素灰度值的方差,形成一特征向量LBPV;
[0014] 步骤S6 ;将所述投影特征Xk和特征向量LBPV结合,形成双层特征XK+LBPV;
[0015] 步骤S7 所述声音样本库中预存声音样本对应的双层特征集为训练样本集,W 待识别的声音信号对应的双层特征为输入样本,通过随机森林的训练,得出待识别的声音 信号于声音样本库中对应的类别并输出结果。
[0016] 进一步的,所述步骤S3转化过程具体内容如下:
[0017] 对所述预存的声音样本或采集的声音信号进行STFT,得到其幅度谱S(t,f),其 中,t为帖索引,f为频率索引,对应的幅度谱S(t,f)的值转化为灰度级所构成的二维图像 即为所述声谱图。
[0018] 进一步的,所述步骤S4的具体内容如下:
[0019] 将所述幅度谱S(t,f)第t帖的数据视为一个向量马=口化0),…,、S'化~'-〇]/,所 述向量g包含N个频率数据,进一步,将所述向量g转化为规范化的log尺度向量St:
[0022] 所述规范化的log尺度向量St表示规范化的log尺度的第t个帖的数据;
[0023] 假设所述幅度谱S(t,f)共有M个帖,将所述M个帖的向量表示为一声谱图矩阵X =時,…,S。…SJT,XGrmxw,由于特征分解的对象为方阵,因此,计算c=扔得到矩阵X的协方差矩阵CGRWXW,按W下公式利用特征值分解对所述协方差矩阵C降维:
[0024]C=UA护 (3)
[00巧] / \ / 'X
(4)
[002引 C=入lUiUi' + 入 2+…+ 入N%U'N妨
[0027] C> 入lUiU/+ 入gUgUg'+…+ 入机%',K< <N (6)
[002引其中,矩阵UGR胃包含矩阵C的所有特征向量y1,…,Uw,A是对角矩阵,其对 角线上的元素是特征值A。…,Aw,所述特征值…,入W代表对应特征向量的权重,而且 入AAW,再通过W下公式计算前K个特征值的贡献比重riK来衡量前K个特征 向量在表示声音中的重要性:
[0029] (7)
[0030] 矩阵U携带了声音的主要信息,选取前K个特征向量组成基本向量矩阵UkGRWxk, 所述投影特征Xk是对所述声谱图矩阵X在所述基本向量矩阵UkGRWXK上进行投影;
[00引]Xk=XUk做
[0032] 其中XkGRMxk。
[0033] 进一步的,所述步骤S5的具体内容如下:
[0034] 纹理T是Wg。像素为中屯、,在半径为R的环形邻域上的P个像素点的联合分布T:
[0035] Tt (s(g〇-ge),S(gj-gc), ???,s(gp-i-gc))巧)
[003引其中,g。表示所述环形领域的中屯、像素的像素值,gi(i= 0, 1,…,P-1)表示环形 邻域上的P个像素点的灰度值,S为符号函数:
[0037]
(10)
[0038] 根据所述联合分布T按特定方向排序构成的0/1序列结合LBP算子计算其二进制 模式,形成LBP值,即LBPp,c;
[003引
(11)
[0040] 环形领域上具有P个像素点,LBP产生2P种二进制模式,即2P个不同的LBP值;
[0041] 提出一等价模式,所述等价模式对应的循环二进制从0到1或从1到0最多有两 次跳变,U值表示所述等价模式中跳变的次数,并用U值判定等价模式:
[0042]
[0043]所有满足U《2的模式都称为等价模式,所述等价模式的值称为等价LBP值,用 l',B巧];恩衰示;
[0044]
[0045] 其中,所述LBP值左公的上标u2表示LBP对应的U值最大是2,所述等价模式 把模式的数量从2P减少为P(P-1)+2,除所述等价模式W外的模式都归为第P(P-1)+3类;
[0046] 对一MXN的声谱图提取其等价LBP,每个像素点(m,n)都得到一等价LBP值,该些 等价LBP值组成一等价LBP图,所述等价LBP图即为等价LBP值矩阵U,统计所述等价LBP 图中每个数字出现的频率,得到所述声谱图的纹理特征向量,但对于相同等价LBP值的等 价LBP图,其纹理可能不同,统计每一个等价LBP值对应的像素与周围像素灰度值的方差, 形成一特征向量LBPV,特征向量LBPV的第k个成分LBPV(k)表示为;
[005。 其中,整数k的范围为kG[1,P(P-l)+3],w(m,n,k)表示声谱图中像素(m,n)对 应于LBPV第k个成分的等价LBP值的权值,LBPV(k)是把声谱图中所有像素对应于第k个 成分的等价LBP值的权值进行累加,根据公式(14),得到的LBPV化),LBPV(2),LBPV化),… ,LBPV(P(P-1) +3),最终形成一个大小为P(P-1) +3的特征向量LBPV。
[0052] 进一步的,所述步骤S7的具体内容如下:
[0053]将所述声音样本模块中预存的声音样本对应的双层特征集为训练样本集 W= (乃+ 相+ …,At+ 巧,从所述训练样本集中自助重采样,生成S棵决 策树,并形成一随机森林;
[0054] 将所述测试声音模块采集的声音信号对应的双层特征LSPr为输入样本,置 于所述随机森林中S棵决策树的根节点处,按照决策树的分类规则向下传递,直到到达某 一个叶节点处,该个叶节点对应类标便是该棵决策树对所述双层特征左APF所属类 别1所做的投票,所述随机森林的S棵决策树均对所述双层特征式+心BPr的类别1进行 投 票得到S个投票,统计所述S个投票,其中票数最多的类别1便是双层特征《+xspr对 应的类别。
[0055] 在本发明一实施例中,在所述步骤S2和步骤S3之间还包括一声音增强,将所述预 存声音样本及待识别的声音信号进行增强处理,所述增强处理采用短时谱估计算法。
[0056] 进一步的,所述短时谱估计的具体内容如下;
[0057] 声音信号y(t)可表示为:
[0058] y(t) =s(1:)+n(t) (18)
[0059] 其中,s(t)为动物声音,n(t)为环境声音,对所述声音信号y(t)进行STFT可得 到其幅度谱Y化,1),其中k为帖索引,1为频率索引,短时谱估计由环境声功率谱N(k,1)估 计、增益因子G(k,1)计算和增强的声音信号幅度谱F(k,1)计算S部分组成:
[0060] 步骤S81 ;对含噪声信号功率谱|Y也1) 12进行平滑处理,得到平滑后功率谱:
[0061] S也U=曰S化-1,U+ (1-曰)IY也U12 (19)
[0062] 式中,a为平滑系数,a= 0. 7 ;
[006引步骤S82 ;通过前向和后向相结合的双向捜索算法寻找S也1)最小频谱分量:
[0064] Smin也:0 =max怯mini也:〇,Smi地也:0 } (20)
[0065] Smini化,1) =min怯(i,1)},k-D+1《i《k (21)
[0066] Sm化2也 1) =min怯(i,1)},k《i《i+D-1 (22)
[0067] 式中,Smhi(k,l)表示前向捜索D帖出来的最小值,Smi"2(k,l)表示后向捜索D帖出 来的最小值,Smh(k,1)表示采用双向捜索得到的最小频谱分量;
[0068] 步骤S83 ;计算动物声音存在的概率;
[0069] P(k,U=aiP化-1,U+ (l-ai)H(k,U(2扣
[0070]式中,a1是常量平滑参数,本文设a1=0. 2,H(k,1)是环境声音存在的判别准 则;
[0071]
[007引式中,Mk)是依赖于频率的判别阔值:
[0073] 侦)
[0074] 式中,Lf和Hf分别表示音频信号频率集中范围的最小值和最大值,Lf= 1曲z,Hf =18曲Z,Fs表示采样频率;
[00巧]步骤S84 ;计算时-频平滑因子n也1)进行环境声功率谱估计:
[007引 q也U=a2+(l-a2)P(k,U(26)
[0077] 式中,根据实际情况设定曰2=0.95,显然,〇2《11化,1)《1,由11也1)可^ 进行噪声功率谱的估计;
[007引 N也 1) =n也 1)N化-1,1) + (1-n也 1))I^k,1) 12 (27)
[0079] W上是环境声功率谱N化,1)的估计过程;
[0080] 步骤S85 ;计算频谱增益因子:
[0081]G也u=C也u/(C也u+ 0N也u) (28)
[008引式中,C(k,U= |Y(k,U|2-N(k,U表示纯净声音信号功率谱,。为过减因子,其 值为:
[0083] (29)
[0084] 步骤S86;得到增强后的音频信号幅度谱:
[00财 F也1) = IG也1) X IY也1) 1211/2 (30)。
[0086] 本发明与现有技术相比具有W下有益效果:
[0087] 1、本发明提出投影特征与LBPV特征相结合的双层特征用于各种环境下的动物声 音识别,不仅提高识别率,还具有较高的抗噪性;
[0088] 2、本发明提出用随机森林识别器用于双层特征的识别;
[0089] 3、本发明提出短时谱估计声音增强结合双层特征与随机森林的架构,特别适用于 低信噪比动物声音识别。
【附图说明】
[0090] 图1是本发明算法流程图。
[0091]图2是本发明实施例一系统模块图。
[0092] 图3是本发明实施例二系统模块图。
[0093]图4是本发明实施例声音增强采用短时谱估计算法模块示意图。
[0094] 图5a是本发明实施例白鹤叫声的声谱图。
[0095]图化是本发明实施例白鹤叫声的规范化log尺度的声谱图。
[0096] 图6是本发明实施例白鹤叫声前K个特征值之和占全部特征值之和的比重图。
[0097] 图7a是本发明实施例3*3图像区域灰度值示意图。
[009引图化是本发明图7a中间像素点C的LBP值示意图。
[0099] 图7c是本发明对图7a实线框部分计算等价LBP值后形成的等价LBP图。
[0100] 图7d是本发明图7a实现框部分对应像素的方差矩阵V示意图。
[0101] 图7e是本发明每个模式出现的频率直方图。
[0102] 图7f是本发明图7c的等价LBP值及表1的序号k,通过图7d方差计算LBPV化), 形成的LBPV直方图。
[0103] 图8a是本发明图5a转化而成的等价LBP图。
[0104] 图8b是本发明图8a的等价LBP直方图。
[0105] 图8c是本发明图的LBPV直方图。
[0106] 图9是本发明随机森林的基本原理示意图。
【具体实施方式】
[0107] 下面结合附图及实施例对本发明做进一步说明。
[010引请参照图1,本发明提供一种基于声谱图双特征的动物声音识别方法,其特征在于 包括W下步骤:
[0109] 步骤SI;建立一声音样本库,用w预存声音样本;
[0110] 步骤S2 ;采集待识别的声音信号;
[0111] 步骤S3 ;将所述预存声音样本及待识别的声音信号转化成声谱图;
[0112] 步骤S4 ;将所述声谱图进行规范化,并对所述规范化后的声谱图进行特征值分解 和投影,将其转化得到一投影特征Xk;
[0113] 步骤S5 ;将所述声谱图转化成等价LBP值矩阵U,统计每一个等价LBP值对应的像 素与周围像素灰度值的方差,形成一特征向量LBPV;
[0114] 步骤S6 ;将所述投影特征Xk和特征向量LBPV结合,形成双层特征XK+LBPV;
[0115] 步骤S7 所述声音样本库中预存声音样本对应的双层特征集为训练样本集,W 待识别的声音信号对应的双层特征为输入样本,通过随机森林的训练,得出待识别的声音 信号于声音样本库中对应的类别并输出结果。
[0116] 进一步的,所述步骤S3转化过程具体内容如下:
[0117] 对所述预存的声音样本或采集的声音信号进行STFT,得到其幅度谱S(t,f),其 中,t为帖索引,f为频率索引,对应的幅度谱S(t,f)的值转化为灰度级所构成的二维图像 即为所述声谱图,图5a所示白鹤叫声的声谱图。
[0118] 进一步的,所述步骤S4的具体内容如下:
[0119] 将所述幅度谱S(t,f)第t帖的数据视为一个向量玄t= 口化巧,…,S化A/ -l)f,所 述向量玄,包含N个频率数据,进一步,将所述向量玄,转化为规范化的log尺度向量St:
[0122] 所述规范化的log尺度向量St表示规范化的log尺度的第t个帖的数据,图化所 示是图5a规范化log尺度的声谱图,该些向量由于维度过高,不适合直接用于分类,必须转 化成低维度的表示;
[0123] 特征值分解是低维度表示的一个简单有效的方法,我们采用特征值分解来降低维 度,假设所述幅度谱S(t,f)共有M个帖,将所述M个帖的向量表示为一声谱图矩阵X= 時,…,S。…SJT,XGrmxw,由于特征分解的对象为方阵,因此,计算C=扔得到矩阵X的 协方差矩阵CGRWXW,按W下公式利用特征值分解对所述协方差矩阵C降维:
[0124] C=UAUT(3)
[0125]
(4)
[01 2引 C=入lUiV+ 入2II2U'2+…+ 入N%u'N 妨
[0127]C> 入lUiu/+ 入2U2II2'+…+ 入K%%',K< <N(6)
[012引其中,矩阵UGRWXW包含矩阵C的所有特征向量y1,…,Uw,A是对角矩阵,其对 角线上的元素是特征值A。…,Aw,所述特征值…,入w代表对应特征向量的权重,而且 入1>AAW,特征值的大小A。反应了它对应的特征向量y。对于声音的重要性, 特征值越大对应的特征向量越重要,再通过W下公式计算前K个特征值的贡献比重riK来 衡量前K个特征向量在表示声音中的重要性,如图6所示是本发明实施例白鹤叫声前K个 特征值之和占全部特征值之和的比重图,从图中我们可W看出,当K《10时K个特征值之 和所占比重快速上升,当K继续增大,比重上升趋势较为平缓且逐渐趋于100% :
[0129] (7)
[0130] 矩阵U携带了声音的主要信息,选取前K个特征向量组成基本向量矩阵UkGRWxk, 所述投影特征Xk是对所述声谱图矩阵X在所述基本向量矩阵UkGRWXK上进行投影;
[0131]Xk=XUk做
[0132]其中XkGRMxk。
[0133] 进一步的,所述步骤S5的具体内容如下:
[0134]LBPV是对ULBP中每个模式对应的所有像素的方差进行累计形成的向量,等价LBP 值描述了图像纹理特征的空间结构,方差则表示对比度信息,LBPV向量结合了该两者特征。 [01巧]纹理T是Wg。像素为中屯、,在半径为R的环形邻域上的P个像素点的联合分布T:
[0136]Tt(S(g〇-gc),S(gi_gc),…,S(gp_i_gc)) (9)
[0137] 其中,g。表示所述环形领域的中屯、像素的像素值,gi(i= 0, 1,…,P-1)表示环形 邻域上的P个像素点的灰度值,S为符号函数:
[0138]
(10)
[0139] 根据所述联合分布T按特定方向排序构成的0/1序列结合LBP算子计算其二进制 模式,形成LBP值,即LBPp,c;
[0140]
(11)
[0141]图7a实线框部分为本发明实施例3*3图像区域像素灰度值示意图,计算灰度 值为80的中屯、像素点C的LBP值如图化所示,其中(141 > 80) - 1,(109 > 80) - 1, (89 > 80) 一 1,(68<80) 一 0,(48<80) 一 0,(52<80) 一 0,(60<80) 一 0,巧9 > 80) 一 1, 因此LBPp,E= (11100001) 2= (225) 1。,对于边缘像素的LBP值,可W用图7a虚线部分所示 的方式,先对相应像素进行拓展后,在用式 (11)进行计算。
[014引环形领域上具有P个像素点,LBP产生2P种二进制模式,即2P个不同的LBP值;
[0143]根据绝大多数的模式最多包含两次从1到0或0到1的跳变,提出一等价模式,所 述等价模式对应的循环二进制从0到1或从1到0最多有两次跳变,U值表示所述等价模 式中跳变的次数,并用U值判定等价模式:
[0144]
[0145]所有满足U《2的模式都称为等价模式,所述等价模式的值称为等价LBP值,用 L公/^;^直表示;
[0146]
[0147] 其中,所述LBP值王公的上标u2表示LBP对应的U值最大是2,所述等价模式 把模式的数量从2P减少为P(P-1) +2,除所述等价模式W外的模式都归为第P(P-1) +3类,W图7a为例,当P= 8和R= 1时,等价模式的数量为59个,根据式(13)可W得到59个等 价LBP值,把他们与1-59的序号k相对应,可W得到如表1所述的等价LBP值与序号k对 应关系,其中ULBP化)是序号k对应的LBP值;
[0148] 表1.等价LBP值与序号k对应关系
[0149]
[0150] 对一MXN的声谱图提取其等价LBP,每个像素点(m,n)都得到一等价LBP值,该些 等价LBP值组成一等价LBP图,所述等价LBP图即为等价LBP值矩阵U,统计所述等价LBP 图中每个数字出现的频率,得到所述声谱图的纹理特征向量,图7c是对图7a实线框部分计 算等价LBP值后形成的等价LBP图,也是一个由等价LBP值组成的矩阵,即等价LBP值矩阵 U,图7e表示每个模式出现的频率直方图,也即表示图7a的纹理特征向量;
[0151] 但对于相同等价LBP值的等价LBP图,其纹理可能不同,因此,我们用方差来表示 对比度信息,方差越大说明该区域纹理变化大,统计每一个等价LBP值对应的像素与周围 像素灰度值的方差,形成一特征向量LBPV,特征向量LBPV的第k个成分LBPV(k)表示为;
[0155]
(17)
[0156]其中,整数k的范围为kG[1,P(P-l)+3],w(m,n,k)表示声谱图中像素(m,n)对 应于LBPV第k个成分的等价LBP值的权值,LBPV(k)是把声谱图中所有像素对应于第k个 成分的等价LBP值的权值进行累加,根据公式(14),得到的LBPV化),LBPV(2),LBPV化),… ,LBPV(P(P-1) +3),最终形成一个大小为P(P-1) +3的特征向量LBPV;
[0157] 图7d是图7a实线区域内对应像素的方差矩阵V,图7f是根据图7c的等价LBP值 及相应的表1的序号k,通过图7d方差计算LBPV化),形成的LBPV直方图,即LBPV特征,它 的示意过程如下:
[015引 11化0) = 11(0, 1) = 193 = ULBP(38) - v(0,0)+v(0, 1) = 577+653 - LBPV(38) =1230,
[0159] 11(0, 2) = 11(1,2) = 241 =ULBP(49) 一v(0, 2)+v(l, 2) = 218+446 一LBPV(49) = 664,
[0160]u(1,0) =u(1,1) = 225 =化BP(44) -V(1,0)+v(1,1) = 1111+880 -LBPV(44) = 1991,
[0161]u化 0) =u(2, 1) = 231 =ULBP(46) -v(2,0)+v(2, 1) = 216+197 -LBPV(46) = 413,
[016引u(2, 2) = 255 = ULBP巧8) - u(2, 2) = 132 - LBPV巧8) = 132,
[0163]因此,
[0164]LBPV={0,…,LBPV(38),0,…,LBPV(44),0,LBPV(46),0, 0,LBPV(49),0,… ,LBPV巧8),0},代入相应的值,得
[016引 LBPV={0,…,1230,0,…,1991,0,413, 0,0, 664,0,…,132,0},其直方图如图 7f 所示;
[0166]W图5a的白鹤声的声谱图为例,图8a-8c表示等价模式的LBP直方图与LBPV直 方图的比较,在图8b中,对应等价LBP值为255,出现的频率特别高,也即二进制模式为 11111111的比例特别高,根据式(10),当即>gc时,S(即-gc) = 1,也就是当中屯、像素的 灰度或灰度值相等是,二进制模式对应的位取1,它表示相应的声谱图空白部分或灰度值相 同的部分占的比例特别高,相对于等价LBP直方图,如图8c所示,LBPV直方图,用周围像素 灰度的方差作为权值,更能反映声谱图中的纹理变化,有利于分类识别。
[0167] 因此,下一步,我们把投影特征Xk和特征向量LBPV相结合形成双层特征Xk+LBPV, 作为各种环境下,动物声音识别的特征,当然也可单把投影特征Xks特征向量LBPV作为动 物识别的特征,双层特征相比于该两者识别率会更加高。
[016引进一步的,所述步骤S7的具体内容如下:
[0169] 随机森林是一种利用多个决策树分类器来对数据进行判别的集成分类器 算法,其原理如图9所示,通过自助重采样技术将所述声音样本模块中预存的声音 样本对应的双层特征集W= +LWKV,?,作+ 、投影特征 集W= {式,式,…,巧}或特征向量集W={LBPV1,LBPy2,…,LBPV。}为训练样本集 (4' = (;^,|+/^6^|乂 + /^3^^-乂'' + /^6户叫,从所述训练样本集中自助重采样,生成8棵决 策树,并形成一随机森林,测试数据的判别结果则由森林中S可数投票形成的分数而定;
[0170] 使用随机森林对待识别声音的识别过程如下,将所述测试声音模块采集的声音信 号对应的双层特征义,;:+ 、投影特征《,或特征向LBPV为输入样本,置于所述随机森 林中S棵决策树的根节点处,按照决策树的分类规则向下传递,直到到达某一个叶节点处, 该个叶节点对应类标便是该棵决策树对所述双层特征為+L公pr所属类别1所做的投票, 所述随机森林的S棵决策树均对所述双层特征+i:i?fr的类别1进行投票得到S个投 票,统计所述S个投票,其中票数最多的类别1便是双层特征乂,L5尸K'对应的类别。
[0171] 在本发明一实施例中,针对于受到噪声严重污染的声音样本,在所述步骤S2和步 骤S3之间还包括一声音增强,将所述预存声音样本及待识别的声音信号进行增强处理,所 述增强处理采用短时谱估计算法。
[0172] 进一步的,所述短时谱估计的具体内容如下:
[0173] 声音信号y(t)可表示为:
[0174] y(t) =s(t)+n(t) (18)
[01巧]其中,s(t)为动物声音,n(t)为环境声音,对所述声音信号y(t)进行STFT可得 到其幅度谱Y化,1),其中k为帖索引,1为频率索引,短时谱估计由环境声功率谱N(k,1)估 计、增益因子G(k,1)计算和增强的声音信号幅度谱F(k,1)计算S部分组成:
[0176] 步骤S81 ;对含噪声信号功率谱|Y也1) 12进行平滑处理,得到平滑后功率谱:
[0177] S也 1) =aS化-1,1) + (1-a)I^k, 1) 12 (19)
[017引式中,a为平滑系数,a= 0. 7 ;
[0179] 步骤S82 ;通过前向和后向相结合的双向捜索算法寻找S(k,1)最小频谱分量:
[0180] Smin也:0 =max怯mini也:〇,Smi地也:0 } (20)
[01引]Sm化i(k,U=min怯(i,l)},k-D+l《i《k(21)
[018引 Sm化2也1) = min怯(i,1)},k《i《i+D-1 (2。
[018引式中,Smhi化,1)表示前向捜索D帖出来的最小值,化,1)表示后向捜索D帖出 来的最小值,Smh(k,1)表示采用双向捜索得到的最小频谱分量;
[0184] 步骤S83 ;计算动物声音存在的概率;
[01财P(k,U=aiP化-1,U+ (l-ai)H(k,U似)
[0186] 式中,a1是常量平滑参数,本文设a1= 0. 2,H(k,1)是环境声音存在的判别准 则;
[0187]
[018引式中,4似是依赖于频率的判别阔值:
[0189]
侦)
[0190] 式中,Lf和Hf分别表示音频信号频率集中范围的最小值和最大值,Lf= 1曲z,Hf =18曲Z,Fs表示采样频率;
[01W] 步骤S84 ;计算时-频平滑因子n也1)进行环境声功率谱估计:
[019引q也U= 02+(1-曰2)口也U(26)
[019引式中,根据实际情况设定曰2=0.95,显然,02《11化,1)《1,由11化,1)可^ 进行噪声功率谱的估计;
[0194]N也 1) =n也 1)N化-1,1) + (1-n也 1))I^k,1) 12 (27)
[0195]W上是环境声功率谱N化,1)的估计过程;
[0196] 步骤S85 ;计算频谱增益因子:
[0197]G也 1) =C也 1) /(C也 1) + 0N也 1)) (28)
[019引式中,0化,1) = |Y也1) |2-N也1)表示纯净声音信号功率谱,0为过减因子,其 值为:
[0199] (29)
[0200] 步骤S86 ;得到增强后的音频信号幅度谱:
[020" F(k, 1)=|G(k, 1) X |Y(k, 1) |2|1/200)。
[0202] 为了让一般技术人员更好的理解本发明的技术方案,W下结合系统本发明进行进 一步介绍。
[0203] 本发明采用的系统如图2所示,包括一声谱图模块,所述声谱图模块的输入端与 一声音样本库模块、测试声音模块连接,所述声谱图模块的输出端与一投影特征模块、一 LBPV特征模块的输入端连接,所述投影特征模块、LBPV特征模块的输出端分别与一双层特 征模块的输入端连接,所述双层特征模块的输出端与一RF识别模块、一结果输出模块依次 连接;
[0204]所述声谱图模块将所述声音样本库模块中预存的声音样本及测试声音模块采集 的声音信号转化成声谱图;
[0205] 所述投影特征模块将所述声谱图模块输出的声谱图进行规范化,并对规范化的声 谱图进行特征值分解和投影得到投影特征Xk;
[0206] 所述LBPV特征模块将所述声谱图模块输出的声谱图转化成等价LBP值矩阵U,统 计每一个等价LBP值对应的像素与周围像素灰度值的方差,形成一特征向量LBPV ;
[0207] 所述双层特征模块将所述投影特征模块输出的投影特征Xk 和LBPV特征模块输出 的特征向量LBPV结合,形成双层特征Xk+LBPV ;
[020引所述RF识别模块W所述声音样本模块中预存的声音样本对应的双层特征集为训 练样本集,W测试声音模块采集的声音信号对应的双层特征为输入样本,通过随机森林的 训练,得出测试声音模块采集的声音信号于声音样本库模块中预存的声音样本对应的类别 并输送给结果输出模块。
[0209] 于本发明另一实施例中,还包括一声音增强模块,所述声音增强模块的输出端与 所述声谱图模块的输入点连接,所述声音增强模块的输入端与所述声音样本库模块、测试 声音模块连接,如图3所示,所述声音增强模块使用声音增强算法对声音信号进行声音增 强,而于各种声音增强算法中,经比较得出又W短时谱估计算法效果最为突出,如图4所 /J、-〇
[0210] W上所述仅为本发明的较佳实施例,凡依本发明申请专利范围所做的均等变化与 修饰,皆应属本发明的涵盖范围。
【主权项】
1. 一种基于声谱图双特征的动物声音识别方法,其特征在于包括以下步骤: 步骤Sl :建立一声音样本库,用以预存声音样本; 步骤S2 :采集待识别的声音信号; 步骤S3 :分别将所述预存声音样本及待识别的声音信号转化成声谱图; 步骤S4 :将所述声谱图进行规范化,并对所述规范化后的声谱图进行特征值分解和投 影,将其转化得到一投影特征Xk; 步骤S5 :将所述声谱图转化成等价LBP值矩阵u,统计每一个等价LBP值对应的像素与 周围像素灰度值的方差,形成一特征向量LBPV ; 步骤S6 :将所述投影特征Xk和特征向量LBPV结合,形成双层特征X K+LBPV ; 步骤S7 :以所述声音样本库中预存声音样本对应的双层特征集为训练样本集,以待识 别的声音信号对应的双层特征为输入样本,通过随机森林的训练,得出待识别的声音信号 于声音样本库中对应的类别并输出结果。2. 根据权利要求1所述的基于声谱图双特征的动物声音识别方法,其特征在于:所述 步骤S3转化过程具体内容如下: 对所述预存的声音样本或采集的声音信号进行STFT,得到其幅度谱S (t,f),其中,t为 帧索引,f为频率索引,对应的幅度谱S(t,f)的值转化为灰度级所构成的二维图像即为所 述声谱图。3. 根据权利要求2所述的基于声谱图双特征的动物声音识别方法,其特征在于:所述 步骤S4的具体内容如下: 将所述幅度谱S(t,f)第t帧的数据视为一个向量$=[5(?.0),···,5仏Λ/-Ι)]7,所述向 量瓦包含N个频率数据,进一步,将所述向量灵转化为规范化的log尺度向量St:所述规范化的log尺度向量St表示规范化的log尺度的第t个帧的数据; 假设所述幅度谱S (t,f)共有M个帧,将所述M个帧的向量表示为一声谱图矩阵X = [S1,…,St,…SM]τ,X e Rmxn,由于特征分解的对象为方阵,因此,计算C = XtX得到矩阵X的 协方差矩阵C e Rnxn,按以下公式利用特征值分解对所述协方差矩阵C降维: C = U Λ Ut (3)C= A1U1Ur !+A2U2Ur2+--- + ANuNurN (5) C ~ A1U1U1^ +A2U2U2^ +…+ AKuKuK ' , K < < N (6) 其中,矩阵U e Rnxn包含矩阵C的所有特征向量μ i,…,μΝ,Λ是对角矩阵,其对角 线上的元素是特征值A1,…,λΝ,所述特征值A1,…,λΝ代表对应特征向量的权重,而且 A1S λ 2多…多λ Ν,再通过以下公式计算前K个特征值的贡献比重riK来衡量前K个特征 向量在表示声音中的重要性:矩阵U携带了声音的主要信息,选取前K个特征向量组成基本向量矩阵队^ Rnxk,所述 投影特征Xk是对所述声谱图矩阵X在所述基本向量矩阵U Ke Rnxk上进行投影: Xk=XUk (8) 其中 XKe Rmxk。4.根据权利要求1所述的基于声谱图双特征的动物声音识别方法,其特征在于:所述 步骤S5的具体内容如下: 纹理T是以g。像素为中心,在半径为R的环形邻域上的P个像素点的联合分布T : T ^ t (s (g〇-gc), S (gi-gc), , s (gp-i-gc)) (9) 其中,g。表示所述环形领域的中心像素的像素值,gi(i = 0, 1,"·,Ρ-1)表示环形邻域 上的P个像素点的灰度值,s为符号函数:根据所述联合分布T按特定方向排序构成的0/1序列结合LBP算子计算其二进制模 式,形成LBP值,即LBPP,K:环形领域上具有P个像素点,LBP产生2P种二进制模式,即2 P个不同的LBP值; 提出一等价模式,所述等价模式对应的循环二进制从〇到1或从1到〇最多有两次跳 变,U值表示所述等价模式中跳变的次数,并用U值判定等价模式:所有满足2的模式都称为等价模式,所述等价模式的值称为等价LBP值,用 值表示:其中,所述LBP值15/^^的上标u2表示LBP对应的U值最大是2,所述等价模式把模 式的数量从2P减少为P (P-I)+2,除所述等价模式以外的模式都归为第P (P-I)+3类; 对一MXN的声谱图提取其等价LBP,每个像素点(m,n)都得到一等价LBP值,这些等价 LBP值组成一等价LBP图,所述等价LBP图即为等价LBP值矩阵u,统计所述等价LBP图中 每个数字出现的频率,得到所述声谱图的纹理特征向量,但对于相同等价LBP值的等价LBP 图,其纹理可能不同,统计每一个等价LBP值对应的像素与周围像素灰度值的方差,形成一 特征向量LBPV,特征向量LBPV的第k个成分LBPV (k)表示为:其中,整数k的范围为k e [l,P(p-l)+3],w(m,n,k)表示声谱图中像素(m,n)对应 于LBPV第k个成分的等价LBP值的权值,LBPV (k)是把声谱图中所有像素对应于第k个 成分的等价LBP值的权值进行累加,根据公式(14),得到的1^?¥(1〇,1^?¥(2),1^?¥(1〇,~ ,LBPV (P (P-I) +3),最终形成一个大小为P (P-I) +3的特征向量LBPV。5. 根据权利要求1所述的基于声谱图双特征的动物声音识别方法,其特征在于:所述 步骤S7的具体内容如下: 将所述声音样本模块中预存的声音样本对应的双层特征集为训练样本集 + …,灯+ MWii卜从所述训练样本集中自助重采样,生成s棵决 策树,并形成一随机森林; 将所述测试声音模块采集的声音信号对应的双层特征<+为输入样本,置于 所述随机森林中s棵决策树的根节点处,按照决策树的分类规则向下传递,直到到达某一 个叶节点处,这个叶节点对应类标便是这棵决策树对所述双层特征'所属类别1 所做的投票,所述随机森林的s棵决策树均对所述双层特征Al 的类别1进行投票 得到s个投票,统计所述s个投票,其中票数最多的类别1便是双层特征< 对应 的类别。6. 根据权利要求1所述的基于声谱图双特征的动物声音识别方法,其特征在于:在所 述步骤S2和步骤S3之间还包括一声音增强,将所述预存声音样本及待识别的声音信号进 行增强处理,所述增强处理采用短时谱估计算法。7. 根据权利要求6所述的基于声谱图双特征的动物声音识别方法,其特征在于:所述 短时谱估计算法的具体内容如下: 声音信号y(t)可表示为: y(t) = s(t)+n(t) (18) 其中,s(t)为动物声音,n(t)为环境声音,对所述声音信号y(t)进行STFT可得到其幅 度谱Y(k, I),其中k为帧索引,1为频率索引,短时谱估计由环境声功率谱N(k, 1)估计、增 益因子G (k,1)计算和增强的声音信号幅度谱F (k,1)计算三部分组成: 步骤S81 :对含噪声信号功率谱|Y (k,I) 12进行平滑处理,得到平滑后功率谱: S(k, I) = aS(k-l, 1) + (1-α) |Y(k, I) |2 (19) 式中,a为平滑系数,a = 〇. 7 ; 步骤S82 :通过前向和后向相结合的双向搜索算法寻找S(k,I)最小频谱分量: Smin (k, I) = max (Sminl (k, I), Smin2 (k, 1)} (20) Sminl (k, I) = min {S (i, I)}, k-D+1 ^ i ^ k (21) Smin2 (k, I) = min {S (i, I)},k < i < i+D-1 (22) 式中,Sminl (k,I)表示前向搜索D帧出来的最小值,Smin2 (k,I)表示后向搜索D帧出来的 最小值,Smin(k,1)表示采用双向搜索得到的最小频谱分量; 步骤S83 :计算动物声音存在的概率: P(k, I) = a ^(k-1, 1) + (1-α 1)H(k, I) (23) 式中,α 1是常量平滑参数,本文设α 1= 0. 2, H(k,1)是环境声音存在的判别准则:式中,Φ (k)是依赖于频率的判别阈值:式中,Lf和Hf分别表示音频信号频率集中范围的最小值和最大值,Lf = 1kHz,Hf = 18kHz,Fs表示采样频率; 步骤S84 :计算时-频平滑因子τι (k,1)进行环境声功率谱估计: q (k, I) = α 2+(1-α 2)P(k, I) (26) 式中,根据实际情况设定α 2= 〇. 95,显然,α # n (k, I)彡1,由n (k, I)可以进行 噪声功率谱的估计: N(k, I) = n (k, l)N(k-l, l) + (l-n (k, 1)) |Y(k, I) I2 (27) 以上是环境声功率谱N (k,I)的估计过程; 步骤S85:计算频谱增益因子: G(k, I) = C(k, l)/(C(k, l) + 〇N(k, 1)) (28) 式中,C(k,I) = IY(k,I) I2-N(k,I)表示纯净声音信号功率谱,。为过减因子,其值为:步骤S86 :得到增强后的音频信号幅度谱: F(k, I) = |G(k, I) X |Y(k, I) I2)172 (30)。
【专利摘要】本发明涉及一种基于声谱图双特征的动物声音识别方法,其特征在于包括以下步骤:建立一声音样本库;采集待识别的声音信号;将预存声音样本及待识别的声音信号转化成声谱图;将声谱图进行规范化,并进行特征值分解和投影,转化成一投影特征XK;将声谱图转化成等价LBP值矩阵u,统计对应的像素与周围像素灰度值的方差,形成一特征向量LBPV;将投影特征XK和特征向量LBPV结合,形成双层特征XK+LBPV;以所述声音样本库中预存声音样本对应的双层特征集为训练样本集,以待识别的声音信号对应的双层特征为输入样本,通过随机森林的训练,得出待识别的声音信号于声音样本库中对应的类别并输出结果。本发明改善了不同声音环境下各种低信噪比动物声音的识别率。
【IPC分类】G10L17/26
【公开号】CN104882144
【申请号】CN201510226082
【发明人】李应, 吴志彬
【申请人】福州大学
【公开日】2015年9月2日
【申请日】2015年5月6日
转载请注明原文地址:https://www.famiwei.com/read-8137407.html

最新回复(0)