多声源的融合定位方法、装置、设备、存储介质和产品与流程

xiaoxiao2026-08-12  5


本技术涉及声源定位,尤其涉及多声源的融合定位方法、装置、设备、存储介质和产品。


背景技术:

1、声源定位技术是指对接收到的信号进行处理得到自然声源或人为声源所在的位置信息。实际场景中,可能存在多个噪声源。这时,传统的声源定位技术在定位多声源的时候会存在问题,不能区分多个声源,声源定位精度降低。


技术实现思路

1、本技术旨在至少解决相关技术中存在的技术问题之一。为此,本技术提出一种多声源的融合定位方法,可以在多声源混响的情况下,实现良好的定位效果,提升整体鲁棒性。

2、本技术还提出多声源的融合定位方法、装置、设备、存储介质和程序产品。

3、根据本技术第一方面实施例的多声源的融合定位方法,包括:采用第一声源定位算法对声音数据进行峰值检测,得到第一峰值结果;在第一峰值结果包括至少两个峰值的情况下,确定至少两个峰值中的最大能量声源作为初步主声源;检测第二峰值结果和第三峰值结果中是否存在峰值落入第一角度范围,以得到第一检测结果;其中,第一角度范围是根据初步主声源的角度位置确定的;第二峰值结果是采用第二声源定位算法对声音数据进行峰值检测得到的;第三峰值结果是采用第三声源定位算法对声音数据进行峰值检测得到的;根据第一检测结果确定主声源的定位结果;其中,第一声源定位算法是基于波束能量的声源定位算法;第二声源定位算法是基于子空间的声源定位算法;第三声源定位算法是基于通道间相关性的声源定位算法。

4、根据本技术实施例的多声源的融合定位方法,通过对三种声源定位算法进行融合,利用第一声源定位算法对声源进行粗定位,然后根据第二声源定位算法和第三声源定位算法对粗定位结果进行修正,因此可以综合三种声源定位算法的优点,在多声源混响的情况下,也能实现良好的定位效果,提升整体系统的鲁棒性。

5、根据本技术的一个实施例,根据第一检测结果确定主声源的定位结果,包括:若在第一检测结果中,第二峰值结果和第三峰值结果中存在至少一个峰值落入第一角度范围,则根据落入第一角度范围的至少一个峰值确定主声源的定位结果。

6、根据本技术的一个实施例,根据落入第一角度范围的至少一个峰值确定主声源的定位结果,包括:在第二峰值结果和第三峰值结果中仅存在一个峰值落入第一角度范围内的情况下,将落入第一角度范围内的一个峰值的角度位置作为主声源的定位结果。

7、根据本技术的一个实施例,根据落入第一角度范围的至少一个峰值确定主声源的定位结果,包括:在第二峰值结果中存在第一峰值落入第一角度范围内,且第三峰值结果中存在第二峰值落入第一角度范围内的情况下,将第一峰值的角度位置和第二峰值的角度位置的平均值作为主声源的定位结果。

8、根据本技术的一个实施例,根据第一检测结果确定主声源的定位结果,包括:若在第一检测结果中,第二峰值结果和第三峰值结果均不存在峰值落入第一角度范围,则检测第二峰值结果和第三峰值结果中是否存在峰值落入第二角度范围,以得到第二检测结果;其中第二角度范围是根据初步主声源的角度位置确定的;第二角度范围大于第一角度范围;根据第二检测结果确定主声源的定位结果。

9、根据本技术的一个实施例,根据第二检测结果确定主声源的定位结果,包括:若在第二检测结果中,第二峰值结果和第三峰值结果不均存在峰值落入第二角度范围,或者,第二峰值结果中落入第二角度范围内的峰值和第三峰值结果中落入第二角度范围内的峰值之间的相差角度值大于或等于第一预设数值,则将初步主声源的角度位置作为主声源的定位结果。

10、根据本技术的一个实施例,根据第二检测结果确定主声源的定位结果,包括:若在第二检测结果中,第二峰值结果和第三峰值结果均存在峰值落入第二角度范围,且第二峰值结果中落入第二角度范围内的峰值和第三峰值结果中落入第二角度范围内的峰值之间的相差角度值小于第一预设数值,则将第二峰值结果中落入第二角度范围内的峰值的角度位置和第三峰值结果中落入第二角度范围内的峰值的角度位置的平均值作为主声源的定位结果。

11、根据本技术的一个实施例,还包括:在第一峰值结果为单峰值的情况下,根据第二峰值结果和第三峰值结果确定主声源的定位结果。

12、根据本技术的一个实施例,根据第二峰值结果和第三峰值结果确定主声源的定位结果,包括:确定第二峰值结果的主峰值和第三峰值结果的主峰值;在第二峰值结果的主峰值和第三峰值结果的主峰值之间的相差角度值小于第二预设数值的情况下,根据第二峰值结果的主峰值的角度位置和第三峰值结果的主峰值的角度位置确定主声源的定位结果。

13、根据本技术的一个实施例,根据第二峰值结果和第三峰值结果确定主声源的定位结果,包括:确定第二峰值结果的峰值数量、第二峰值结果的主峰值、第三峰值结果的峰值数量和第三峰值结果的主峰值;在第二峰值结果的主峰值和第三峰值结果的主峰值之间的相差角度值大于或等于第二预设数值的情况下,根据第二峰值结果的峰值数量和第三峰值结果的峰值数量,将第二峰值结果的主峰值的角度位置或者第三峰值结果的主峰值的角度位置作为主声源的定位结果。

14、根据本技术的一个实施例,第一声源定位算法在存在两个声源时确定各个角度能量峰值的相对值的效果优于第二声源定位算法和第三声源定位算法;第三声源定位算法的所需算力大于第一声源定位算法的所需算力,且小于第二声源定位算法的所需算力;第三声源定位算法的指向性优于第一声源定位算法的指向性,且弱于第二声源定位算法的指向性。

15、根据本技术的一个实施例,第一声源定位算法为相位转换可控波束响应算法;第二声源定位算法为最小方差失真响应算法;第三声源定位算法为广义互相关-相位变换加权算法。

16、根据本技术第二方面实施例的多声源的融合定位装置,包括:第一峰值结果模块,用于采用第一声源定位算法对声音数据进行峰值检测,得到第一峰值结果;初步主声源模块,用于在第一峰值结果包括至少两个峰值的情况下,确定至少两个峰值中的最大能量声源作为初步主声源;第一检测结果模块,用于检测第二峰值结果和第三峰值结果中是否存在峰值落入第一角度范围,以得到第一检测结果;其中,第一角度范围是根据初步主声源的角度位置确定的;第二峰值结果是采用第二声源定位算法对声音数据进行峰值检测得到的;第三峰值结果是采用第三声源定位算法对声音数据进行峰值检测得到的;主声源定位结果模块,用于根据第一检测结果确定主声源的定位结果;其中,第一声源定位算法是基于波束能量的声源定位算法;第二声源定位算法是基于子空间的声源定位算法;第三声源定位算法是基于通道间相关性的声源定位算法。

17、根据本技术第三方面实施例的电子设备,包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,处理器执行程序时实现如上述任一种多声源的融合定位方法。

18、根据本技术第四方面实施例的非暂态计算机可读存储介质,其上存储有计算机程序,计算机程序被处理器执行时实现如上述任一种多声源的融合定位方法。

19、根据本技术第五方面实施例的计算机程序产品,包括计算机程序,计算机程序被处理器执行时实现如上述任一种多声源的融合定位方法。

20、本技术实施例中的上述一个或多个技术方案,至少具有如下技术效果之一:

21、通过对三种声源定位算法进行融合,利用第一声源定位算法对声源进行粗定位,然后根据第二声源定位算法和第三声源定位算法对粗定位结果进行修正,综合三种声源定位算法的优点,在多声源混响的情况下,也能实现良好的定位效果,提升整体系统的鲁棒性;

22、需要进行融合的算法包括作为第一声源定位算法的基于波束能量的声源定位算法,作为第二声源定位算法的基于子空间的声源定位算法和作为第三声源定位算法的基于通道间相关性的声源定位算法;这三种算法分别从三种角度进行声源定位,可以进一步提高融合效果;

23、进一步地,本技术利用了相位转换可控波束响应算法能量相对值比较准确的优势,能够准确在多声源中选择主声源,克服了相位转换可控波束响应算法角度定位精度不准的问题;

24、进一步地,本技术利用了最小方差失真响应算法角度定位精度准的优势,克服了最小方差失真响应算法峰值能量不准的问题;

25、进一步地,本技术利用了广义互相关-相位变换加权算法的单声源定位准确的特点,克服了广义互相关-相位变换加权算法再两个声源能量差不多时候,定位精度差的特点。

26、本技术的附加方面和优点将在下面的描述中部分给出,部分将从下面的描述中变得明显,或通过本技术的实践了解到。


技术特征:

1.一种多声源的融合定位方法,其特征在于,包括:

2.根据权利要求1所述的多声源的融合定位方法,其特征在于,所述根据所述第一检测结果确定主声源的定位结果,包括:

3.根据权利要求2所述的多声源的融合定位方法,其特征在于,所述根据落入所述第一角度范围的至少一个峰值确定所述主声源的定位结果,包括:

4.根据权利要求2或3所述的多声源的融合定位方法,其特征在于,所述根据落入所述第一角度范围的至少一个峰值确定所述主声源的定位结果,包括:

5.根据权利要求1所述的多声源的融合定位方法,其特征在于,所述根据所述第一检测结果确定主声源的定位结果,包括:

6.根据权利要求5所述的多声源的融合定位方法,其特征在于,所述根据所述第二检测结果确定主声源的定位结果,包括:

7.根据权利要求5或6所述的多声源的融合定位方法,其特征在于,所述根据所述第二检测结果确定主声源的定位结果,包括:

8.根据权利要求1所述的多声源的融合定位方法,其特征在于,还包括:

9.根据权利要求8所述的多声源的融合定位方法,其特征在于,所述根据所述第二峰值结果和所述第三峰值结果确定所述主声源的定位结果,包括:

10.根据权利要求8或9所述的多声源的融合定位方法,其特征在于,所述根据所述第二峰值结果和所述第三峰值结果确定所述主声源的定位结果,包括:

11.根据权利要求1至10任一项所述的多声源的融合定位方法,其特征在于,所述第一声源定位算法在存在两个声源时确定各个角度能量峰值的相对值的效果优于所述第二声源定位算法和所述第三声源定位算法;

12.根据权利要求11所述的多声源的融合定位方法,其特征在于,

13.一种多声源的融合定位装置,其特征在于,包括:

14.一种电子设备,包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,其特征在于,所述处理器执行所述程序时实现如权利要求1至12任一项所述多声源的融合定位方法。

15.一种非暂态计算机可读存储介质,其上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现如权利要求1至12任一项所述多声源的融合定位方法。

16.一种计算机程序产品,包括计算机程序,其特征在于,所述计算机程序被处理器执行时实现如权利要求1至12任一项所述多声源的融合定位方法。


技术总结
本申请涉及声源定位技术领域,提供多声源的融合定位方法、装置、设备、存储介质和产品,该方法包括:采用第一声源定位算法对声音数据进行峰值检测,得到第一峰值结果;在包括至少两个峰值的情况下,确定至少两个峰值中的最大能量声源作为初步主声源;检测第二峰值结果和第三峰值结果中是否存在峰值落入第一角度范围,以得到第一检测结果;第一角度范围是根据初步主声源的角度位置确定的;第二峰值结果是采用第二声源定位算法对声音数据进行峰值检测得到的;第三峰值结果是采用第三声源定位算法对声音数据进行峰值检测得到的;根据第一检测结果确定主声源的定位结果。本申请可以在多声源混响的情况下,实现良好的定位效果,提升整体鲁棒性。

技术研发人员:张文彬,高羽
受保护的技术使用者:美的集团(上海)有限公司
技术研发日:
技术公布日:2024/9/23
转载请注明原文地址:https://www.famiwei.com/read-9025916.html

最新回复(0)