基于声纹识别身份的对话难度调整方法与流程

xiaoxiao2026-08-19  2


本发明涉及声纹识别,更具体地说,本发明涉及基于声纹识别身份的对话难度调整方法。


背景技术:

1、随着人工智能和机器学习技术的不断进步,声纹识别技术在生物特征识别领域表现出色。声纹识别具有独特性、便利性和高安全性,逐渐成为身份验证的一种重要方式。

2、特别是随着语音助手和智能对话系统的普及,声纹识别技术被应用于对话系统中,以提高系统的用户体验和安全性,基于声纹识别身份的对话难度调整方法,通过将声纹识别技术与人机交互相结合,动态调整对话的难度,提高系统的安全性和用户体验。


技术实现思路

1、本发明针对现有技术中存在的技术问题,提供基于声纹识别身份的对话难度调整方法,以解决上述背景技术中提出的问题。

2、本发明解决上述技术问题的技术方案如下:基于声纹识别身份的对话难度调整方法,具体包括以下步骤:

3、步骤101、收集多个动画角色的声纹数据,并对收集的声纹数据进行预处理;

4、步骤102、使用声纹识别算法,从预处理的声纹数据中提取声纹的特征,并存储到角色声纹特征库中,所述声纹特征包括音调、语速、音色,将提取的声纹特征与角色身份进行关联,建立角色的声纹模型;

5、步骤103、针对每个动画角色,设定不同的对话难度级别,使用建立好的角色声纹模型进行声纹识别,根据声纹识别结果确定动画角色身份,根据识别到的角色身份,将设定的对话难度级别与相应的动画角色进行关联,动态调整对话策略和难度。

6、在一个优选地实施方式中,所述步骤101中,收集多个动画角色的声纹数据,并对收集的声纹数据进行预处理,具体步骤如下:

7、步骤a1、声音信号采集:使用音频设备为每个动画角色录制一段标准的原始声音样本,创建一个声音数据库,将其存储为不同的文件夹,并将采集到的声纹数据进行切割,分为较短的语音片段,每段长度为1-3秒;

8、步骤a2、预处理声音数据:对切割后的语音片段进行预处理,以提高声纹特征的可靠性和准确性,包括去除噪音、增强语音信号、端点检测操作,所述端点检测操作是使用基于短时能量变化率的端点检测方法,对语音片段进行检测,确定语音的起始和结束点,进一步包括以下步骤:

9、步骤a201、计算短时能量:对语音信号进行分帧处理,每帧的长度为n个采样点,对每帧进行加窗,并计算其能量,具体计算公式如下:

10、

11、其中,e(n)表示第n帧的能量值,n是每帧的采样点数,s(i)表示第n帧中第i个采样点的语音信号值,表示加窗函数中的第i个采样点的值;

12、步骤a202、计算相邻帧之间的能量变化率为e(n)-e(n-1),定义一个能量变化率门限r,对于每个采样点n,当能量变化率大于门限r,将当前采样点n标记为语音的起始点;继续遍历后续采样点,直到遇到连续m个采样点的能量变化率均小于门限r:将当前采样点n标记为语音的结束点。

13、在一个优选地实施方式中,所述步骤102中,使用声纹识别算法,从预处理的声纹数据中提取声纹的特征,并存储到角色声纹特征库中,所述声纹特征包括音调、语速、音色,将提取的声纹特征与角色身份进行关联,建立角色的声纹模型,具体步骤如下:

14、步骤b1、声纹特征提取:从预处理后的声音数据中提取声纹特征,通过计算声音信号的频谱来获取音调、语速、音色,并将提取到的声纹特征转化为声纹向量,存储到角色声纹特征库中,便于后续的模式匹配和比对,进一步包括以下步骤:

15、步骤b101、将声音信号进行分帧处理,将长时间的声音信号切割成若干个短时段的帧,对每个帧应用加窗函数来消除频谱泄漏,并将其转化为时域信号乘以窗函数的结果,通过对每一帧进行傅里叶变换,得到每一帧的频谱信息,具体计算公式如下:

16、

17、其中,x(h)是输入信号的时域波形,是加窗函数,x(h,ω)是在第h帧的频率为ω的复数值频谱,j是虚数单位,m是离散时间的索引,h为窗口函数的长度;

18、步骤b102、声纹向量:对于每个声音信号帧,将得到的频谱信息表示为一个频谱图谱,通过对数变换方式将频谱图谱进行预处理,将其转化为频谱向量,通过将频谱向量进行降维处理,得到最终的声纹特征向量;

19、步骤b2、建立声纹模型:将提取的声纹特征与角色身份进行关联,使用机器学习算法,将声纹特征与角色身份进行匹配和识别,建立角色的声纹模型,进一步包括以下步骤:

20、步骤b201、建立声纹特征库:将提取的声纹特征存储到角色声纹特征库中,每个角色包括多个声纹特征向量,每个特征向量包含音调、语速、音色特征,

21、使用角色id标识符将声纹特征与角色进行关联,当有新的声音进行声纹识别时,通过比对角色的声纹特征来确定角色的身份;

22、步骤b202、使用卷积神经网络建立角色声纹模型,通过多层卷积和池化操作,提取声纹特征,并通过全连接层进行分类,具体计算公式如下:

23、y=softmax(wλ+b)

24、其中,λ表示声纹特征,y表示角色标签,w是权重矩阵,b是偏置项,softmax函数用于将输出转化为概率分布,表示不同角色的概率。

25、在一个优选地实施方式中,所述步骤103中,针对每个动画角色,设定不同的对话难度级别,使用建立好的角色声纹模型进行声纹识别,根据声纹识别结果确定动画角色身份,根据识别到的角色身份,将设定的对话难度级别与相应的动画角色进行关联,动态调整对话策略和难度,具体步骤如下:

26、步骤c1、设定对话难度级别:根据角色的特性、语速、词汇量因素进行设定,为每个动画角色设定不同的对话难度级别,将对话难度分为简单、中等和困难级别;

27、步骤c2、对话内容录制:在对话过程中,持续使用音频设备以短时间段为单位录制角色的声音,对每个录制的声音片段进行声纹特征提取,包括音调、语速、音色特征,根据之前存储的声纹特征提取方法来提取对话中的角色声纹特征;

28、步骤c3、声纹识别:当开始进行对话时,使用建立好的角色声纹模型进行声纹识别,通过提取对话中的角色声纹特征并与预先存储的声纹模型进行比对,根据声纹识别结果确定动画角色身份;

29、步骤c4、动态调整对话策略:将设定的对话难度级别与识别到的动画角色身份进行关联,根据预设的对话难度级别为该角色调整对话策略和难度。

30、本发明的有益效果是:收集多个动画角色的声纹数据,并对收集的声纹数据进行预处理,使用声纹识别算法,从预处理的声纹数据中提取声纹的特征,并存储到角色声纹特征库中,所述声纹特征包括音调、语速、音色,将提取的声纹特征与角色身份进行关联,建立角色的声纹模型,针对每个动画角色,设定不同的对话难度级别,使用建立好的角色声纹模型进行声纹识别,根据声纹识别结果确定动画角色身份,根据识别到的角色身份,将设定的对话难度级别与相应的动画角色进行关联,动态调整对话策略和难度,随着对话难度的动态调整,用户与动画角色之间的对话能够更贴近角色特点,让互动更加生动有趣,增加用户的参与感和沉浸感。


技术特征:

1.基于声纹识别身份的对话难度调整方法,其特征在于,具体包括以下步骤:

2.根据权利要求1所述的基于声纹识别身份的对话难度调整方法,其特征在于:所述步骤101中,收集多个动画角色的声纹数据,并对收集的声纹数据进行预处理,具体步骤如下:

3.根据权利要求2所述的基于声纹识别身份的对话难度调整方法,其特征在于,所述步骤a2中,所述端点检测操作是使用基于短时能量变化率的端点检测方法,对语音片段进行检测,确定语音的起始和结束点,进一步包括以下步骤:

4.根据权利要求1所述的基于声纹识别身份的对话难度调整方法,其特征在于,所述步骤102中,使用声纹识别算法,从预处理的声纹数据中提取声纹的特征,并存储到角色声纹特征库中,所述声纹特征包括音调、语速、音色,将提取的声纹特征与角色身份进行关联,建立角色的声纹模型,具体步骤如下:

5.根据权利要求4所述的基于声纹识别身份的对话难度调整方法,其特征在于,所述步骤b1声纹特征提取中,通过计算声音信号的频谱来获取音调、语速、音色,并使用短时傅里叶变换将提取到的声纹特征转化为声纹向量,进一步包括以下步骤:

6.根据权利要求4所述的基于声纹识别身份的对话难度调整方法,其特征在于,所述步骤b2建立声纹模型中,使用机器学习算法,将声纹特征与角色身份进行匹配和识别,建立角色的声纹模型,进一步包括以下步骤:

7.根据权利要求1所述的基于声纹识别身份的对话难度调整方法,其特征在于,所述步骤103中,针对每个动画角色,设定不同的对话难度级别,使用建立好的角色声纹模型进行声纹识别,根据声纹识别结果确定动画角色身份,根据识别到的角色身份,将设定的对话难度级别与相应的动画角色进行关联,动态调整对话策略和难度,具体步骤如下:


技术总结
本发明涉及基于声纹识别身份的对话难度调整方法,涉及声纹识别技术领域,收集多个动画角色的声纹数据,并对收集的声纹数据进行预处理,使用声纹识别算法,从预处理的声纹数据中提取声纹的特征,并存储到角色声纹特征库中,所述声纹特征包括音调、语速、音色,将提取的声纹特征与角色身份进行关联,建立角色的声纹模型,针对每个动画角色,设定不同的对话难度级别,使用建立好的角色声纹模型进行声纹识别,根据声纹识别结果确定动画角色身份,根据识别到的角色身份,将设定的对话难度级别与相应的动画角色进行关联,动态调整对话策略和难度。

技术研发人员:田学崇
受保护的技术使用者:北京优趣时光文化科技有限公司
技术研发日:
技术公布日:2024/9/23
转载请注明原文地址:https://www.famiwei.com/read-9026280.html

最新回复(0)