本发明涉及声纹识别,更具体地说,本发明涉及基于声纹识别身份的对话难度调整方法。
背景技术:
1、随着人工智能和机器学习技术的不断进步,声纹识别技术在生物特征识别领域表现出色。声纹识别具有独特性、便利性和高安全性,逐渐成为身份验证的一种重要方式。
2、特别是随着语音助手和智能对话系统的普及,声纹识别技术被应用于对话系统中,以提高系统的用户体验和安全性,基于声纹识别身份的对话难度调整方法,通过将声纹识别技术与人机交互相结合,动态调整对话的难度,提高系统的安全性和用户体验。
技术实现思路
1、本发明针对现有技术中存在的技术问题,提供基于声纹识别身份的对话难度调整方法,以解决上述背景技术中提出的问题。
2、本发明解决上述技术问题的技术方案如下:基于声纹识别身份的对话难度调整方法,具体包括以下步骤:
3、步骤101、收集多个动画角色的声纹数据,并对收集的声纹数据进行预处理;
4、步骤102、使用声纹识别算法,从预处理的声纹数据中提取声纹的特征,并存储到角色声纹特征库中,所述声纹特征包括音调、语速、音色,将提取的声纹特征与角色身份进行关联,建立角色的声纹模型;
5、步骤103、针对每个动画角色,设定不同的对话难度级别,使用建立好的角色声纹模型进行声纹识别,根据声纹识别结果确定动画角色身份,根据识别到的角色身份,将设定的对话难度级别与相应的动画角色进行关联,动态调整对话策略和难度。
6、在一个优选地实施方式中,所述步骤101中,收集多个动画角色的声纹数据,并对收集的声纹数据进行预处理,具体步骤如下:
7、步骤a1、声音信号采集:使用音频设备为每个动画角色录制一段标准的原始声音样本,创建一个声音数据库,将其存储为不同的文件夹,并将采集到的声纹数据进行切割,分为较短的语音片段,每段长度为1-3秒;
8、步骤a2、预处理声音数据:对切割后的语音片段进行预处理,以提高声纹特征的可靠性和准确性,包括去除噪音、增强语音信号、端点检测操作,所述端点检测操作是使用基于短时能量变化率的端点检测方法,对语音片段进行检测,确定语音的起始和结束点,进一步包括以下步骤:
9、步骤a201、计算短时能量:对语音信号进行分帧处理,每帧的长度为n个采样点,对每帧进行加窗,并计算其能量,具体计算公式如下:
10、
11、其中,e(n)表示第n帧的能量值,n是每帧的采样点数,s(i)表示第n帧中第i个采样点的语音信号值,表示加窗函数中的第i个采样点的值;
12、步骤a202、计算相邻帧之间的能量变化率为e(n)-e(n-1),定义一个能量变化率门限r,对于每个采样点n,当能量变化率大于门限r,将当前采样点n标记为语音的起始点;继续遍历后续采样点,直到遇到连续m个采样点的能量变化率均小于门限r:将当前采样点n标记为语音的结束点。
13、在一个优选地实施方式中,所述步骤102中,使用声纹识别算法,从预处理的声纹数据中提取声纹的特征,并存储到角色声纹特征库中,所述声纹特征包括音调、语速、音色,将提取的声纹特征与角色身份进行关联,建立角色的声纹模型,具体步骤如下:
14、步骤b1、声纹特征提取:从预处理后的声音数据中提取声纹特征,通过计算声音信号的频谱来获取音调、语速、音色,并将提取到的声纹特征转化为声纹向量,存储到角色声纹特征库中,便于后续的模式匹配和比对,进一步包括以下步骤:
15、步骤b101、将声音信号进行分帧处理,将长时间的声音信号切割成若干个短时段的帧,对每个帧应用加窗函数来消除频谱泄漏,并将其转化为时域信号乘以窗函数的结果,通过对每一帧进行傅里叶变换,得到每一帧的频谱信息,具体计算公式如下:
16、
17、其中,x(h)是输入信号的时域波形,是加窗函数,x(h,ω)是在第h帧的频率为ω的复数值频谱,j是虚数单位,m是离散时间的索引,h为窗口函数的长度;
18、步骤b102、声纹向量:对于每个声音信号帧,将得到的频谱信息表示为一个频谱图谱,通过对数变换方式将频谱图谱进行预处理,将其转化为频谱向量,通过将频谱向量进行降维处理,得到最终的声纹特征向量;
19、步骤b2、建立声纹模型:将提取的声纹特征与角色身份进行关联,使用机器学习算法,将声纹特征与角色身份进行匹配和识别,建立角色的声纹模型,进一步包括以下步骤:
20、步骤b201、建立声纹特征库:将提取的声纹特征存储到角色声纹特征库中,每个角色包括多个声纹特征向量,每个特征向量包含音调、语速、音色特征,
21、使用角色id标识符将声纹特征与角色进行关联,当有新的声音进行声纹识别时,通过比对角色的声纹特征来确定角色的身份;
22、步骤b202、使用卷积神经网络建立角色声纹模型,通过多层卷积和池化操作,提取声纹特征,并通过全连接层进行分类,具体计算公式如下:
23、y=softmax(wλ+b)
24、其中,λ表示声纹特征,y表示角色标签,w是权重矩阵,b是偏置项,softmax函数用于将输出转化为概率分布,表示不同角色的概率。
25、在一个优选地实施方式中,所述步骤103中,针对每个动画角色,设定不同的对话难度级别,使用建立好的角色声纹模型进行声纹识别,根据声纹识别结果确定动画角色身份,根据识别到的角色身份,将设定的对话难度级别与相应的动画角色进行关联,动态调整对话策略和难度,具体步骤如下:
26、步骤c1、设定对话难度级别:根据角色的特性、语速、词汇量因素进行设定,为每个动画角色设定不同的对话难度级别,将对话难度分为简单、中等和困难级别;
27、步骤c2、对话内容录制:在对话过程中,持续使用音频设备以短时间段为单位录制角色的声音,对每个录制的声音片段进行声纹特征提取,包括音调、语速、音色特征,根据之前存储的声纹特征提取方法来提取对话中的角色声纹特征;
28、步骤c3、声纹识别:当开始进行对话时,使用建立好的角色声纹模型进行声纹识别,通过提取对话中的角色声纹特征并与预先存储的声纹模型进行比对,根据声纹识别结果确定动画角色身份;
29、步骤c4、动态调整对话策略:将设定的对话难度级别与识别到的动画角色身份进行关联,根据预设的对话难度级别为该角色调整对话策略和难度。
30、本发明的有益效果是:收集多个动画角色的声纹数据,并对收集的声纹数据进行预处理,使用声纹识别算法,从预处理的声纹数据中提取声纹的特征,并存储到角色声纹特征库中,所述声纹特征包括音调、语速、音色,将提取的声纹特征与角色身份进行关联,建立角色的声纹模型,针对每个动画角色,设定不同的对话难度级别,使用建立好的角色声纹模型进行声纹识别,根据声纹识别结果确定动画角色身份,根据识别到的角色身份,将设定的对话难度级别与相应的动画角色进行关联,动态调整对话策略和难度,随着对话难度的动态调整,用户与动画角色之间的对话能够更贴近角色特点,让互动更加生动有趣,增加用户的参与感和沉浸感。
1.基于声纹识别身份的对话难度调整方法,其特征在于,具体包括以下步骤:
2.根据权利要求1所述的基于声纹识别身份的对话难度调整方法,其特征在于:所述步骤101中,收集多个动画角色的声纹数据,并对收集的声纹数据进行预处理,具体步骤如下:
3.根据权利要求2所述的基于声纹识别身份的对话难度调整方法,其特征在于,所述步骤a2中,所述端点检测操作是使用基于短时能量变化率的端点检测方法,对语音片段进行检测,确定语音的起始和结束点,进一步包括以下步骤:
4.根据权利要求1所述的基于声纹识别身份的对话难度调整方法,其特征在于,所述步骤102中,使用声纹识别算法,从预处理的声纹数据中提取声纹的特征,并存储到角色声纹特征库中,所述声纹特征包括音调、语速、音色,将提取的声纹特征与角色身份进行关联,建立角色的声纹模型,具体步骤如下:
5.根据权利要求4所述的基于声纹识别身份的对话难度调整方法,其特征在于,所述步骤b1声纹特征提取中,通过计算声音信号的频谱来获取音调、语速、音色,并使用短时傅里叶变换将提取到的声纹特征转化为声纹向量,进一步包括以下步骤:
6.根据权利要求4所述的基于声纹识别身份的对话难度调整方法,其特征在于,所述步骤b2建立声纹模型中,使用机器学习算法,将声纹特征与角色身份进行匹配和识别,建立角色的声纹模型,进一步包括以下步骤:
7.根据权利要求1所述的基于声纹识别身份的对话难度调整方法,其特征在于,所述步骤103中,针对每个动画角色,设定不同的对话难度级别,使用建立好的角色声纹模型进行声纹识别,根据声纹识别结果确定动画角色身份,根据识别到的角色身份,将设定的对话难度级别与相应的动画角色进行关联,动态调整对话策略和难度,具体步骤如下:
