使用深度生成网络的实时数据包丢失隐藏的制作方法

xiaoxiao2026-08-31  3


本公开涉及一种用于使用神经网络系统执行数据包丢失隐藏的方法、一种用于训练用于数据包丢失隐藏的神经网络系统的方法以及一种实施所述方法的计算机实施的神经网络系统。


背景技术:

1、通信技术领域内的大多数实施是在受约束的实时条件下操作的,以确保用户在通信中不会经历任何延迟或中断。互联网语音协议(voip)是通信协议的一个示例,它在严格的实时条件下操作以使用户能够进行自然对话。为了满足严格的条件,voip和类似的通信协议依赖于稳定的数据包流,每个数据包携带通信信号的一部分,这些数据包从发送实体连续且没有中断地传输到接收实体。然而,在实践中,数据包经常被延迟、以错误的顺序传递到接收实体、或者甚至完全丢失,从而在通信信号中引入明显的失真和中断,这会降低用户体验到的通信质量。

2、为此,需要一种执行数据包丢失隐藏(plc)的改进方法。


技术实现思路

1、用于执行数据包丢失隐藏的先前解决方案涉及复制最近数据包的结构和采用音频处理,使得信号能量衰减以自然地延长最新数据包代替下一个数据包的持续时间。然而,虽然先前的解决方案在某种程度上降低了丢失数据包的可察觉性,但是通信信号的中断仍然会妨碍通信信号质量,并且特别是对于长时间的中断,即使在plc处理之后,用户可能仍然会感觉到通信信号中的失真。

2、为此,本公开的目的是提供一种用于执行数据包丢失隐藏的改进的方法和系统。

3、根据本公开的第一方面,提供了一种用于不完整音频信号的数据包丢失隐藏的方法,其中,不完整音频信号包括替换完整音频信号的原始信号部分的替代信号部分。所述方法包括获得所述不完整音频信号的表示,以及将所述不完整音频信号的表示输入到编码器神经网络,所述编码器神经网络被训练成在给定不完整音频信号的表示的情况下预测完整音频信号的潜在表示。所述编码器神经网络输出预测的完整音频信号的潜在表示,并且所述潜在表示被输入到解码器神经网络,所述解码器神经网络被训练成在给定完整音频信号的潜在表示的情况下预测完整音频信号的表示,其中,所述解码器神经网络输出所述预测的完整音频信号的表示,所述预测的完整音频信号的表示包括所述完整音频信号的原始部分的重构,其中,所述编码器神经网络和所述解码器神经网络已经用对抗神经网络进行训练。

4、替代信号部分是指替换完整音频信号的对应(真实)部分(的替代)的信号部分。例如,替代信号部分可以是沉默(零)信号部分,其指示信号的一部分已经丢失、被破坏或缺失。虽然通常使用零信号来指示未被接收或缺失的信号部分,但是也可以使用其他替代信号部分,例如特定频率的锯齿信号或任何其他预定类型的信号,所述信号已经被建立来表示代替完整音频信号的实际信号部分的替代信号部分。在一些实施方式中,缺失信号部分被指示为元数据以使得能够将替代信号部分与例如实际的完全沉默(零)信号部分区分开。

5、在一些实施方式中,所述方法进一步包括量化所述完整音频信号的潜在表示以获得经量化潜在表示,其中,所述经量化潜在表示是通过从预定的词分(token)词汇组中选择一组词分来形成的。使用经量化潜在表示的至少一个词分来调节生成神经网络,其中,所述生成神经网络被训练成在给定所述组词分中的至少一个词分的条件下预测所述组词分中的不同词分,其中,生成潜在模型输出潜在表示的预测的词分和与预测的词分相关联的置信度量度。基于预测的词分的置信度,用生成模型的预测的词分替换经量化潜在表示的对应词分以形成提供给解码器神经网络的一组校正的词分(校正的经量化表示)。

6、上述神经网络系统包括由编码器神经网络和解码器神经网络形成的深度因果对抗自动编码器,编码器神经网络和解码器神经网络一起学习以生成提供不完整音频信号的重构完整音频信号的表示。因果自动编码器是非自回归模型,其可以用单个推断步骤预测任意长的信号部分(例如,跨越若干数据包)。在一些实施方式中,解码器直接输出波形表示,并且由于对抗训练,输出的波形可以是完整音频信号的非常精确的重构。因果自动编码器可以生成重构完整音频信号,其中,替代信号部分超过100毫秒,这与使用自回归环路逐帧生成的大多数现有模型相反。

7、因果自动编码器中不存在时间依赖性,这意味着所述模型可以在一个单个前馈步骤中输出任何长度的重构音频信号(以任何采样率),这与从输出到输入采用某种形式的自回归环路的大多数现有技术数据包丢失隐藏解决方案相反。利用可选的生成潜在模型,可以增强针对长持续时间丢失的数据包丢失隐藏性能。另外地,因果自动编码器是确定性的,这意味着相同的输入将产生相同的输出。然而,由于因果自动编码器生成模拟真实数据的数据,因此因果自动编码器可以被称为发生器对抗训练设置中的发生器。这与依赖于随机变量来执行新数据生成的其他发生器形成对比,其他发生器不会有助于确定性过程。

8、在一些实施方式中,因果自动编码器由生成潜在模型辅助,所述生成潜在模型对因果自动编码器的经量化潜在表示进行操作。生成潜在模型尤其能够在更长的时间内(例如,超过100毫秒)进行信号重构,而且还能够对任何长度的重构进行便利的重构。

9、根据本公开的第二方面,提供了一种用于音频信号的数据包丢失隐藏的计算机实施的神经网络系统,其中,所述音频信号包括替换完整音频信号的原始信号部分的替代信号部分。所述系统包括:输入单元,所述输入单元被配置为获得不完整音频信号的表示;以及编码器神经网络,所述编码器神经网络被训练成在给定不完整音频信号的表示的情况下预测完整音频信号的潜在表示,并且被配置为接收不完整音频信号的表示并输出预测的完整音频信号的潜在表示。所述神经网络系统进一步包括解码器神经网络,所述解码器神经网络被训练成在给定重构完整音频信号的潜在表示的情况下预测完整音频信号的表示,并且被配置成接收预测的完整音频信号的潜在表示并输出重构完整音频信号的表示,以及输出单元,所述输出单元被配置成输出预测的完整音频信号的表示,所述预测的完整音频信号包括完整音频信号的原始部分的重构,其中,所述编码器神经网络和所述解码器神经网络已经用对抗神经网络进行训练。

10、根据本公开的第三方面,提供了一种用于训练用于数据包丢失隐藏的神经网络系统的方法,所述方法包括获得用于数据包丢失隐藏的神经网络系统,

11、获得鉴别器神经网络,获得一组训练数据,以及通过将所述组训练数据提供给所述神经网络系统并将所述神经网络系统的输出提供给所述鉴别器神经网络,在生成-对抗训练模式下使用所述组训练数据结合所述鉴别器神经网络训练所述神经网络系统。在一些实施方式中,鉴别器包括以不同采样率操作的至少两个鉴别器分支,并且所述方法进一步包括基于所述至少两个鉴别器分支的单独指示符来确定聚合似然指示符。

12、根据第二方面和第三方面的公开以与根据第一方面的公开相同或等同的实施例和益处为特征。例如,神经网络系统的编码器和解码器可能已经使用具有以不同采样率操作的至少两个鉴别器分支的鉴别器进行训练。进一步地,关于方法描述的任何功能可以在用于在计算机程序产品中执行这种功能的系统或代码中具有对应的结构特征。


技术特征:

1.一种用于训练用于数据包丢失隐藏的神经网络系统的方法,所述方法包括:

2.根据权利要求1所述的用于训练用于数据包丢失隐藏的神经网络系统的方法,其中,所述训练数据包括随机噪声信号。

3.根据权利要求1或权利要求2所述的用于训练用于数据包丢失隐藏的神经网络系统的方法,其中,所述训练数据包括记录的音频信号的至少一个示例。

4.根据权利要求1至3中任一项所述的用于训练用于数据包丢失隐藏的神经网络系统的方法,其中,所述鉴别器神经网络包括两个神经网络分支,所述方法进一步包括:

5.根据权利要求1至4中任一项所述的用于训练用于数据包丢失隐藏的神经网络系统的方法,其中,所述鉴别器网络输出指示所述神经网络系统的输出包括完整音频信号的似然的似然测度,并且其中,结合所述鉴别器神经网络训练所述神经网络系统包括:

6.根据权利要求5所述的用于训练用于数据包丢失隐藏的神经网络系统的方法,进一步包括


技术总结
提供了一种使用深度生成网络的实时数据包丢失隐藏。本公开涉及一种用于使用神经网络系统执行数据包丢失隐藏的方法和系统。方法包括获得不完整音频信号的表示,将不完整音频信号的表示输入到编码器神经网络,并输出预测的完整音频信号的潜在表示。潜在表示被输入到解码器神经网络,解码器神经网络输出预测的完整音频信号的表示,预测的完整音频信号的表示包括完整音频信号的原始部分的重构,其中,该编码器神经网络和该解码器神经网络已经用对抗神经网络进行训练。

技术研发人员:S·帕斯夸尔,J·塞拉,J·庞斯普伊格
受保护的技术使用者:杜比国际公司
技术研发日:
技术公布日:2024/9/23
转载请注明原文地址:https://www.famiwei.com/read-9026857.html

最新回复(0)