← 最新论文
💻 computer science

PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech Enhancement

该论文提出了 PASE,这是一个生成式语音增强框架,它利用预训练 WavLM 模型的鲁棒音韵先验来有效缓解语言和声学幻觉,同时实现比现有方法更优越的感知质量。

原作者: Xiaobin Rong, Qinwen Hu, Mansur Yesilbursa, Kamil Wojcicki, Jing Lu

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaobin Rong, Qinwen Hu, Mansur Yesilbursa, Kamil Wojcicki, Jing Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在嘈杂、轰鸣的体育场中听清一位朋友的声音。你的大脑是一项了不起的工程奇迹;它能过滤掉观众的尖叫声和震耳欲聋的音乐,从而专注于你朋友的话语。几十年来,科学家们一直试图制造出能做到同样事情的计算机,这个领域被称为语音增强(Speech Enhancement)。其目标很简单:将一段杂乱、多噪的录音进行清理,使其听起来像是录制在安静的房间里一样。

传统上,计算机通过扮演一个非常严格的编辑来完成这项工作,即切掉声波中“不好”的部分。但这往往会让声音听起来带有机器人感或显得平淡。最近,新一代的“生成式”计算机出现了。不要把它们看作是编辑,而要看作是能够重新构思声音应有模样的天才艺术家。它们非常擅长让声音听起来自然且流畅。然而,这里有一个陷阱:因为它们太擅长于想象,有时会变得过于“放飞自我”。如果噪音太大,它们可能会发明出从未被说出的词汇,或者将说话者的声音变成完全不同的另一个人。这被称为“幻觉(hallucination)”。这就像一位音乐家试图修复一段损坏的录音,却因为猜测“应该”在那里而误弹了错误的音符。大问题在于:我们如何既能获得新一代艺术家的自然音质,又不让他们编造故事?

这就是来自南京大学和思科系统(Cisco Systems)的研究人员提出的新研究所要解决的问题。他们提出了一种名为 PASE(音素锚定语音增强器,Phonologically Anchored Speech Enhancer)的系统来解决这个“过于有创意”的问题。他们并没有教计算机从零开始猜测单词,而是决定给它一个基于人类语音实际运作方式的参考依据。

研究人员意识到,之前的“生成式”系统试图通过观察嘈紧、破碎的录音来学习语言规则。这就像是通过观看一场在暴风雪中进行的比赛来学习足球规则,而在暴风雪中你几乎看不见球。计算机会感到困惑并开始发明规则。PASE 采取了不同的方法。它使用了一个名为 WavLM 的预训练 AI 模型,该模型已经学习了数千小时清晰的语音。可以将 WavLM 想象成一位精通语言学的专家,他确切地知道人类的声音(音素)是如何组合在一起的。PASE 不尝试重新学习这些规则;它只是向这位语言学专家寻求帮助。它利用专家的知识来“锚定”清理过程,确保计算机永远不会发明一个不符合人类语音结构的单词。

为了处理声音的个性(例如说话者独特的音调和音高),PASE 使用了一个巧妙的双轨系统。想象一下计算机是一位画家。一条轨道专注于“故事”(单词和意义),利用语言学专家的帮助来确保故事的准确性。另一条轨道则专注于“纹理”(说话者的声音),从 AI 的底层提取细微特征,以保持说话者的原声。通过将这两条轨道分离但又协同工作,PASE 避免了在修复单词的同时改变说话者身份的常见陷阱。

他们的实验结果非常令人振奋。当他们测试 PASE 与其他顶尖模型时,它不仅听起来很好,而且准确度更高。在针对极度嘈杂音频的测试中,其他模型经常会编造单词,导致在极端情况下“词错率”(衡量错误单词数量的指标)高达 36% 甚至 72%。然而,PASE 保持了较低的错误率,根据测试不同,大约在 7.5% 到 15% 之间,同时听起来依然自然。它在保持说话者声音听起来像原作者而非变成陌生人方面也做得更好。

作者指出,成功的关键不仅仅是拥有更大的计算机或更多的数据,而是使用了正确的“先验知识”。他们发现,理解语音结构的能力来自于 AI 被训练去预测缺失声音的具体方式,而不仅仅是来自于看到海量的数据。通过利用这种特定的知识,PASE 表现得像一位纪律严明的艺术家:它拥有填补嘈杂录音空白处的创造力,但它受到人类语言规则的严格引导,因此绝不会越界去胡编乱造。这使得它成为一个更可靠的工具,适用于对清晰度和准确性要求同样高的现实世界场景。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →