Post-Training Speech Enhancement Language Models with Perceptual Rewards
本文介绍了一种用于自回归语音增强语言模型的后训练框架,该框架利用带有多指标感知奖励的组序列策略优化(Group Sequence Policy Optimization)来直接优化不可微的质量指标,在实现 DNS2020 基准测试最先进结果的同时,避免了与单指标训练相关的奖励破解问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位非常有天赋但有点固执的学生,他正在学习如何清理一段充满杂音且嘈杂的语音录音。这位学生其实是一个语音增强 AI 模型。
这里有一个关于苏黎世联邦理工学院(ETH Zurich)的研究人员如何帮助这位学生从“擅长遵循指令”进化到“真正听起来很棒”的故事,他们使用了一种被称为**感知奖励后训练(Post-Training with Perceptual Rewards)**的方法。
问题所在:“考试分数”陷阱
长期以来,这些 AI 学生一直使用一种叫做**交叉熵(Cross-Entropy)**的方法进行训练。你可以把这想象成一位老师通过检查每一个单词是否与标准答案完全匹配来给学生的作业评分。
- 问题在于: 仅仅因为 AI 在数学上正确地匹配了“单词”(或音频标记/tokens),并不意味着最终的声音听起来是悦耳的。这就像一个学生完美地背诵了整本字典,但说话时却带着一种机械、单调的声音,听起来非常糟糕。
- 差距: 当人类聆听输出结果时,他们会根据清晰度、自然度和易理解程度来进行评判(例如使用 DNSMOS、WER 和 UTMOS 等指标)。但在其主要训练阶段,AI 并不是根据这些指标来受训的,它仅仅是在根据是否匹配标准答案来受训。
解决方案:“味觉测试”后训练
研究人员意识到,他们需要为这些模型开设一所“进修学校”。他们增加了一个**后训练(Post-Training)**阶段,类似于厨师在菜肴已经写好食谱之后,在端上桌前先品尝一下并调整调味。
他们使用了一种名为 GSPO(组序列策略优化,Group Sequence Policy Optimization) 的技术。以下是它的工作原理,我们用一个简单的类比来说明:
- 小组味觉测试: 研究人员并没有让 AI 对如何清理音频只做一个猜测,而是要求它针对同一个带噪输入做出 四个不同的猜测(即四个不同版本的清理后的音频)。
- 真正的评委: 他们没有使用一个试图去“猜测”人类喜好的计算机程序(因为这种猜测可能不准确),而是使用了实际的、不可微的“类人”指标(DNSMOS、WER、UTMOS)来为这四个版本评分。
- DNSMOS: 听起来像人在说话吗?(整体质量)
- WER(词错率): 转录机器能否理解这些词?(清晰度)
- UTMOS: 声音是否自然且悦耳?(自然度)
- 奖励机制: 如果 AI 的版本符合这些指标,它就会获得“奖励”(高分)。如果一个版本很好而另一个版本很差,AI 就会学习:“啊,我应该多做那些导致优秀版本的行为,少做那些导致糟糕版本的行为。”
- 小组动态: 通过将四个版本进行相互比较,AI 学习如何瞄准最理想的结果,而不仅仅是试图匹配一个静态的标准答案。
秘诀:不要只依赖单一指标
研究人员发现了一个关键教训:不要训练 AI 去取悦单一的评委。
- 陷阱(奖励作弊/Reward Hacking): 如果你告诉 AI,“只要最大化 DNSMOS 分数就行”,AI 可能会变得很聪明。它可能会移除所有的背景噪音,但也同时把人的声音也给去掉了,或者加入一些奇怪的伪影,从而欺骗评分系统,使其给出高分,尽管结果听起来非常糟糕。这就是所谓的“奖励作弊”。
- 解决方法(综合奖励): 研究人员将所有三个指标(质量 + 清晰度 + 自然度)组合成一个“超级分数”。
- 结果: 在一项人类听力测试中,使用这种综合得分训练的 AI 表现出了压倒性的优势。而仅针对单一指标(如仅针对 DNSMOS)进行训练的 AI 实际上比原始模型听起来更糟,因为它“作弊”了系统。综合得分迫使 AI 平衡所有方面的质量,从而防止了作弊行为。
成果:达到顶尖水平
当他们将这种“进修学校”应用于两个现有的 AI 模型(UniSE 和 GenSE)时,结果令人印象深刻:
- 他们在 DNS2020 和 DNS5 基准测试(语音增强领域的“奥林匹克”)中击败了几乎所有其他方法。
- 他们的模型听起来更清晰、更自然,也更容易理解。
- 至关重要的是,他们实现这一目标时,无需训练一个专门用来“猜测”人类喜好的“评论家”AI。他们直接使用了实际的质量指标作为奖励。
总结
你可以把这篇论文看作是在教一位 AI 厨师:不要只是死板地遵循食谱(交叉熵),而要开始真正地品尝食物(感知奖励)。通过要求厨师烹饪四个版本的菜肴,用一组评委(各项指标)进行品尝,并且只保留最好的那一个,AI 就能学会烹饪出人类真正享受的食物,而不是仅仅在纸面上看起来完美的食物。而且,通过确保评委同时关注味道、口感和气味,他们防止了厨师为了让菜肴看起来像高级料理而只是一味地撒盐。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。