← 最新论文
🤖 machine learning

From A to B to A: Palindromic Zero-Shot Voice Conversion with Non-Parallel Data

本文提出了一种非并行零样本语音转换框架,该框架利用 WavLM 表示上的 K-最近邻检索,从多语言数据中构建合成训练对,在仅使用英文数据进行训练的情况下,实现了极高的自然度和说话人相似度。

原作者: Moshe Mandel, Shlomo E. Chazan

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Moshe Mandel, Shlomo E. Chazan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想用你最喜欢的名人的声音来唱一首歌,但你手里只有一段你自己唱歌的录音,以及一段该名人的短促(10秒)说话片段。你并没有他们演唱这首特定歌曲的录音。这就是**语音转换(Voice Conversion)**的挑战:将一个人的语音转换为另一个人的声音,同时又不丢失词句和原意。

通常,为了教计算机完成这项任务,你需要“平行数据”——即成千上万小时由 A 人和 B 人同时说出的相同句子。这就像是需要一本每一对单词都并排翻译好的字典。这既昂贵又难以寻找,而且对于许多语言来说,这种数据往往并不存在。

这篇论文介绍了一种巧妙的新方法,利用非平行数据(即来自许多不同人的随机语音集合)以及一个被称为**“从 A 到 B 再到 A”**的技巧来训练计算机。

以下是该系统的工作原理,通过简单的概念进行拆解:

1. “魔镜”戏法(回文框架)

其核心思想就像一面能将声音来回反射的魔镜。

  • 问题: 计算机需要学习如何将“你的声音”转化为“名人的声音”,但它并没有一对完美的录音来进行学习。
  • 解决方案: 研究人员使用“最近邻搜索”(KNN)创建了一个**“伪造训练对”**。
    • 想象你有一个名人的声音库。
    • 计算机观察你所说的句子,找到该名人已经说过的一句听起来最相似的句子,然后进行声音替换。
    • 现在,计算机拥有了一个用该名人的声音说出的、关于你句子的“伪造”版本。
    • 回文(Palindrome): 随后,计算机被训练去将这个“伪造的”名人声音转回成真实的名人声音(而它拥有真实的音频作为基准真相)。
    • 通过学习修复自己制造的“伪造”错误,模型学会了如何准确地将任何声音转换为目标声音,即使它从未见过那个特定的声音。

2. 三步流水线

该系统由三个阶段组成的工厂式结构:

  1. 翻译员 (WavLM): 首先,计算机倾听音频,并将声波转化为一种“特征语言”(就像把一首歌变成乐谱)。它使用一个名为 WavLM 的预训练 AI 来理解语音的内容,而不去关注是谁在说话。
  2. 变色龙 (Transformer): 这是主要的大脑。它获取源说话人的“乐谱”,并尝试重写它,使其看起来像目标说话人的“乐谱”。它通过在第一步中创建的“伪造对”上进行练习来学习。
  3. 歌手 (Vocoder): 最后,系统将新的“乐谱”重新转化为实际的声波(音频)。

3. “身份警察”(说话人损失函数)

语音转换中有一个大问题是,计算机可能会改变词义或让声音听起来很机械。为了解决这个问题,研究人员加入了一个严格的“身份警察”(说话人验证模型)。

  • 这就像是一个俱乐部的保安。每当计算机生成一个新声音时,保安都会检查:“这听起来像目标名人吗?”
  • 如果声音听起来太像原始说话人或陌生人,保安就会将其退回进行修正。这确保了最终结果听起来完全像你想模仿的那个人。

4. 结果:“一效多用”

研究人员在英语和许多其他语言(如法语、德语和西班牙语)上测试了该系统。

  • 神奇之处: 他们仅在英语数据上训练了该系统。
  • 惊喜: 当他们在从未见过的其他语言上进行测试时,效果依然非常好。它不需要针对这些语言进行重新训练或“微调”。
  • 表现: 与其他顶尖系统相比,该方法在保持目标说话人身份(使其听起来像正确的人)方面表现更好,并且在保持词句清晰自然方面也同样出色。当参考片段非常短(仅 3 秒)时,其表现尤为令人印象深刻。

总结

简而言之,这篇论文介绍了一个通过利用其自身创建的伪造数据进行练习来学习改变声音的系统。它使用一种“镜像”策略来教会自己如何实现一种声音到另一种声音的映射,而无需需要完美的、并排的录音。它就像是一个通用的声音翻译器,能够模仿任何语言中的任何人,即使它只接受过英语训练。

注:本文完全侧重于技术方法和性能指标(声音质量及词汇准确度)。它并未讨论任何特定的未来应用、临床用途或商业产品。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →