X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning
X-Voice 是一个轻量级的 04B 多语言零样本语音克隆模型,基于 42 万小时语料库训练而成,采用新颖的两阶段范式并结合架构改进,使其能够在无需音频提示转录文本的情况下,以 30 种语言实现高质量语音合成,其性能可与十亿级参数规模的模型相媲美。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想学习说 30 种不同的语言,但你没有老师、没有教科书,甚至没有脚本。你只有一段朋友声音的简短录音。X-Voice 是一款全新的 AI 模型,让这一切成为可能。它是一只“声音变色龙”,能够提取你朋友的声音,并让它用这 30 种语言中的任何一种说话,即使你的朋友从未说过这些语言。
以下是论文对 X-Voice 的解释,拆解为简单的概念:
1. 问题:“脚本”瓶颈
当今大多数语音克隆 AI 就像一位严格的演员,需要剧本。要克隆声音,你通常需要两样东西:
- 该人的简短音频片段。
- 该人在该片段中确切所说的内容的转录文本。
这对于英语或中文来说效果很好,因为获取书面转录很容易。但对于许多其他语言(尤其是稀有语言或方言),获取准确的转录非常困难甚至不可能。如果没有脚本,AI 就会感到困惑,无法正确克隆声音。
2. 解决方案:两阶段训练营
研究人员使用一种巧妙的“两阶段”训练方法构建了 X-Voice,就像一位主厨培训学徒一样。
第一阶段:主厨(X-Voice1)
首先,他们利用来自 30 种不同语言的 42 万小时语音数据训练了一个庞大的模型。这就像是一位知晓世间所有食谱和口味的“主厨”。这个模型非常擅长说话,但它仍然需要脚本才能知道说什么。第二阶段:学徒(X-Voice2)
这里是魔法所在。研究人员利用“主厨”生成了 1 万小时的新音频。他们取一段真实的声音片段,输入给主厨,并让它说一段不同的文本。现在,他们利用这些新音频片段教模型一个新课程:“忽略脚本,只听声音。”他们训练模型仅使用音频来重现原始声音,完全隐藏文本。这就创造了X-Voice2,这是最终无需阅读转录文本即可克隆声音的模型。
3. 秘密武器:“双层”语言注入
当你要求 AI 使用旧声音说一门新语言时,一个常见的问题是“口音泄露”。例如,如果你要求一位法语使用者用日语说“你好”,AI 可能会不小心给它加上法语口音。
为了解决这个问题,研究人员发明了一种双层语言注入系统。想象 AI 有两个不同的“旋钮”来控制语言:
- 文本旋钮:告诉 AI说什么词。
- 时间旋钮:告诉 AI何时说以及节奏应该是怎样的。
通过同时调节这两个旋钮,AI 可以完美地将声音(这个人独特的声音)与口音(语言的节奏)分离开来。这确保了这个人听起来像他自己,但能正确地说出新语言。
4. 结果:快速、免费且流利
论文声称 X-Voice 是一个"0.4B"模型,这意味着与占据整个服务器机房的大型模型相比,它相对小巧轻便。
- 速度:因为它不使用缓慢的、逐步的“自回归”方法(像一次写一个词那样),所以它能非常快速地生成语音。
- 质量:在测试中,它的表现与那些大得多的商业模型(如 Qwen3-TTS)一样好,但不需要转录文本。
- 开源:团队免费发布了所有数据(42 万小时的音频)和代码,因此任何人都可以使用它。
总结类比
把 X-Voice 想象成声音的通用翻译器。
- 旧 AI:“只有当你把这句特定的话读给我听,并且我有这句话的书面文本时,我才能克隆你的声音。”
- X-Voice:“我仅凭你哼唱的 5 秒钟片段就能克隆你的声音,并且能瞬间让你说 30 种不同的语言,甚至不需要知道你在哼唱什么词。”
论文总结道,这项技术消除了多语言语音克隆的最大障碍:对书面转录的需求。它允许任何人用任何人的声音说任何语言,只要他们有一段简短的音频样本。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。