← 最新论文
⚡ electrical engineering

X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning

X-Voice 是一个轻量级的 04B 多语言零样本语音克隆模型,基于 42 万小时语料库训练而成,采用新颖的两阶段范式并结合架构改进,使其能够在无需音频提示转录文本的情况下,以 30 种语言实现高质量语音合成,其性能可与十亿级参数规模的模型相媲美。

原作者: Rixi Xu, Qingyu Liu, Haitao Li, Yushen Chen, Zhikang Niu, Yunting Yang, Jian Zhao, Ke Li, Berrak Sisman, Qinyuan Cheng, Xipeng Qiu, Kai Yu, Xie Chen

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Rixi Xu, Qingyu Liu, Haitao Li, Yushen Chen, Zhikang Niu, Yunting Yang, Jian Zhao, Ke Li, Berrak Sisman, Qinyuan Cheng, Xipeng Qiu, Kai Yu, Xie Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想学习说 30 种不同的语言,但你没有老师、没有教科书,甚至没有脚本。你只有一段朋友声音的简短录音。X-Voice 是一款全新的 AI 模型,让这一切成为可能。它是一只“声音变色龙”,能够提取你朋友的声音,并让它用这 30 种语言中的任何一种说话,即使你的朋友从未说过这些语言。

以下是论文对 X-Voice 的解释,拆解为简单的概念:

1. 问题:“脚本”瓶颈

当今大多数语音克隆 AI 就像一位严格的演员,需要剧本。要克隆声音,你通常需要两样东西:

  1. 该人的简短音频片段。
  2. 该人在该片段中确切所说的内容的转录文本

这对于英语或中文来说效果很好,因为获取书面转录很容易。但对于许多其他语言(尤其是稀有语言或方言),获取准确的转录非常困难甚至不可能。如果没有脚本,AI 就会感到困惑,无法正确克隆声音。

2. 解决方案:两阶段训练营

研究人员使用一种巧妙的“两阶段”训练方法构建了 X-Voice,就像一位主厨培训学徒一样。

  • 第一阶段:主厨(X-Voice1)
    首先,他们利用来自 30 种不同语言的 42 万小时语音数据训练了一个庞大的模型。这就像是一位知晓世间所有食谱和口味的“主厨”。这个模型非常擅长说话,但它仍然需要脚本才能知道说什么

  • 第二阶段:学徒(X-Voice2)
    这里是魔法所在。研究人员利用“主厨”生成了 1 万小时的音频。他们取一段真实的声音片段,输入给主厨,并让它说一段不同的文本。

    现在,他们利用这些新音频片段教模型一个新课程:“忽略脚本,只听声音。”他们训练模型仅使用音频来重现原始声音,完全隐藏文本。这就创造了X-Voice2,这是最终无需阅读转录文本即可克隆声音的模型。

3. 秘密武器:“双层”语言注入

当你要求 AI 使用旧声音说一门新语言时,一个常见的问题是“口音泄露”。例如,如果你要求一位法语使用者用日语说“你好”,AI 可能会不小心给它加上法语口音。

为了解决这个问题,研究人员发明了一种双层语言注入系统。想象 AI 有两个不同的“旋钮”来控制语言:

  • 文本旋钮:告诉 AI说什么词。
  • 时间旋钮:告诉 AI何时说以及节奏应该是怎样的。

通过同时调节这两个旋钮,AI 可以完美地将声音(这个人独特的声音)与口音(语言的节奏)分离开来。这确保了这个人听起来像他自己,但能正确地说出新语言。

4. 结果:快速、免费且流利

论文声称 X-Voice 是一个"0.4B"模型,这意味着与占据整个服务器机房的大型模型相比,它相对小巧轻便。

  • 速度:因为它不使用缓慢的、逐步的“自回归”方法(像一次写一个词那样),所以它能非常快速地生成语音。
  • 质量:在测试中,它的表现与那些大得多的商业模型(如 Qwen3-TTS)一样好,但不需要转录文本。
  • 开源:团队免费发布了所有数据(42 万小时的音频)和代码,因此任何人都可以使用它。

总结类比

把 X-Voice 想象成声音的通用翻译器

  • 旧 AI:“只有当你把这句特定的话读给我听,并且我有这句话的书面文本时,我才能克隆你的声音。”
  • X-Voice:“我仅凭你哼唱的 5 秒钟片段就能克隆你的声音,并且能瞬间让你说 30 种不同的语言,甚至不需要知道你在哼唱什么词。”

论文总结道,这项技术消除了多语言语音克隆的最大障碍:对书面转录的需求。它允许任何人用任何人的声音说任何语言,只要他们有一段简短的音频样本。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →