← 最新论文
⚡ electrical engineering

Qwen3-TTS Technical Report

Qwen3-TTS 系列推出了一系列先进的、采用 Apache 2.0 许可的多语言文本转语音模型,这些模型基于超过 500 万小时的数据进行训练,具有最先进的语音克隆、细粒度控制以及采用专用分词器的双轨架构,从而实现了实时、超低延迟的流式合成。

原作者: Hangrui Hu, Xinfa Zhu, Ting He, Dake Guo, Bin Zhang, Xiong Wang, Zhifang Guo, Ziyue Jiang, Hongkun Hao, Zishan Guo, Xinyu Zhang, Pei Zhang, Baosong Yang, Jin Xu, Jingren Zhou, Junyang Lin

发布于 2026-01-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Hangrui Hu, Xinfa Zhu, Ting He, Dake Guo, Bin Zhang, Xiong Wang, Zhifang Guo, Ziyue Jiang, Hongkun Hao, Zishan Guo, Xinyu Zhang, Pei Zhang, Baosong Yang, Jin Xu, Jingren Zhou, Junyang Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你的口袋里有一个神奇的录音室,它可以瞬间变成你描述的任何声音,或者仅通过几秒钟的音频就能复制一个声音。这本质上就是 Qwen3-TTS 团队在这份报告中所介绍的技术。

不要仅仅把这项技术看作是一个“文本转语音”工具,而要把它看作是一个全能的声音变形器。以下是利用简单的类比,对它的工作原理及特别之处进行的详细拆解。

1. 两个“声音引擎”(分词器/Tokenizers)

团队构建了两种不同的“引擎”来将文本转化为声音,具体取决于你的需求。他们称之为分词器(Tokenizers)

  • “高保真”引擎 (25Hz):

    • 类比: 把它想象成一部高分辨率的 4K 电影。它捕捉到了声音的每一个微小细节,使声音听起来极其丰富且自然。
    • 工作原理: 它将语音分解成小的块。因为它需要稍微“向前看”一点,以确保声音流动完美(就像导演在检查下一场戏一样),所以它在发出第一个声音之前需要多花一点点时间。
    • 最适合: 当你想要绝对的最佳质量,并且不在乎那零点几秒延迟的时候。
  • “即时”引擎 (12Hz):

    • 类比: 把它想象成一个高速快递服务。它不会等看到整个包裹后再发送第一个盒子;它会在第一个盒子准备好时就立即发出。
    • 工作原理: 它使用了一个聪明的技巧,即先发送单词最重要的“含义”,然后紧接着填充声学细节。这使得它能在 97 毫秒内开始说话(比人类眨眼还要快)。
    • 最适合: 实时对话场景,比如与机器人助手交谈,你不希望在它开口说话前还要等待它“思考”。

2. “声音克隆”的魔力

通常,克隆一个声音需要数小时的录制。Qwen3-TTS 改变了游戏规则,它说:“给我 3 秒钟,我就能给你整个声音。”

  • 类比: 想象你有一位顶级大厨,他只需品尝一勺汤,就能瞬间重现整道菜的配方,包括那些秘密香料。
  • 功能: 你可以喂给它一段 3 秒钟的人说话的片段,它就能用那个完全相同的声音生成无限的新句子。它还可以通过你的描述来创造全新的声音(例如:“一个低沉、暴躁、听起来像是刚睡醒的机器人声音”)。

3. “多语言通晓者”

这个模型不仅仅擅长一种语言,它是一个语言上的变色龙

  • 类比: 想象一位演员,他背下了 10 种不同语言的剧本,但在所有语言中都保持着相同的个性与表演风格。
  • 功能: 它在超过 500 万小时的语音数据上进行了训练,涵盖 10 种语言。如果你要求它用从中文母语者那里学到的声音来说韩语,它不仅会翻译单词,还会保持原说话者独特的“音色”(声音的质感),同时完美地使用韩语。它处理复杂的语言对(如中韩之间)的表现比以往任何系统都要出色。

4. “无限讲述者”

AI 声音面临的一个大问题是,它们往往会感到疲劳、重复,或者在几分钟后听起来变得机械化。

  • 类比: 想象一位疲惫的电台主持人,在播报一小时后开始语无伦次。Qwen3-TTS 则像是一位精力充沛的旁白员,可以朗读长达 10 分钟的故事,而不会气喘吁吁或改变语调。
  • 功能: 团队专门针对处理长文本进行了训练。它可以生成超过 10 分钟的连续、流畅的语音,而不会出现通常在 AI 尝试长时间说话时产生的“故障”或瑕疵。

5. “指令遵循型”导演

你不仅限于复制声音,你还可以指挥表演。

  • 类比: 想象你是一位正在对演员说话的电影导演。你可以说:“读这一行,但听起来像是你在低声诉说一个秘密,”或者“说这个,但听起来像是你对惊喜感到兴奋。”
  • 功能: 你可以输入指令,如“说话慢一点且忧伤一点”或“听起来像是一个兴致勃勃的新闻主播”,模型会立即调整声音以匹配你的描述。它对这些复杂指令的理解能力优于许多之前的模型。

总结

Qwen3-TTS 团队发布了一系列快速、多语言且极具可控性的模型。他们通过提供两个版本(一个用于即时速度,一个用于最高质量)解决了“速度与质量”之间的权衡问题,并证明了 AI 现在可以从极小的样本中克隆声音、同时流利地使用多种语言,并讲述长篇故事而不显疲态。

他们将这些工具向所有人开放(开源),希望开发者和研究人员能够利用它们来构建下一代人机对话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →