← 最新论文
⚡ electrical engineering

dots.tts Technical Report

本文介绍了 dots.tts,这是一个拥有 20 亿参数的连续自回归 TTS 基础模型,通过在 AudioVAE 训练、全历史条件化以及无奖励自纠正方面的创新,在多语言语音生成、声音克隆和情感表达能力方面实现了最先进的性能,同时还通过 MeanFlow 蒸馏提供低延迟推理,并开源了所有代码和检查点。

原作者: Shi Lian, Changtao Li, Bohan Li, Hankun Wang, Da Zheng, Junfeng Tian, Yufeng Ma, Colin Zhang, Kai Yu

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Shi Lian, Changtao Li, Bohan Li, Hankun Wang, Da Zheng, Junfeng Tian, Yufeng Ma, Colin Zhang, Kai Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是 dots.tts 技术报告的中文翻译,保留了原有的生动比喻与语气:

核心理念:一种新型的配音演员

想象一下,你想制造一个能够说任何语言、模仿任何人、并能表达任何情感的机器人。长期以来,大多数语音机器人更像是莫尔斯电码机。它们必须在说话之前,将文字转化为一系列有限的“声音块”(离散标记)。这种方式虽然高效,但意味着机器人无法捕捉到人类语音中那些细微、流畅的差别,比如轻微的呼吸声、独特的笑声或复杂的歌唱旋律。

dots.tts 是一个拥有 20 亿参数的新型 AI 模型,它抛弃了“声音块”的概念。它将语音视为河流中流动的流水(连续流)。它不会把语音切碎,而是预测流中下一个微小的水滴,这使得声音更加平滑、自然且富有表现力。

工作原理:三部分组成的交响乐团

论文将 dots.tts 描述为一个协同工作的三部分团队,共同创造出这种流动的声音:

  1. 翻译官 (AudioVAE):
    你可以把它想象成一台高保真的相机和投影仪。它将原始声波压缩成一种“秘密语言”(连续潜空间),以便计算机理解。

    • 创新点: 通常,这些秘密语言是混乱的。dots.tts 团队使用了一个特殊的“老师”(WavLM)来训练这个翻译官,以确保这种秘密语言能够完整保留所有的情感和声学细节,使团队中的下一部分成员更容易读取。
  2. 说书人 (LLM):
    这是整个操作的大脑,基于文本 AI(Qwen2.5)。它阅读你输入的文字,并规划应该说什么

    • 创新点: 团队没有直接把原始、混乱的音频数据喂给说书人,而是构建了一个语义编码器 (Semantic Encoder)。它就像一份“摘要笔记”,告诉说书人:“过去几秒钟的声音是快乐且响亮的”,而不会让它被技术性的噪音淹没。这让说书人能够专注于含义,防止在长句子中感到困惑。
  3. 画家 (Flow-Matching Head):
    这是真正绘制声音的艺术家。它获取说书人的计划和过去音频的“摘要笔记”,然后画出接下来的几秒钟声音。

    • 创新点: 团队意识到,如果画家犯了一个小错,下一步就会基于这个错误继续构建,导致声音偏离轨道(就像玩“传声筒”游戏一样)。为了解决这个问题,他们使用了全历史条件控制 (Full-History Conditioning)。想象一下,画家在画下一笔时,会观察自己已经画出的整个画布,而不只是最后一笔,以确保整体画面保持一致。

解决“漂移”问题:自我修正循环

即使有优秀的画家,在处理长句子时也会出错。论文引入了一个聪明的技巧,叫做无奖励自我修正 (Reward-Free Self-Correction)

  • 类比: 想象一个正在学画的学生。通常,他们需要老师说:“那条线画歪了。”但在这种情况下,AI 是它自己的老师。它生成一幅画,然后立即尝试“撤销”其中的一小部分并重新绘制,通过从自己的错误中学习,而不需要人类来评分。这种“自我修正”训练使声音更加稳定,不太容易在长篇演讲中出现故障。

加速过程:“MeanFlow”捷径

生成流动的声音通常很慢,因为计算机必须采取许多微小的步骤才能得到正确的结果。

  • 类比: 想象你从家走到公园。旧的方法是走 100 个细小且谨慎的步子。新方法(称为 MeanFlow Distillation)就像拥有一个 GPS,它告诉你:“迈出 4 个巨大且自信的步伐就能到达那里。”
  • 结果: 团队成功地压缩了这个过程,使 AI 只需要 2 到 4 步而不是许多步即可生成语音。这使得语音生成速度极快——仅需 54 毫秒(比人类眨眼还快)——非常适合实时对话。

成果展示 (计分板)

团队在多项挑战中,将 dots.tts 与现有的顶尖语音系统(如 CosysVoice、Seed-TTS 及商业产品)进行了对比测试:

  • 准确性: 它在表达内容方面极少出错(低词错率),在标准测试中击败了几乎所有对手。
  • 声音克隆: 如果你给它一段 3 秒钟的人声片段,它可以完美模仿,其“相似度”得分高于任何其他开源模型。
  • 多语言能力: 它能流利地使用 24 种语言,并在切换语言时保持说话人的音色不变。
  • 表现力: 它处理复杂任务(如唱歌、情感对话以及拟声词,如叹息或笑声)的能力优于以往依赖“声音块”的模型。

总结

dots.tts 的突破在于,它证明了要实现语音 AI,并不需要将语音切碎成细小、僵硬的碎片。通过将语音视为连续的流动,并赋予 AI 自我修正和观察“大局”的工具,他们创造出了一个具备以下特性的系统:

  1. 更自然(像水一样流动,而非块状)。
  2. 更稳定(在长谈中不会产生漂移)。
  3. 足够快(足以进行实时聊天)。

该团队已免费发布了所有代码和模型,允许任何人基于这种“连续性”的语音技术进行开发。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →