以下是 dots.tts 技术报告的中文翻译,保留了原有的生动比喻与语气:
核心理念:一种新型的配音演员
想象一下,你想制造一个能够说任何语言、模仿任何人、并能表达任何情感的机器人。长期以来,大多数语音机器人更像是莫尔斯电码机。它们必须在说话之前,将文字转化为一系列有限的“声音块”(离散标记)。这种方式虽然高效,但意味着机器人无法捕捉到人类语音中那些细微、流畅的差别,比如轻微的呼吸声、独特的笑声或复杂的歌唱旋律。
dots.tts 是一个拥有 20 亿参数的新型 AI 模型,它抛弃了“声音块”的概念。它将语音视为河流中流动的流水(连续流)。它不会把语音切碎,而是预测流中下一个微小的水滴,这使得声音更加平滑、自然且富有表现力。
工作原理:三部分组成的交响乐团
论文将 dots.tts 描述为一个协同工作的三部分团队,共同创造出这种流动的声音:
翻译官 (AudioVAE):
你可以把它想象成一台高保真的相机和投影仪。它将原始声波压缩成一种“秘密语言”(连续潜空间),以便计算机理解。
- 创新点: 通常,这些秘密语言是混乱的。dots.tts 团队使用了一个特殊的“老师”(WavLM)来训练这个翻译官,以确保这种秘密语言能够完整保留所有的情感和声学细节,使团队中的下一部分成员更容易读取。
说书人 (LLM):
这是整个操作的大脑,基于文本 AI(Qwen2.5)。它阅读你输入的文字,并规划应该说什么。
- 创新点: 团队没有直接把原始、混乱的音频数据喂给说书人,而是构建了一个语义编码器 (Semantic Encoder)。它就像一份“摘要笔记”,告诉说书人:“过去几秒钟的声音是快乐且响亮的”,而不会让它被技术性的噪音淹没。这让说书人能够专注于含义,防止在长句子中感到困惑。
画家 (Flow-Matching Head):
这是真正绘制声音的艺术家。它获取说书人的计划和过去音频的“摘要笔记”,然后画出接下来的几秒钟声音。
- 创新点: 团队意识到,如果画家犯了一个小错,下一步就会基于这个错误继续构建,导致声音偏离轨道(就像玩“传声筒”游戏一样)。为了解决这个问题,他们使用了全历史条件控制 (Full-History Conditioning)。想象一下,画家在画下一笔时,会观察自己已经画出的整个画布,而不只是最后一笔,以确保整体画面保持一致。
解决“漂移”问题:自我修正循环
即使有优秀的画家,在处理长句子时也会出错。论文引入了一个聪明的技巧,叫做无奖励自我修正 (Reward-Free Self-Correction)。
- 类比: 想象一个正在学画的学生。通常,他们需要老师说:“那条线画歪了。”但在这种情况下,AI 是它自己的老师。它生成一幅画,然后立即尝试“撤销”其中的一小部分并重新绘制,通过从自己的错误中学习,而不需要人类来评分。这种“自我修正”训练使声音更加稳定,不太容易在长篇演讲中出现故障。
加速过程:“MeanFlow”捷径
生成流动的声音通常很慢,因为计算机必须采取许多微小的步骤才能得到正确的结果。
- 类比: 想象你从家走到公园。旧的方法是走 100 个细小且谨慎的步子。新方法(称为 MeanFlow Distillation)就像拥有一个 GPS,它告诉你:“迈出 4 个巨大且自信的步伐就能到达那里。”
- 结果: 团队成功地压缩了这个过程,使 AI 只需要 2 到 4 步而不是许多步即可生成语音。这使得语音生成速度极快——仅需 54 毫秒(比人类眨眼还快)——非常适合实时对话。
成果展示 (计分板)
团队在多项挑战中,将 dots.tts 与现有的顶尖语音系统(如 CosysVoice、Seed-TTS 及商业产品)进行了对比测试:
- 准确性: 它在表达内容方面极少出错(低词错率),在标准测试中击败了几乎所有对手。
- 声音克隆: 如果你给它一段 3 秒钟的人声片段,它可以完美模仿,其“相似度”得分高于任何其他开源模型。
- 多语言能力: 它能流利地使用 24 种语言,并在切换语言时保持说话人的音色不变。
- 表现力: 它处理复杂任务(如唱歌、情感对话以及拟声词,如叹息或笑声)的能力优于以往依赖“声音块”的模型。
总结
dots.tts 的突破在于,它证明了要实现语音 AI,并不需要将语音切碎成细小、僵硬的碎片。通过将语音视为连续的流动,并赋予 AI 自我修正和观察“大局”的工具,他们创造出了一个具备以下特性的系统:
- 更自然(像水一样流动,而非块状)。
- 更稳定(在长谈中不会产生漂移)。
- 足够快(足以进行实时聊天)。
该团队已免费发布了所有代码和模型,允许任何人基于这种“连续性”的语音技术进行开发。
技术摘要:dots.tts
1. 问题陈述
本文针对当前文本转语音(TTS)系统的两个主要局限性提出了探讨:
- 离散 Token 的局限性: 主流的自回归(AR)TTS 系统依赖于离散的声学 Token。虽然这允许复用大语言模型(LLM)架构,但量化瓶颈限制了系统建模涵盖语音、情感副语言、歌唱及通用音频的单一分布的能力。
- 连续 AR 的不稳定性: 近期尝试将语音建模为连续表示自回归生成的尝试避免了量化,但面临长程误差累积的问题。不同于离散系统通过编解码器将不完美的样本“拉回”到有效配置,连续潜变量会忠实地重建每一个微小的预测误差,并将其作为下一步的条件反馈。这会导致在长序列生成过程中出现漂移和不稳定。
- 后训练阶段尚不成熟: 连续 AR 模型的后训练技术栈不如离散 Token 系统成熟,缺乏在没有外部奖励模型的情况下纠正推理时误差的鲁棒方法。
2. 方法论
dots.tts 是一个拥有 20 亿参数、全连续、端到端自回归 TTS 基础模型。它通过三个核心架构与训练创新,在连续潜空间中对语音进行建模:
A. 语义因果音频 VAE (Semantic Causal AudioVAE)
该系统构建于一个高保真 AudioVAE 之上,将 48 kHz 单声道语音编码为 25 Hz 的 128 维潜变量流(1920× 时间下采样)。
- 架构: 使用了 BigVGAN-v2 解码器的因果变体以及全因果卷积编码器。
- 训练目标:
- 阶段 1: 专注于重建质量,使用多周期/子带 CQT 对抗损失、多尺度梅尔频谱损失以及特征匹配损失,并通过 KL + flow 先验进行正则化。
- 阶段 2: 增强 AR 主干的可学习性。它增加了 WavLM 表示对齐损失(帧级余弦对齐)和多任务下游模块(ASR、情感、说话人分类)。这确保了潜空间在不牺牲重建保真度的前提下,具备语义结构且易于预测。
- 语义编码器: 该模块从 AudioVAE 训练流水线中移植,将每个生成的 25 Hz VAE 潜变量块投影为单个 6.25 Hz 的音频语义嵌入。它剥离了高方差的声学细节,为 LLM 提供紧凑的语义摘要而非原始潜变量。
B. 自回归流匹配主干 (Autoregressive Flow-Matching Backbone)
主干由三个解耦的部分组成:
- 语义编码器: 将 VAE 块转换为 LLM 输入。
- LLM 主干: 初始化自 Qwen2.5-1.5B,消耗 BPE 文本 Token 和 6.25 Hz 的语义嵌入。它负责处理长程文本到内容的建模。
- 双流模式: 支持 1T1A 交错模式(文本 Token 与音频步长交替),用于低延迟对话,允许在完整话语生成前即开始合成。
- 自回归流匹配 (AR-FM) 头: 一个扩散 Transformer (DiT),用于生成接下来的四个帧的 VAE 潜变量块。
- 全历史条件控制: 该头以 LLM 隐藏状态、所有先前的干净块以及当前的噪声块作为条件。
- 块因果注意力 (Block-Causal Attention): 一种专门的训练掩码,允许在所有块之间进行并行训练,同时严格还原推理时的逐步自回归上下文,确保训练与 Rollout 之间的数值一致性。
C. 训练流水线与后训练
训练分为三个阶段:
- 预训练:
- 模态对齐: 使语义编码器和 AR-FM 头与冻结的 LLM 对齐。
- 通用训练: 在 150 万小时的多语言数据上进行端到端训练。
- 退火: 在高质量子集上进行微调。
- 无奖励自我纠正对齐 (SOAR):
- 将 SOAR 概念应用于 AR 流匹配头。
- 模型从自身的推理状态执行脱离(detached)欧拉 Rollout,以生成“偏离轨迹”的误差。
- 随后训练模型将这些误差引导回干净的潜变量终点。这提高了鲁в性与声学质量,且无需奖励模型或外部教师。
- CFG 感知 MeanFlow 蒸馏:
- 将自我纠正的教师 DiT 蒸馏到学生 DiT 中。
- 学生模型预测一个时间间隔内的平均速度,将分类器无关引导 (CFG) 直接融合进目标中。
- 这实现了仅需 2–4 次函数评估 (NFE) 即可完成低延迟推理,消除了对独立条件/无条件传递的需求。
3. 核心贡献
- dots.tts 模型: 一个 20 亿参数的全连续 AR TTS 系统,去除了离散声学 Token,同时实现了最先进的稳定性和零样本语音克隆质量。
- 稳定性机制: 通过三位一体的设计来缓解连续 AR 的不稳定性:
- 具有 WavLM 对齐的语义因果 AudioVAE。
- 将语义规划(LLM)与声学渲染(AR-FM)解耦。
- 用于流匹配头的无奖励自我纠正对齐。
- 效率: 实现了 CFG 感知的 MeanFlow 蒸馏和全因果 1T1A 交错流式传输,实现了极低的首次包延迟(普通模式 85 ms,交错模式 54 ms),适用于实时部署。
4. 实验结果
模型在 150 万小时语音上进行训练,并在多个基准测试中进行了评估:
Seed-TTS-Eval (零样本语音克隆):
- 在开源系统中取得了最佳的平均性能。
- WER(字错率): 0.94% (zh), 1.30% (en), 6.60% (zh-hard)。
- SIM(说话人相似度): 81.0 (zh), 77.1 (en), 79.5 (zh-hard)。
- 超越了 CosyVoice 3、Seed-TTS 和 VoxCPM 2 等基线模型。
MiniMax 多语言测试集 (24 种语言):
- 在平均说话人相似度 (83.9) 上领先,超过了表现第二的基线模型 (VoxCPM 2 为 82.3)。
- 在 24 种语言中的 19 种语言上取得了最高的 SIM。
- WER 具有竞争力,但由于 BPE Token 覆盖范围限制,在低资源语言上略高。
CV3-Eval (跨语言克隆):
- 在跨语言任务中领先说话人相似度 (en→zh 为 75.0, zh→en 为 72.8),显著优于 CosyVoice 3。
- 在经过 SOAR 后训练阶段后,在 "hard-en" 子集上表现出显著提升。
EmergentTTS-Eval (表现力):
- 在所有系统(包括开源和闭源)中获得了最高的句法复杂度得分 (65.7%),超越了 Gemini-2.5-Pro。
- 在情感 (72.7%) 以及相对于 gpt-4o-mini-tts 的整体胜率方面领先开源系统。
- 注意到一个权衡:SOAR 提升了文本忠实度 (Syntax),但相比预训练检查点,在情感表现力方面略有代价。
效率:
- 在单张 NVIDIA H800 GPU 上,MeanFlow 蒸馏模型在交错流式模式下实现了 54 ms 的首包延迟 (TTFP),RTF 为 0.245。
5. 意义与声明
论文声称 dots.tts 成功弥合了连续潜变量生成的高表现力与生产所需稳定性之间的鸿沟。通过将语义推理与声学渲染解耦,并引入无奖励自我纠正机制,作者证明了连续 AR TTS 可以在不使用离散量化的情况下,实现最先进的稳定性和语音克隆质量。
该工作被呈现为一个可复现的连续-AR TTS 参考堆栈,采用 Apache 2.0 协议发布,并提供完整的训练与推理代码。作者将该系统定位为实时对话应用的有效解决方案,在高质量、多语言覆盖和低延迟之间取得了平衡,而这正是以往连续模型难以同时实现的。
承认的局限性:
- 低资源语言: 由于 BPE Token 覆盖范围限制,在差异化剧本或代表性不足的语言(如阿拉伯语、印地语)上的表现有限。
- 范围: 当前版本侧重于语音;歌唱及统一的语音-声音生成尚未涵盖。
- 控制: 系统是在标准的零样本条件下评估的,缺乏显式的风格或指令控制(尽管配对字幕的数据集暗示了前进路径)。
- 安全性: 作者承认了高保真零样本语音克隆的风险,并鼓励使用感知同意的政策和检测工具。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。