✨ 要点🔬 技术摘要
想象一下,你的口袋里有一个神奇的录音室,它可以瞬间变成你描述的任何声音,或者仅通过几秒钟的音频就能复制一个声音。这本质上就是 Qwen3-TTS 团队在这份报告中所介绍的技术。
不要仅仅把这项技术看作是一个“文本转语音”工具,而要把它看作是一个全能的声音变形器 。以下是利用简单的类比,对它的工作原理及特别之处进行的详细拆解。
1. 两个“声音引擎”(分词器/Tokenizers)
团队构建了两种不同的“引擎”来将文本转化为声音,具体取决于你的需求。他们称之为分词器(Tokenizers) 。
“高保真”引擎 (25Hz):
类比: 把它想象成一部高分辨率的 4K 电影 。它捕捉到了声音的每一个微小细节,使声音听起来极其丰富且自然。
工作原理: 它将语音分解成小的块。因为它需要稍微“向前看”一点,以确保声音流动完美(就像导演在检查下一场戏一样),所以它在发出第一个声音之前需要多花一点点时间。
最适合: 当你想要绝对的最佳质量,并且不在乎那零点几秒延迟的时候。
“即时”引擎 (12Hz):
类比: 把它想象成一个高速快递服务 。它不会等看到整个包裹后再发送第一个盒子;它会在第一个盒子准备好时就立即发出。
工作原理: 它使用了一个聪明的技巧,即先发送单词最重要的“含义”,然后紧接着填充声学细节。这使得它能在 97 毫秒 内开始说话(比人类眨眼还要快)。
最适合: 实时对话场景,比如与机器人助手交谈,你不希望在它开口说话前还要等待它“思考”。
2. “声音克隆”的魔力
通常,克隆一个声音需要数小时的录制。Qwen3-TTS 改变了游戏规则,它说:“给我 3 秒钟,我就能给你整个声音。”
类比: 想象你有一位顶级大厨,他只需品尝一勺汤,就能瞬间重现整道菜的配方,包括那些秘密香料。
功能: 你可以喂给它一段 3 秒钟的人说话的片段,它就能用那个完全相同的声音生成无限的新句子。它还可以通过你的描述来创造全新的 声音(例如:“一个低沉、暴躁、听起来像是刚睡醒的机器人声音”)。
3. “多语言通晓者”
这个模型不仅仅擅长一种语言,它是一个语言上的变色龙 。
类比: 想象一位演员,他背下了 10 种不同语言的剧本,但在所有语言中都保持着相同的个性与表演风格。
功能: 它在超过 500 万小时 的语音数据上进行了训练,涵盖 10 种语言。如果你要求它用从中文母语者那里学到的声音来说韩语,它不仅会翻译单词,还会保持原说话者独特的“音色”(声音的质感),同时完美地使用韩语。它处理复杂的语言对(如中韩之间)的表现比以往任何系统都要出色。
4. “无限讲述者”
AI 声音面临的一个大问题是,它们往往会感到疲劳、重复,或者在几分钟后听起来变得机械化。
类比: 想象一位疲惫的电台主持人,在播报一小时后开始语无伦次。Qwen3-TTS 则像是一位精力充沛的旁白员 ,可以朗读长达 10 分钟的故事,而不会气喘吁吁或改变语调。
功能: 团队专门针对处理长文本进行了训练。它可以生成超过 10 分钟的连续、流畅的语音,而不会出现通常在 AI 尝试长时间说话时产生的“故障”或瑕疵。
5. “指令遵循型”导演
你不仅限于复制声音,你还可以指挥表演。
类比: 想象你是一位正在对演员说话的电影导演。你可以说:“读这一行,但听起来像是你在低声诉说一个秘密,”或者“说这个,但听起来像是你对惊喜感到兴奋。”
功能: 你可以输入指令,如“说话慢一点且忧伤一点”或“听起来像是一个兴致勃勃的新闻主播”,模型会立即调整声音以匹配你的描述。它对这些复杂指令的理解能力优于许多之前的模型。
总结
Qwen3-TTS 团队发布了一系列快速、多语言且极具可控性 的模型。他们通过提供两个版本(一个用于即时速度,一个用于最高质量)解决了“速度与质量”之间的权衡问题,并证明了 AI 现在可以从极小的样本中克隆声音、同时流利地使用多种语言,并讲述长篇故事而不显疲态。
他们将这些工具向所有人开放(开源),希望开发者和研究人员能够利用它们来构建下一代人机对话。
技术摘要:Qwen3-TTS
问题陈述
神经文本转语音(TTS)领域旨在实现稳定、可控且类人的语音合成,这一能力被视为通往通用人工智能(AGI)的关键路径。虽然基于大规模数据集训练的现代模型可以从短参考音频生成高质量语音,但在平衡稳定性与自然度、实现用于实时流式传输的超低延迟,以及在多样化语言和长文本语境下保持鲁棒性能方面仍面临挑战。现有的方法往往在分词(tokenization)过程中的语义保真度与声学丰富度之间难以权衡,或者由于复杂的基于扩散(diffusion-based)的解码器和前瞻(look-ahead)需求而面临延迟瓶颈。此外,如何将 TTS 无缝集成到大语言模型(LLM)中,以支持细粒度的指令遵循和语音克隆,同时避免对 ASR 指标的过拟合,仍然是一个重大障碍。
方法论
架构与分词
Qwen3-TTS 引入了一个基于双轨自回归架构的模型家族,专为实时合成设计。其核心创新在于开发了两个不同的语音分词器,以满足不同的延迟和质量需求:
Qwen-TTS-Tokenizer-25Hz: 一种强调语义内容的单码本编解码器(25 Hz)。它构建在 Qwen2-Audio 编码器之上,并增加了重采样和矢量量化(VQ)层。它利用基于流匹配(Flow Matching)的块状扩散 Transformer(DiT)进行波形重建。该分词器集成了语义和声学线索,能够与 Qwen-Audio 无缝集成,并通过滑动窗口块注意力机制支持流式传输。然而,其单码本设计和前瞻需求限制了其在超低延迟应用中的适用性。
Qwen-TTS-Tokenizer-12Hz: 一种具有 16 层残差矢量量化(RVQ)设计的多码本编解码器(12.5 Hz)。第一个码本捕捉语义内容,随后的层则对声学细节进行建模。受 Mimi 架构启发,它采用了带有教师-学生(WavLM)设置的 GAN 训练框架来处理语义路径。至关重要的是,它使用了完全因果(fully causal)的特征编码器和解码器,允许在无需前瞻的情况下立即发射首个数据包。波形重建由轻量级因果卷积网络(ConvNet)处理,消除了对说话人向量提取或复杂扩散模型的需求。
模型架构
Qwen3-TTS 模型利用了 Qwen3 大语言模型(LM)家族。
双轨表示: 文本和声学 token 沿通道轴进行拼接。在接收到文本 token 后,模型会预测相应的声学 token,随后由 Code2Wav 模块将其转换为波形。
分层预测(12Hz 版本): 主干网络预测第零层码本,而多 token 预测(MTP)模块生成所有残差码本,从而捕捉复杂的声学细节并增强语音一致性。
说话人控制: 一个可学习的说话人编码器与主干网络进行联合训练,以保持精确的身份控制。该系统支持通过参考语音(说话人嵌入)或文本-语音对(上下文学习)进行语音克隆,同时也支持通过自然语言描述进行语音设计。
训练策略
训练过程包括预训练和后训练阶段,所有数据均采用 ChatML 格式:
预训练:
通用阶段 (S1): 在超过 500 万小时的多语言语音数据上进行训练,以建立单调的文本到语音映射。
高质量阶段 (S2): 在分层的高质量数据上进行持续预训练(CPT),以减少幻觉并提高语音质量。
长上下文阶段 (S3): 将 token 长度从 8,192 增加到 32,768,并通过对长语音数据进行上采样,以增强上下文处理能力。
后训练:
直接偏好优化 (DPO): 使用构建的偏好对使输出符合人类偏好。
基于规则的奖励与 GSPO: 增强各项任务中的能力和稳定性。
轻量级说话人微调: 使基础模型适应特定声音,同时提高自然度和可控性。
指令遵循: 在训练中引入了一种概率激活的思维模式,以提高对复杂描述的遵循能力。
核心贡献
双分词器框架: 引入了两个专门的分词器(25Hz 用于高保真语义集成,12Hz 用于超低延迟流式传输),使模型能够在表达能力与实时性能之间取得平衡。
超低延迟流式传输: 12Hz 版本通过使用因果、多码本设计,实现了极低的首次数据包延迟(0.6B 模型为 97 ms,1.7B 模型为 101 ms),从而能够立即发射波形。
高级可控性: 模型支持 3 秒语音克隆、预定义语音配置文件,以及通过自然语言描述对语音创建(Voice Design)和编辑(Target Speaker)进行的细粒度控制。
鲁棒的多语言性能: 在超过 500 万小时、涵盖 10 种语言的数据上进行训练,该模型展示了说话人一致的多语言生成能力和卓越的跨语言语音迁移能力。
长文本稳定性: 该架构解决了自回归模型中常见的稳定性问题,能够无缝生成超过 10 分钟的流畅语音,避免了块状系统(chunk-based systems)常见的伪影问题。
实验结果
语音分词器评估
25Hz 分词器: 在 ASR 任务(CommonVoice, Fleurs)上取得了与 S3 分词器系列相当或更优的词错率(WER),尤其是在第一阶段。第二阶段的 WER 略有上升,这是由于为了获得更好的 TTS 生成效果而刻意在声学丰富度方面进行了权衡。
12Hz 分词器: 在 LibriSpeech test-clean 集的所有指标(PESQ, STOI, UTMOS, SIM)上,在语音重建方面创下了新的纪录,超越了 Mimi、SpeechTokenizer 和 X-Codec 等模型,同时保持了极高的编码效率。
语音生成评估
零样本克隆: 在 Seed-TTS 基准测试中,Qwen3-TTS-12Hz-1.7B 的 WER 分别为 1.24(英语)和 0.77(中文),优于 CosyVoice 3、Seed-TTS 和 MiniMax-Speech 等基准模型。
多语言生成: 与 MiniMax 和 ElevenLabs 相比,该模型在 10 种语言中的 6 种语言(包括中文、英文、韩文、俄文)中实现了最低的 WER,并在所有 10 种语言中获得了最高的说话人相似度得分。
跨语言迁移: 展示了卓越的泛化能力,与 CosyVoice 3 相比,在中译韩生成中的错误率降低了约 66%。
可控生成: 在 InstructTTSEval 上,12Hz Voice Design 版本在描述-语音一致性(DSD)和响应精准度(RP)方面优于开源模型和商业系统(Hume, VoiceSculptor)。在目标说话人编辑(Target Speaker editing)方面,它显著优于 GPT-4o-mini-tts。
长文本生成: 25Hz 版本在 10 分钟长文本测试集中实现了最低的 WER(中文 1.533,英文 1.571),展示了优于 Higgs-Audio-v2 和 VibeVoice 等块状系统的稳定性。
效率
流式延迟: 在单并发条件下,12Hz 模型的首次数据包延迟(97–101 ms)明显低于 25Hz 模型(138–150 ms)。
并发性: 模型在不同并发水平(1, 3, 6)下均能保持稳定的性能,其中 12Hz 版本显示出更低的每个数据包稳态成本。
意义
论文声称,Qwen3-TTS 代表了迈向稳定、可控且类人语音合成的重要一步。通过在单一自回归框架内统一多样化的任务——零样本克隆、跨语言迁移和细粒度指令控制——它为下一代全能型音频系统铺平了道路。发布这两个模型及其分词器(采用 Apache 2.0 许可证)旨在促进社区研究以及开发更自然、更易获取的人机交互界面。这项工作强调,结合语义与声学分词、因果解码以及先进的训练策略,可以克服以往 TTS 架构中的延迟与稳定性限制。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。