End-to-End Training for Discrete Token LLM based TTS System
本文提出了一种全端到端训练框架,通过联合优化语音分词器、自回归大语言模型、流匹配模型和奖励模型来统一基于离散标记的 TTS 组件,与传统的级联方法相比,该框架在实现新的最先进性能的同时,显著简化了流水线。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心思想:从接力赛到交响乐
想象一下,构建一个文本转语音(TTS)系统(即让计算机朗读文本的系统)就像在组建一支接力赛队伍。
旧方法(级联流水线):
在大多数现有系统中,你有三位独立的跑者:
- 翻译官(分词器/Tokenizer): 将声音转化为一组数字组成的秘密代码(标记/tokens)。
- 预测员(大语言模型/LLM): 阅读文本并猜测该秘密代码中的下一个数字。
- 歌手(流匹配模型/FM Model): 将这些猜出的数字重新转化为声波。
问题在于?这三位跑者是分开训练的。翻译官训练目标是做好语音识别(ASR),预测员训练目标是猜测数字,而歌手训练目标是重建声音。他们在练习期间从未交流过。当他们最终一起比赛时,会因为互不了解彼此的风格而踉跄跌倒。这就像是一个翻译官所使用的方言,预测员听不懂,从而导致最终表演一团糟。
新方法(端到端训练):
本文提出,将所有三位跑者(加上一位教练)放在一起进行一次大型、统一的练习赛。他们学习说同一种语言,预判彼此的动作,并实时调整自己的表现。
角色介绍
语音分词器(翻译官):
- 职责: 它将人类的声音切碎成微小的、离散的“乐高积木”(标记)。
- 旧有问题: 它以前是为“人类”设计的优秀翻译官(例如用于语音转文字应用),而不是专门为计算机的下一步操作设计的。
- 改进方案: 在这个新系统中,翻译官学习制作专门为预测员和歌手使用的乐高积木。
大语言模型(预测员):
- 职责: 它阅读你输入的文本,并预测实现该文本所需的乐高积木序列。
- 旧有问题: 它曾被训练去猜测“最可能”出现的积木,这往往会让声音听起来平淡、乏味或显得“平庸”。
- 改进方案: 它能从歌手和教练那里获得即时反馈,了解它的猜测是否真的听起来很好,而不仅仅是统计学上的概率是否正确。
流匹配模型(歌手):
- 职责: 它接过乐高积木,并构建出实际的语音波形。
- 旧有问题: 它是在“完美”的积木(来自真实数据)上训练的,但在现实中,预测员会犯错。因此,当面对不完美的积木时,歌手会崩溃。
- 改进方案: 它学会了即使在积木略有瑕疵的情况下也能歌唱,使系统更加稳健。
奖励模型(教练):
- 职责: 这是一个新增角色。它倾听输出内容并检查三件事:“他们说对词了吗?”(ASR/语音识别)、“听起来像同一个人吗?”(说话人识别/Speaker ID)以及“听起来有情感吗?”(情感/Emotion)。
- 角色: 它充当裁判,为准确的发音和风格打分,引导整个团队走向更好的表现。
如何训练:三阶段排练
作者并没有直接把所有人扔进赛场,而是使用了一个聪明的三阶段训练流程来保持稳定性。
第一阶段:基础建设(一阶损失/First-Order Loss)
- 类比: 想象翻译官、预测员和歌手都在看着同一份“完美的剧本”和“完美的录音”。
- 过程: 他们共同学习。翻译官学习制作易于预测员猜测且易于歌手使用的积木。教练在一旁观察,确保积木承载了正确的含义和情感。
- 目标: 让大家步调一致,防止翻译官制造出让其他人困惑的“坏”积木。
第二阶段:独立练习
- 类比: 翻译官现在成为了大师,停止改变。预测员和歌手开始各自练习,但他们被允许使用不同的数据集(例如,歌手在嘈杂的录音上练习,而预测员在干净的录音上练习)。
- 目标: 在不破坏翻译官编码的前提下,微调歌手和预测员的具体技能。
第三阶段:全套彩排(二阶损失/Second-Order Loss)
- 类比: 这是正式比赛。预测员现在被允许犯错(使用猜测的积木而非完美的积木)。歌手和教练必须应对这些不完美的猜测。
- 神奇之处: 如果预测员猜错了积木,歌手和教练会向预测员发送信号:“这个猜测让声音听起来很差,再试一次。”
- 目标: 这闭合了反馈环。预测员学会了做出歌手能够处理的猜测,而歌手学会了对错误具有鲁棒性。这消除了“训练与测试不匹配”(即系统在练习时表现良好,但在现实世界中失效)的问题。
结果:为什么这很重要
论文声称,通过让所有人共同训练,系统变得显著更好。
- 更高的准确度: 在一项标准测试(Seed-TTS)中,他们的系统在发音错误方面极少出错(中文词错率为 0.78%,英文为 1.56%)。这创下了新的“最先进水平”(SOTA)记录。
- 更小的模型: 他们使用相对较小的模型(预测员 0.6B 参数,歌手 0.5B 参数)就实现了这一目标,证明了如果你训练得当,并不需要一个庞大臃肿的系统也能获得极佳效果。
- 更丰富的信息: 该系统创建的“乐高积木”(标记)更聪明。它们包含了更多关于声音和意义的有用信息,并且更高效地利用了现有的“码本”(所有可能的积木集合),避免了系统只使用少数常见积木而忽略其他积木的问题。
总结
本文认为,过去构建 TTS 系统的方法——即分别构建各个部分并寄希望于它们能契合在一起——是低效的。通过将整个系统视为一个巨大的、相互关联的有机体进行端到端训练,你可以获得更准确、更有表现力且更易于训练的声音,即使使用的是较小的计算机模型。这就像是陌生人试图凑合着合奏一首歌,与一支已经共同排练了数月每一个音符的乐队之间的区别。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。