DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis
该论文介绍了 DLLM-TTS,这是一个拥有 0.6B 参数量的框架,它将文本到语音合成表述为针对神经音频编解码器标记(tokens)的条件块离散扩散过程,通过在顺序块内进行并行标记预测,实现了具有高清晰度的竞争性性能以及 0.15 的实时因子。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图教一个机器人唱歌。你有两种主要的方法,但每种方法都有一个令人恼火的缺陷。第一种方法就像一个学生在朗读一本书,一次读一个词。他们发音完美,故事逻辑通顺,但他们必须读完整个句子后才能开始下一个句子。这太慢了,而且如果你想让机器人听起来像某个特定的人,你需要给它喂食海量的书籍库(或者在这种情况下,是数小时甚至数千小时的录音)来学习这种技巧。第二种方法则像是合唱团,每个人都在同一时刻唱出自己的部分。这非常快,但由于他们没有听取前一个人的声音,往往会出现走调、跳词或重复的情况。
多年来,科学家们一直困于在“完美但缓慢”与“快速但混乱”之间做出选择。这篇由 Smallest.ai 团队撰写的论文,切入了这一混乱的中间地带。他们从事的是文本转语音(TTS)领域,即这种将书面文本转化为语音音频的技术。他们运用的核心理念是“离散扩散”(discrete diffusion)。这就像是一个“反向版”的传声筒游戏。与其将信息在人群中传递,不如想象你有一个句子,所有的单词都被问号遮盖住了。机器人的任务是猜出缺失的单词,但它并不只是一个接一个地猜,而是同时猜出一整块单词,检查它们是否合理,然后进行精炼。作者希望看看他们能否结合“合唱团”方法的速度和“学生”方法的准确性,同时使用比通常情况下少得多的训练数据。
该团队推出了一种名为 DLLM-TTS 的新框架。它并没有尝试一次生成整个语音信号或一次只生成极小的一块,而是将音频分解成小的“块”(blocks),就像书中的章节一样。想象一下,语音是一列长长的火车。旧的快速方法试图一次构建整列火车,这经常导致车厢脱轨;旧的慢速方法则一次只造一节车厢,必须等每一节完成后才开始下一节。DLLM-TTS 则以“组”为单位构建火车(块)。在每一组内部,机器人同时猜测所有的车厢,但它会等待前一组完成后再开始下一组。
这种“块”方法使得机器人能够通过同时处理多个部分的音频来保持高效,但由于它仍然遵循故事的顺序,因此能保持准确。机器人在训练中使用了一种特殊的“掩码”(masking)机制。在训练期间,机器人被展示了一个句子,其中一些单词被隐藏了,它必须根据文本和一段想要模仿的语音样本来推断这些单词是什么。因为机器人每次看到的同一个句子中隐藏的单词都不同,所以它学习语音规则的速度比如果只是从头到尾读一遍要快得多。这就像是通过随机练习不同的段落来学习一首歌,而不是仅仅一遍又一遍地重复唱完整首歌;这样你学习旋律和歌词的效率更高。
结果非常令人振奋。团队使用仅 2 万小时的语音数据,训练了一个拥有 6 亿参数(衡量机器人“大脑”大小的指标)的模型。为了让你有个直观的概念,其他顶尖的机器人通常需要 6 万到 25 万小时的数据才能学会同样的技巧。尽管使用了更少的数据,他们的机器人在衡量语音质量和模仿特定人物相似度的标准测试中,表现依然极具竞争力。在速度方面,该机器人可以以 0.15 的“实时因子”(RTF)实现实时语音生成。这意味着机器人只需 0.15 秒就能生成一秒钟的音频,这使其足以应对实时对话。
论文指出,这种基于“块”的方法是传统方法的一个强有力的替代方案。它表明,你并不一定需要海量的数据或超级缓慢的顺序处理过程,也能获得高质量的语音。通过将问题分解为可管理的块,并使用“猜测并精炼”的策略,作者创建了一个既具有数据效率又具备高速度的系统。虽然论文并未声称这是解决所有语音问题的终极方案,但它证明了这种结合速度与准确性的特定方式运作得非常出色,为制造无需通过学习全世界所有声音就能自然且快速交谈的机器人提供了一条新路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。