Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder
Confucius4-TTS 是一个多语言零样本文本转语音系统,它通过采用一种带有可学习说话人编码器的两阶段架构,从自监督语音表示中提取音色特征,从而实现了无需转录文本的跨语言声音克隆,并在 14 种语言中实现了高清晰度和高说话人相似度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人模仿你最喜欢的电影角色说话。在计算机科学领域,这被称为“文本转语音”(TTS)。通常,为了让机器人听起来完全像那个角色,你需要两样东西:一段该角色的短音频剪辑,以及一段精确记录了该音频中所说内容的文字稿(剧本)。把这段文字稿想象成一张地图;没有它,机器人在将声音与文字匹配的过程中就会迷失方向。但问题在于,在现实世界中,我们发现的大多数音频剪辑——比如一段随机的 TikTok 视频或播客片段——并没有自带剧本。它们是“无转录文本的”。这使得在野外进行声音克隆变得极其困难,尤其是当你希望机器人用一种与原始音频不同的语言说话时。这篇论文正是针对这一难题:即使我们没有原始音频的剧本,我们该如何让机器人以一种新的语言模仿特定的人说话?
由此诞生了 Confucius4-TTS,这是来自网易有道的一个新系统,它扮演着一个高超的声音变色龙的角色。研究人员构建了一个两阶段机器,它可以获取一段陌生人的短音频剪辑和一段不同语言的目标文本,并生成出听起来像是那个陌生人在说这种新语言的声音——而这一切都不需要原始剧本。
以下是它的工作原理,使用了一个简单的类比。想象这个系统是一个两人小组:一个翻译官和一个演员。
首先,翻译官(称为文本到语义模块)观察你想要朗读的目标文本。但它不仅仅是在阅读文字,它还在倾听参考音频剪辑。至关重要的一点是,它不需要知道参考音频到底说了什么;它只需要知道是谁在说话。为了实现这一点,它使用了一个特殊的“可学习说话人编码器”(Learnable Speaker Encoder)。把这个编码器想象成一个声音指纹扫描仪。它提取那些杂乱无章、无转录文本的音频,并从中提取出独特的“音色”或“色彩”——就像吉他弦的质感一样——而忽略具体的词汇。然后,它将这个“声音指纹”交给翻译官,翻译官将其与你的新文本结合,生成一组“语义标记”(semantic tokens)。这些标记就像是语音的蓝图:它们包含了意义和节奏,但还没有最终的声音。
接下来,演员(称为语义到声学模块)接过那份蓝图和声音指纹。这个部分使用了一种被称为“条件流匹配”(conditional flow matching)的高级技术,这就像一位雕塑家将一块粘土慢慢塑造成雕像。它从随机噪声开始,逐渐将其塑造为一个梅尔频谱图(mel-spectrogram,即声音波形的视觉图),使其符合声音指纹和蓝图的要求。最后,一个“声码器”(vocoder,即声音合成器)将这张图谱转化为你可以听到的实际音频波。
该论文的主要发现是,这个系统在没有剧本的情况下表现得极其出色。作者在 14 种语言上对其进行了测试,包括中文、英文、日语、韩语以及几种欧洲和东南亚语言。当他们将 Confucius4-TTS 与其他顶尖系统在名为 CV3-Eval(测试跨语言声音克隆)的基准测试中进行对决时,它在六种不同的语言方向上实现了平均 3.73% 的字错率(WER)。这是一个非常低的错误率,意味着语音具有极高的清晰度。事实上,在 X-Voice 基准测试中,它在七种不同的源语言到中文的语言对中,达到或超过了其他领先系统。
研究人员还发现,如果你恰好拥有参考音频的剧本,该系统可以切换到“延续克隆”(continuation cloning)模式。这就像是给了演员剧本以及声音指纹。虽然这会让声音听起来更像原说话人(提高了说话人相似度得分),但也会带来一个小小的权衡:语音的清晰度可能会比无剧本版本略低。然而,默认的“免转录模式”才是真正的明星,它证明了你不需要地图也能找到声音。
在人类测试中(即由真人聆听结果并进行排名),Confucius4-TTS 经常在音色相似度(听起来有多像原作者)和自然度(听起来有多像人类)方面占据首位。例如,在将中文转换为英文的测试中,它在几乎所有类别中都排名第一或第二,击败了商业巨头和其他开源模型。
论文明确排除了“必须拥有转录文本才能获得高质量跨语言克隆”的观点。以往的方法严重依赖强制对齐(将单词与声音完美匹配)或合成训练对,但 Confucius4-TTS 表明,通过使用自监督语音表示(即通过单纯听取语音而无需被教导词汇的 AI),你可以直接提取声音身份。作者之所以对这些结果充满信心,是因为他们在大规模数据(约 50 万小时的语音)上进行了测试,并在多个公开基准测试和内部人工评估中验证了其有效性。
那么,这对未来意味着什么?作者认为,这为视频配音、有声读物和辅助工具打开了大门,在这些场景中,你可以通过一段随机剪辑瞬间克隆声音,并让它说任何语言,且无需剧本。他们甚至已经向公众发布了代码和模型,邀请他人基于这种“免转录”魔力进行开发。虽然该系统并不完美(它仍有一定的错误率,且可以更快),但它代表了迈向“只需点击‘播放’即可实现语音克隆”这一目标的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。