想象一下,你想用你最喜欢的名人的声音来唱一首歌,但你手里只有一段你自己唱歌的录音,以及一段该名人的短促(10秒)说话片段。你并没有他们演唱这首特定歌曲的录音。这就是**语音转换(Voice Conversion)**的挑战:将一个人的语音转换为另一个人的声音,同时又不丢失词句和原意。
通常,为了教计算机完成这项任务,你需要“平行数据”——即成千上万小时由 A 人和 B 人同时说出的相同句子。这就像是需要一本每一对单词都并排翻译好的字典。这既昂贵又难以寻找,而且对于许多语言来说,这种数据往往并不存在。
这篇论文介绍了一种巧妙的新方法,利用非平行数据(即来自许多不同人的随机语音集合)以及一个被称为**“从 A 到 B 再到 A”**的技巧来训练计算机。
以下是该系统的工作原理,通过简单的概念进行拆解:
1. “魔镜”戏法(回文框架)
其核心思想就像一面能将声音来回反射的魔镜。
- 问题: 计算机需要学习如何将“你的声音”转化为“名人的声音”,但它并没有一对完美的录音来进行学习。
- 解决方案: 研究人员使用“最近邻搜索”(KNN)创建了一个**“伪造训练对”**。
- 想象你有一个名人的声音库。
- 计算机观察你所说的句子,找到该名人已经说过的一句听起来最相似的句子,然后进行声音替换。
- 现在,计算机拥有了一个用该名人的声音说出的、关于你句子的“伪造”版本。
- 回文(Palindrome): 随后,计算机被训练去将这个“伪造的”名人声音转回成真实的名人声音(而它拥有真实的音频作为基准真相)。
- 通过学习修复自己制造的“伪造”错误,模型学会了如何准确地将任何声音转换为目标声音,即使它从未见过那个特定的声音。
2. 三步流水线
该系统由三个阶段组成的工厂式结构:
- 翻译员 (WavLM): 首先,计算机倾听音频,并将声波转化为一种“特征语言”(就像把一首歌变成乐谱)。它使用一个名为 WavLM 的预训练 AI 来理解语音的内容,而不去关注是谁在说话。
- 变色龙 (Transformer): 这是主要的大脑。它获取源说话人的“乐谱”,并尝试重写它,使其看起来像目标说话人的“乐谱”。它通过在第一步中创建的“伪造对”上进行练习来学习。
- 歌手 (Vocoder): 最后,系统将新的“乐谱”重新转化为实际的声波(音频)。
3. “身份警察”(说话人损失函数)
语音转换中有一个大问题是,计算机可能会改变词义或让声音听起来很机械。为了解决这个问题,研究人员加入了一个严格的“身份警察”(说话人验证模型)。
- 这就像是一个俱乐部的保安。每当计算机生成一个新声音时,保安都会检查:“这听起来像目标名人吗?”
- 如果声音听起来太像原始说话人或陌生人,保安就会将其退回进行修正。这确保了最终结果听起来完全像你想模仿的那个人。
4. 结果:“一效多用”
研究人员在英语和许多其他语言(如法语、德语和西班牙语)上测试了该系统。
- 神奇之处: 他们仅在英语数据上训练了该系统。
- 惊喜: 当他们在从未见过的其他语言上进行测试时,效果依然非常好。它不需要针对这些语言进行重新训练或“微调”。
- 表现: 与其他顶尖系统相比,该方法在保持目标说话人身份(使其听起来像正确的人)方面表现更好,并且在保持词句清晰自然方面也同样出色。当参考片段非常短(仅 3 秒)时,其表现尤为令人印象深刻。
总结
简而言之,这篇论文介绍了一个通过利用其自身创建的伪造数据进行练习来学习改变声音的系统。它使用一种“镜像”策略来教会自己如何实现一种声音到另一种声音的映射,而无需需要完美的、并排的录音。它就像是一个通用的声音翻译器,能够模仿任何语言中的任何人,即使它只接受过英语训练。
注:本文完全侧重于技术方法和性能指标(声音质量及词汇准确度)。它并未讨论任何特定的未来应用、临床用途或商业产品。
技术摘要:从 A 到 B 再到 A:基于非平行数据的回文式零样本语音转换
问题陈述
语音转换(Voice Conversion, VC)旨在将源说话人的语音转换为匹配目标说话人身份的形式,同时保留语言内容。传统的基于数据的方法依赖于平行语料库(不同说话人的对齐语句),这在规模化收集时既昂贵又不切实际。虽然已经开发了非平行方法,但它们在“任意对任意”(any-to-any)的零样本设置下(即源说话人和目标说话人在训练期间均未见过)往往表现不佳。现有的解决方案通常尝试使用语言监督(如音素)或自监督学习(SSL)来解耦内容和说话人信息。然而,这些方法面临挑战:语言相关的方法依赖于 ASR/TTS 系统,而基于解耦的 SSL 方法往往受到不完全分离的影响,导致说话人信息泄露或内容保留能力下降。此外,在 SSL 特征上进行简单的 K-最近邻(KNN)检索虽然有效,但在单样本(one-shot)场景下由于邻居稀疏和目标数据有限,效果会发生退化。
方法论
作者提出了一个框架,仅使用非平行数据即可实现用于零样本语音转换的有监督学习。其核心创新在于一种回文式训练策略,该策略可以在不需要对齐的源-目标语句的情况下构建合成训练对。
合成数据生成(“A 到 B”阶段):
- 系统利用预训练的自监督学习(SSL)模型 WavLM 来提取帧级特征。
- 对于给定的真实目标语音段(a1)和参考说话人库(bref),系统执行离线 KNN 检索。它将目标的特征与参考说话人进行匹配,以生成合成源特征集(B^1)。
- 这创建了一个训练三元组:合成源(B^1)、真实目标(a1)以及来自目标说话人的额外真实参考段(a2)。
模型架构:
- 编码器(Encoder): 预训练的 WavLM 编码器。
- 转换器(Converter): 一个基于 Transformer 的潜变量转换器,用于将合成源特征映射到目标说话人的声学特性,从而产生潜变量特征(A~1)。
- 声码器(Vocoder): 一个 HiFi-GAN 声码器,用于从潜变量特征重建波形。
训练过程(三个阶段):
- 阶段 1(声码器预训练): 训练一个声码器,通过重建损失(多分辨率 STFT)和对抗训练(多周期及多尺度判别器)从原始 WavLM 特征中重建音频。
- 阶段 2(Transformer 训练): 训练 Transformer 将合成特征转换为目标特征。损失函数包括:
- L1 损失: 在预测特征与地面真值目标特征之间计算。
- 说话人损失: 使用预训练的说话人验证模型计算的波形级损失。它计算参考波形(a2)与转换后的波形(a~1)之间的余弦相似度和 L1 距离,以强制执行身份一致性。
- 阶段 3(声码器后训练): 在 Transformer 生成的转换特征上训练一个新的声码器实例,以适应特定的特征分布,从而减少伪影并提高自然度。
推理:
- 在推理阶段,系统直接作用于真实的输入语音(而非合成语音)。模型从合成训练范式泛化到执行现实世界的转换,仅需目标说话人的短参考语句。
核心贡献
- 非平行、零样本框架: 一种新颖的方法,通过受控的合成数据生成(通过 SSL 特征上的 KNN 检索)来实现有监督的说话人转换,而无需对齐的语音数据。
- 说话人验证损失: 引入了源自说话人验证模型的波形级损失,直接优化说话人相似度并确保一致的身份保留。
- 多语言泛化能力: 尽管仅在英语数据上进行训练,该系统仍展示了强大的跨语言性能,且无需在非英语数据上进行任何微调。
- 性能表现: 该方法在说话人相似度和等错误率(EER)方面优于近期的最先进系统(包括 KNN-VC、Seed-VC 和 Vevo),同时保持了相当的字错率(WER)、字符错误率(CER)和主观质量(MOS/SMOS)。
实验结果
实验在 LibriSpeech(英语)和 Multilingual LibriSpeech 数据集上进行。
- 说话人相似度: 在所有提示时长(3秒至60秒)下,所提方法均优于基准模型。值得注意的是,在低资源设置(3秒提示)下,它显著优于 KNN-VC,后者由于邻居稀疏而导致可懂度和质量下降。
- 可懂度与质量: 该方法保持了与最先进系统相当的 WER 和 CER,表明在提升说话人相似度的同时并未损害内容保留。主观评估(MOS 和 SMOS)显示,该方法实现了高自然度和说话人相似度,尤其是在短提示场景下。
- 跨语言性能: 在荷兰语、法语、德语、意大利语、波兰语、葡萄牙语和西班牙语测试中,尽管没有进行非英语微调,该模型仍实现了 WER 的持续改进,并保持了与竞争对手相当的说话人相似度和 DNS-MOS 分数。
- 消融实验: 去除声码器后训练阶段会导致明显的听觉伪影和较低的 DNS-MOS 分数,证实了使声码器适应 Transformer 输出分布的必要性。
意义
论文指出,受控的合成监督结合显式的说话人级目标,为传统的基于解耦的语音转换提供了一种有效的替代方案。通过避免需要平行语料库或显式语言对齐,该框架为高质量、任意对任意的零样本语音转换提供了一条可扩展且数据高效的路径。结果表明,所提出的“回文”策略有效地弥合了合成训练数据与现实世界推理之间的差距,即使在参考数据有限且跨越未知语言的情况下,也能实现稳健的性能。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。