← 最新论文
🤖 machine learning

Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer

本文证明了,通过在基础文本-音频-视频模型中添加一个零初始化的线性层,能够实现高保真度的语音克隆,且与现有的文本-转-语音基准模型相比具有更优越的说话人相似度,同时通过将音频生成与视频路径解耦,还实现了 30 倍的推理加速。

原作者: Ivan Mikheev, Viacheslav Vasilev, Anna Dmitrienko, Alexey Letunovskiy, Ivan Kirillov, Kirill Chernyshev, Denis Dimitrov

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Ivan Mikheev, Viacheslav Vasilev, Anna Dmitrienko, Alexey Letunovskiy, Ivan Kirillov, Kirill Chernyshev, Denis Dimitrov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机可以观看一段场景描述,并瞬间生成一段完整的视频剪辑,其中还包含属于该场景的声音。如果你输入“一只狗在公园里吠叫”,机器就会生成公园的画面和吠叫的声音。这种被称为“文本生成音频-视频”(text-to-audio-video generation)的技术已经飞速发展,使得机器能够仅凭文字便合成整个场景。然而,一个显著的局限性一直存在:虽然计算机可以决定制作什么样的声音,但它无法决定由谁来发出这些声音。输出结果中的说话声或吠叫声本质上是随机的,是从机器所学习到的庞大可能性库中抽取的,这使得创作者无法指定某个特定角色应该听起来像特定的人。这种控制力的缺失,使得这些工具难以用于个性化故事、动画角色配音,或为数字虚拟形象赋予特定个体的声音。

与此同时,人工智能的另一个分支已经掌握了声音克隆(voice cloning)的艺术,即系统在仅听取几秒钟某人的说话声后,就能模仿其独特的音调。然而,这些声音克隆系统严格受限于音频;它们无法生成伴随的视频,并且通常需要从头开始构建专门且复杂的结构。研究人员面临的挑战在于如何结合这两个世界:如何将一个强大的视频与声音生成器,在不破坏其创建逼真场景的能力、也不需要彻底重建系统的前提下,教会它复制特定的声音。

一组研究人员现在展示了一种极其简单的方法来弥补这一差距。他们表明,一个能够同时生成视频和声音的大型现有模型,可以通过在其音频处理单元之上仅添加一层微小的、空的数学连接层,从而转化为一个声音克隆工具。这个新层在初始状态下不包含任何已学习的信息,这意味着模型的行为与进行更改前的模型完全一致。研究人员随后使用一种特定的方法对修改后的系统进行了相对较短时间的训练。他们将一段目标说话人的短录音与文本描述一起输入模型。系统学会了倾听这段录音,并利用其独特的音质来塑造新生成的音频,同时保持视频生成的完整性。

这一成功的关键在于研究人员向机器引入参考声音的方式。他们使用了两种互补的信号。首先,他们将目标录音的数字表示置于音频数据流的最前端,使模型在创建新声音时能够不断回溯参考。其次,他们提取了一个关于说话人声音的单一、紧凑的摘要,并利用它来轻微引导模型产生的每种声音的音调。这种方法仅需要一个新增的线性层,这是一个微小的增量,且在初始化时被设为零,以确保在学习的初始阶段不会干扰模型。通过训练系统去关注这些信号,研究人员使其能够高精度地复制声音的音色(timbre),即声音独特的色彩。

该方法的成果通过一个包含30位不同说话人、共计674对独特“文本-声音”组合的基准测试,与另外五种领先的声音克隆系统进行了对比。这个拥有50亿参数的新模型,在匹配目标说话人声音的能力方面超越了所有其他系统。它在三个独立的验证网络(这些网络是专门用于衡量两个声音相似度的专业工具)中都获得了最高分。研究人员发现,该模型能够捕捉到说话者声音中微妙、自然的特性,包括使声音具有辨识度的特定声学纹理,即使这意味着生成的语音偶尔会出现细微的用词错误。这种权衡表明,该模型优先考虑的是对说话者声音的真实重构,而非完美的文本准确性,这种行为与那些倾向于产生更清晰但缺乏辨识度声音的其他系统有所不同。

该架构的一个意外收获是,视频和音频部分可以在创作的最终阶段进行分离。由于该模型采用了非对称结构(即音频和视频流的处理方式不同但相互关联),研究人员发现他们可以单独运行模型的音频部分。这使得他们能够在无需等待视频生成的情况下,直接生成克隆后的音频,从而实现了约30倍的速度提升。这种仅使用总计算能力一小部分的变体,依然保留了有效克隆声音的能力,为在投入全量视频生成之前快速试听不同声音提供了一种实用的方法。

至关重要的是,研究人员证实,添加这种声音克隆能力并未损害模型的原始能力。当他们在没有提供参考声音的任务上测试修改后的模型时,其表现甚至优于原始版本,生成的音频更加自然,且与文本描述结合得更加紧密。这表明,这个从中性状态开始的新层,作为一个灵活的增量,在增强系统的同时,并没有迫使它忘记已有的知识。这项研究结论指出,通过极小的架构改动,就可以为先进的视频与声音生成器装备模仿特定声音的能力,从而为更具个性化和受控的视听内容创作打开了大门,而无需进行大规模的重新训练或复杂的全新设计。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →