← 最新论文
⚡ electrical engineering

Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance

本文提出了一种逐步的视频到音频合成方法,该方法利用负向音频引导来增量式地生成清晰、真实的声学事件,且无需昂贵的多参考数据集,从而增强了声音的可分离性和整体音频质量。

原作者: Akio Hayakawa, Masato Ishii, Takashi Shibuya, Yuki Mitsufuji

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Akio Hayakawa, Masato Ishii, Takashi Shibuya, Yuki Mitsufuji

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看电影中的一个场景:一只驼鹿走过森林,溅起水花,然后发出喷鼻声。在旧时代的电影制作中,一名“拟音师”(Foley artist)会坐在录音室里,手动将这些声音一层一层地叠加起来:先是脚步声,然后是水花声,接着是喷鼻声,最后是树叶沙沙作响的风声。他们像制作三明治一样,一层又一层地添加美味的配料,构建出最终的音频轨道,让画面感觉真实。

如今,计算机可以尝试自动完成这一切。它们观察视频并猜测应该产生什么样的声音。但目前大多数 AI 模型就像一个笨拙的厨师,试图一口气把整个三明治吞下去。它们会吐出一个试图同时包含所有内容的单一音频轨道。如果 AI 忘记了水声,或者不小心让脚步声重复得太响,创作者就必须丢弃整个轨道并重新开始。你无法在不破坏其余部分的情况下,仅仅“添加”缺失的水声。

这篇论文介绍了一种名为**基于负向音频引导的逐步视频到音频合成(Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance)**的新方法。以下是它的工作原理,我们使用简单的类比来解释:

1. 问题所在:“回声室”效应

目前的 AI 模型非常擅长观察视频并说:“我看到了驼鹿,所以我将制作驼鹿的声音。”但如果你要求它制作第二种声音,比如“鸟鸣声”,它们往往会感到困惑。它们会一直想着:“噢,那里还有一只驼鹿!”然后它们会不小心在鸟鸣声中再次加入驼鹿的脚步声。这就像是要求一位画家在森林的画作中添加蓝天,但画家因为太专注于森林,结果不断地把树木又涂成了蓝色。

2. 解决方案:“负向音频引导”(NAG)

作者创造了一个聪明的技巧,叫做负向音频引导(Negative Audio Guidance)。你可以把它想象成一个“请勿重复”的告示牌。

以下是他们提出的逐步过程:

  • 第 1 步: AI 观察视频并生成第一个声音(例如:驼鹿的脚步声)。
  • 第 2 步: 现在,AI 需要添加下一个声音(例如:水花声)。在开始之前,它会先听一遍刚才生成的第一个声音。
  • 神奇的诀窍: AI 不仅仅是忽略第一个声音,而是将其作为“负向引导”。它本质上是在说:“我知道驼鹿脚步声是什么样子的。现在,我要生成水花声,但我会主动远离脚步声的声音。”

这就像一位音乐家在演奏一种新乐器。他们倾听已经在播放的鼓点,并有意识地演奏一段能够围绕鼓点展开的旋律,确保自己不会不小心演奏出相同的节奏。AI 利用这种“远离”的力量,确保新的声音是独特的,并且不会与已有的声音重叠。

3. 他们是如何训练 AI 的(无需昂贵的数据)

通常,要教 AI 完成这项任务,你需要一个庞大的库,其中包含人们已经录制好的、将脚步声、水声和风声作为独立轨道的视频。这很难找,而且非常昂于成本。

作者找到了一个聪明的变通方法。他们通过一个“拆分”游戏来训练 AI:

  • 他们选取一段带有单一长音频轨道的普通视频。
  • 他们将音频切成两个互不重叠的部分(例如,前 4 秒和后 4 秒)。
  • 他们这样教导 AI:“这是视频和前 4 秒的音频。现在,请预测接下来的 4 秒声音,但要确保它听起来不像前 4 秒那样。”

通过在同一段视频的非重叠片段上进行训练,AI 学会了识别环境的“氛围”(如森林或天气),而不仅仅是复制完全相同的声音。这使得他们可以使用标准的、易于获取的视频数据集来训练系统。

4. 结果:更好的“音频三明治”

当他们测试这种方法时,结果令人印象深刻:

  • 分离度: 声音更加清晰。脚步声不会渗入鸟鸣声,水声也不会听起来像脚步声。
  • 质量: 所有声音组合在一起的最终混音比 AI 一次性生成所有内容的效果更真实、质量更高。
  • 控制力: 它模仿了现实世界中拟音师的工作流程,允许用户逐层构建复杂的声景,在不破坏整个轨道的情况下添加或优化特定的声音。

简而言之,这篇论文为 AI 提供了一种成为更好声音设计师的方法。它不再是试图一次性猜出整个电影原声,而是现在可以分步构建它,清楚地知道自己已经创造了什么,以及需要避免重复什么。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →