← 最新论文
🤖 machine learning

SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos

SALSA-V 是一种多模态视频转音频生成模型,它利用掩码扩散目标和一种新颖的捷径损失,仅需八步即可从无声视频中合成高度同步、高保真的长篇音频,在对齐度和效率方面都显著超越了现有的最先进方法。

原作者: Amir Dellali, Luca A. Lanzendörfer, Florian Grötschla, Roger Wattenhofer

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Amir Dellali, Luca A. Lanzendörfer, Florian Grötschla, Roger Wattenhofer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:你所看过的每一部默片突然都焕发了生机,拥有了属于自己的音轨——不仅仅是通用的钢琴配乐,还有箱子掉落时的“砰”声、轮胎碾过碎石的“嘎吱”声,或是微风吹过树叶的“沙沙”声。这就是“视频转音频”(video-to-audio)生成的梦想,这是一个计算机科学领域,机器试图通过视觉来“聆听”。长期以来,计算机在这方面表现得很糟糕;它们能猜出大致的氛围,却抓不住时机,导致发出的声音感觉像是迟到了现场。其核心挑战在于两个方面:计算机需要理解正在发生的是“什么”(语义理解),以及它在“何时”发生(时间对齐)。如果一个球撞到了墙,声音必须在那个精确的毫秒内响起,否则我们的大脑会感到困惑。直到现在,制作这些声音需要很长时间,就像等待烤箱缓慢烘焙蛋糕一样,而且如果尝试制作长视频而非短片段,结果往往会崩塌。

SALSA-V 登场了,这是一个旨在解决这些问题的数字魔法师。把它想象成一位顶尖的拟音师(Foley artist,即为电影创作音效的人),他被赋予了一种超能力:能够工作得极快且永不乱节奏。SALSA-V 背后的研究人员构建了一个模型,它可以获取一段静音视频,并瞬间生成高质量且完美同步的音频。与以往那些在处理长视频时表现挣扎或需要数小时等待的方法不同,SALSA-V 可以在几秒钟内生成数分钟的声音,它甚至可以“聆听”你提供的音频样本来模仿其风格,就像一只音乐变色龙。

以下是这位新魔法师的工作原理以及它的发现:

“捷径”的魔力
大多数生成声音的 AI 模型的工作方式就像雕塑家从石块中凿刻,一步步地剔除噪声直到声音出现。通常,这需要数十个步骤,速度很慢。然而,SALSA-V 学会了一个“捷径”。想象一下尝试从你家走到公园。普通的模型走得小心翼翼,每走一步都要检查地面。而 SALSA-V 学会了向前看,并迈出巨大的、自信的步伐。通过训练模型去理解“一大步等于两小步之和”,研究人员教会了它跳过那些枯燥的部分。结果如何?SALSA-V 只需八个采样步骤即可生成高质量音频。这快到足以让人感觉到近乎实时,将原本需要数分钟的过程变成了几乎瞬间完成的事情。

掩码拼图
为了处理长视频而不让音频变成一片混乱,SALSA-V 使用了一个巧妙的技巧,叫做“掩码流匹配”(masked flow matching)。想象你在填一个填字游戏,但你不是从零开始,而是已经有了几个填好的单词,然后你需要猜出剩下的部分。SALSA-V 对声音也这样做。在训练期间,模型会被展示一段视频和一段音频,但音频中的随机一块内容被隐藏了(被掩盖)。模型必须根据视频和它仍能听到的声音部分,推断出缺失的声音应该是怎样的。这教会了模型具备灵活性。这意味着你可以给模型一段短视频和一段音频片段,它可以进行声音的“外绘”(outpaint),将其无缝延伸以匹配更长的视频,或者填补空白以创造连续的声景。

节奏部分
视频转音频最关键的部分是时机。如果视频里有一只狗在叫,狗吠声必须恰好发生在狗张嘴的那一刻。以往的模型经常在时机上出现偏差,这听起来很不自然。SALSA-V 通过训练一个特殊的“同步教练”解决了这个问题。这个教练是一个独立的 AI,它学习识别视频中事件发生的精确时刻,并将其与声音匹配。研究人员发现,要让这个教练变得真正出色,他们需要非常谨慎地进行训练;使用过多的示例反而会让它在辨别相似声音之间的细微差别时表现变差。通过这样精细的调整,SALSA-V 实现了人类评价优于其他顶尖模型的同步水平。在一项听力测试中,人们认为 SALSA-V 的时机和整体质量都优于其他最先进的模型。

长篇挑战
许多 AI 模型擅长处理短片段(约 10 秒),但在处理 30 秒或更长的视频时就会崩溃。它们要么耗尽内存,要么声音开始产生偏移。SALSA-V 通过使用一种“渐进式”方法来应对这一问题。它不是试图一次性猜出整整一分钟的声音,而是将音频分成小块生成,并利用前一个片段的结尾作为下一个片段的引导。这使得它能够保持更长时间的节奏和风格一致性。在针对 30 秒视频的测试中,SALSA-V 保持了高水平的质量和同步性,而其他模型则开始迷失方向。

它目前还做不到的事
作者坦诚地说明了局限性。由于该模型是通过扩展前一个片段来构建声音的,如果视频有一个突然切换到完全不同场景的剪辑(比如从安静的图书馆跳转到嘈杂的建筑工地),除非用户进行干预,否则模型可能会试图将安静的图书馆声音带入建筑工地。它最适合处理没有突兀变化的连续场景。

总结
SALSA-V 表明我们可以鱼与熊掌兼得:生成高质量、完美同步的音频,且只需几秒钟而非几分钟。它不仅仅是在制造声音,它还在让声音“感觉”正确,以以往模型难以企及的精度匹配视觉节奏。通过将“捷径”训练法与处理长序列的聪明方式相结合,该模型为近实时的音效设计铺平了道路,可能改变我们创作电影、游戏甚至沉默档案资料的方式。虽然它并非适用于所有视频场景的完美解决方案,但它代表了让机器真正“听见”所见之物的重大飞跃。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →