← 最新论文
⚡ electrical engineering

Unlocking Spatial Grounding in Large Audio-Visual Retrieval models

本文介绍了 LAIP,这是一个利用中间视觉标记(intermediate visual tokens)和音频启发式空间池化(audio-informed spatial pooling)来解锁大规模音视频检索模型中细粒度空间定位能力的框架,该框架无需像素级监督,并在定位基准测试中实现了最先进的性能。

原作者: Hugo Malard, Michel Olvera, Sanjeel Parekh, Gaël Richard, Slim Essid, Stéphane Lathuilière

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Hugo Malard, Michel Olvera, Sanjeel Parekh, Gaël Richard, Slim Essid, Stéphane Lathuilière

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教会一个机器人不仅通过视觉,还要通过听觉来理解世界。这就是**音视频学习(audio-visual learning)**的世界——这是人工智能的一个分支,旨在研究计算机如何理解声音与视觉之间的联系。你可以把它想象成一名侦探,不仅看到了犯罪现场,还听到了警笛声、玻璃破碎声和叫喊声,并试图拼凑出这些声音究竟是从哪里传出来的。

长期以来,教机器人完成这项任务就像是在没有蓝图的情况下盖房子。要教计算机在视频中精准地指向声音来源的位置,通常需要人类在视频的每一帧上都画出一个框。这被称为“密集空间标注(dense spatial annotation)”,它极其繁琐、昂贵且缓慢。这就像是要求你的朋友在一个小时内,为一群飞鸟中的每一只都画出完美的轮廓。因为这太难了,大多数研究人员不得不一直使用“弱线索”——即仅仅知道视频中存在某种声音,却不知道声音具体在哪里

然而,最近科学家们构建了大规模的“检索模型(retrieval models)”。这些是超级智能的 AI 系统,经过数百万个视频和声音的训练,能够回答诸如“帮我找到与这段音频匹配的视频片段”之类的问题。它们非常擅长将声音的整体氛围与整个视频进行匹配,但它们在指出声音发生的具体位置方面表现得很差。它们能看到整片森林,却错过了发出声音的那棵特定的树。一个大问题一直是:我们能否利用这些擅长寻找视频的巨型预训练模型,通过某种方式解锁它们指向声音精确来源的能力,而不需要雇佣一支军队来画框?


这篇论文的核心思想:解锁隐藏的地图

你正在阅读的这篇论文题为**《解锁大规模音视频检索模型中的空间定位能力》(Unlocking Spatial Grounding in Large Audio-Visual Retrieval models)**,它说:是的,我们可以做到。 来自法国、Meta 和 NVIDIA 的研究团队发现,这些庞大的检索模型实际上确实知道声音在哪里,只是它们在抛弃这些信息之前,将这些信息深藏在了大脑深处。

想象一个巨大的图书馆(检索模型),它读过数百万本书(视频),也听过数百万本有声读物(声音)。当你问图书管理员:“有没有关于狗叫声的书?”他们可以瞬间找到正确的书架。但如果你问:“请问这张狗的照片里,嘴巴在哪个位置叫?”图书管理员通常只会耸耸肩说:“我只知道这是一张关于狗的照片。”

作者意识到,图书管理员并不是真的无知。图书管理员脑海中其实有一张详细的狗嘴巴地图,但在他们决定给你一个简单的“我有关于狗的书”的答案时,就把那张地图扔掉了。作者引入了一个巧妙的技巧,称为 LAIP(通过音频信息引导的池化,Localization via Audio-Informed Pooling),旨在在那个地图被扔掉之前将其捕捉住。

LAIP 如何运作:音频侦探

他们方法的核心是一个被称为 音频信息空间池化(Audio-informed Spatial Pooling, AiSP) 的新模块。用通俗易懂的话来说,它是这样工作的:

  1. 设置: AI 逐帧观察视频。在 AI 内部,有数千个微小的“标记(tokens)”(代表图像的不同部分的数据碎片)。通常情况下,AI 会将这些微小的碎片压缩成一个巨大的总结标记(summary token),以决定该视频是否与声音匹配。这就像是将一整个披萨压成一个巨大的面团球,以此来判断它是不是培根味的。在这个过程中,你会丢失培根片的具体位置。
  2. 干预: 作者并没有让 AI 立即把所有东西揉在一起,而是在最终的总结生成之前插入了一个“停止标志”。他们提取音频(狗叫声),并将其作为查询(query)
  3. 奇迹发生: 他们询问音频:“嘿,你在跟这些微小的图像碎片中的哪些在对话?”音频就像一只手电筒,照亮了与声音相对应的特定图像标记。AI 随后只收集那些相关的碎片,组成一个新的总结。
  4. 结果: 因为 AI 被迫去关注图像中与声音相匹配的特定部分,它就“意外地”学会了绘制一张声音来源的地图。这就像是图书管理员在交给你书的同时,为了证明他真的找到了那本书,必须指明书中“吠叫”这个词出现在哪一页、哪一段。

他们的发现

结果非常出色。作者在三个不同的基准测试(AI 的标准测试)上测试了他们的方法:

  • AVATAR: 在这个关注复杂、动态视频中声音来源的测试中,他们的方法几乎使之前最优秀的模型的性能翻倍。他们的得分从大约 13-14% 跃升至 27.63% (CIoU)27.77% (AUC)
  • AVSBench: 他们在此测试中也取得了最高分,单源声音的 F-score 达到了 65.18,击败了之前最好的 45.33
  • ADE-SP: 他们在这里也碾压了竞争对手,达到了 33.35 m-IoU53.57 mAP

论文指出,这之所以奏效,是因为这些庞大的检索模型已经经过了海量数据的训练,因此学习到了声音与视觉之间丰富的联系。作者并不需要从头开始教 AI 什么是狗或汽车;他们只需要教它在听到声音时如何去图像中的正确部分。

他们排除了什么

作者非常谨慎地展示了哪些方法是行不通的。他们尝试了几种其他想法,并发现它们表现不佳:

  • 仅使用最后一层: 如果你在 AI 处理过程的最后阶段(即图像已经被挤压成一个单一色块之后)尝试这样做,就会失败。因为此时空间细节已经消失了。你必须在中间层进行操作,那时图像仍然保留着细节。
  • 简单的注意力机制: 仅仅要求 AI 看一眼图像是不够的。他们发现使用**层级化(hierarchical)**的方法(即分步骤进行,比如从广角视图逐渐放大到特写视图)是必要的。
  • 梯度图(Gradient maps): 他们尝试使用标准的数学技巧来观察 AI 在看什么(称为基于梯度的图),但效果很差,得分仅为 4.14,而他们的得分是 26.22。这证明了他们特定的“池化(pooling)”方法才是产生差异的关键,而不仅仅是观察 AI 的内部数学逻辑。

局限性(Catch)

论文诚实地说明了一个局限性。虽然这种方法让 AI 非常擅长寻找声音的位置,但也让它在执行原有的任务(快速寻找视频)时变得稍微困难了一些。因为 AI 现在必须通过观察声音来决定关注图像的哪一部分,所以你无法预先计算视频的“指纹”并将其存储在数据库中进行瞬时搜索。你每次提问时都必须重新计算它。作者指出,原始的检索模型在搜索方面仍然运行良好,但新的“定位器(localizer)”版本在处理大规模数据库时速度会稍慢。

总结

简而言之,这篇论文证明了你不需要从头构建一个新的 AI 来寻找声源。你可以拿一个已经擅长将声音与视频进行匹配的巨型预训练 AI,并通过一个巧妙的小插件(LAIP),解锁它指向声音精确来源位置的隐藏能力。这提醒我们,有时候答案并不在于构建一个更大的大脑,而在于教会现有的脑如何去关注正确的细节。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →