← 最新论文
⚡ electrical engineering

VGGSounder: Audio-Visual Evaluations for Foundation Models

本文介绍了 VGGSounder,这是一个经过全面重新标注的多标签测试集,旨在克服原始 VGGSound 数据集的标注与对齐局限性,从而通过详细的模态分析和一种新的混淆度量,实现对音视频基础模型更可靠且更精确的评估。

原作者: Daniil Zverev, Thaddäus Wiedemer, Ameya Prabhu, Matthias Bethge, Wieland Brendel, A. Sophia Koepke

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Daniil Zverev, Thaddäus Wiedemer, Ameya Prabhu, Matthias Bethge, Wieland Brendel, A. Sophia Koepke

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过向机器人展示视频来教它理解世界。你希望机器人知道,如果它看到一个鼓被敲击并听到“咚咚”声,它应该说:“那是鼓!”

长期以来,研究人员一直使用一个名为 VGGSound 的庞大视频库来测试这些机器人。但本文的作者 Daniil Zverev 及其团队发现,这个库就像是一个杂乱、组织不善的阁楼。它存在三个严重的问题,使得我们无法判断机器人是真的聪明还是仅仅运气好:

  1. “单一标签”陷阱: 这个库强制要求每个视频只能有一个标签。但在现实生活中,一段视频可能会同时显示狗在吠叫,同时汽车在鸣笛。旧的库会只选择其中一个,忽略了另一个。这就像是把一张带有意大利香肠和蘑菇的披萨仅仅描述为“一张奶酪披萨”。
  2. “名称混淆”问题: 有些标签是孪生兄弟。一个标签可能写着“狗吠”,而另一个标签写着“狗呜呜叫”。机器人会因此感到困惑,因为它们本质上是同一件事,但测试却将它们视为不同的事物。
  3. “幽灵”问题: 有时库中声称视频里有某种声音,但实际上在视频中是看不见的,或者反之亦然。例如,一段视频可能被标记为“管弦乐团”,但你只能听到音乐,却看不到乐器。旧的测试并不在意这种不匹配。

解决方案:VGGSounder

该团队构建了一个全新的、升级版的库,叫做 VGGSounder。你可以把它想象成将那个杂乱的阁楼翻修成一座高科技、组织严密的博物馆

他们采取了不同的做法:

  • 多标签化: 不再强迫使用单一标签,而是允许每个视频佩戴它需要的所有标签。一段视频可以同时被标记为“鼓”、“吉他”和“歌唱”。
  • 模态标签: 他们为每一个标签都添加了一个特殊的“清单”。他们会询问:这个东西是可见的吗?它是可听的吗? 这让他们能够测试机器人是擅长视觉、擅长听觉,还是两者兼具。
  • 元标签: 他们为棘手的情况添加了“警告标志”。如果一段视频带有背景音乐、旁白,或者仅仅是带有声音的静态照片,他们都会进行标记。这有助于研究人员观察机器人是否会被噪音干扰。

重大发现: “干扰”效应

该团队发现的最令人惊讶的事情是,当机器人同时拥有眼睛和耳朵时,它们的表现如何。

他们发明了一个新的评分标准,叫做 “模态混淆”(Modality Confusion)。想象一下,你擅长仅用眼睛去解开一个谜题。然后,有人递给你第二个谜题碎片(声音),突然之间,你反而无法解决第一个谜题了。这就是模态混淆

  • 研究结果: 许多最新的、最先进的“基础模型”(那些超级智能的 AI 机器人)在被允许同时听和看时,表现反而变差了
  • 偏差: 这些机器人似乎对声音是“盲目”的。如果你向它们展示一只狗在吠叫的视频,但只让它们去,它们会失败。但如果它们能看到这只狗,它们就会成功。当它们尝试同时使用视觉和听觉时,声音往往会让它们感到困惑,导致它们完全忽略了声音,仅仅依赖于所看到的画面。

为什么这很重要

本文认为,我们不能只是把大量的数据投喂给机器人并寄希望于它能学习。我们需要一个更好的测试(VGGSounder),它能告诉我们机器人究竟是如何思考的。

  • 旧测试 (VGGSound): 就像一场路面有雾且缺少路标的驾驶考试。你可能靠运气通过,但你并不知道自己是否是一名安全的驾驶员。
  • 新测试 (VGGSounder): 就像一场拥有清晰路标、配备了指出危险的副驾驶,并且能提供成绩单来告诉你使用了哪些感官做出决策的驾驶考试。

作者总结道,虽然这些新的 AI 模型令人印象深刻,但它们往往难以有效地结合视觉和听觉。它们倾向于在能看到视频时忽略音频,这是对于旨在全面理解世界的机器来说的一个重大缺陷。VGGSounder 正是旨在揭露这些缺陷的工具,以便工程师们能够进行修复。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →