← 最新论文
💻 computer science

SVAG-Bench: A Large-Scale Benchmark for Multi-Instance Spatio-temporal Video Action Grounding

本文介绍了 SVAG-Bench,这是一个大规模基准测试与评估工具包,旨在通过严格测试模型在复杂多主体视频场景中同时检测、跟踪并时间定位由自然语言查询描述的多个动作执行对象的能力,从而推动具身智能的发展。

原作者: Tanveer Hannan, Shuaicong Wu, Mark Weber, Suprosanna Shit, Jindong Gu, Rajat Koner, Aljoša Ošep, Laura Leal-Taixé, Thomas Seidl

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Tanveer Hannan, Shuaicong Wu, Mark Weber, Suprosanna Shit, Jindong Gu, Rajat Koner, Aljoša Ošep, Laura Leal-Taixé, Thomas Seidl

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对论文SVAG-Bench的解释。

核心理念:从“发现”到“叙事”

想象你正在观察一个繁忙的街景。

  • 旧式 AI 就像一名保安,可以指着一处说:“那是个人”,或者说:“那是一辆车”。或者,他们可以说:“那个人在下午 2 点走过。”但他们无法一次性告诉你走过、在做什么,以及确切发生在何时
  • 问题所在: 当前的 AI 基准测试(考核)只检查 AI 能否单独完成这些任务。它们测试 AI 能否找到一件红衬衫(空间定位),或者能否找到一个正在跑步的人(时间定位),但它们不测试 AI 能否找到那个穿着红衬衫、在下午 2 点开始跑步、并在 2 点 05 分停止跑步的特定的人
  • 解决方案: 作者们创建了SVAG-Bench。你可以将其视为一项针对 AI 的更困难的新测试。它迫使 AI 像侦探一样,观察混乱的人群,听取复杂的指令(例如:“找到那个正在和狗击掌的人”),然后准确指出做了这件事、在哪里做的,以及何时发生的,即使同时有十个人在做不同的事情。

“拥挤的派对”类比

想象一个拥挤的派对,其中:

  1. 旧测试(SVG、VTG、STVG): 这些测试要求 AI 找到“戴蓝帽子的人”(仅关注视觉)或“音乐何时开始”(仅关注时间)。它们假设只有一个戴蓝帽子的人,或者不在乎是否有五个。
  2. 新测试(SVAG): 这项测试要求:“找到所有正在与舞伴跳舞的人,追踪他们在房间里的移动,并告诉我每支舞的确切持续时间。”
    • 可能有三对情侣在跳舞。
    • 其中一对提前停止了跳舞。
    • 另一对则开始得较晚。
    • AI 必须分别追踪这三对情侣,确切知道谁是谁,而不能将它们混淆。

他们构建了什么(工具包)

为了运行这项新测试,团队构建了三个主要部分:

  1. SVAG-Bench(测试试卷):

    • 他们收集了688 段现实生活视频(拥挤的街道、交通、野生动物)。
    • 他们为这些视频编写了19,590 个问题(查询)。
    • 密度: 这是关键。旧测试每段视频可能只有 3 或 4 个问题。而这项测试每段视频有28 个问题。这就像给学生一份数学试卷,其中每一道题目都要求同时解出三个不同的方程。
    • 他们利用人类和 AI(GPT-3.5)来编写这些问题并验证答案,以确保其自然且正确。
  2. SVAGEval(评分标准):

    • 这是一个专门用于给 AI 答案打分的工具。由于 AI 必须同时答对“谁”、“哪里”和“何时”,该工具会检查 AI 是否将 A 人与 B 人混淆,或者是否将动作发生的时间说错。
  3. SVAGFormer(学生模型):

    • 作者们构建了一个新的 AI 模型来参加这项测试。
    • 工作原理: 该模型没有试图同时寻找人物和时间(这会令 AI 困惑),而是采用了一种“时间优先”策略。
    • 类比: 想象你要在马拉松比赛中找到特定的跑步者。与其在整个比赛过程中扫描整个人群,该模型首先会说:“好的,跑步发生在第 10 分钟到第 15 分钟之间。”然后,它在该时间窗口内放大画面来寻找跑步者。这防止了 AI 被其他时间静止不动的人所迷惑。

结果:“现实检验”

该论文在多种类型的 AI 上运行了这项测试,包括最著名的“大型视觉 - 语言模型”(如 GPT-4 或 Claude 等超级智能 AI)。

  • 裁决: 结果令人清醒。即使是最高级的 AI 在这项特定任务上也惨败。
  • 差距: 作者们发现了一个巨大的差距。如果单独询问,AI 通常能猜对正确的时间或正确的人物,但它无法将它们结合起来。
    • 类比: 这就像一个 AI,它能告诉你“比赛在晚上 7 点开始”以及“球员穿着红色球衣”,但当你问“哪个穿红色球衣的人在晚上 7 点开始比赛?”时,它会感到困惑,并指向错误的人或错误的时间。
  • 为何重要: 该论文认为,为了让机器人在现实世界中工作(例如在医院提供帮助或驾驶汽车),它们需要理解这些涉及多人的复杂故事。如果它们无法通过这项测试,就说明它们尚未准备好进入现实世界。

一句话总结

作者们创建了一项名为SVAG-Bench的超难测试,迫使 AI 追踪同时做不同事情的多个人,结果揭示出即使是当前最聪明的 AI,在理解涉及“谁在何时何地做了什么”的复杂现实世界故事方面,表现依然糟糕。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →