← 最新论文
💻 computer science

CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering

本文介绍了 CaST-Bench,这是一个新的基准测试与评估套件,旨在通过提供一个包含 2,066 个问题并附有细粒度时空标注的数据集,严格评估视觉 - 语言模型在视频问答中执行基于因果链的时空推理的能力。

原作者: Mingfang Zhang, Jingjing Pan, Ashutosh Kumar, Rajat Saini, Mustafa Erdogan, Hsuan-Kung Yang, Caixin Kang, Yifei Huang, Yoichi Sato, Quan Kong

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingfang Zhang, Jingjing Pan, Ashutosh Kumar, Rajat Saini, Mustafa Erdogan, Hsuan-Kung Yang, Caixin Kang, Yifei Huang, Yoichi Sato, Quan Kong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一部悬疑电影。如今大多数视频 AI 模型就像超高速扫描仪,能准确告诉你屏幕上有哪些物体:“有一个女人。有一个孩子。有一个蓝色的包。”它们非常擅长描述正在发生什么

但它们极不擅长解释为什么会发生

本文介绍了CaST-Bench,这是一项新的“期末考试”,旨在测试视频 AI 是否真能像侦探一样思考,实时地连接因果线索。

以下是本文所做工作及发现内容的简要概述:

1. 问题所在:AI 是“智能猜测机器”

当前的 AI 模型往往基于以往见过的模式来猜测“为什么”类问题的答案,而不是查看具体的视频证据。

  • 类比:想象一个学生在参加考试。如果你问:“那个女人为什么停下脚步?”一个“智能猜测”的 AI 可能会回答:“因为她累了”,因为这是人们停下的常见原因。但在视频中,她停下其实是因为她的孩子落在了后面。AI 错过了具体的视觉线索(孩子落后),而依赖了“虚假相关性”(基于常识的幸运猜测)。

2. 解决方案:CaST-Bench(“因果链”考试)

作者构建了一个名为CaST-Bench的新基准测试。你可以将其视为一个严格的训练场,AI 模型必须在此证明它们不仅仅是在猜测。

  • 任务:AI 会收到一段视频和一个“为什么”类问题。要得分,它不能只给出答案,必须构建一条因果链
  • 链条:这就像一串面包屑。AI 必须找到:
    1. 原因:(例如,“孩子在 00:05 蹲了下来”)。
    2. 结果:(例如,“女人在 00:12 停了下来”)。
    3. 证据:它必须指出这些事件发生的确切秒数以及屏幕上的确切位置(边界框)。

如果 AI 说“女人停下来是为了等她的孩子”,却无法指出孩子落后这一视频证据,那么它就未能通过测试。

3. 构建方法:人机协作团队

创建这项考试非常困难,因为视频往往是杂乱无章的。作者采用了一条人机协作流水线

  • 第一步:他们使用真实世界的视频(而非电影,而是杂乱、真实的生活场景),并利用 AI 追踪每个人和每个物体。
  • 第二步:人类审查 AI 的描述,以确保其准确性。
  • 第三步:他们利用一个“因果思考者”AI 来生成棘手的问题和答案。
  • 第四步(过滤器):他们玩了一场“捉迷藏”游戏。他们将包含答案的视频部分进行遮罩(变黑)。如果 AI 在看不到关键证据的情况下仍能正确回答问题,他们就会丢弃该问题。这确保了问题要求AI 查看具体的线索。

4. 结果:AI 依然困惑

作者在这项新考试上测试了 15 种不同的顶级 AI 模型(包括 Gemini 和 GPT 等知名模型)。结果令人清醒:

  • 人类:得分92%。我们擅长连接线索。
  • 最佳 AI 模型:得分约为50%
  • 差距:这些模型面临显著困难。它们经常得出正确答案,但理由错误(幻觉出证据),或者无法指出视频中正确的时间和地点。

关键发现:本文表明,即使是最聪明的 AI 模型也不擅长落地(grounding)。它们无法可靠地说:“我知道这一点,因为我在这一特定秒数看到了这一特定像素。”

5. 为何这很重要(根据本文观点)

本文认为,为了让 AI 真正有用且值得信赖,它必须停止猜测,开始证明

  • 透明度:如果 AI 能向你展示得出其结论的确切视频片段,你就更能信任它。
  • 准确性:通过迫使 AI 构建因果链,它不再依赖幸运猜测,而是开始理解场景的实际运作机制。

一言以蔽之
CaST-Bench 是视频 AI 的一项新“驾驶考试”。它不仅仅问:“你能看见那辆车吗?”它问:“你能解释那辆车为什么停下来,并向我展示司机踩下刹车的确切时刻吗?”目前,大多数 AI“司机”都未能通过这项考试,这证明在机器能够真正理解其所见之物的“原因”之前,我们还有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →