← 最新论文
🤖 AI

EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs

本文介绍了 EgoCoT-Bench,这是一个细粒度的第一人称视频基准,包含 3,172 个带有明确逐步推理注释的可验证问答对,旨在评估和提升多模态大语言模型基于 grounding 的、以操作为核心的推理能力。

原作者: Yang Dai, Dian Jiao, Tianwei Lin, Wenqiao Zhang

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Yang Dai, Dian Jiao, Tianwei Lin, Wenqiao Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一段以某人第一人称视角拍摄的视频(就像在他们的额头上戴了一台 GoPro 运动相机)。你看到一只手抓起一把刀、一个锅和一把勺子。现在,想象你问一个超级聪明的 AI 机器人:“厨师放下盐瓶后,它在哪里?”

机器人可能会回答:“它在台面上。”而且它可能是对的!但关键在于:机器人是真的“看到”盐瓶被移到了那里,还是仅仅在猜测?

这正是论文《EgoCoT-Bench》试图解决的问题。

问题:“幸运猜中”的机器人

目前,许多 AI 模型就像那些只背答案却不理解数学原理的学生。它们可以观看视频并给出问题的正确答案,但其解释(即它们的“推理”)可能是编造的、前后矛盾的,或是基于视频中并未实际发生的事件。

在“第一人称”(Egocentric)视频的世界里,这个问题尤为棘手,因为:

  • 手经常遮挡视线。
  • 物体会消失又重现。
  • 相机剧烈晃动并快速移动。

现有的 AI 测试仅检查最终答案是否正确。这篇论文指出:“这还不够!我们需要检查 AI 关于‘发生了什么’的‘故事’是否真正符合视频内容。”

解决方案:EgoCoT-Bench(“真相侦探”测试)

作者们构建了一个名为EgoCoT-Bench的全新、超详细的测试。你可以把它想象成 AI 的“驾驶考试”,只不过 AI 不需要开车,而是要理解一段关于某人用手执行任务的视频。

他们是如何构建它的:

  1. 地图(STSG): 他们不只是观看视频,而是首先构建了视频的“地图”。这张地图追踪每一个物体、每一只手以及每一秒的时间,就像一出戏剧的详细剧本。
  2. 问题: 他们利用这张地图生成了 3,172 个问题。这些问题不仅仅是“杯子是什么颜色的?”这类简单提问,而是像这样棘手的问题:“手在 1:00 抓起了蓝色杯子,然后在 1:05 抓起了红色杯子。那么在 1:03 时,哪一个杯子在桌子上?”
  3. 证据: 每一个问题都附带一张“收据”。测试包含了回答问题所需的精确时间、位置和视觉证据。这样,我们就可以检查 AI 的推理是否与“收据”相符。

四大挑战类型

该测试分为四个主要类别,就像视频游戏中的关卡:

  1. 动作识别(定位与感知): “手现在正接触什么?”(AI 能否看到当下正在发生什么?)
  2. 时间机器(回溯): “手拿起勺子之前,勺子在哪里?”(AI 能否记住过去?)
  3. 预言家(预测与因果推断): “手正握着盖子。接下来会发生什么?”或者“咖啡为什么会洒出来?”(AI 能否预测未来或解释原因?)
  4. 全局观(高层推理): “厨师做完三明治了吗,还是还有一步?”(AI 能否理解整体目标?)

测试 AI 时发生了什么?

作者们选取了当时最智能的 AI 模型(如 GPT-5、Qwen 和 LLaVA)并让它们接受这项测试。以下是他们的发现:

  • “幸运猜中”现象: 许多模型给出了正确答案(例如,“瓶子在架子上”),但当被问及为什么时,它们的解释却是错误的。它们可能会说“因为我看到了一个瓶子”,而实际上视频显示瓶子是在问题所问的时间点之后才被移动的。
  • 差距: 即使是最好的 AI 模型,正确率也仅在 60-70% 左右。人类的得分则接近 96%。这意味着在观察手移动物体方面,人类理解与 AI 理解之间仍存在巨大差距。
  • 最困难的部分: AI 在预测接下来会发生什么方面表现尚可,但在追踪物体历史方面表现极差(例如,跟随衬衫上的特定标签,直到它被扯下来)。

核心结论

这篇论文提出了一种评估 AI 的新方法。他们不再仅仅根据最终答案打分,现在也会对推理过程进行评分。

他们发现,许多 AI 属于“虚假正确”——它们因错误的原因得出了正确答案。这是危险的,因为如果你让 AI 帮助厨房里的机器人,而 AI 猜对了答案却对刀的位置有错误的认知,机器人可能会切到不该切的东西。

EgoCoT-Bench 是一个工具,旨在迫使 AI 停止猜测,转而逐步关注视频中实际存在的证据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →