← 最新论文
🤖 AI

EgoGapBench: Benchmarking Egocentric Action Selection in Multi-Agent Scenes

本文介绍了 EgoGapBench,这是一个揭示了当前多模态大语言模型在多智能体场景中难以进行自我中心动作选择(即错误地采用他人的动作)的诊断性基准测试,且这种差距在经过现有第一人称数据微调后依然存在。

原作者: Jihyeok Jung (KAIST AI), Jeewu Lee (Sogang University), Sanghyeop Kim (Sogang University), Chanhee Han (Ministry of Science and ICT), Seong Joon Oh (KAIST AI)

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Jihyeok Jung (KAIST AI), Jeewu Lee (Sogang University), Sanghyeop Kim (Sogang University), Chanhee Han (Ministry of Science and ICT), Seong Joon Oh (KAIST AI)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正站在一个拥挤的房间里,观看一场棒球比赛。你既不是击球手,也不是投手,也不是裁判。你只是一个站在本垒板后方的观察者。

现在,想象一个机器人就站在你身边,通过你的眼睛观察着完全相同的场景。这个机器人的任务是决定:“我现在应该做什么?”

根据这篇论文,目前的 AI 机器人在这项特定任务上表现得很糟糕。它们经常会感到困惑并认为:“噢,我看到一个拿着球棒的击球手!我一定是那个击球手!”尽管它们明明是站在本垒板后方的。

以下是该论文研究结果的拆解,使用了简单的类比:

1. 问题所在:“身体线索”这一拐杖

长期以来,科学家们一直通过“第一视角”视频(例如绑在人头上的 GoPro)来测试 AI。在这些视频中,你通常可以看到人的手、脚或正在使用的工具。

  • 类比: 这就像一个学生在考试时通过偷看自己的手来作弊。如果 AI 看到手握着球棒,它就知道“我是击球手”。
  • 缺陷: 论文指出,AI 并没有真正理解“视角”;它只是在识别身体部位。如果你把视频倒过来或者去掉手部,AI 就会迷失方向。它并不知道“自己是谁”,它只知道“看到了什么”。

2. 新的测试:EgoGapBench

研究人员构建了一个名为 EgoGapBench 的新测试,旨在观察 AI 是否能在不作弊的情况下真正理解视角。

  • 设置: 他们向 AI 展示了繁忙场景(如棒球赛或婚礼)的图像,在这些图像中,从摄像机视角出发,没有任何人的手或身体是可见的
  • 陷阱: 在图片中,有一个击球手正在挥棒。AI 被要求扮演站在本垒板后的裁判
  • 问题: “你下一步应该做什么?”
  • 错误答案: AI 经常会选择“挥棒”,因为它看到了击球手正在做这个动作。这被称为**“运动侵入”(Motor Intrusion)**错误。这就像 AI 认为:“我看到有人在跑,所以我一定是那个跑步的人”,即便它其实正站在原地不动。

3. 结果:人类 vs 机器人

  • 人类: 当人类进行这项测试时,几乎每次都能答对(94.5%)。我们天生就能理解:“我是裁判,所以我应该向前倾身去判断投球,而不是挥棒。”
  • AI 模型: 即便是最智能的 AI 模型(如 GPT-5 或 Gemini)得分也低得多(最好的也仅为 66% 左右,其他模型则接近随机猜测)。它们会一致地试图模仿他们所看到的人的动作。

4. “训练”中的错误

研究人员尝试通过用更多“第一视角”视频(即能看到手和身体的视频)来教导 AI 来修复这个问题。

  • 类比: 这就像试图通过观看别人开车视频来教一个人开车,但从未让他坐在驾驶座上。
  • 结果: 这反而让 AI 变得更糟了。AI 对寻找身体线索变得更加依赖。当在新测试中缺少这些线索时,AI 就崩溃了。

5. 结论

论文得出结论,**“看见”一个场景与“基于特定视角进行行动”**是两回事。

  • 现在的 AI 非常擅长描述它看到了什么(“那里有一个击球手”)。
  • 现在的 AI 却不擅长根据它所处的位置来判断它自己应该做什么(“我是裁判,所以我应该观察”)。

研究人员表示,我们不能仅仅向 AI 展示人们在做某事的视频,而要开始教它如何理解它在房间里的“位置”,并将其与其他人区分开来。他们发布了这个测试(EgoGapBench),以便其他科学家可以尝试构建不会被身边的人搞混的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →