← 最新论文
💬 NLP

ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop

本文介绍了 ESI-Bench,这是一个基于 OmniGibson 和 Spelke 核心知识系统构建的具身空间智能综合基准,它表明主动的感知 - 行动循环通过使智能体能够发现隐藏的空间信息而显著优于被动观察,同时揭示当前模型的失败主要归因于行动盲点和元认知差距,而非感知能力薄弱。

原作者: Yining Hong, Jiageng Liu, Han Yin, Manling Li, Leonidas Guibas, Li Fei-Fei, Jiajun Wu, Yejin Choi

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Yining Hong, Jiageng Liu, Han Yin, Manling Li, Leonidas Guibas, Li Fei-Fei, Jiajun Wu, Yejin Choi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一座房子里解开一个谜团,但你只能看到眼睛正前方的事物。你不能四处走动,不能触摸任何东西,也不能从沙发后面偷看。你只能盯着单张静止的照片,去猜测厨房里有什么、柜台上有多少个苹果,或者一个球是否被藏在盒子里。

这就是目前大多数人工智能“空间智能”的工作方式。它就像一名被手铐铐在椅子上、盯着单张照片试图破解罪案的侦探。

现在,请认识 ESI-BENCH。

这篇论文的作者建立了一个名为 ESI-BENCH(具身空间智能基准)的新测试平台。把它想象成一个巨大的虚拟游乐场,人工智能代理在这里被赋予了身体、双腿和双手。它们不再只是盯着照片看,而是被允许四处走动、上下打量、拿起物品并移动物体来回答问题。

以下是他们发现的内容分解,使用了简单的类比:

1. “主动侦探”与“被动观察者”

研究人员通过三种方式测试了人工智能模型:

  • 被动观察者: 人工智能获得一张照片,然后进行猜测。
  • 被动囤积者: 人工智能获得 30 张房间的随机照片(就像有人随机翻阅相册),然后进行猜测。
  • 主动侦探: 人工智能可以选择去哪里走、看什么以及触摸什么,以解开谜题。

巨大的惊喜:
“被动囤积者”(获得 30 张随机照片)的表现往往不如仅有一张照片的情况。这就像给侦探一堆 30 张模糊且无关的照片;这只会让他们感到困惑。
然而,主动侦探却是一个游戏规则的改变者。在没有被告知如何解决谜题的情况下,人工智能自发地想出了聪明的策略。

  • 例子: 如果被问到“这个玻璃杯里有栗子吗?”,人工智能不会只是盯着看。它会意识到需要走到玻璃杯后面、从上方观察,甚至拿起玻璃杯倒出来看看。它自己发明了这些策略。

2. 真正的问题:“行动盲视”

论文发现,人工智能的“眼睛”(感知能力)实际上相当不错。真正的问题在于其大脑选择行动的能力

  • 类比: 想象一个人拥有完美的视力,却不知道该往哪里看。他们可能站在角落里盯着空白墙壁看 30 秒,却错过了就藏在身后的宝箱。
  • 发现: 当研究人员给人工智能提供完美的行走路径(即“真实轨迹”)时,人工智能几乎完美地解决了谜题。这证明,只要知道该去哪里,人工智能就能看到答案。失败的原因不是它看不见,而是它不知道下一步该做什么

3. “3D 眼镜”陷阱

研究人员尝试给人工智能戴上"3D 眼镜”(从照片重建房间的 3D 模型),以帮助其理解深度。

  • 结果: 当 3D 眼镜完美时,人工智能变得更聪明了。但当 3D 重建略有噪声或不完美时(这种情况经常发生),人工智能反而变得比以前更笨
  • 类比: 这就像给某人戴上一副轻微扭曲世界的眼镜。这非但没有帮助他们看得更清楚,反而因为扭曲让他们绊倒在原本用正常眼睛就能轻松避开的事物上。人工智能过于信任“损坏”的 3D 地图,从而做出了错误的决定。

4. “过度自信的猜测”(人类差距)

最有趣的发现是关于信心的。

  • 人类: 当人类侦探不确定时,他们会说:“我需要换个角度看,”或者“让我检查一下那个窗帘后面。”如果找到新证据,他们愿意改变主意。
  • 人工智能: 人工智能模型就像一名固执的侦探,在匆匆一瞥后猜测“这是一架钢琴!”即使它们四处走动并看到证据表明那实际上是一个橱柜,它们也拒绝改变主意。即使错了,它们也会以 100% 的信心加倍坚持最初的猜测。
  • 隐喻: 人类就像保持地图灵活性的探险家。人工智能则像一名游客,只看了一次路牌,就断定博物馆已关闭,即使大门敞开,也拒绝走进去检查。

基准测试总结

该论文创建了一个包含10 个类别挑战的测试,基于人类婴儿认识世界的方式(如理解物体、数量和物理原理)。

  • 计数: 毯子下藏着多少个球?
  • 物理: 这堆积木会倒塌吗?
  • 反射: 镜子里的那个物体是真实的,还是只是反射?
  • 导航: 我能否不经过客厅就从卧室走到厨房?

核心结论

论文得出结论,要制造真正聪明的机器人,我们不能仅仅改进它们的摄像头。我们必须教会它们如何移动和互动。它们需要明白,有时为了看清真相,你必须停止死盯着看,转而开始行走、触摸和探索。目前,人工智能非常擅长看到眼前的东西,但在知道接下来需要做什么以找到答案方面却表现糟糕。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →