← 最新论文
🤖 AI

SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks

该论文介绍了 SpatialWorld,这是一个统一的基准测试,包含分布在八个仿真后端上的 760 个人工标注任务,旨在严格评估多模态智能体在现实场景中的交互式空间推理能力,并揭示了即使是目前最先进的模型,在主动探索和长程规划方面也面临着成功率低和效率失配严重的问题。

原作者: Hongcheng Gao, Hailong Qu, Jingyi Tang, Jiahao Wang, Zihao Huang, Hengkang Qiao, Shihong Huang, Junming Yang, Yi Li, Hongyixuan Yuan, Wenjie Li, Bohan Zeng, Wenbo Li, Bo Wang, Jianhui Liu, Olive Huang
发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongcheng Gao, Hailong Qu, Jingyi Tang, Jiahao Wang, Zihao Huang, Hengkang Qiao, Shihong Huang, Junming Yang, Yi Li, Hongyixuan Yuan, Wenjie Li, Bohan Zeng, Wenbo Li, Bo Wang, Jianhui Liu, Olive Huang, Haoyang Huang, Wentao Zhang, Guoqing Huang, Nan Duan, Yinpeng Dong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何在真实的房子里导航。你不能只给它看一张客厅的照片,然后问它:“咖啡杯在哪里?”因为机器人无法从一个固定的点看到整个房子。它必须走动、窥视门后,并在移动的过程中弄清楚物体的方位。

这篇论文介绍了 SpatialWorld,这是一个巨大的、严谨的“试驾”测试,旨在观察最智能的 AI 机器人(被称为多模态大语言模型,Multimodal Large Language Models)是否真的具备这种现实世界的导航和问题解决能力。

以下是他们所做工作的拆解,使用了简单的类比:

1. 问题所在:“静态照片”陷阱

此前,研究人员使用静态照片(就像“寻找威利”这类找茬游戏)或提供了不公平优势的模拟器(例如提供 GPS 地图或房间内所有物体的清单)来测试 AI 的空间技能。

  • 类比: 这就像是通过展示一张完美的停车位俯视图来测试驾驶员的停车能力,而不是让他们实际驾驶汽车、观察后视镜并转向驶入车位。
  • 问题: 现实生活是“部分可观测”的。你无法同时看到一切。你必须移动头部和身体来收集线索。旧的测试并没有检查 AI 是否能够进行这种主动探索。

2. 解决方案:“八个世界”障碍赛

作者构建了 SpatialWorld,这是一个统一的测试场,它将八个不同的模拟环境(类似于不同的视频游戏引擎)组合成了一个单一的考试。

  • 这些世界包括: 室内房屋模拟(如 AI2-THUNDER)、室外驾驶模拟器(如 CARLA),甚至还有抽象的 3D 游戏(如《贪吃蛇》或魔方)。
  • 规则:
    • 仅限视觉: AI 只能获得摄像机画面(就像人类的眼睛)。没有 GPS,没有 X 光透视,没有“作弊清单”来告知物体位置。
    • 文本指令: AI 必须使用简单的文本指令来决定行动,例如“向前移动”、“拿起杯子”或“向右转”。
    • 目标: AI 必须通过逐步探索世界来完成任务(例如,“找到钥匙并把它们拿到桌子上”)。

3. 结果:“现实检验”

研究人员测试了 15 个目前最智能的 AI 模型(包括来自 OpenAI、Google 和阿里巴巴的顶尖模型)。结果令人清醒:

  • 评分表: 即便是最强大的模型 GPT-5,也仅在约 17% 的任务中取得了成功。表现最好的开源模型成功率约为 14%
    • 类比: 如果你给一个人一个简单的任务,比如“去厨房拿个杯子”,他们几乎每次都能成功。而这些 AI 目前在 10 次尝试中有 8 次都失败了。
  • 效率差距: 一些确实成功的模型效率极低。它们会在房子里绕来绕去 50 步,只为了找到一个就在身边的灯开关。
    • 类比: 这就像一个司机最终找到了杂货店,但却绕了 50 英里远路,白白浪费了很多汽油,仅仅是为了到达目的地。
  • 专业化分化: 没有一个模型是全能的。
    • GPT-5 擅长室内家务任务(在房间内寻找物体)。
    • Gemini 在数字游戏和室外导航方面表现得异常出色。
    • 类比: 这就像拥有一个擅长烤蛋糕但不会烤牛排的大厨,以及一个擅长烤肉但完全不会烤蛋糕的烧烤大师。

4. 失败原因:“四大致命缺陷”

研究人员分析了机器人为何失败,并发现了四个主要原因:

  1. 空间迷失(Spatial Disorientation): 机器人迷路了。它忘记了自己在哪里,或者无法想出如何回到目标点。
  2. 物体幻觉(Object Hallucination): 机器人试图去抓取一个并不存在的物体(比如试图去抓一个其实在墙后面的杯子)。
  3. 过早终止(Premature Termination): 机器人过早放弃了。它认为“离得差不多了”,然后在完成工作之前就停止了行动。
  4. 动作循环(Action Loops): 机器人陷入了死循环,重复做着无意义的动作(比如原地打转),直到时间耗尽。

5. 核心结论

SpatialWorld 证明了虽然 AI 在“观察”图片并回答相关问题方面变得非常出色,但在 3D 世界中“行动”方面仍然非常糟糕。

论文得出结论,我们需要停止用静态照片来测试 AI,而是开始用这些主动的、“盲视”的导航任务来测试它们。在成功率显著提高之前,我们无法信任这些智能体在现实物理世界中安全或有效地运行。

简而言之: 我们为 AI 机器人建立了一场非常严格的驾驶考试。目前,即使是最优秀的驾驶员也在考试中不及格、迷路或过早放弃。我们需要教会它们如何真正地导航,而不只是如何看地图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →