← 最新论文
💬 NLP

MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence

本文介绍了 MMSI-Bench,这是一个包含 1,000 道多图像空间推理问题的具有挑战性的基准测试,它揭示了当前多模态大语言模型与人类之间存在的显著性能差距,同时提供了一套自动化错误分析流程,用于诊断具体的失败模式并指导未来研究。

原作者: Sihan Yang, Runsen Xu, Yiman Xie, Sizhe Yang, Mo Li, Jingli Lin, Chenming Zhu, Xiaochen Chen, Haodong Duan, Xiangyu Yue, Dahua Lin, Tai Wang, Jiangmiao Pang

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Sihan Yang, Runsen Xu, Yiman Xie, Sizhe Yang, Mo Li, Jingli Lin, Chenming Zhu, Xiaochen Chen, Haodong Duan, Xiangyu Yue, Dahua Lin, Tai Wang, Jiangmiao Pang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何在一所房子里导航。你给它看一张客厅的照片,然后是一张厨房的照片,接着是一张走廊的照片。人类可以轻松地查看这三张图片并说:“啊,如果我从客厅走到厨房,走廊就在我的左边。”

但目前的 AI 模型呢?它们就像那些只看了一张地图就迷路了的游客。它们难以将多张图片拼接起来,以理解事物之间的相对位置关系。

本文介绍了MMSI-Bench,这是一项新设计的“考试”,专门用于测试 AI 在执行多图片空间推理方面的能力。以下是他们所做的工作及发现,使用简单的类比进行分解。

1. 问题所在:AI 擅长单张图片,却不擅长多张图片

将现有的 AI 基准测试想象成使用单张照片玩的“找不同”游戏。AI 在这方面表现出色。但现实世界不是一张单张照片;它是一部电影。要理解一个房间、一辆车或机器人的移动,你需要看到事物如何从一个角度变化到下一个角度。

作者认为,之前的测试在“电影般”的理解方面对 AI 的挑战不足。他们希望设计一项测试,迫使 AI 将多张图片之间的点连接起来,从而构建一个三维心理地图。

2. 解决方案:人工打造的“空间健身房”

团队创建了MMSI-Bench,这是一套包含 1,000 道棘手选择题的集合。

  • 来源:他们没有使用计算机生成的机器人或简单的模板。相反,六名人类专家(3D 视觉研究人员)花费了超过 300 小时,手动筛选了 120,000 张真实世界的照片。
  • 内容:这些照片来自真实场所:客厅、驾驶录像、机械臂以及户外街道。
  • 任务:问题的设计使得你无法仅通过查看一张图片来回答。你必须查看图片 A 和图片 B,意识到它们是从不同角度拍摄的同一房间,然后找出答案。
    • 示例:“如果你穿过图片 3 中的门面向南方,书相对于床在哪里?”要回答这个问题,AI 必须利用多张图片中的线索,在心理上重构房间的布局。

3. 考试成绩:AI 距离人类智能仍有漫长距离

研究人员在此项考试中测试了 37 种不同的 AI 模型(包括免费/开源模型和昂贵/商业模型)。结果非常鲜明:

  • 人类:得分97%。(我们天生擅长此道)。
  • 最佳 AI(GPT-5):得分仅为40%
  • 最佳开源 AI:得分约为30%
  • 随机猜测:大约能得25%

类比:想象一场考试,人类得了 A+,而世界上最聪明的 AI 勉强刚过 C 线。差距巨大。论文指出,即使是最先进的 AI 模型,在给定多个视角时,也难以“看见”三维世界。

4. 它们为何失败?(错误分析)

这篇论文不仅给出了分数,还分析了 AI 失败的原因。他们发现了 AI 产生混淆的四种主要方式,称之为“失败模式”:

  1. 定位错误(“盲目”错误):AI 看着图片,却无法真正找到物体。它可能把椅子误认为是桌子,或者完全漏掉某个细节。
  2. 重叠与重构错误(“拼图”错误):AI 看到了同一棵树的两张图片,但没有意识到这是同一棵树。它未能将这两张图片拼接成一个连贯的场景。
  3. 情境转换错误(“视角”错误):AI 对我们在谈论谁的“左”或“右”感到困惑。如果相机转动,AI 会忘记世界是如何随之旋转的。
  4. 空间逻辑错误(“数学”错误):AI 做出了不合逻辑的推断。例如,如果 A 在 B 的左边,B 在 C 的左边,AI 可能会错误地得出结论:A 在 C 的右边。

5. 什么方法行不通?

研究人员试图通过“作弊”来帮助 AI 通过考试:

  • 要求它“逐步思考”:他们让 AI 在回答之前解释其推理过程(就像人类参加考试一样)。这几乎没有帮助。
  • 在图片上画线:他们在照片中标记出连接匹配点的线条,以帮助 AI 看到联系。这也几乎没有帮助。

结论:问题不在于 AI 需要一个更好的提示或一点小推动。问题在于 AI 从根本上缺乏处理这些任务所需的“空间大脑”。这不是软件漏洞;而是能力的缺失。

总结

MMSI-Bench 是一项新的、非常困难的测试,它证明了当前的 AI 在理解从多个角度观察时物理世界如何拼接方面仍然非常糟糕。虽然人类可以轻松利用一系列照片在房间里导航,但即使是最聪明的 AI 也会迷路。论文建议,要解决这个问题,我们需要更好的训练数据,以及教导 AI 以三维而非仅仅是更大模型的方式去“看见”的新方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →