Multimodal Language Models Cannot Spot Spatial Inconsistencies
该论文提出了一种通过生成空间不一致图像对来评估多模态大语言模型(MLLMs)3D 运动一致性推理能力的新方法,结果显示当前最先进的模型在识别此类空间矛盾方面表现远逊于人类,暴露出其对物理世界三维结构理解的脆弱性与不完整性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是在给现在的顶级 AI 模型做一场“找茬”的体检,结果发现了一个令人惊讶的真相:这些 AI 虽然能看图说话,但在理解“空间感”和“物理现实”方面,却像个刚学会走路的孩子,甚至不如人类。
下面我用几个生活中的比喻,把这篇论文的核心内容讲给你听:
1. 核心问题:AI 是个“照相机”,但不是“建筑师”
想象一下,你给 AI 看一张照片,它能非常详细地告诉你:“这是一把椅子,上面有花纹,旁边有个桌子。”它像个超级摄影师,描述细节很厉害。
但是,如果你给它看两张来自同一个房间、但角度稍微不同的照片,问它:“这两张照片里,哪把椅子的摆放位置在物理上是不可能的?”
这时候,AI 就懵了。它就像个只会背说明书的建筑师,虽然知道椅子长什么样,但脑子里没有“三维空间”的蓝图。它无法判断如果把椅子从左边搬到右边,它的透视、阴影和遮挡关系是否合理。
2. 他们是怎么测试的?(“移花接木”大法)
为了测试 AI 的“空间感”,作者们发明了一个聪明的“作弊”方法,就像魔术师的移花接木:
- 找素材:他们找了一个真实的 3D 房间场景,有三张不同角度的照片(V1, V2, V3)。
- 剪贴画:他们把 V2 照片里的一把椅子“剪”下来,把背景补好(就像用 PS 把椅子抹掉)。
- 错位粘贴:然后,他们把 V3 照片里那把椅子的样子,“贴”回 V2 照片里原本的位置。
- 制造矛盾:因为 V3 的角度和 V2 不同,贴回去的椅子虽然看起来还是那把椅子,但它的透视角度、阴影和大小跟周围的环境完全对不上号。这就好比你在照片里把一个人头贴到了脚的位置,或者把远处的山贴到了近处的桌子上。
结果:人类看一眼就能发现:“哎?这把椅子怎么‘飘’起来了?”或者“这阴影怎么反了?”但大多数最先进的 AI 模型却看不出破绽,甚至猜得跟瞎蒙差不多。
3. 测试结果:AI 的“空间感”有多脆弱?
论文测试了包括 GPT-5、Gemini 2.5 等在内的各种顶级模型,发现:
- 人类是“空间大师”:准确率高达 84.8%。只要是人,稍微有点生活经验就能发现不对劲。
- AI 是“空间盲人”:最好的模型(GPT-5)准确率也只有 34% 左右,大部分模型甚至不如随机猜。
- 越“聪明”越没用:有趣的是,让 AI 花更多时间去“思考”(增加推理预算),它的表现并没有变好,甚至有时候更差了。这说明它不是“没想通”,而是脑子里根本没有这个概念。
4. 为什么 AI 会失败?(几个有趣的发现)
作者还像侦探一样分析了 AI 为什么犯错:
- 距离感缺失:AI 对远处的物体比对近处的物体更敏感(这很奇怪,人类通常对近处更敏感)。
- 光线依赖:AI 在光线适中的时候表现最好,太亮或太暗就抓瞎,而人类在各种光线下都很稳。
- 物体类别偏见:有些 AI 认得“椅子”的破绽,却认不出“镜子”的破绽。就像有的学生擅长做数学题,但一做语文题就挂科,它的知识是不均衡的。
- 不是被“修图痕迹”骗了:有人可能会想,AI 是不是因为看到了 PS 留下的痕迹才猜对的?作者特意做了实验,把修图痕迹放大,AI 也没变强。这说明它确实是在试图理解空间,只是理解错了。
5. 总结与启示
这篇论文告诉我们一个扎心的事实:
现在的 AI 模型,就像是一个背熟了所有百科全书的图书管理员。如果你问它“书里写了什么”,它无所不知。但如果你问它“如果我把这本书扔在地上,它会怎么弹起来”,它就完全不知道该怎么回答。
未来的方向:
我们需要教 AI 不仅仅是“描述世界”(看图说话),而是要真正“理解世界”(建立物理模型)。只有当 AI 拥有了像人类一样的空间直觉,它才能真正帮我们驾驶汽车、操作机器人,或者在虚拟世界里构建真实的场景。
一句话总结:
现在的 AI 能画出逼真的画,但还没学会怎么在三维空间里“走路”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。