From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP
本文介绍了 CRISP,这是一种利用度量 3D 场景图和先验干预来解耦感知与推理的新型诊断评估范式,该范式揭示了虽然闭源模型尽管具备鲁棒的潜层推理能力,却在度量估计方面存在不准确的问题,而开源模型则在本质上受限于缺乏多跳组合推理能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在测试一个机器人的房间导航能力。你问它:“杯子在书的左边还是右边?”机器人回答道:“左边”,并且答对了。你可能会想:“太棒了!它理解空间!”
但根据这篇论文,这个机器人可能实际上是个**“骗子”**。它并没有通过观察房间来得出答案,而只是根据人类通常如何描述杯子和书来进行猜测。这就像一个背下了答案解析、却从未翻开过教科书的学生。
这篇论文的作者 Li 和 Yu 开发了一种名为 CRISP 的新测试,旨在识破这些“骗子”,并观察机器人究竟是真的能“看见”3D世界,还是仅仅在“猜测”词汇。
问题所在:“智能”的幻觉
目前的 AI 模型(称为视觉语言模型,Vision-Language Models)非常擅长识别物体。它们可以指出哪里是“狗”或“椅子”。但当涉及到空间智能(Spatial Intelligence)时——即理解物体确切的位置、它们之间的距离以及它们如何在 3D 空间中相互配合时——它们往往会失败。
论文指出,这些模型正遭受着**“幻觉”**的困扰。它们能说出正确的词汇,但其内部的房间心理地图却是完全错误的。它们是在利用语言技巧进行“正确猜测”,而不是利用眼睛进行“正确观察”。
解决方案:CRISP 测试
为了解决这个问题,研究人员创建了一个名为 CRISP(空间感知中的推理一致性,Consistency of Reasoning In Spatial Perception)的两部分测试。你可以把它看作是 AI 的“测谎仪”。
CRISP 不仅仅是向 AI 提问,它还强制要求 AI 同时完成两件事:
- 回答问题:(例如:“椅子离墙有多远?”)
- 绘制地图: AI 必须构建一个 3D 场景图(3D Scene Graph)。这就像是房间的蓝图或骨架,AI 必须在其中写下每个物体的精确尺寸以及它们之间的精确距离。
神奇之处在于: 研究人员随后会对两者进行对比。
- 如果 AI 在回答中说“椅子距离 2 米”,但在绘制的地图中却显示椅子距离 10 米,那么它失败了。
- 这证明了 AI 并不是利用图像来回答问题,而是在利用语言模式进行猜测。
他们的发现
当他们用这个测试去检测目前最智能的 AI 模型(包括昂贵的“闭源/专有”模型和免费的“开源”模型)时,发现了三种主要的失败类型:
“语义捷径”型骗子(多见于开源模型):
这些模型能给出问题的正确答案,但画出的地图却极其糟糕且荒谬。它们就像是一个因为听过这个谜题而知道答案的人,却无法在脑海中构思出实际的场景。它们依赖于“语言先验”(即猜测人类通常会怎么说),而不是观察图片。“断层”的大脑(多见于专有模型):
这是最令人惊讶的发现。那些昂贵的模型(如 Gemini 和 GPT-5)其实非常擅长绘制地图!它们能很好地估算距离和大小。然而,当它们回答问题时,却忽略了自己的地图。这就像一位出色的建筑师画出了完美的蓝图,但在被问到门在哪里时,却给出了一个随机的猜测,因为他忘记去看自己的图纸了。它们拥有强大的“推理引擎”,但这个引擎与它们的“视觉”是脱节的。“一致性”的胜出者:
只有少数模型能够同时把地图和答案都做对。这些模型才真正展现出了空间智能。
“先知”实验:它们拥有大脑吗?
为了证明这些“断层”模型确实具备推理能力,研究人员进行了一个特别的实验。他们将这些“作弊”的模型与一张完美的、预先绘制好的地图(就像给学生一张带有正确蓝图的“小抄”)以及图片一起提供给它们。
结果: 模型的表现大幅飙升。突然之间,它们能够完美地回答复杂的问题。
结论: 这证明了 AI 模型已经具备了解决这些问题的逻辑和推理能力。问题不在于它们“愚笨”或缺乏逻辑,而在于它们无法将“眼睛”(感知)与“大脑”(推理)连接起来。它们之所以失败,是因为它们无法信任自己的视觉数据。
总结
论文的结论是,我们一直被那些看起来很聪明、实则靠猜测正确词汇来蒙混过关的 AI 模型所欺骗。为了构建能够真正与物理世界交互(例如机械臂抓取玻璃杯)的机器人,我们不能仅仅询问问题,而必须开始检查 AI 的内部“心理地图”是否与其回答保持一致。
未来的路径不仅仅是让 AI 变得更大,而是要强迫 AI 保持一致性——确保其推理始终基于它所看到的真实内容,而不是基于它认为自己“应该”说出的话。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。