Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models
本文引入了想象感知标记(Imaginative Perception Tokens, IPT),这是一种中间感知表示,使视觉语言模型能够通过将未观察到的空间配置外显化来增强空间推理能力,从而在透视理解、路径追踪和多视角计数等任务上超越了文本思维链方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:教 AI “想象”看不见的世界
想象你正在玩一款电子游戏。你站在一个房间里,正看着一扇门。游戏问你:“如果你穿过这扇门并向左转,你的右边会看到什么?”
目前的 AI 模型(视觉语言模型)非常擅长描述它们“眼睛”正前方看到的东西。但面对这个问题时,它们却很吃力,因为答案并不在它们正在观察的这张图片里。它们必须在脑海中模拟出一个尚未见过的全新场景。
这篇论文认为,要解决这些“空间推理”谜题,AI 需要学会像人类一样去想象缺失的拼图碎片。作者们将这个新工具称为想象感知标记(Imaginative Perception Tokens,简称 IPTs)。
问题所在:AI 不擅长处理“如果……会怎样?”
把现在的 AI 想成一位非常博学的图书管理员,他能完美地描述书架上的每一本书。但如果你问他:“如果我们把书架移到后墙,图书馆看起来会是什么样?”这位管理员就会卡壳。他只能描述当前可见的事物。
以往解决这一问题的尝试是让 AI 写下它的思考过程(类似于“思维链”)。作者发现,强迫 AI 用文字来描述一个 3D 旋转或一条隐藏路径,就像试图仅用一条短信来描述一段复杂的舞蹈动作一样。这种方式笨拙、混乱,且经常导致错误。
解决方案:“心理草稿本”
作者引入了想象感知标记(IPTs)。他们不再要求 AI 用长篇大论来描述新的视角,而是教它去画一张快速草图,描绘出它认为自己会看到的景象。
- 类比: 想象你是一名建筑师。为了确定一面新墙是否合适,你不仅是在口头讨论,还会画出一份新布局的快速蓝图。
- 运作方式: AI 被训练去生成一张中间图像(即“草图”),这张图代表了一个它尚未实际观察到的视角。
- 例子: 如果问题是关于沿着走廊行走,AI 会画出一张“侧视图”,展示从路径中间位置看过去走廊的样子,尽管它手里只有起点和终点的照片以及一张地图。
- 例子: 如果问题是关于从三个不同角度观察一个凌乱房间里的椅子数量,AI 会画出一张“鸟瞰图”地图,以便在不重复计数的情况下看清每把椅子的位置。
一旦 AI “画”出了这张心理草稿,它就会根据自己的画作来回答最终的问题。
三个“想象力训练场”任务
为了测试这一点,研究人员创建了三个特定的训练游戏(数据集),让 AI 练习如何进行想象:
视角转换(“传送”游戏):
- 设定: 你从一个角度观察一个房间。
- 任务: “如果你传送到标记的这个点并向右转 90 度,沙发是在你的左边还是右边?”
- 想象过程: AI 必须生成一张从那个新位置观察房间的图片,才能正确回答。
路径追踪(“盲行”游戏):
- 设定: 你有一张路径的俯视图,以及起点和终点的照片。
- 任务: “当你沿着这条路径行走时,在路程一半的地方,你的左侧会看到什么物体?”
- 想象过程: AI 必须生成一个“第一人称视角”的中间路径画面,而这个画面是它从未真正见过的。
多视角计数(“拼图”游戏):
- 设定: 你被展示了三张从房间不同角落拍摄的照片。
- 任务: “这个房间里总共有多少把椅子?”(有些椅子可能在其中一张照片中被遮挡,但在另一张中可见)。
- 想象过程: AI 必须生成一张单一的“俯视图”地图,将所有三个视角合并成一张完整的图片,从而进行准确计数。
研究发现
研究人员使用这些“心理草图”作为教学工具,训练了一个强大的 AI 模型(BAGEL)。以下是实验结果:
- 绘画胜过写作: 当 AI 被迫通过“画草图”(IPT)来进行“思考”时,它在处理空间问题上的表现远优于被迫通过“写文字”(文本思维链)进行思考。事实上,用文字进行思考有时反而会让 AI 在这些任务上表现得更差,因为文字是描述 3D 空间的糟糕方式。
- 训练的魔力: 即使在随后的测试中,当 AI 不被允许 画草图(只能直接给出答案)时,它的表现依然更好。这表明,在训练过程中进行的“绘画”练习,在 AI 的大脑中构建了一个更强大的内部地图。
- 超越顶尖水平: 在某些任务上,这种方法让这个开源模型能够与通常在这些基准测试中占据统治地位的昂贵闭源模型(如 GPT-5)相媲美。
总结
这篇论文表明,要让 AI 理解空间和导航,我们不应仅仅要求它用语言“更努力地思考”。相反,我们应该教它去视觉化那些看不见的事物。通过给 AI 一个“心理草稿本”来练习想象新的视角,我们帮助它建立起对 3D 世界更深刻的理解,使其能够解决以前对它来说无法完成的谜题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。