← 最新论文
💬 NLP

SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards

SpatialThinker 是一种新型多模态大语言模型,它通过使用带有密集空间奖励的在线强化学习,在单次传递中统一了场景图生成与视觉推理,从而在有限的训练数据下,在空间基准测试中实现了最先进的性能。

原作者: Hunar Batra, Haoqin Tu, Hardy Chen, Yuanze Lin, Cihang Xie, Ronald Clark

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Hunar Batra, Haoqin Tu, Hardy Chen, Yuanze Lin, Cihang Xie, Ronald Clark

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:AI 对空间是“盲目”的

想象一下,你给一个非常聪明但有点笨手笨脚的机器人展示一张杂乱书桌的照片。你问它:“红灯是不是直接在笔记本电脑上方?”

目前的 AI 模型(比如这篇论文中的示例模型)通常根据“直觉”来猜测。它们可能会说:“嗯,灯通常都在物体上方,所以是的,”或者它们可能会对左右方向感到困惑。它们难以理解物体在 3D 空间中相对于彼此的位置,即使它们能完美地描述出这些物体是什么。它们就像是一个知道足球队所有球员名字,却无法告诉你谁站在谁前面的解说员。

解决方案:“SpatialThinker”

研究人员构建了一个名为 SpatialThinker 的新 AI。你可以不把它仅仅看作一个聊天机器人,而是一个在回答问题之前先画好地图的制图师

SpatialThinker 不仅仅是观察图片并进行猜测,它每次看到图像时都会遵循一个严格的四步流程:

  1. 观察 (Observe): 它观察图片。
  2. 绘图 (Map It - 场景图): 它画出一张脑中的“连点成线”地图。它识别物体(如“笔记本电脑”、“灯”),并在它们之间连线,并标注标签,如“在……上方”、“在……左侧”或“在……后面”。
  3. 思考 (Think): 它利用这张地图进行逻辑推理。
  4. 回答 (Answer): 它根据地图给出最终答案,而不是凭直觉猜测。

秘密武器:“密集奖励” (GPS 式训练器)

他们是如何教会 AI 正确绘制这些地图的呢?他们并没有仅仅向它展示数千张图片,并在它答对最终问题时说“做得好”。那就像是通过只在行程结束时告诉司机“你到达了!”来教开车一样,如果司机开错了街区,你却没有及时纠正。

相反,他们使用了密集奖励 (Dense Rewards),这就像是一个GPS 训练器,会提供持续的反馈:

  • 格式奖励 (Format Reward): “你按正确的格式画图了吗?”(是/否)
  • 计数奖励 (Count Reward): “你数对了物体的数量吗?”(如果你说有 3 把椅子,但实际只有 2 把,你就会扣分)。
  • 准确度奖励 (Accuracy Reward): “你得到最终正确的答案了吗?”
  • 空间奖励 (Spatial Reward): “你在地图上的位置放对了吗?”

AI 会因为过程中的每一个步骤都正确而获得积分,而不仅仅是因为最终答案正确。这迫使它去学习世界的“位置”和“方式”,而不只是学习“是什么”。

训练数据:一个微小但高质量的图书馆

大多数 AI 模型需要阅读数百万本书(或观察数百万张图片)来学习。SpatialThinker 则不同。

  • 研究人员创建了一个名为 STVQA-7K 的特殊数据集。
  • 它仅包含 7,000 个示例(与其它模型使用的数十亿数据相比,这简直是沧海一粟)。
  • 然而,每一个示例都是高质量的,并经过两个不同 AI 系统的验证,以确保这些“地图”是完美的。

类比: 想象你在教一名棋手。与其让他们进行 1,000,000 场随机对局,不如给他们 7,000 场经过完美分析的大师级对局,且每一步棋都有详细解释。他们学习游戏“原则”的速度和质量,会比那些只玩过数百万场粗糙对局的人快得多,也强得多。

结果:小数据,大智慧

该论文声称取得了一些令人印象深刻的成果:

  • 击败巨头: 其 70 亿参数版本的 SpatialThinker 在空间任务上的表现,能够媲美甚至超越 GPT-5GPT-4o 等庞大的商业模型。
  • 300 亿参数的强力版本: 更大的 30B 版本在 14 项测试的平均表现上击败了 GPT-5Claude 4 Sonnet
  • 泛化能力: 因为它学习的是空间的“结构”(即“地图”的概念)而非仅仅记忆模式,它在处理现实世界的通用问题时也表现得更好。它减少了“幻觉”(凭空捏造)现象,因为它必须在地图上的特定位置进行说明,才能证明其答案的合理性。

总结

SpatialThinker 是一种通过强制自己在回答问题前绘制物体间关系的“脑内地图”,从而学会“感知”空间的 AI。通过使用严格的“GPS 式”训练系统,对绘图过程中的每一步正确性进行奖励,它仅利用其他模型所需数据的一小部分,就学会了理解 3D 空间和物体位置,并超越了规模更大、成本更高的 AI 系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →