← 最新论文
💻 computer science

Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models

本文介绍了 Space Tokens,这是一个轻量级且与模态无关的框架,通过将 3D 几何结构和物体属性蒸馏为用于思维链处理的连续潜变量标记(latent tokens),增强了视觉语言模型的空间推理能力,在无需额外推理时模块的情况下,在空间基准测试上达到了最先进的性能。

原作者: Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian, Richard Shi, Jinjun Shan, Amir Rasouli, Dongfeng Bai

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian, Richard Shi, Jinjun Shan, Amir Rasouli, Dongfeng Bai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何在凌乱的客厅里导航。你给它看一张沙发、咖啡桌和一只猫的照片。一个基础的机器人可能会说:“我看到了一张沙发。”但如果要让它在不撞倒桌子的情况下捡起玩具,它需要知道得更多:沙发有多大?它离墙有多远?猫是坐在桌子上还是在桌子下面?这就是“看见”与真正“理解空间”之间的区别。在人工智能领域,这被称为“空间智能”。长期以来,计算机非常擅长识别物体,但在理解这些物体如何组合在 3D 空间中方面却表现得很差。为了解决这个问题,科学家们尝试了两种主要方法:要么让计算机的大脑(模型)变得庞大且昂贵,要么添加专门用于测量距离的重型工具。两者都有效,但既慢又笨重。

现在,一组研究人员提出了一种聪明的技巧,叫做“空间标记”(Space Tokens)。把标准的 AI 模型想象成一个正在参加考试的学生。通常,如果学生需要知道如何测量一个房间,他们必须带上量角器和卷尺(额外的工具),或者背诵一本巨大的几何百科全书(一个巨大的大脑)。这项新研究提出了一种不同的方法:如果这个学生可以仅仅通过“思考”来获取测量值呢?研究人员发现了一种方法,可以教 AI 在其自身的思考过程中创建“隐形的心理笔记”。这些笔记,或称为“标记”,就像是几何信息的微小、连续的低语,AI 可以利用它们来推理大小、距离和形状,而无需任何额外工具或更大的大脑。这就像是给了 AI 一种内置的空间感,让它在说话的同时也能理解空间,从而在不减慢速度的情况下变得更聪明,更好地理解物理世界。

问题所在:大容量大脑 vs. 重型工具

想象一下你有一个非常聪明的朋友,他很擅长描述图片。你给他看一张厨房的照片,他能告诉你:“那是一个冰箱,那是面包机。”但如果你问:“我能在冰箱和面包机之间塞进一个巨大的披萨盒吗?”他可能会猜错,因为他并不真正“感知”空间。

为了解决这个问题,科学家们尝试了两条路径。第一条是“规模化”(Scaling),这就像是告诉这位朋友去读遍图书馆里的每一本书,并背诵每一种可能的房间布局。这确实有效,但需要一个运行起来极其缓慢的庞大大脑。第二条是“专业化工具”,这就像是给这位朋友一个激光测距仪和一个 3D 扫描仪,让他每次看照片时都使用。这很精确,但速度慢、成本高,而且如果朋友赶时间或者工具不在身边,他就无法使用。

这篇论文的作者提出了一个简单的问题:我们能否教会这位朋友直接在脑海中“感知”空间,而不需要图书馆或激光测距仪?

解决方案:空间标记

研究人员引入了一种名为 空间标记(Space Tokens) 的方法。他们并没有增加新的硬件或让 AI 模型变得巨大,而是教会了 AI 生成特殊的“标记”(它们只是微小的数据片段)来代表 3D 空间。

把这些标记想象成 隐形的便利贴,AI 将它们贴在自己的思路上。

  1. 场景级笔记: 一些笔记描述整个房间。它们捕捉地板的形状、墙壁的位置以及房间的深度。
  2. 物体级笔记: 其他笔记描述特定的物品。它们保存着关于物体位置、大小以及朝向的信息。

神奇之处在于这些笔记是“连续的”,这意味着它们不仅仅是像“大”或“小”这样的简单标签。它们就像是精确的坐标和测量值,AI 可以利用它们在脑海中进行数学运算。AI 通过观察来自“老师”模型(一个非常聪型的 3D 重建系统)的示例并进行练习,学会了如何创建这些笔记。

他们是如何教导 AI 的

训练过程分为三个阶段,就像一个有三个关卡的电子游戏:

  • 第一关:学习空间的语言。 AI 被展示了图片,并被教导如何生成与场景 3D 几何结构相匹配的“便利贴”(标记)。它学会了将其内部思维与现实世界的精确 3D 形状对齐。
  • 第二关:利用笔记进行思考。 一旦 AI 学会了制作笔记,他们就教它利用这些笔记来回答问题。他们强迫 AI 查看笔记并得出结论:“因为冰箱距离 2 米,所以披萨盒放不下。”这被称为“思维链”(Chain-of-Thought)推理,但现在的思维包含了空间数据。
  • 第三关:通过练习变得更好。 最后,他们使用了强化学习技术。AI 尝试回答问题,如果它对尺寸或距离的判断正确,它就会获得“奖励”。如果错了,它就会从错误中学习。这有助于 AI 更加精准地使用其空间笔记。

他们的发现

结果令人印象深刻。研究人员在名为 VSI-Bench 的基准测试(这是一个针对空间理解能力的严苛测试)上测试了他们的新方法。

  • 当他们将此方法应用于 Qwen3-VL-8B 模型时,得分提升了 4.3%
  • 当他们将其应用于更强大的模型 SenseNova-SI-1.3 时,得分提升了 1.3%

但真正的胜利在于特定任务。新方法在预测 物体大小(准确率达到 79.2%)和 房间大小(准确率达到 75.7%)方面成为了世界领先水平。这些任务通常需要沉重的 3D 工具,但该方法仅凭其内部的“便利贴”就完成了任务。

为什么这很重要

最令人兴奋的部分是,AI 不需要改变其大脑或携带额外工具。它只是学会了以不同的方式思考。研究人员还证明了这些“便利贴”是真实存在的。他们可以将这些标记解码回 3D 形状,并观察到 AI 确实学习了房间的几何结构。它不仅仅是在瞎猜;它拥有对空间的真实理解。

这表明,我们不需要构建更大、更慢或更昂贵的 AI 模型来让它们具备空间智能。我们只需要教会它们如何创建并使用这些内部的空间笔记。这是一种更轻量、更快且更灵活的方法,能赋予机器在我们的 3D 世界中导航的能力,这是对于需要在家中移动的机器人或需要安全驾驶的汽车等应用而言,迈出的重要一步。

简而言之,这篇论文表明,通过给 AI 一种使用简单的内部标记来进行“3D 思考”的方法,我们可以让它更好地理解物理世界,而不会让它变得更臃肿或更慢。这只是改变了 AI 思考方式的一个微小变化,却带来了其能力的巨大飞跃。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →