← 最新论文
🤖 AI

SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning

该论文介绍了 SpatialClaw,这是一个无需训练的框架,它通过利用一个有状态的代码执行接口来增强视觉语言模型在开放式 3D/4D 空间推理方面的能力,使智能体能够灵活地组合感知操作,并在无需针对特定模型进行适配的情况下,在 20 个基准测试中实现了最先进的性能。

原作者: Seokju Cho, Ryo Hachiuma, Abhishek Badki, Hang Su, Byung-Kwan Lee, Chan Hee Song, Sifei Liu, Subhashree Radhakrishnan, Seungryong Kim, Yu-Chiang Frank Wang, Min-Hung Chen

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Seokju Cho, Ryo Hachiuma, Abhishek Badki, Hang Su, Byung-Kwan Lee, Chan Hee Song, Sifei Liu, Subhashree Radhakrishnan, Seungryong Kim, Yu-Chiang Frank Wang, Min-Hung Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图解决一个复杂的谜题,比如仅仅通过几张照片或一段视频,就弄清楚一个加热器距离一扇门到底有多远。

长期以来,AI 模型(被称为视觉语言模型)在识别图像中“有什么”(例如:“那是加热器”)方面表现出色,但在处理物体在 3D 空间中的“位置”以及它们之间的“距离”时却显得力不从心。它们就像一个能叫出房间里所有物品的名字,但对距离和几何感极其糟糕的人。

为了解决这个问题,研究人员尝试给这些 AI 模型提供“工具”(比如卷尺或 3D 扫描仪)。但他们使用这些工具的方式非常笨拙。这篇名为 SpatialClaw 的论文指出,问题不在于工具本身,而在于 AI 用来请求帮助的说明书(接口)。

以下是 AI 尝试解决这些谜题的三种方式,我们使用一个简单的类比来进行说明:

1. “一掷千金”的赌徒 (单次代码执行/Single-Pass Code)

想象你在玩一个数学题游戏,但在你看到答案之前,你只被允许写下唯一的一句指令。

  • 运作方式: AI 必须一次性写出一个完整的计算机程序来测量距离。它必须在看到第一步(比如找到加热器)是否奏效之前,就预判出整个策略。
  • 问题所在: 如果 AI 在第一步犯了一个微小的错误,整个程序就会失败。它无法说:“等等,我找到了加热器,但遮罩不对。让我先修正它,然后再进行测量。” 这就像是在把全部薪水都押在一次掷骰子上。

2. “固定菜单”的食客 (结构化工具调用/Structured Tool-Call)

想象你在一家餐厅用餐,但服务员只允许你从一份极其有限的、预印好的菜单中点餐。你可以说,“我要‘测量距离’工具”和“我要‘寻找加热器’工具”。

  • 运作方式: AI 可以从列表中挑选工具,但它不能创造性地将它们混合使用。如果问题需要一种菜单上没有预设的奇特组合,AI 就会陷入困境。这就像你想做一个定制三明治,却只被允许从展示柜里挑选现成的单品。
  • 问题所在: 现实世界的空间问题是混乱且多变的。有时你需要以一种菜单并未预见到的方式来组合工具。

3. “大厨” (SpatialClaw)

现在,你给 AI 一个配备齐全的厨房(一个持久运行的 Python 计算机程序),并告诉它:“你就是大厨。你可以抓取任何食材,进行混合、品尝;如果味道不好,就把它们扔掉,尝试新的食谱。你可以一步步地持续烹饪,直到这道菜完美为止。”

  • 运作方式:
    • 厨房: AI 有一个“持久化厨房”,可以将所有的食材(图像、3D 地图、遮罩)安全地保存起来。
    • 循序渐进: 它不会一次性写完整个食谱。它会先写一条小指令(例如“找到加热器”),观察结果(例如“噢,我找错物体了!”),然后写下下一条指令来修正错误。
    • 品尝: 它可以观察自己的工作成果(视觉反馈),并说:“这个测量值看起来很奇怪,让我尝试另一种数学技巧。”
    • 自由度: 它可以根据需要随时使用标准的数学工具(如计算器或尺子),而不局限于预设的菜单。

实验结果

研究人员在涉及 3D 距离、移动物体和多视角拍摄的 20 个不同谜题上测试了这种“大厨”方法(SpatialClaw)。他们使用了各种 AI “大脑”(从小型到大规模的模型)。

  • 得分: SpatialClaw 的平均得分为 59.9%,大幅领先于之前的最佳“AI 大厨”(领先了 11.2 个百分点)。
  • 秘诀: 最显著的提升出现在最难的谜题中——比如计算视频中物体的运动方式或从不同角度测量距离。这是因为这些任务需要 AI 不断检查自己的工作、修正错误,并以新的方式组合工具,而只有“大厨”模式才能实现这一点。

为什么这很重要(根据论文观点)

该论文声称,最大的突破并不是给了 AI 新的 工具,也不是让 AI 变得更聪明,而是仅仅改变了接口,让 AI 能够像人类解决困难的空间问题时那样,在一个循环中进行思考、行动、检查和纠正。

这就像是意识到,要盖好一座房子,你需要的不仅仅是一把更好的锤子,而是要允许建筑师停下来,观察墙壁,发现墙歪了,然后在进行下一步之前将其修好。SpatialClaw 赋予了 AI 这种停顿、检查和纠正的权限。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →