← 最新论文
💻 computer science

3D Primitives are a Spatial Language for VLMs

本文提出了一种以代码形式表达的 3D 几何图元,作为一种强大的空间语言用于视觉 - 语言模型,并通过 SpatialBabel 基准测试、无需训练的 Code-CoT 推理策略以及自监督的 S3^{3}-FT 微调方法证明,这种中间表示显著增强了空间推理能力,且无需人工标注即可在多样化的视觉 - 语言模型架构中实现泛化。

原作者: Junze Liu, Kun Qian, Florian Dubost, Kai Zhong, Arvind Srinivasan, Nan Chen, Anping Wang, Sam Zhang, Alejandro Mottini, Qingjun Cui, Tian Wang

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Junze Liu, Kun Qian, Florian Dubost, Kai Zhong, Arvind Srinivasan, Nan Chen, Anping Wang, Sam Zhang, Alejandro Mottini, Qingjun Cui, Tian Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明且富有艺术感的机器人,它能看着一张房间的图片并向你描述它。但奇怪的是:如果你问这个机器人“这张图片里有几把椅子?”,它可能会猜错,明明只有三把,它却说是五把。它似乎很困惑。

然而,如果你让同一个机器人编写一段计算机程序,用简单的形状(如立方体、球体和圆柱体)来构建那个完全相同的房间,它却能做得非常出色。它编写的代码能准确地在正确的位置放置三个立方体。它完全知道答案,只是无法用 plain English(普通英语)说出来。

这篇题为《3D 基本体是视觉语言模型的空间语言》的论文,探讨了这种奇怪的矛盾,并利用它让这些机器人变得更聪明。

以下是他们发现与解决方案的分解,辅以简单的类比:

1. 问题所在:“双语”机器人

研究人员发现,视觉语言模型(VLMs)就像那些精通一门秘密语言(代码),但在涉及空间时却难以掌握通用语言(英语)的人。

  • 悖论:机器人可以用代码(就像乐高积木的搭建说明)构建出完美的场景 3D 模型,但如果你问它关于同一场景的简单问题,它却会产生幻觉(编造事实)。
  • 测试(SpatialBabel):他们创建了一个名为SpatialBabel的大型测试。想象一下,给机器人同一张图片,并要求它用六种不同的“语言”(如 Three.js、Unity,甚至是一种特殊的 JSON 格式)来重建它。
  • 令人震惊的发现:机器人的表现因它必须使用的哪种语言而异。在一种语言中,它是大师级建造者;在另一种语言中,它却是个笨拙的业余爱好者。这证明了机器人的“空间大脑”与其“编码习惯”纠缠在一起。

2. 第一个解决方案:“代码思维链”(Code-CoT)(先以代码思考)

既然机器人更擅长写代码而不是回答问题,研究人员尝试了一种名为Code-CoT(代码思维链)的新技巧。

  • 类比:想象你正在尝试解决一个棘手的数学应用题。与其立即猜测答案,不如先在纸上写出方程。一旦方程写出来,答案就变得显而易见了。
  • 工作原理:当被问到诸如“红色立方体是否在蓝色球体的左侧?”这样的问题时,机器人被强制先编写代码来构建场景。一旦代码编写完成,机器人便“阅读”它自己的代码来寻找答案。
  • 结果:这对于那些原本就擅长编程的机器人来说效果极佳。它显著提高了它们的准确率,因为它迫使它们利用强大的“代码大脑”来解决“英语问题”。

3. 第二个解决方案:"S3-FT"(自我教学的机器人)

对于那些不擅长编程的机器人怎么办?它们无法使用“先写代码”的技巧,因为它们的代码很混乱。

研究人员发明了一种名为S3-FT(自监督空间微调)的方法。

  • 类比:想象一个不擅长画画的学生。与其聘请老师,不如让学生先画一幅画,然后立即看着自己的画作,看看哪里对了、哪里错了,然后再尝试画一次。它们自己就是老师。
  • 工作原理
    1. 机器人观察一张简单的几何形状(立方体、球体)图片。
    2. 它尝试编写代码来重建该图片。
    3. 研究人员将该代码自动转化为“作弊条”(一份结构化的事实列表:“在位置 X 有一个红色立方体”)。
    4. 他们将这份“作弊条”作为课程反馈给机器人,教导它基于自己的代码正确回答问题。
  • 结果:机器人学会了理解空间,无需人类教师或昂贵的标签。它将隐藏在编码能力中的“空间知识”转移到了其一般的对话技能中。

4. 核心结论

该论文得出结论,以代码表达的 3D 几何形状(基本体)充当了这些机器人的“通用翻译器”

  • 作为诊断工具:如果机器人无法回答空间问题,但在编写代码方面却成功了,我们就知道问题不在于它“看不见”物体,而在于它无法将其视觉转化为文字。
  • 作为词汇表:通过强制机器人通过代码以“立方体、球体和圆柱体”的术语进行思考,我们赋予了它一种结构化的词汇来理解世界。

简而言之:研究人员发现,这些 AI 模型对空间的了解比它们表现出来的要多。通过让它们用 3D 积木(代码)的语言“说话”,我们可以解锁这些隐藏的知识,让它们正确回答简单的问题,而无需人类来教导它们答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →