想象一下,你有一个非常聪明且富有艺术感的机器人,它能看着一张房间的图片并向你描述它。但奇怪的是:如果你问这个机器人“这张图片里有几把椅子?”,它可能会猜错,明明只有三把,它却说是五把。它似乎很困惑。
然而,如果你让同一个机器人编写一段计算机程序,用简单的形状(如立方体、球体和圆柱体)来构建那个完全相同的房间,它却能做得非常出色。它编写的代码能准确地在正确的位置放置三个立方体。它完全知道答案,只是无法用 plain English(普通英语)说出来。
这篇题为《3D 基本体是视觉语言模型的空间语言》的论文,探讨了这种奇怪的矛盾,并利用它让这些机器人变得更聪明。
以下是他们发现与解决方案的分解,辅以简单的类比:
1. 问题所在:“双语”机器人
研究人员发现,视觉语言模型(VLMs)就像那些精通一门秘密语言(代码),但在涉及空间时却难以掌握通用语言(英语)的人。
- 悖论:机器人可以用代码(就像乐高积木的搭建说明)构建出完美的场景 3D 模型,但如果你问它关于同一场景的简单问题,它却会产生幻觉(编造事实)。
- 测试(SpatialBabel):他们创建了一个名为SpatialBabel的大型测试。想象一下,给机器人同一张图片,并要求它用六种不同的“语言”(如 Three.js、Unity,甚至是一种特殊的 JSON 格式)来重建它。
- 令人震惊的发现:机器人的表现因它必须使用的哪种语言而异。在一种语言中,它是大师级建造者;在另一种语言中,它却是个笨拙的业余爱好者。这证明了机器人的“空间大脑”与其“编码习惯”纠缠在一起。
2. 第一个解决方案:“代码思维链”(Code-CoT)(先以代码思考)
既然机器人更擅长写代码而不是回答问题,研究人员尝试了一种名为Code-CoT(代码思维链)的新技巧。
- 类比:想象你正在尝试解决一个棘手的数学应用题。与其立即猜测答案,不如先在纸上写出方程。一旦方程写出来,答案就变得显而易见了。
- 工作原理:当被问到诸如“红色立方体是否在蓝色球体的左侧?”这样的问题时,机器人被强制先编写代码来构建场景。一旦代码编写完成,机器人便“阅读”它自己的代码来寻找答案。
- 结果:这对于那些原本就擅长编程的机器人来说效果极佳。它显著提高了它们的准确率,因为它迫使它们利用强大的“代码大脑”来解决“英语问题”。
3. 第二个解决方案:"S3-FT"(自我教学的机器人)
对于那些还不擅长编程的机器人怎么办?它们无法使用“先写代码”的技巧,因为它们的代码很混乱。
研究人员发明了一种名为S3-FT(自监督空间微调)的方法。
- 类比:想象一个不擅长画画的学生。与其聘请老师,不如让学生先画一幅画,然后立即看着自己的画作,看看哪里对了、哪里错了,然后再尝试画一次。它们自己就是老师。
- 工作原理:
- 机器人观察一张简单的几何形状(立方体、球体)图片。
- 它尝试编写代码来重建该图片。
- 研究人员将该代码自动转化为“作弊条”(一份结构化的事实列表:“在位置 X 有一个红色立方体”)。
- 他们将这份“作弊条”作为课程反馈给机器人,教导它基于自己的代码正确回答问题。
- 结果:机器人学会了理解空间,无需人类教师或昂贵的标签。它将隐藏在编码能力中的“空间知识”转移到了其一般的对话技能中。
4. 核心结论
该论文得出结论,以代码表达的 3D 几何形状(基本体)充当了这些机器人的“通用翻译器”。
- 作为诊断工具:如果机器人无法回答空间问题,但在编写代码方面却成功了,我们就知道问题不在于它“看不见”物体,而在于它无法将其视觉转化为文字。
- 作为词汇表:通过强制机器人通过代码以“立方体、球体和圆柱体”的术语进行思考,我们赋予了它一种结构化的词汇来理解世界。
简而言之:研究人员发现,这些 AI 模型对空间的了解比它们表现出来的要多。通过让它们用 3D 积木(代码)的语言“说话”,我们可以解锁这些隐藏的知识,让它们正确回答简单的问题,而无需人类来教导它们答案。
技术摘要:3D 图元作为视觉语言模型的空间语言
问题陈述
视觉语言模型(VLMs)在空间推理方面表现出一个显著的悖论。虽然当面对图像时,它们往往无法回答简单的自然语言空间问题(例如计数物体或识别关系),但相同的模型却经常能够生成可执行代码(例如 Three.js、Unity C#),以重建具有正确物体数量、类别和近似位置的 3D 场景。这表明 VLMs 拥有无法通过直接自然语言查询获取的潜在空间知识。该论文认为,这种差异代表了一种“任务路由失败”,即模型通过结构化代码外化空间理解的能力未能有效地转移到直接问答中。此外,现有的基准测试往往将空间能力与对特定输出格式(自然语言或单一代码语言)的熟悉度混为一谈,未能隔离出真正的空间推理能力。
方法论
作者提出了一个以可执行代码表达的3D 几何图元(立方体、球体、圆柱体等)为核心的框架,将其作为诊断工具和中间表示。该方法论包含三个主要组成部分:
1. SPATIALBABEL 基准测试
为了将空间理解与格式熟悉度解耦,作者引入了 SPATIALBABEL,这是一个评估 VLMs 在两个场景域和六种场景代码语言上表现的基准测试。
- 场景域:
- 图元分割(Primitive Split): 1,000 个程序化生成的 Blender 场景,包含 3 到 20 个几何图元,无重大遮挡。这提供了精确的 ground truth,零标签噪声。
- Hypersim 分割: 405 个具有复杂几何结构和大量遮挡的逼真室内场景,作为更难的验证域。
- 场景代码语言: 该基准测试评估了六种不同格式的重建能力:Three.js(JavaScript)、Unity C#、Blender Python、Open3D Python、Canonical JSON(本工作引入的声明式模式)以及一种场景语言 DSL。
- 任务:
- 重建(Reconstruct): 生成可执行代码以重现场景。
- 问答(QA): 回答关于场景的自然语言问题(定位、关系、计数、存在性、比较)。
- 指标: 综合的 SpatialBabel-Reconstruct-Score,聚合了解析率、F1 分数(匈牙利匹配物体匹配)、类别准确率、位置保真度和尺度保真度。
2. 代码思维链(Code-CoT)
一种旨在在推理阶段缩小差距的免训练推理策略。
- 机制: 模型不直接回答空间问题,而是首先被提示将场景重建为基于图元的可执行代码。随后,它基于其自身的结构化输出来回答空间问题。
- 原理: 这迫使模型将其推理路由至代码这一“空间语言”中(模型在此表现出更高的能力),然后再将该理解翻译回自然语言。
3. S3-FT(自监督空间微调)
一种训练时的干预措施,旨在将空间知识蒸馏到通用视觉推理中,专门针对编码能力较弱的模型。
- 流程:
- 伪真值生成: 基础 VLM 为图元场景生成 Three.js 重建代码。语法质量过滤器确保代码有效。
- 标注提取: 将生成的代码确定性解析为结构化空间标注(物体数量、类别、3D 姿态、关系)。这些标注与规则生成的自然语言问答对及场景描述相结合。
- 微调: 同一 VLM 在此多任务混合数据上使用 LoRA 进行微调。
- 关键特征: 该过程完全是自监督的;它不需要人工标注,也不需要外部“教师”模型,因为监督信号源自模型自身的高保真代码生成。
关键结果
基准测试发现(SPATIALBABEL)
- 语言依赖的性能: VLM 的性能在不同场景代码语言间差异巨大。对于同一模型在同一图像上,物体检测 F1 分数根据目标语言的不同,最高可达 5.7 倍 的波动。
- 弱相关性: 模型的重建 F1 分数与其直接问答准确率之间存在弱相关性(Pearson r≈0.12)。一个模型可能在生成代码方面非常准确,但在回答直接问题时表现不佳,这证实了任务路由失败。
- Code-CoT 的有效性: Code-CoT 将图元场景的问答分数提高了高达 +6.4%(例如 Gemini-2.5-Pro),并将具有强编码能力的模型在真实照片 CV-Bench-3D 上的准确率提升了 +5.0%。然而,在图元词汇量不足的杂乱、逼真场景中,它显示出收益递减或性能回退。
S3-FT 性能
- 分布内增益: 仅在图元图像上训练显著提高了 SpatialBabel-Primitive-QA 任务的性能。对于 Qwen3-VL-8B,S3-FT 在各种推理模式下带来了 +4.6% 到 +8.6% 的提升。
- 分布外迁移: 关键在于,仅在图元场景上的训练能够迁移到通用视觉推理基准测试中。
- HallusionBench: 提升 +17%。
- CV-Bench-2D: 提升 +9.7%。
- CV-Bench-3D: 提升 +3.3%。
- 泛化性: 该方案在不同模型家族(Qwen、InternVL、LLaVA)和规模间均可迁移,尽管增益取决于模型容量。
意义与主张
该论文确立了可执行代码中的 3D 几何图元既可作为 VLMs 的诊断工具,也可作为可迁移的空间词汇。
- 诊断工具: SPATIALBABEL 基准测试揭示,空间理解通常与特定的代码生成先验纠缠在一起。跨语言的巨大性能差距表明,标准基准测试可能测量的是格式熟悉度而非真正的空间推理。
- 可迁移词汇: Code-CoT 和 S3-FT 的成功表明,VLMs 在预训练期间已通过几何图元隐式地“标记化”了 3D 空间。通过利用这种结构化表示,模型可以获取那些无法通过直接自然语言提示访问的潜在空间知识。
- 自监督蒸馏: S3-FT 证明,只要基础模型能够生成足够准确的图元重建,高质量的空间推理就可以在没有人工标注或教师模型的情况下蒸馏到通用 VLMs 中。这降低了提升开源模型空间能力的门槛。
作者总结道,虽然该方法在高度复杂、遮挡严重的逼真场景中显示出明显的局限性(图元近似在此失效),但它为通过可执行 3D 代码的中间表示来增强 VLMs 的空间推理能力提供了一条稳健的途径。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。