← 最新论文
🤖 AI

G3^3VLA: Geometric inductive bias for Vision-Language-Action Models

本文介绍了 G3^3VLA,这是一种感知相机的几何模块,它通过射线嵌入和跨视图融合,在无需深度传感器的情况下将校准后的 3D 结构注入视觉-语言-动作模型中,从而显著提升了机器人在多种基准测试和真实场景中的操控性能。

原作者: Yue Peng, Yongzhe Zhao, Artur Habuda, Khuyen Pham, Yanheng Zhu, Tran Nguyen Le, Fares Abu-Dakka, Li Guo

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Yue Peng, Yongzhe Zhao, Artur Habuda, Khuyen Pham, Yanheng Zhu, Tran Nguyen Le, Fares Abu-Dakka, Li Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常聪明的机器人厨师。这位厨师读过数百万本食谱,也看过无数烹饪视频,因此它知道什么是“三明治”,也知道如何遵循英文编写的食谱。然而,当你要求它实际去拿起面包并把它放在盘子上时,它有时会遇到困难。它可能会抓得离面包太左了,或者完全错过了盘子。

为什么会这样?因为虽然这位厨师在理解语言和图像方面是个天才,但它看世界的方式就像看一张平面的照片。它并不自然地理解深度距离,以及不同的摄像机视角是如何在 3D 空间中相互关联的。这就像是戴着一副能把世界压扁成 2D 图画的太阳镜去接球:你知道球在那里,但你无法判断它到底有多远。

这篇论文介绍了一个名为 G3VLA 的“辅助轮”系统,旨在不改变厨师大脑的前提下,修复这个特定的视觉盲点。

问题所在:“平面图像”导致的盲目性

大多数现代机器人大脑(被称为视觉-语言-动作模型,即 VLA 模型)都是构建在能够出色识别 2D 图像中物体的庞大 AI 模型之上的。但机器人生活在 3D 世界中。当机器人拥有多个摄像头(比如头部的两侧各有一个眼睛)时,标准的 AI 会将每个摄像头视为一个独立的、互不相关的照片。它会忘记这些摄像头在物理上是连接在一起的,并且从不同的角度观察同一个物体。

论文指出,这是一种信息的浪费。我们确切地知道摄像头的安装位置及其角度(这被称为“标定”),但机器人的大脑忽略了这些数学信息,仅仅是在观察像素。

解决方案:给机器人戴上“3D 眼镜”

作者创建了一个名为 G3VLA 的模块,它就像是为机器人的现有大脑戴上了一副 3D 眼镜。它并不取代大脑,只是在机器人决定行动之前,为视觉数据增加了一层几何理解。

以下是它的工作原理,使用了简单的类比:

  1. 射线嵌入(“激光笔”效应):
    想象摄像机图像中的每一个像素都附带了一个微小的、隐形的激光笔,从摄像机镜头向外直射。标准的 AI 并不知道这些激光指向哪里。G3VLA 根据摄像机的镜头设置,精确计算出每个“激光”指向的位置。它为每个像素贴上了这个方向标签,这样机器人就知道:“这个像素不仅仅是一个红点;它是位于那个特定方向上的红点。”

  2. PRoPE(“地图连接器”):
    如果你有两个摄像头,一个在左边,一个在右边,它们会从不同的角度看到同一个杯子。标准的 AI 会将它们视为两个独立的故事。G3VLA 使用一种特殊的数学技巧(称为投影位置编码,Projective Positional Encoding)来充当翻译官。它告诉机器人:“你在左边看到的杯子就是你在右边看到的那个杯子,而且这是它们在 3D 空间中连接的确切方式。”它将这些视角融合在一起,使机器人能够理解整个场景,而不仅仅是孤立的快照。

  3. “老师”(无需尺子的学习):
    通常,要教会机器人关于 3D 空间知识,你需要昂贵的深度传感器(如 LiDAR)或由人类手动绘制 3D 地图。G3VLA 非常聪明:它使用了一个“老师” AI(称为 π3X\pi3X),这个老师仅通过观察普通照片就能非常出色地推测出 3D 形状。

    • 阶段 1: 机器人在尝试移动之前,先从这位老师那里学习,在“家庭作业”(预测深度图)中练习其 3D 推测技能。
    • 阶段 2: 随后,机器人回到它的主线任务(遵循指令并移动),但它保留了这种 3D 理解能力作为一种有益的习惯。

结果:更擅长“空间”任务

研究人员在多个机器人基准测试中对其进行了测试。以下是他们的发现:

  • 在空间感重要的任务中表现最佳: 机器人在需要精确定位的任务中表现显著提升,例如“拿起杯子后面的物体”或“将方块移动到红色方块的左侧”。
  • 无需新硬件即可运行: 你不需要购买新的 3D 摄像头。你只需要现有的摄像头及其标定数据。
  • 兼容不同的机器人大脑: 他们在三种不同类型的机器人 AI 模型上进行了测试。它在标准模型上表现出色。然而,他们注意到一个有趣的现象:如果机器人的大脑设计方式使得“视觉”部分和“动作”部分距离很远(就像一座两层楼的建筑,视觉信息必须乘坐电梯才能到达动作层),那么 3D 辅助的效果就会减弱。这表明,为了让 3D 眼镜发挥最佳效果,机器人需要将 3D 信息放在其决定如何移动的位置附近进行“观察”。

核心结论

G3VLA 是一个轻量级的升级,它为那些虽然聪明但缺乏空间感的机器人注入了关于 3D 几何的“常识”。它让机器人理解世界具有深度,且不同的摄像机视角是相互关联的,从而实现更精确、更可靠的动作,尤其是在复杂的、多摄像头的设置中。这就像是给一位 2D 画家一把尺子和一个量角器,让他们终于能够画出一幅真实的 3D 场景。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →