✨ 要点🔬 技术摘要
想象一下,你正在教一个机器人做家务,比如堆叠积木或把锅放到炉灶上。为了出色地完成任务,机器人需要同时理解三件事:你告诉它要做什么 (语言)、它现在看到了什么 (视觉),以及当它移动时世界会发生怎样的变化 (物理/几何)。
目前大多数机器人的“大脑”就像只能看平面 2D 照片的人。它们擅长识别物体,但在理解深度、距离或物体在被推动时如何倾倒方面却很吃力。它们必须仅凭一张扁平的照片来猜测世界的 3D 形状,这就像试图通过看一张明信片来判断一座山的规模一样。
这篇论文介绍了一种新的机器人大脑,叫做 GAM(几何动作模型) 。以下是它的工作原理,我将使用简单的类比来解释:
1. “预训练建筑师”(基础模型)
研究人员并没有从零开始构建机器人大脑。相反,他们采用了一个庞大的、经过预训练的“几何基础模型”(GFM)。你可以把这个 GFM 想象成一位超级建筑师 ,他多年来一直在研究蓝图和 3D 结构。这位建筑师已经知道如何将扁平的照片转化为详细的 3D 地图。他理解深度、比例以及物体如何占据空间。
2. “拆分与插入”策略
通常,人们使用这种超级建筑师只是为了让它观察房间并进行描述,然后将描述交给一个独立的“执行者”机器人去移动。GAM 改变了这一游戏规则,它通过在中间拆分并插入 一个新的“规划器”来改变局势。
上半部分(眼睛): 建筑师的第一部分观察当前的摄像机照片,并将它们转化为 3D 心理地图。
中间部分(时间旅行者): 在建筑师的正中间,研究人员插入了一个特殊的“因果未来预测器”。想象一下这是一个时间旅行规划器 。它获取当前的 3D 地图,并聆听你的指令(“把杯子放在这里”),然后询问:“如果我这样移动手臂,一秒钟后的 3D 世界会是什么样子?”
下半部分(双手): 建筑师的第二部分获取那个未来 的 3D 预测,并利用它来计算出机器人应该如何移动手臂,以实现那个未来。
3. 为什么这很重要
大多数其他机器人模型试图在 2D 空间中(像电子游戏一样)预测未来,或者在最后阶段才猜测 3D 形状。GAM 的做法不同:
它从一开始就进行 3D 思考: 因为它在所有环节 都使用建筑师的 3D 知识,所以机器人不需要去猜测物体是远是近。它心里有数。
它是“一次性完成”的奇迹: 其他模型通常必须运行一个复杂且缓慢的过程(比如扩散模型),多次迭代才能确定一个动作,这就像一位画家试图通过一遍遍重画整张画布来修正错误。而 GAM 就像一位速写画家 ,能快速、自信地一笔勾勒出整个计划。
它快速且轻量: 由于其高效性,它的运行速度比一些最大、最慢的模型快 55 倍 ,并且占用的计算机内存也少得多。
4. 结果:鲁棒性
研究人员通过两种方式测试了这个机器人:
模拟环境: 在一个可以改变光照、移动摄像头或扰乱背景的计算机世界中。
现实生活: 在真实房间里的一个实际机器人手臂上。
关于“扰动”的类比: 想象你在房间里走动。如果灯光闪烁或者有人挪动了一把椅子,一个只看 2D 照片的机器人可能会感到困惑,认为椅子消失了或者移到了别处。
旧机器人: 当摄像头角度发生轻微变化时,它们的成功率会大幅下降(就像驾驶员在 GPS 信号闪烁时迷路一样)。
GAM: 因为它理解房间内真实的 3D 几何结构 ,所以它并不在意摄像头移动或光照变化。它准确地知道物体在空间中的位置。在摄像头被移动到奇怪角度的测试中,GAM 依然保持成功,而其他模型则失败了。
总结
GAM 是一种机器人策略,它提取了一个“3D 专家”(几何基础模型),将其剖开并在内部插入了一个“未来规划器”。这使得机器人能够同时以 3D 方式观察、以 3D 方式预测未来并以 3D 方式行动 。其结果是,相比目前的尖端机器人,GAM 更加快速、更小巧,并且能更好地处理现实世界的混乱情况(如移动的摄像头或变化的灯光)。
技术摘要:用于机器人策略学习的几何动作模型 (Geometric Action Model)
问题陈述
开发通用机器人操控策略需要模型能够遵循自然语言指令,同时对物体、摄像头与机器人动作在 3D 物理空间中的复杂交互进行推理。虽然近期的视觉-语言-动作模型 (VLA) 和视频世界-动作模型 (WAM) 利用大规模基础模型来获取语义或时间先验,但它们主要运行在 2D 图像帧或 2D 衍生的潜空间上。因此,关键的 3D 线索——如深度、尺度和遮挡——仍然是隐性的。这种局限性阻碍了模型在环境变化下的泛化能力,特别是在机器人初始状态和摄像头视角的变化方面。现有的引入 3D 几何的方法通常仅将几何基础模型 (GFM) 视为静态特征提取器,或将其特征蒸馏到 VLA 主干网络中,未能将 GFM 的多层几何结构重新定义为策略自身的时序与动作生成基质。
方法论:几何动作模型 (GAM)
作者提出了几何动作模型 (GAM),这是一种以语言为条件的操控策略,它直接将预训练的几何基础模型 (GFM) 重新利用为一个用于感知、时序预测和动作解码的共享基质。
核心架构
GAM 通过在中间层 L s L_s L s 处拆分预训练的 GFM(例如 DA3),并在浅层与深层之间插入一个因果未来预测器 (Causal Future Predictor) 来运行。该框架按三个顺序阶段执行:
观测编码 (Observation Encoding): GFM 的浅层 (E ≤ L s E_{\le L_s} E ≤ L s ) 作为观测编码器。它们处理多视图 RGB 观测数据以提取潜在几何特征,生成每步的几何潜状态序列。
因果未来预测 (Causal Future Prediction): 在拆分层处,插入一个因果 Transformer 预测器 (g ϕ g_\phi g ϕ )。它接收当前的几何潜标记 (tokens)、通过冻结文本编码器获得的指令标记、本体感受状态以及动作历史。利用块因果自注意力机制 (block-causal self-attention),该预测器同时预测两个输出:
未来的几何潜标记 (Z ~ t + 1 ( L s ) \tilde{Z}^{(L_s)}_{t+1} Z ~ t + 1 ( L s ) )。
预测的下一个动作标记 (a ~ t \tilde{a}_t a ~ t )。 这种设计使得模型能够以极小的架构修改实现语言条件的时序世界建模,因为只有被插入的预测器需要学习如何将语言、本体感受和动作历史与 GFM 特征进行融合。
特征传播与解码 (Feature Propagation and Decoding): 预测的未来标记和动作标记被路由至剩余的深层 GFM 模块 (D > L s D_{>L_s} D > L s )。这些深层模块最初被预训练为将浅层特征解码为 3D 几何,现在被重新用于解码预测的未来标记。此阶段产生:
未来几何 (Future Geometry): 通过 GFM 的深度头解码为与动作对齐的未来深度图。
动作块 (Action Chunk): 通过轻量级动作头解码为可执行的增量位姿 (delta-pose) 或关节指令。
训练目标
该策略使用多任务损失函数进行端到端训练:L t o t a l = λ a c t L a c t + λ f e a t L f e a t + λ d e p t h L d e p t h \mathcal{L}_{total} = \lambda_{act}\mathcal{L}_{act} + \lambda_{feat}\mathcal{L}_{feat} + \lambda_{depth}\mathcal{L}_{depth} L t o t a l = λ a c t L a c t + λ f e a t L f e a t + λ d e pt h L d e pt h
动作损失 (L a c t \mathcal{L}_{act} L a c t ): 解码的动作块与专家动作之间的 ℓ 1 \ell_1 ℓ 1 回归。
特征损失 (L f e a t \mathcal{L}_{feat} L f e a t ): 将预测的未来潜标记与实际下一帧的潜标记(从冻结的 GFM 中提取)进行对齐,从而将预测器锚定在时序几何转换上。
深度损失 (L d e p t h \mathcal{L}_{depth} L d e pt h ): 使用尺度不变性和梯度匹配惩罚,监督解码的未来深度图相对于真实未来深度(或现实场景中的伪标签)的表现。
核心贡献
统一架构: GAM 引入了一种单一的共享主干架构,将时序世界建模、潜特征空间预测和几何基础模型基质结合在一起。
共享标记空间预测: 作者证明了动作和几何可以在一个共享的自回归标记序列中进行预测。单次前向传播即可产生动作标记和未来场景标记,并由轻量级头进行解码,而非依赖于独立的头部或扩散过程。
重用 GFM: 不同于以往仅将 GFM 用作静态提取器的研究,GAM 明确地重新利用了 GFM 的深层模块来解码预测的未来标记,充分利用其几何先验进行动态世界建模。
实验结果
作者在多种模拟环境 (LIBERO, LIBERO-Plus) 和现实世界机器人操控基准测试中评估了 GAM。
性能对比基线: GAM 实现了与当前基础模型规模基线(VLA 和 WAM)相当甚至更高的成功率,同时使用了显著更少的参数(1.4B 对比 7B+)。
鲁棒性: GAM 展示了卓越的分布外 (OOD) 扰动鲁棒性。特别是在 LIBERO-Plus 的摄像头扰动设置中,GAM 比最佳基线高出 9.7 个百分点。
效率: GAM 实现了 6.9 ms 的单次前向推理延迟(约 145 Hz),比基于扩散的策略(如 Cosmos-Policy)快约 55 倍。
现实世界迁移: 在涉及四个操控任务的现实世界实验中,GAM 显著优于包括 π 0.5 \pi0.5 π 0.5 和 Spatial Forcing 在内的基线,并在其他模型难以应对的摄像头扰动下保持了鲁棒性。
意义与主张
论文声称,通过解决 2D 中心化基础模型固有的空间歧义性,GAM 代表了迈向通用机器人策略的重要一步。通过将几何世界动力学直接集成到策略的预测路径中,GAM 在高精度、环境变化鲁棒性和计算效率之间取得了平衡。作者认为,他们的方法证明了动作和几何可以在共享的潜空间中进行有效建模,从而使单个主干网络能够处理感知、未来状态预测和控制。
作者承认了局限性,指出模型的语言推理和常识能力受限于所使用的冻结文本编码器,这表明集成大语言模型或外部推理模块是未来研究的一个自然方向。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。