← 最新论文
🤖 machine learning

Geometric Action Model for Robot Policy Learning

本文介绍了几何动作模型(Geometric Action Model, GAM),这是一种语言条件下的操控策略,它通过拆分预训练的几何基础模型以集成因果未来预测器,从而在保留丰富几何先验的同时,实现用于机器人控制的高效、准确且鲁棒的 3D 推理。

原作者: Jisang Han, Seonghu Jeon, Jaewoo Jung, René Zurbrügg, Honggyu An, Tifanny Portela, Marco Hutter, Marc Pollefeys, Seungryong Kim, Sunghwan Hong

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Jisang Han, Seonghu Jeon, Jaewoo Jung, René Zurbrügg, Honggyu An, Tifanny Portela, Marco Hutter, Marc Pollefeys, Seungryong Kim, Sunghwan Hong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人做家务,比如堆叠积木或把锅放到炉灶上。为了出色地完成任务,机器人需要同时理解三件事:你告诉它要做什么(语言)、它现在看到了什么(视觉),以及当它移动时世界会发生怎样的变化(物理/几何)。

目前大多数机器人的“大脑”就像只能看平面 2D 照片的人。它们擅长识别物体,但在理解深度、距离或物体在被推动时如何倾倒方面却很吃力。它们必须仅凭一张扁平的照片来猜测世界的 3D 形状,这就像试图通过看一张明信片来判断一座山的规模一样。

这篇论文介绍了一种新的机器人大脑,叫做 GAM(几何动作模型)。以下是它的工作原理,我将使用简单的类比来解释:

1. “预训练建筑师”(基础模型)

研究人员并没有从零开始构建机器人大脑。相反,他们采用了一个庞大的、经过预训练的“几何基础模型”(GFM)。你可以把这个 GFM 想象成一位超级建筑师,他多年来一直在研究蓝图和 3D 结构。这位建筑师已经知道如何将扁平的照片转化为详细的 3D 地图。他理解深度、比例以及物体如何占据空间。

2. “拆分与插入”策略

通常,人们使用这种超级建筑师只是为了让它观察房间并进行描述,然后将描述交给一个独立的“执行者”机器人去移动。GAM 改变了这一游戏规则,它通过在中间拆分并插入一个新的“规划器”来改变局势。

  • 上半部分(眼睛): 建筑师的第一部分观察当前的摄像机照片,并将它们转化为 3D 心理地图。
  • 中间部分(时间旅行者): 在建筑师的正中间,研究人员插入了一个特殊的“因果未来预测器”。想象一下这是一个时间旅行规划器。它获取当前的 3D 地图,并聆听你的指令(“把杯子放在这里”),然后询问:“如果我这样移动手臂,一秒钟后的 3D 世界会是什么样子?”
  • 下半部分(双手): 建筑师的第二部分获取那个未来的 3D 预测,并利用它来计算出机器人应该如何移动手臂,以实现那个未来。

3. 为什么这很重要

大多数其他机器人模型试图在 2D 空间中(像电子游戏一样)预测未来,或者在最后阶段才猜测 3D 形状。GAM 的做法不同:

  • 它从一开始就进行 3D 思考: 因为它在所有环节都使用建筑师的 3D 知识,所以机器人不需要去猜测物体是远是近。它心里有数。
  • 它是“一次性完成”的奇迹: 其他模型通常必须运行一个复杂且缓慢的过程(比如扩散模型),多次迭代才能确定一个动作,这就像一位画家试图通过一遍遍重画整张画布来修正错误。而 GAM 就像一位速写画家,能快速、自信地一笔勾勒出整个计划。
  • 它快速且轻量: 由于其高效性,它的运行速度比一些最大、最慢的模型快 55 倍,并且占用的计算机内存也少得多。

4. 结果:鲁棒性

研究人员通过两种方式测试了这个机器人:

  1. 模拟环境: 在一个可以改变光照、移动摄像头或扰乱背景的计算机世界中。
  2. 现实生活: 在真实房间里的一个实际机器人手臂上。

关于“扰动”的类比:
想象你在房间里走动。如果灯光闪烁或者有人挪动了一把椅子,一个只看 2D 照片的机器人可能会感到困惑,认为椅子消失了或者移到了别处。

  • 旧机器人: 当摄像头角度发生轻微变化时,它们的成功率会大幅下降(就像驾驶员在 GPS 信号闪烁时迷路一样)。
  • GAM: 因为它理解房间内真实的 3D 几何结构,所以它并不在意摄像头移动或光照变化。它准确地知道物体在空间中的位置。在摄像头被移动到奇怪角度的测试中,GAM 依然保持成功,而其他模型则失败了。

总结

GAM 是一种机器人策略,它提取了一个“3D 专家”(几何基础模型),将其剖开并在内部插入了一个“未来规划器”。这使得机器人能够同时以 3D 方式观察、以 3D 方式预测未来并以 3D 方式行动。其结果是,相比目前的尖端机器人,GAM 更加快速、更小巧,并且能更好地处理现实世界的混乱情况(如移动的摄像头或变化的灯光)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →