General Covariant Action Modeling: Constructing Generalized Manifolds via Spatio-Temporal Decoupling
本文介绍了广义动作流形(Generalized Action Manifold, GAM)框架,该框架通过空间路径几何与时间动力学的结构化解耦来强制执行一般协变性,从而增强了具身智能中的鲁棒泛化能力,使策略能够从稀疏演示中有效地迁移至不同的速度和空间配置。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大问题:机器人的“平均值”错误
想象一下,你正在教一个机器人拿起杯子并将其倒入水槽。你向它展示了三个视频:
- 视频 A: 机器人移动得很快,从左侧倾倒。
- 视频 B: 机器人移动得很慢,从右侧倾倒。
- 视频 C: 机器人以中等速度移动,从中间倾倒。
目前的 AI 模型通常试图通过对这三个视频取“平均值”来学习。
- 结果: 机器人尝试以中等速度移动,但因为它对“左边”和“右边”的位置进行了平均,最终它会把水倒在杯子和水槽之间的空气中。它失败了,因为它学习了一个在现实世界中并不存在的“数学平均值”。
这篇论文称之为**“模态平均”(Mode Averaging)**。这发生是因为机器人被两件事搞混了:
- 速度: 动作是快还是慢?
- 位置: 动作是在左边还是右边?
当机器人试图同时学习所有这些不同的版本时,它会陷入一个“鞍点(saddle point)”——即一个它认为自己在做正确事情,但实际上却毫无用处的点。
解决方案:“广义动作流形”(Generalized Action Manifold, GAM)
作者提出了一种名为 GAM 的新方法来教机器人。与其让机器人死记硬背特定的坐标(比如“向左移动 5 英寸”),GAM 教会机器人动作的形状,而不受其发生在哪里或速度如何的影响。
这就像是在教一个人画圆。
- 旧方法: 你告诉他们,“从像素 100, 100 开始画一个圆,每秒移动 5 个像素。”如果他们在 200, 200 的位置开始,他们就会感到困惑。
- GAM 方法: 你告诉他们,“画一个圆。”无论他们画得大、小、快还是慢,这都不重要。形状才是关键。
GAM 通过将动作分解为两个独立的“层”或“维度”来实现这一点:
1. “形状”层(几何不变性)
类比:蓝图 vs. 建筑工地。
想象一张房子的蓝图。蓝图展示了房间的形状(即“模式/schema”)。它不在乎房子是建在纽约还是伦敦,也不在乎墙壁是被涂成红色还是蓝色。
- GAM 的做法: 它剥离了特定位置带来的“噪声”(即“仿射/affine”部分)。它观察机器人的运动,并询问:“这个路径纯粹的形状是什么?”它将每一个不同版本的“拿起杯子”动作,都转化为一个单一的标准“规范形状”。
- 益处: 机器人会学习到“抓取”永远是同一种形状,即使杯子在左边、右边或倒置着。
2. “速度”层(时间不变性)
类比:乐谱 vs. 指挥家。
想象一首歌。无论钢琴家演奏得快(快板)还是慢(柔板),乐谱(音符)都是一样的。
- GAM 的做法: 它使用了一个特殊的工具,叫做弧长参数化器(Arc-Length Parameterizer)。它不再计算时间(1 秒、2 秒),而是计算行驶距离。
- 如果机器人移动得快,它会在更短的时间内覆盖更多的距离。
- 如果机器人移动得慢,它会在更长的时间内覆盖更少的距离。
- GAM 根据机器人沿着路径行驶的距离来对齐动作,而不是根据经过了多少时间。
- 益处: 机器人会完美地学习路径,无论它是匆忙赶路还是悠闲漫步。它不再试图将一个快速的手部动作与一个缓慢的手部动作进行“平均”。
实际运作方式:“规划器与执行器”
论文构建了一个有两个截然不同部分的机器人大脑,它们像导演与演员一样协作:
导演(规划器/The Planner):
- 导演观察场景并接收指令(如“拿起勺子”)。
- 导演不会去猜测精确的坐标,而是选择一个离散模式(Discrete Schema)。这就像是从一个库中选择一个特定的“电影场景”。“好吧,这是一个‘抓取’场景。”
- 这将机器人锁定在一个特定的“成功盆地(basin of success)”中,防止它在各种可能性的混乱中迷失方向。
演员(执行器/The Executor):
- 一旦导演说“执行‘抓取’场景”,演员就开始填充细节。
- 演员生成平滑且连续的运动,以匹配那个特定的场景,并针对当前的速率和位置进行调整。
- 因为导演已经选定了正确的“形状”,所以演员不需要猜测,只需要进行精细化的调整。
结果:为什么这很重要
作者在模拟世界(如 LIBERO 和 SimplerEnv)中测试了这些方法。
- 旧方法: 当速度发生变化或物体移动到新位置时,机器人经常失败。它们会“平均”动作,从而撞到物体。
- GAM 方法: 机器人的鲁棒性大大增强。它们可以处理:
- 速度变化: 移动快或慢都不会让它们感到困惑。
- 位置变化: 将物体移动到新位置不会破坏逻辑。
- 长任务: 它们可以将许多步骤串联起来(比如一段很长的舞蹈动作),而不会迷失方向。
简而言之,这篇论文认为,要让机器人变得聪明,我们不应该只是喂给它们更多的数据。我们需要教会它们理解运动的几何结构(形状和路径),并将它们与时间及位置带来的“噪声”区分开来。通过这样做,我们将一个混乱、令人困惑的学习问题变成了一个清晰、可解的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。