Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning
Temporal GRPO 通过阶段特定的优势对齐来缓解轨迹层面的信用分配混淆,从而通过增强视觉-语言-动作强化学习,提高任务成功率和样本效率,相比于传统的展开层级方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在教一个机器人做一道复杂的菜,比如一顿包含三道菜的正餐。在机器人和人工智能领域,这被称为“视觉-语言-动作”(Vision-Language-Action)学习。机器人有眼睛(视觉)、理解指令的大脑(语言)以及移动物体的手臂(动作)。通常,我们通过向机器人展示人类完成任务的视频来教它,但这既慢又贵。一种更新颖、更酷的方法是“强化学习”(Reinforcement Learning),即让机器人通过自我尝试来学习。如果成功了,它会得到一个“击掌鼓励”(奖励);如果失败了,它会得到一个温柔的“再试一次”(惩罚)。
问题在于,现实生活是混乱的。机器人可能完美地切好了蔬菜、炒好了洋葱并摆好了盘,却在最后撒装饰物时把它掉在了地上。在旧的教学方法中,计算机看到最后的掉落后会说:“你整顿饭都失败了!”并惩罚它所做的所有事情,甚至包括它那完美的切菜和炒洋葱的过程。这就像是因为你在最后一步犯了一个小错,就给你的数学考试打了个不及格,从而抹杀了你之前所有正确答案的功劳。这篇论文针对这种不公平性提出了解决方案,它提出了一种更聪明的授信方式,让机器人能准确知道哪里出了错,而不至于忘记它已经做对的部分。
“全有或全无”的陷阱
让我们来看看旧的训练方式,作者称之为轨迹级信用(Trajectory-Level Credit)。想象一个机器人正在尝试堆叠积木。它成功地拿起第一个积木,将其移动到桌子上,并将其堆叠起来。但在处理最后一个积木时,它滑了一下,把整个塔都撞倒了。
在标准方法(称为 GRPO)中,计算机观察最终结果:塔倒了。它为整个动作序列分配了一个单一的“失败得分”。这意味着机器人的大脑接收到一个信号:“不要拿积木,不要移动它们,也不要堆叠它们。”它对成功的早期动作进行的惩罚与对失败的最终动作一样重。作者称之为轨迹级信用混淆(trajectory-level credit aliasing)。这就像老师在批改学生的作文时只看最后一句话;如果结尾写得不好,整篇作文都会被判不及格,即使开头和正文部分写得非常精彩。这会让机器人感到困惑,使其难以学习长而复杂的任务。
新的想法:时间 GRPO
论文介绍了一种名为 Temporal GRPO(意为“时间组相对策略优化”,但我们可以称之为“时空旅行老师”)的新方法。它不再将整个任务视为一个巨大的整体,而是将任务分解为清晰、可检测的章节或“阶段”。
把机器人的工作想象成一场带有不同关卡的电子游戏:
- 第一关: 拿起红色的杯子。
- 第二关: 将杯子移动到架子上。
- 第三关: 将杯子放在架子上。
使用 Temporal GRPO,计算机不仅仅是看着最后的“游戏结束”画面。它会观察机器人如何玩完每一关。
- 如果机器人在第三关失败了(掉落了杯子),计算机会说:“第一关和第二关做得很好!你保持了杯子的稳定并移动得很好。但你在最后的放置环节搞砸了。”
- 然后,它会专门针对第一关和第二关的动作给予“击掌鼓励”(正向信用),而仅针对第三关的动作给予“再试一次”(负向信用)。
论文解释说,这是通过根据指令创建一系列“可检测阶段”来实现的。机器人的动作随后与这些阶段对齐。如果机器人甚至没能到达第二关,它就不会被拿来与到达了第三关的机器人进行比较。它们只会与处于同一阶段的其他机器人进行比较。这确保了机器人能从正确的错误中学习,而不会忘掉已有的成功。
实验结果显示了什么
研究人员在两个不同的机器人训练场上测试了这种新方法:RoboTwin 2.0 和 LIBERO-Long。
在具有不同长度任务(短、中、长)的 RoboTwin 2.0 上,新方法表现得显著更好。
- 旧方法(如标准的 Trajectory-GRPO)的平均成功率约为 46.4%。
- 新的 Temporal GRPO 方法达到了 75.8% 的成功率。
- 这种提升在所有任务长度中都是一致的,尤其是在容易发生“全有或全无”错误的复杂长任务中,它的表现尤为出色。
论文还对 LIBERO-Long 进行了特别测试,以观察机器人在哪里进行学习。他们发现,使用旧方法时,机器人实际上在早期步骤(如拿起物体)的表现反而变差了,因为它在为后期的失败受罚。而使用 Temporal GRPO 时,机器人保持了早期技能的敏锐度,并只专注于它出错的具体步骤进行学习。
为什么这很重要
这不仅仅是关于机器人堆叠杯子,更是关于教机器如何处理长而复杂的任务而不产生困惑。通过修复我们给予信用(credit)的方式,机器人可以学习得更快、更高效。作者指出,这种方法可以帮助机器人掌握需要连续执行许多步骤的任务,比如组装家具或烹饪一顿完整的晚餐,因为它确保了机器人不会仅仅因为最后的一个小失误就丢弃了之前所有的努力。
然而,论文也指出,该方法目前依赖于能够清晰定义这些“阶段”的能力。如果任务过于混乱或步骤不明确,系统可能会难以判断一个阶段何时结束,下一个阶段何时开始。但对于具有清晰开头、中间和结尾的任务,这个“时空旅行老师”似乎是让机器人变得更聪明、更可靠的游戏规则改变者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。