← 最新论文
🤖 machine learning

SEAR: Sample Efficient Action Chunking Reinforcement Learning

本文介绍了 SEAR,这是一种样本高效的离策强化学习算法,它利用具有多时界目标的因果 Transformer 评论家(causal transformer critic)和后退时界重规划策略(receding horizon replanning strategy),从而实现基于动作块(action chunks)的高效在线学习,并在具有挑战性的操控任务上超越了最先进的方法。

原作者: C. F. Maximilian Nagy, Onur Celik, Emiliyan Gospodinov, Florian Seligmann, Weiran Liao, Aryan Kaushik, Gerhard Neumann

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: C. F. Maximilian Nagy, Onur Celik, Emiliyan Gospodinov, Florian Seligmann, Weiran Liao, Aryan Kaushik, Gerhard Neumann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人玩一款复杂的视频游戏,比如一个需要收集钥匙、打开门并解开谜题的迷宫。在人工智能的世界里,这被称为强化学习(Reinforcement Learning)。这就像是在训练一只狗:当它做得对时,你给它奖励(奖励);当它做错时,则不给。但棘手之处在于,如果游戏非常长,这只狗可能会忘记最后那个奖励是因为它最初做的第一件事。它需要把开头和结尾联系起来。

为了帮助机器人学得更快,科学家们使用了一种叫做**动作分块(Action Chunking)**的技巧。与其告诉机器人“手臂向左移动”、“手臂向上移动”、“抓取杯子”这样一步步微小的指令,不如说:“这里有一个完整的序列:向左移动、向上移动并抓取。”这就像是在教钢琴家一整个小节的乐谱,而不是一次只教一个音符。这有助于机器人看到更宏观的图景并更好地进行规划。然而,这里有一个陷阱。如果你只是告诉机器人演奏一整块乐曲,却不让它在演奏过程中听音乐,一旦它弹错了一个音符,它就会迷失方向。它需要能够停下来、倾听,并不断调整自己的计划。这篇论文探讨了如何教机器人这些大型“动作块”,同时又不让它们在遇到错误时变得反应迟钝或笨拙。


见见 SEAR(样本高效动作分块强化学习),一种旨在教机器人如何提前规划而不失冷静的新方法。研究人员发现,虽然一次性执行一整套动作序列(即“动作块”)有利于学习,但用传统的方法做往往会导致灾难。如果你只是递给机器人一份包含10个动作的清单并说“开始”,而它在第3个动作时犯了错,它会盲目地继续执行直到清单结束。等到它意识到自己偏离轨道时,已经太晚了。

作者发现,以往方法失败的主要原因在于它们没有给机器人足够的“练习”来掌握计划中的每一个小环节。想象一下,如果你每天只能练习一遍长达2分钟的完整舞蹈,而不是练习每一个具体的舞步,你永远无法掌握每一个细节。SEAR 通过使用一种特殊的“老师”——**因果 Transformer 评论家(Causal Transformer Critic)**来解决这个问题。这位老师不仅仅根据整个舞蹈的最终结果来评分,而是会在序列执行的过程中,对每一个单独的步骤进行评分。这就像一位舞蹈教练,每做一个动作就会停下音乐说:“脚步很好!”或者“注意你的手肘!”这让机器人在每一次尝试中都能获得海量的反馈,从而学得更快、更高效。

但学习大块动作只是成功的一半。机器人还需要能够快速反应。为了解决这个问题,SEAR 使用了一种聪明的策略,叫做随机重规划(Random Replanning)。SEAR 不会强迫机器人执行它计划的整个动作列表,而是告诉它只执行其中随机的一部分——也许只是前三个动作——然后停止,并根据它当前实际所处的位置询问:“好,现在的计划是什么?”这就像一个 GPS,它不仅给你一条全程路线并让你“开车”,还会每隔几个街区根据实际路况重新计算路径,以避开交通拥堵。这保持了机器人的“状态-动作覆盖率(state-action coverage)”处于高水平,这意味着它学会了处理各种各样的状况,而不仅仅是那些它计划得非常完美的状况。

结果令人印象深刻。在 Metaworld 基准测试(一个包含20项非常困难的机器人操控任务,如拿起物体或按下按钮)中,SEAR 的成功率超过了 80%。这是一个巨大的飞跃,因为以往的方法仅能达到 60% 左右。更有趣的是,研究人员发现,SEAR 可以在训练期间使用这些大块动作进行学习,但在实际测试时可以切换到单步决策模式,有效地变成了一个通过“大局思维”训练出来的“超快速单步学习者”。

论文还在“离线到在线(offline-to-online)”的设置下测试了 SEAR,即机器人首先从大量的过往视频数据中学习(离线),然后通过实际执行任务来提升自己(在线)。通过将 SEAR 的技术应用于现有的 QC 方法,研究人员在 OGBench 的立方体三连任务(cube-triple tasks)上看到了性能的显著提升,证明了即使在机器人拥有过往数据作为起步优势的情况下,这些想法依然有效。

然而,作者也谨慎地指出,这并不是解决所有机器人问题的“万灵药”。他们指出,SEAR 最适合那些需要较长时间完成且不需要瞬时反应的任务,例如组装家具或移动物体。它不适用于像机器狗在森林中奔跑那样需要极快反应的任务,因为在这种情况下,“分块”方法可能会导致数据质量下降。但对于机器人操控这类缓慢、刻意且复杂的任务,SEAR 提供了一种强大的新方式,教机器如何预判未来、学得更快,并时刻保持警觉。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →