← 最新论文
💻 computer science

Learning Robust Execution in Robotic Manipulation with Agentic Reinforcement Learning

本文提出了一种智能体强化学习框架,通过引入运行时执行质量指标以及能够检测性能退化并触发恢复机制以恢复标称任务状态的高层决策策略,增强了机器人操控的鲁棒性,并在 LIBERO 基准测试中实现了显著的成功率提升。

原作者: Xiaopeng Zhang, Yueyang Weng, Qi Liu, Yongjin Mu, Yanjie Li

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaopeng Zhang, Yueyang Weng, Qi Liu, Yongjin Mu, Yanjie Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人搭建一座复杂的乐高城堡。你给它一套指令,它就开始堆叠积木。但机器人很笨拙;有时它会偏离积木一毫米,或者桌面会晃动,或者它们的“抓握”会稍微打滑一点。在机器人领域,这被称为不确定性(uncertainty)。当机器人在早期犯下一个小错误时,这个错误并不会消失;它会随着任务的进行而变得越来越严重,就像滚下山的雪球一样。这被称为复合误差(compounding error)。最终,机器人可能会把积木拿错位置,或者完全掉落了一个零件,但它仍然试图继续执行原来的计划,导致一团糟。

长期以来,科学家们试图通过教机器人学习每一种可能发生的错误案例来解决这个问题。但这就像是在开始搭建乐高塔之前,试图背诵所有可能的倒塌方式——这既耗时又昂贵。另一种想法是给机器人一个超级聪明的“大脑”(比如语言模型),让它不断检查工作并告诉它下一步该做什么。但这会让机器人变得缓慢且复杂,就像有一个老师在每一次放置积木时都在大声指挥一样。核心问题在于:我们能否制造出一种机器人,它能察觉到自己偏离了轨道,并知道如何自我修复,而不需要超级计算机或一个记录了所有灾难的图书馆?

这篇论文介绍了一种处理机器人错误的高明新方法,称为智能体强化学习(Agentic Reinforcement Learning)。作者并没有试图教机器人如何完美地移动手臂(这是最难的部分),而是构建了一个“管理者”,它观察机器人的表现,并决定何时继续前进、何时后退以及何时重新开始。你可以把机器人的手臂想象成一个技术熟练但略显笨拙的工人,而这个新的“管理者”则是一个并不负责搬运,而是监视整个施工现场的工头。

研究人员发现,当机器人开始踉跄时,这个管理者能在问题演变成灾难之前察觉到麻烦。他们创建了两张“计分卡”来衡量机器人的表现:一张检查机器人当前的动作是否流畅(局部质量),另一张检查机器人是否仍处于与完美范例一致的正确路径上(全局质量)。如果分数下降,管理者并不会尝试发明新的移动手臂的方法。相反,它会从一个预定义的、较小的恢复动作列表中进行选择:

  • 重试(RETRY): 如果机器人刚刚抓取失败,管理者会告诉它后退几步,然后重试。
  • 修复(REPAIR): 如果机器人卡住了或者抓取姿势很奇怪,管理者会告诉它松手,移动到一个安全的位置,并重新调整抓取。
  • 重置(RESET): 如果机器人已经掉落了所有东西或处于无法挽救的境地,管理者会按下“重启”按钮,从任务的最开始重新开始。

团队在著名的机器人挑战集 LIBERO 上测试了这个系统,这些挑战涉及诸如拿起碗、打开抽屉和堆叠物体等任务。他们发现,加入这个“管理者”显著提高了机器人的任务完成率。在标准测试中,成功率提升了高达 13.7%。但真正的奇迹发生在加入随机干扰(如摇晃机器人或干扰其动作)的情况下。在这些混乱的情况下,成功率跃升了高达 39.2%。

论文指出,仅仅通过增加数据量训练机器人并不总是最佳答案,而添加沉重、缓慢的推理系统也并不高效。相反,这种“智能体式”的方法将“恢复决策”与“移动动作”分离开来。机器人不需要学习新的技能;它只需要一个聪明的监督者,知道何时说:“等等,那行不通,让我们再试一次,”或者“好吧,我们卡住了,让我们重新开始。” 结果表明,这种方法适用于各种类型的机器人大脑(从简单的到复杂的),使机器人更加稳健可靠,而无需从头开始重新训练。虽然该系统无法修复所有不可能的情况,但它证明了,一点点聪明的监管在保持机器人稳健运行方面可以发挥巨大的作用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →