← 最新论文
⚡ electrical engineering

Guided Reinforcement Learning for Omnidirectional 3D Jumping in Quadruped Robots

本文提出了一种新颖的引导式强化学习框架,该框架将贝塞尔曲线与匀加速直线运动模型相结合,使四足机器人能够实现高效、可解释且鲁棒的全向三维跳跃,从而克服了传统端到端方法在样本效率和安全认证方面面临的挑战。

原作者: Riccardo Bussola, Michele Focchi, Giulio Turrisi, Claudio Semini, Luigi Palopoli

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Riccardo Bussola, Michele Focchi, Giulio Turrisi, Claudio Semini, Luigi Palopoli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个四足机器人试图跳过一道缝隙或跃上一个高架子。对人类而言,跳跃是自然而然的事;对机器人来说,这就像在跑马拉松的同时,试图解开一道复杂的物理谜题。如果机器人发力过猛,可能会折断自己的腿;如果发力太轻,则无法成功;如果发力角度不对,就会头朝下落地。

本文提出了一种训练这些机器人跳跃的新方法,作者称之为引导式强化学习(Guided Reinforcement Learning, GRL)。以下通过简单的类比,解析其工作原理。

问题所在:“试错”陷阱

传统上,训练机器人跳跃,就像把小孩扔下悬崖,指望他们学会飞行。

  • 旧方法(优化法): 工程师试图完美计算每一个数学方程。这就像在时钟滴答作响时试图解一道数独题。耗时过长,且一旦地面湿滑或机器人比预期稍重,往往就会失败。
  • 标准 AI 方法(端到端强化学习): 让机器人在电子游戏中尝试跳跃数百万次。大多数时候,它会摔倒。最终,在数百万次尝试后,它或许能学会。这极其缓慢,且机器人常会学会一些怪异、不可预测的动作,难以让人信任。

解决方案:"GPS 与物理”方法

作者表示:“在机器人开始学习之前,先给它一点常识。”与其让机器人盲目猜测,不如利用物理直觉对其进行引导。

可以这样理解:

  1. 贝塞尔曲线(路线图): 不是告诉机器人“左腿移动 5 度,然后右腿移动 3 度”,而是让机器人使用一种名为贝塞尔曲线的数学工具,在空中绘制一条平滑的无形道路。想象用笔绘制一条平滑的弧线。机器人只需决定该弧线的起点和终点在哪里,数学计算会自动填补两者之间的平滑路径。这使得学习任务变得更小、更简单。
  2. “爆发”助推(UARM): 有时,仅绘制平滑弧线不足以跳得足够高。机器人需要一个“踢蹬”。作者在计划中增加了第二部分:在机器人离地前,施加一段直线加速运动(匀加速直线运动)。这就像短跑运动员身体前倾,从起跑器上爆发冲出。这确保了机器人能跳得足够高,而无需过度弯曲腿部导致腹部触地。
  3. 安全过滤器(守门员): 由于机器人利用真实的物理方程来规划跳跃,计算机可以在机器人实际移动之前检查该计划。这就像夜店门口的保安检查身份证。如果计划显示“如果你这样跳,会撞到头部”,计算机就会说“不行,不允许”,并阻止机器人尝试。这使得系统既安全又可预测。

学习如何发生

机器人使用“教师”(AI)和“学生”(机器人)。

  • 教师提出跳跃计划(弧线的形状和速度)。
  • 学生尝试遵循该计划。
  • 如果机器人落点接近目标且未损坏任何部件,它会获得“击掌”(奖励)。
  • 如果落点不佳或违反安全规则(如关节移动过快),它会受到“暂停”(惩罚)。

由于机器人受到贝塞尔曲线物理原理和“爆发”助推的引导,它无需尝试数百万次。它仅需2,000 次尝试即可学会,而其他方法可能需要数百万次。这就像被扔进深水区学游泳,与穿着救生衣、有教练指导学游泳的区别。

结果:机器人能做什么

团队在两台真实机器人(Unitree Go1 和 Aliengo)以及仿真环境中测试了该方法。

  • 全向性: 机器人可以向前、向后、向侧方跳跃,甚至在空中旋转跳跃。
  • 上下跳跃: 它可以跳上高箱子,或从 ledge 跳下。
  • 零样本迁移: 他们在小型机器人(Go1)上训练了 AI,然后让更大、更重的机器人(Aliengo)使用完全相同的指令进行跳跃。更大的机器人成功了,无需从头重新学习一切。这就像教孩子骑自行车,然后让他们骑上摩托车,立刻就知道如何保持平衡。

为何重要

该论文声称,与以往方法相比,此方法训练更快更安全更准确。它不只是猜测,而是利用物理定律来引导其猜测。这意味着我们可以信任机器人在现实世界情境(如搜救)中执行跳跃,而无需担心它会因为“猜错”而突然翻倒。

简而言之,作者不仅教会了机器人跳跃,还教会了它如何思考跳跃,利用物理规则使其成为更聪明、更安全的学习者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →