想象一下,一个四足机器人试图跳过一道缝隙或跃上一个高架子。对人类而言,跳跃是自然而然的事;对机器人来说,这就像在跑马拉松的同时,试图解开一道复杂的物理谜题。如果机器人发力过猛,可能会折断自己的腿;如果发力太轻,则无法成功;如果发力角度不对,就会头朝下落地。
本文提出了一种训练这些机器人跳跃的新方法,作者称之为引导式强化学习(Guided Reinforcement Learning, GRL)。以下通过简单的类比,解析其工作原理。
问题所在:“试错”陷阱
传统上,训练机器人跳跃,就像把小孩扔下悬崖,指望他们学会飞行。
- 旧方法(优化法): 工程师试图完美计算每一个数学方程。这就像在时钟滴答作响时试图解一道数独题。耗时过长,且一旦地面湿滑或机器人比预期稍重,往往就会失败。
- 标准 AI 方法(端到端强化学习): 让机器人在电子游戏中尝试跳跃数百万次。大多数时候,它会摔倒。最终,在数百万次尝试后,它或许能学会。这极其缓慢,且机器人常会学会一些怪异、不可预测的动作,难以让人信任。
解决方案:"GPS 与物理”方法
作者表示:“在机器人开始学习之前,先给它一点常识。”与其让机器人盲目猜测,不如利用物理直觉对其进行引导。
可以这样理解:
- 贝塞尔曲线(路线图): 不是告诉机器人“左腿移动 5 度,然后右腿移动 3 度”,而是让机器人使用一种名为贝塞尔曲线的数学工具,在空中绘制一条平滑的无形道路。想象用笔绘制一条平滑的弧线。机器人只需决定该弧线的起点和终点在哪里,数学计算会自动填补两者之间的平滑路径。这使得学习任务变得更小、更简单。
- “爆发”助推(UARM): 有时,仅绘制平滑弧线不足以跳得足够高。机器人需要一个“踢蹬”。作者在计划中增加了第二部分:在机器人离地前,施加一段直线加速运动(匀加速直线运动)。这就像短跑运动员身体前倾,从起跑器上爆发冲出。这确保了机器人能跳得足够高,而无需过度弯曲腿部导致腹部触地。
- 安全过滤器(守门员): 由于机器人利用真实的物理方程来规划跳跃,计算机可以在机器人实际移动之前检查该计划。这就像夜店门口的保安检查身份证。如果计划显示“如果你这样跳,会撞到头部”,计算机就会说“不行,不允许”,并阻止机器人尝试。这使得系统既安全又可预测。
学习如何发生
机器人使用“教师”(AI)和“学生”(机器人)。
- 教师提出跳跃计划(弧线的形状和速度)。
- 学生尝试遵循该计划。
- 如果机器人落点接近目标且未损坏任何部件,它会获得“击掌”(奖励)。
- 如果落点不佳或违反安全规则(如关节移动过快),它会受到“暂停”(惩罚)。
由于机器人受到贝塞尔曲线物理原理和“爆发”助推的引导,它无需尝试数百万次。它仅需2,000 次尝试即可学会,而其他方法可能需要数百万次。这就像被扔进深水区学游泳,与穿着救生衣、有教练指导学游泳的区别。
结果:机器人能做什么
团队在两台真实机器人(Unitree Go1 和 Aliengo)以及仿真环境中测试了该方法。
- 全向性: 机器人可以向前、向后、向侧方跳跃,甚至在空中旋转跳跃。
- 上下跳跃: 它可以跳上高箱子,或从 ledge 跳下。
- 零样本迁移: 他们在小型机器人(Go1)上训练了 AI,然后让更大、更重的机器人(Aliengo)使用完全相同的指令进行跳跃。更大的机器人成功了,无需从头重新学习一切。这就像教孩子骑自行车,然后让他们骑上摩托车,立刻就知道如何保持平衡。
为何重要
该论文声称,与以往方法相比,此方法训练更快、更安全且更准确。它不只是猜测,而是利用物理定律来引导其猜测。这意味着我们可以信任机器人在现实世界情境(如搜救)中执行跳跃,而无需担心它会因为“猜错”而突然翻倒。
简而言之,作者不仅教会了机器人跳跃,还教会了它如何思考跳跃,利用物理规则使其成为更聪明、更安全的学习者。
技术摘要:用于四足机器人全向三维跳跃的引导式强化学习
问题陈述
四足机器人在执行跳跃动作时面临重大挑战,尤其是那些超过其腿长或在非平坦环境中发生的跳跃。虽然存在基于优化的方法,但它们通常计算成本高昂、对初始化敏感,并且依赖于在非结构化环境中难以维持的精确系统模型。相反,标准的端到端(E2E)强化学习(RL)方法虽然前景广阔,但由于奖励信号稀疏且缺乏可解释性,通常需要数百万次训练步骤,使得安全认证变得困难。所解决的核心问题是:需要一种控制策略,该策略具备样本效率、对模型不确定性具有鲁棒性、能够实现全向三维跳跃(包括高度变化和旋转),并且具有足够的可解释性以确保物理可行性。
方法论
作者提出了一种**引导式强化学习(GRL)**框架,将物理直觉注入学习过程,从而摆脱原始的端到端控制。该方法论围绕三个主要组件构建:
1. 轨迹参数化
策略并非直接学习关节力矩或位置,而是学习笛卡尔空间中的高层轨迹。
- 混合参数化:推力阶段的轨迹采用**贝塞尔曲线(Bézier curves)与匀加速直线运动(UARM)**模型相结合的方式进行建模。
- 初始阶段使用三次贝塞尔曲线来模拟“蓄力”和减压运动,确保平滑性和可微性。
- 为了克服贝塞尔曲线在爆发式离地阶段的表现力限制(这可能导致工作空间违规,例如机器人腹部触地),轨迹会过渡到 UARM 段。这允许在保持可行性的同时获得更高的离地速度。
- 姿态控制:单独的贝塞尔曲线对躯干姿态(欧拉角)进行参数化,从而实现动态机动,如原地扭转跳跃。
- 动作空间:RL 智能体输出一组简化的 13 个参数(例如时间间隔、离地位置和速度的球坐标、速度乘数以及姿态目标),而非原始关节指令。这极大地减少了搜索空间。
2. 学习框架
- 算法:系统使用近端策略优化(PPO)。
- 状态空间:状态定义在任务空间(位置和姿态相对于目标的位移),使策略对特定机器人形态无关。排除关节级信息以防止对特定硬件过拟合。
- 奖励函数:设计了一个包含物理信息的奖励函数,以平衡任务成功与安全性。它包括:
- 正向奖励:着陆目标奖励,随跳跃距离缩放,并对着陆误差进行惩罚。
- 惩罚:违反路径约束(关节限制、摩擦锥、力矩限制)、跟踪误差以及不安全着陆条件(弹跳、高角速度)的成本。
- 安全过滤器:事后安全检查使用弹道方程验证提议的动作在物理上是否能在执行前到达目标高度,增加了一层可解释性。
3. 控制执行
学习到的笛卡尔轨迹通过**逆运动学(IK)**映射到关节位置。带有重力补偿的低层比例 - 微分(PD)控制器跟踪这些参考值。这种分离使得高层 RL 策略可以专注于轨迹生成,同时依靠经典控制来应对摩擦和惯性不确定性带来的鲁棒性。
主要贡献
- 新颖的 GRL 策略:一种用于全向三维跳跃的样本高效 RL 方法,利用物理直觉(贝塞尔曲线 + UARM)引导学习过程,避免了端到端方法的“黑盒”性质。
- 与机器人无关的动作空间:一种在任务空间(笛卡尔位置/姿态)中定义动作的公式,使策略能够泛化到不同的四足形态(通过零样本转移证明)。
- 可预测性与安全性:轨迹的参数化性质允许对落点进行确定性预测并实施安全过滤器,解决了 RL 中的安全认证差距。
- 单阶段学习:与需要多阶段训练的基于课程的方法不同,该方法在单个学习阶段内实现最终目标,显著减少了训练时间和复杂性。
结果
该方法通过在Unitree Go1和Aliengo两款四足机器人上进行的广泛仿真和真实世界实验进行了验证。
- 样本效率:策略在约2,000 个训练步骤(15 小时)内收敛,与通常需要数百万步骤的端到端方法相比,这是一个显著的减少。
- 精度与可行性:
- 平地跳跃:在 0.5 米半径内的跳跃,着陆误差低于 5 厘米。
- 垂直跳跃:成功执行了高达 0.26 米的向上跳跃和高达 0.4 米的向下跳跃。
- 旋转:展示了执行原地偏航旋转的能力,最大姿态误差约为 6 度。
- 鲁棒性:
- 仿真到仿真:当转移到不同的仿真器(Locosim)以及在质量(高达 50%)和关节阻尼变化下,策略保持了性能,无需在训练期间进行域随机化。
- 仿真到现实:在 Go1 和 Aliengo 上的真实世界实验显示出高重复性。虽然较重的 Aliengo 上的绝对误差略高(归因于未建模的摩擦),但标准差保持较低,表明行为一致。
- 零样本转移:在 Go1 上训练的策略成功应用于 Aliengo 机器人(具有不同的质量和连杆长度),仅需低层控制调整,验证了任务空间公式的有效性。
- 与最先进方法的比较:与 Atanassov 等人 [39] 的最先进端到端方法相比,所提出的方法以显著更少的样本实现了相当或更高的精度、更高的跳跃高度(0.26 米对比 0.1 米)以及更均匀的可行区域。
意义与主张
本文主张,通过将物理直觉(由贝塞尔曲线和弹道物理引导)集成到 RL 框架中,可以克服传统优化(计算成本、模型依赖性)和标准端到端 RL(样本效率低、缺乏可解释性)的主要局限性。
作者强调,他们的方法:
- 实现实时应用:轻量级神经网络和可预计算的轨迹允许毫秒级规划。
- 确保物理可行性:该方法通过奖励设计和动作空间约束,本质上尊重关节限制和摩擦约束,降低了不安全行为的风险。
- 促进泛化:通过将策略与特定关节配置解耦,该方法支持在不同机器人平台之间的转移,而无需从头开始重新训练。
- 简化训练:单阶段学习过程消除了对复杂课程调度和大量奖励工程的需求。
作者总结道,虽然当前方法纯粹是运动学的,并假设初始速度为零,但它代表了使腿式机器人在复杂环境中的动态跳跃变得稳健、安全和高效的重要一步。未来的工作被确定为将该方法扩展到力矩控制动力学、处理非零初始速度以及纳入可变形地形。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。