✨ 要点🔬 技术摘要
想象一个机器人不再只是靠轮子在地上挪动,而是能像狗或人类一样,在崎岖不平的地面上跳跃、跨步和蹦跳的世界。这就是足式机器人学(legged robotics)令人兴奋的前沿领域。长期以来,让这些机器人移动就像教蹒跚学步的幼儿走路:你必须给它们非常严格的规则,比如“左脚抬高到这个高度,然后右脚抬高到那个高度”。这种方法虽然有效,但会让机器人显得僵硬,且在遇到意外情况时会手忙脚乱。后来,科学家们发现了 强化学习(Reinforcement Learning, RL) ,这是一种让机器人通过试错来学习的方法,有点像视频游戏中的角色通过成千上万次的坠落来学习如何跳过裂缝,并在此过程中不断进步。然而,许多这类“学习型”机器人要么是“盲目”的(它们看不见前方的地面),要么仍然受困于那些陈旧、僵化的规则,导致在面对新地形时显得笨拙。研究人员试图解决的核心问题是:我们如何教会机器人既具备观察地面的智慧,又具备在不被明确告知每个关节如何运动的情况下,灵活调整步伐的能力?
PGTT (相位引导的地形穿越,Phase-Guided Terrain Traversal)应运而生,这是一种试图寻找完美平衡点的全新方法。把旧有的“盲目”机器人想象成闭着眼睛走路、只能祈祷不要绊倒的人;而旧有的“规则驱动型”机器人则像是必须遵循编舞家精确剧本的舞者;如果地板发生了变化,它们就无法即兴发挥。PGTT 则像是教会机器人一种节奏 ,同时允许它即兴创作舞步 。
研究人员给了机器人一双“聪明的眼睛”(激光扫描仪),它可以构建前方地面快速的 3D 地图。他们并没有强迫机器人去踩准特定的足部目标点,而是教会了它一种简单的节奏:“你的腿应该像波浪一样摆动。”但神奇之处在于:他们并没有强迫机器人的关节遵循一条严格的路径。相反,他们给了机器人一张计分卡 (奖励系统)。如果机器人的腿摆动得太低并撞到了石头,它会得到低分;如果它摆动得足够高以越过石头,它就会得到高分。机器人通过学习,弄清楚了如何通过移动自己的“肌肉”来获得高分,从而根据它所看到的情况自动调整步高。
论文显示,这种方法在计算机模拟中表现得极其出色。在测试于复杂的阶梯状地形和散落的障碍物时,PGTT 机器人在保持站立稳固方面比其他顶尖方法更成功。事实上,它在应对推力干扰(比如被人推搡)时成功率提升了 7.5% ,并且比排名第二的机器人多越过了 9% 的障碍物。它不仅生存了下来,而且保持了与其他机器人相同的移动速度。
团队还将此方法应用在了真实的机器人 Unitree Go2 (一种看起来像狗的四足机器人)上。他们使用了在计算机中训练出的同一套“大脑”,没有更改任何设置,机器人便成功爬上了真实的楼梯并跳过了真实的障碍物。他们甚至在另一款机器人 ANYmal-C 上也进行了测试,结果同样奏效,这表明这种“有节奏无规则”的思想可能适用于各种类型的足式机器。
然而,论文也谨慎地指出,这目前还不是解决所有问题的“万灵药”。现实世界的测试是在 0.4 米/秒 的适中步行速度下进行的,因为机器人的激光扫描仪在更高速度下无法快速更新地图。此外,虽然该机器人在防止跌倒方面表现出色,但研究人员尚未测量其能源使用效率。但总体而言,PGTT 表明,通过给机器人一个简单的节奏去遵循,同时让它们自己去处理细节,我们可以制造出鲁棒、适应性强且准备好应对混乱、不可预测的真实世界的机器。
技术摘要:相位引导地形遍历 (PGTT)
问题陈述 最先进的感知强化学习 (RL) 足式机器人控制器在设计上面临一种两难境地。现有方法通常要么 (i) 施加基于振荡器或逆运动学 (IK) 的步态先验,这限制了动作空间、偏置了策略优化,并限制了跨不同机器人形态的适应性;或者 (ii) 以“盲目”方式运行(仅依赖本体感受),导致其无法预见后腿地形,且对观测噪声极其脆弱。虽然视觉或距离传感已被集成到控制回路中,但在有限的视野、传感器噪声以及对时间记忆或脆弱全局位姿估计的需求方面仍存在挑战。核心挑战在于实现鲁棒、地形自适应的运动,既能预见障碍物,又不会引入过度的归纳偏置或将策略与特定的机器人运动学耦合。
方法论 作者提出了 相位引导地形遍历 (PGTT) ,这是一种感知觉察型的深度强化学习方法,通过奖励塑造而非动作空间约束来强制执行步态结构。
感知: PGTT 利用从 LiDAR 高程制图中在线获取的紧凑型、以机器人为中心的高度图。这种局部表示捕捉了与所有腿部相关的地形几何形状,而无需全局一致性或位姿估计,并直接输入策略网络。
步态编码: PGTT 并非使用振荡器或 IK 来规定关节目标,而是将每条腿的相位变量 ϕ i , t \phi_{i,t} ϕ i , t 编码为三次埃尔米特样条曲线 (Cubic Hermite Spline)。该样条曲线定义了一个平滑且具有地形自适应性的摆动轨迹,其中摆动顶点根据局部高度图统计特性(具体为腿部周围的最大和最小地形高度)进行调整。
奖励塑造: 相位先验仅通过奖励函数进行强制执行,而非通过动作空间。策略直接在关节空间内行动(输出相对于静止姿态的期望关节角),从而保留了不受限的动作空间。奖励包括:
一个相位引导项 ,鼓励足端遵循埃尔米特样条曲线轨迹。
一个摆动阶段接触惩罚 ,以防止在摆动阶段发生过早的地面接触。
标准任务奖励(速度跟踪、朝向、关节限制)。
学习架构: 系统采用非对称 Actor-Critic 架构,在 MuJoCo(具体为 GPU 加速的 MJX 分支)中通过近端策略优化 (PPO) 进行训练。Actor 仅基于部分观测(本体感受 + 高度图)进行调节,而 Critic 则利用特权状态信息(包括真实的线性速度)进行价值估计。
训练策略: 训练在通过波函数坍缩 (WFC) 算法生成的程序化生成阶梯状环境中进行。课程学习方法逐步增加了地形难度(阶梯高度和复杂度)。应用了广泛的领域随机化(传感器噪声、机器人物理参数和摩擦力)以弥合 Sim-to-Real 差距。
核心贡献
地形自适应、相位引导奖励: 一种新型奖励公式,通过驱动局部高度图统计特性的埃尔米特样条曲线来编码摆动轨迹,并惩罚摆动阶段的接触。与基于振荡器/IK 调节的方法相比,该方法减少了归纳偏置,并促进了形态无关的部署。
紧凑的感知-策略设计: 一个直接将以机器人为中心的高度图输入策略的系统,在不依赖全局位姿假设的情况下,捕捉了步进所需的必要地形几何形状。
广泛的评估与迁移: 在阶梯状和离散障碍物地形上的综合仿真结果表明,其成功率高于基准模型。该工作包括在 Unitree Go2 上的 Sim2Real 迁移,以及在采用相同超参数的 ANYmal C 上的初步跨平台结果。
易于获取的训练栈: 使用 MuJoCo/MJX 的轻量级训练流水线,在单个消费级 GPU 上即可实现高吞吐量,为更重的 Isaac Gym 流程提供了替代方案。
结果
仿真性能: 在受到推力扰动时,PGTT 的成功率高于评估的基准模型(MassLoco 和 Wild,中位数高出次优模型 +7.5%),在离散障碍物上表现更佳(+9%)。速度跟踪性能与最强的基准模型相当。
收敛性: 与端到端、无先验的 RL 基准模型相比,PGTT 展示了更快的学习收敛速度,并且比 MassLoco 具有显著更高的样本效率。
现实世界部署: 该策略已成功部署在 Unitree Go2 上,并配合实时 LiDAR 高程转高度图流水线,展示了鲁棒的阶梯和障碍物遍历能力。在 ANYmal C 上的初步结果显示,在无需任何超参数重调的情况下实现了成功的行走行为。
消融实验: 去除足端相位奖励后,在阶梯上的成功率从 83.4% 下降到 75.5%,证实了其作为性能主要驱动力的地位。足端接触惩罚提供了较小但必要的边缘情况稳定性优化。
意义与主张 论文声称,PGTT 提供了早期证据,证明地形自适应、相位引导的奖励塑造可以跨不同的机器人平台进行迁移,而无需平台特定的策略先验或广泛的重调。通过在保持节奏结构优势的同时通过奖励塑造保持动作空间不受限,该方法减少了归纳偏置并支持形态无关的部署。作者将 PGTT 定位为推进敏捷、鲁棒足式运动的易于获取的基础,通过支持在廉价硬件(单个消费级 GPU)上进行训练,降低了研究人员的准入门槛,同时保持了高性能。
局限性 作者承认,目前的实现依赖于低规格的 L1 LiDAR(21,600 点/秒),这限制了实验最高只能达到 0.4 m/s 的速度,因为在更高速度下测量会变得稀疏。此外,尚未评估 PGTT 在现实世界部署中的能量效率。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。