想象一下,教一个机器人在一个混乱、不可预测的世界中行走——比如一个有楼梯、地面不平且门口狭窄的建筑工地。通常,你有两个选择:要么教机器人通过摄像头“感知”周围环境(但这可能显得笨拙),要么给它一份完美、预先写好的脚本,精确规定每一步腿部的动作(但一旦地面发生变化,这份脚本就会失效)。
本文提出了一种巧妙的折中方案:一种机器人,它通过遵循一份“智能脚本”来学习行走,这份脚本会根据地面情况实时自我调整。
以下是他们如何实现这一点的简要分解,分为几个简单概念:
1. 问题所在:“盲目”的脚本 vs. “笨拙”的摄像头
- 旧方法(参考引导式): 想象一下给舞者一份脚本,上面写着“向前迈步 1 米”。如果地板是平的,他们就会迈 1 米。但如果地上有个坑或有个台阶,他们可能会绊倒,因为脚本并不知道地板已经变了。
- 另一种旧方法(感知强化学习): 想象一下,通过向机器人展示成千上万个行走视频,让它自己摸索物理规律来教它行走。这种方法效果不错,但很难将其与一个告诉机器人“去哪里”的“GPS”系统连接起来。机器人可能非常擅长行走,但在遵循地图方面却一塌糊涂。
2. 解决方案:“变形”的脚本
作者创建了一个系统,让机器人通过遵循参考轨迹(即脚本)来学习行走,但在机器人尝试跟随之前,脚本就已经根据地形进行了“塑形”。
可以这样理解:
- 机器人拥有一个“大脑”(AI 策略),它想要遵循一条特定的路径。
- 在机器人移动之前,一个快速的数学模型(称为线性倒立摆)充当路径的 3D 打印机。
- 如果机器人看到楼梯,“打印机”会立即将“向前迈步 1 米”的指令重塑为“向前迈步 1 米,但将脚抬得更高,并调整角度以匹配台阶”。
- 随后,机器人学习遵循这份经过调整的脚本。因为这份脚本已经完美适配了地形,机器人能更快、更稳定地学会行走。
3. "SE(2)"接口:万能遥控器
机器人领域的一个最大障碍是让“大脑”(行走器)与“导航器”(GPS/规划器)进行对话。
- 通常,这两者说着不同的语言。导航器说“去厨房”,但行走器需要知道如何精确移动每一个关节。
- 本文赋予机器人一个万能遥控器。导航器只需发送简单的指令,例如“以每秒 1 米的速度向前走”或“向左转”。
- 机器人的内部系统接收这个简单指令,观察地面,重塑“脚本”(参考轨迹),并自动执行复杂的腿部动作。这使得将这种行走机器人接入标准导航软件变得轻而易举。
4. 结果:知行合一
团队在宇树 G1人形机器人(一种看起来像人类的双足机器人)上测试了该系统。
- 在模拟器中: 他们证明,当机器人使用“塑形”后的脚本时,其路径跟踪效果远优于尝试遵循僵化、不变的脚本。
- 在现实世界中: 他们将机器人置于真实的建筑物内和户外。
- 机器人自主行走了超过 70 米(大约相当于一个足球场的长度)。
- 它爬上了两层楼梯,并穿越了崎岖不平的地面。
- 所有这一切都是在机器人机载的“思考”和“感知”下完成的,无需连接外部计算机。
总结类比
想象一下你正在学习开车。
- 方法 A(旧方法): 你得到一个 GPS,它告诉你针对某条特定道路的精确转向角度和油门压力。如果你绕了路,指令就会出错,导致你撞车。
- 方法 B(旧方法): 你被扔进一辆没有任何说明的车里,被告知“自己想办法”。你或许能学会,但这需要耗费漫长时间,而且你无法轻易地告诉这辆车“开车去商店”。
- 本文的方法: 你有一个 GPS,它告诉你“开车去商店”。当你驾驶时,一位智能助手会根据你此刻看到的坑洼和弯道,即时重写“转向和油门”的指令。你遵循这些即时、完美的指令,从而能够安全、高效地驾驶到任何地方。
本文证明,通过让“指令”实时适应地形,你可以教会人形机器人在复杂的人类环境(如楼梯和崎岖地面)中行走,并将其整合到完整的导航系统中。
技术摘要:面向人形机器人导航的地形一致参考引导强化学习
问题陈述
当代人形机器人运动方法已实现了高敏捷性和鲁棒性,通常利用人类数据或轨迹优化来引导强化学习(RL)。然而,在将这些行为部署到更复杂的非结构化环境中的大型导航栈时,仍存在显著瓶颈。现有的参考引导 RL 方法面临两个主要局限:
- 缺乏规划接口:许多方法需要全自由度参考轨迹或实时动作捕捉作为输入,导致其无法与发出简单速度指令(例如 SE(2) 速度)的标准导航规划器兼容。
- 缺乏环境条件化:标准的参考生成流程未考虑地形几何(例如有效的落脚点、楼梯、斜坡)。因此,基于静态参考训练的策略难以在粗糙地形上跟踪轨迹,导致在部署到现实世界的人本环境中时出现不稳定或失败。
虽然一些工作解决了无参考的感知运动问题,但它们往往缺乏参考引导方法的鲁棒性。相反,参考引导方法通常难以与自主性栈集成或适应地形。本文旨在解决感知性参考引导 RL 与闭环导航自主性之间的交集。
方法论
所提出的方法地形一致参考引导 RL,在 RL 训练循环内部直接合成与环境一致参考轨迹。该系统旨在输出一个策略,该策略接受标准的 SE(2) 速度指令,同时利用深度相机数据进行地形适应。
1. 环境一致参考合成
核心创新在于利用**线性倒立摆(LIP)**模型快速生成参考轨迹,该模型经过调制以匹配地形几何。
- 基础生成:利用 LIP 模型动力学,将期望的 SE(2) 速度指令(vd)转换为期望的步长和质心(CoM)轨迹。这生成了 CoM、摆动脚和手臂的标称参考。
- 地形投影:在 RL 智能体接收参考之前,系统将期望的落脚点投影到由地形几何(表示为多边形网格)导出的最近有效落脚点上。
- 轨迹修改:
- 落脚点:将期望的步态投影到有效落脚点,并纳入该点的地形横滚角和俯仰角。
- 摆动脚:修改摆动脚轨迹,使其连接初始姿态与投影姿态,包括地形朝向。z 轴高度通过沿摆动路径添加地形点上方凸包的高度进行调整,以确保净空。
- 质心:根据连接当前支撑脚与投影落脚点位置的连线,调整质心高度轨迹。
- 效率:此合成过程在训练循环内快速运行,使策略能够从与即时环境物理一致的参考中学习。
2. 运动策略与训练
- 架构:策略采用单阶段、基于多层感知机(MLP)的架构。它将本体感觉和单张深度相机图像(26x30 分辨率)直接映射到动作。
- 感知:安装在机器人躯干上的 ZED Mini 深度相机提供输入。在仿真中,通过射线投射并配合激进的降采样来模拟现实世界的噪声和伪影。
- 奖励设计:训练利用控制李雅普诺夫函数(CLF-RL)。为跟踪目标(骨盆、摆动脚、关节)定义二次李雅普诺夫函数。奖励函数包含两项:
- 一项鼓励紧密跟踪参考信号。
- 一项激励满足李雅普诺夫递减条件(确保系统向参考移动)。
这种方法使奖励信号稠密化,即使在跟踪不完美但正在改善时也能提供反馈。
- 非对称演员 - 评论家:演员接收含噪的本体感觉和深度数据,而评论家接收无噪观测和特权信息(真实参考、接触状态等)。
3. 导航自主性栈
训练好的运动策略通过干净的SE(2) 速度接口集成到完整的自主性栈中。
- 规划器:模型预测控制(MPC)规划器在带有航向模型的单积分器上运行。它接收目标位姿和环境地图(通过 LiDAR 和 FAST-LIO2 生成),以规划无碰撞路径。
- 控制障碍函数(CBF):MPC 结合离散时间 CBF 约束,以确保避障并增强对跟踪误差的鲁棒性。
- 执行:MPC 输出速度指令轨迹,这些指令由反馈控制器跟踪,并传递给 RL 运动策略。
主要贡献
- 环境条件化参考合成:本文介绍了首个用于人形机器人的参考引导 RL 流程,其中参考在训练循环内利用降阶 LIP 模型进行在线调制,以与地形几何(楼梯、斜坡、离散落脚点)保持一致。
- 简化架构:生成的策略仅依赖 MLP,无需历史缓冲区,消除了对复杂蒸馏或循环网络的需求,同时实现了与基于注意力模型相当的性能。
- 闭环自主性集成:该方法成功将感知性参考引导 RL 策略集成到标准导航栈中。它展示了 Unitree G1 在包含粗糙地形和连续楼梯的户外环境中进行长程(>70 米)自主导航的能力,所有传感和计算均在机载完成。
结果
仿真
- 跟踪性能:与使用未修改(环境无关)的参考相比,对环境进行条件化的参考显著提高了跟踪性能。在楼梯地形上,跟踪误差减少了一半。
- 模型复杂度:简单的基于 MLP 的策略(“我们的方法”)在平坦、斜坡和楼梯地形上,实现了与更复杂的交叉注意力架构(“我们的方法(注意力)”)统计上相似的跟踪误差。然而,MLP 版本所需的 VRAM 显著更少(14GB 对比 60GB),且更易于实现。
硬件部署
- 平台:配备 ZED Mini 深度相机和 Livox MID360 LiDAR 的 Unitree G1 人形机器人。
- 性能:该系统成功在户外人本环境中执行了闭环自主导航。
- 楼梯:机器人自主导航了 15 级连续楼梯。
- 长程:机器人导航超过 70 米,穿越树根、粗糙地形、路缘石和两组楼梯。
- 室内外过渡:机器人爬上户外楼梯,进入建筑物,并爬上室内楼梯。
- 对比:与依赖盲式基于模型控制器进行导航或未集成到自主性栈中的感知 RL 方法的先前工作不同,本工作展示了一个感知条件化、参考引导的策略,作为完整自主性栈的运动层。
意义与主张
本文主张,这项工作弥合了高性能参考引导运动与实用导航自主性之间的差距。通过在训练期间合成与地形一致的参考,该方法使 RL 策略能够学习针对非结构化环境的鲁棒行为,而无需复杂的基于历史的架构。
其意义在于SE(2) 速度接口,它使运动策略能够作为即插即用组件集成到标准导航规划器中。这使得敏捷的、感知性的人形机器人运动能够部署到现实世界场景(楼梯、粗糙地形)中,而这些场景此前由于缺乏环境条件化和规划兼容性,对参考引导方法而言是不可及的。作者将此定位为迈向人本环境中通用人形机器人导航的一步,超越了平坦地面或实验室构建的定制地形。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。