想象一下,你正在教一只四足机器人狗如何在崎岖不平的森林中奔跑。长期以来,工程师们试图通过给机器人一套庞大且复杂的规则来教它: “左脚抬高正好5英寸”、“双腿在空中的时间保持0.3秒”、“不要撞击地面太重”以及“像马一样奔跑”。这就像是在教人类跳舞时,强迫他们去数每一个脚步,并保持手臂处于特定的形状。这种方法虽然可行,但非常僵化、耗能,而且一旦地面发生变化,机器人就会陷入混乱。
名为 “LoComposition” 的论文提出了一种更聪明、更自然的方法来教导机器人。他们不再微观管理机器人“如何”移动,而是教导机器人“要做什么”,并让机器人自己去寻找实现目标的最佳方式。
以下是他们实现这一目标的方法,通过简单的概念进行了拆解:
1. 旧方法:“严厉的编舞师”
以往的方法使用单一且复杂的“评分卡”(奖励函数)来试图控制一切。它会精确地告诉机器人如何移动它的腿(步态先验)、如何保持安全以及如何遵循指令。
- 问题所在: 这就像一位严厉的编舞师,不允许舞者进行即兴发挥。如果地形改变了,机器人仍会试图遵循那些僵化的步骤,从而浪费能量,甚至因为试图将“方榫头放入圆卯眼”而折断自己的关节。
2. 新方法:“聪明的教练” (LoComposition)
作者将教学过程分成了四个不同的角色,就像一支各司其职的运动队:
- 目标设定者 (任务规范): 这个部分只是简单地说:“朝那个方向走,保持那个速度。”它不在乎你如何到达那里,只要求你必须到达。
- 安全卫士 (操作限制): 这就像夜店里的保安。它不会告诉机器人如何跳舞,它只是说:“如果你扭伤膝盖太厉害或者旋转得太快,你就出局了。”它设定了硬性边界,以防止机器人损坏自身。
- 预算管理者 (能量最小化): 这是核心秘诀。教练不是说“像马一样小跑”,而是说“尽量少用电池”。机器人很聪明;它很快就会意识到,某种特定的奔跑方式(如“小跑”)比跳跃式奔跑更省电。因此,它会在没有被明确告知的情况下,自然而然地选择高效的小跑。
- 眼睛 (感知): 这是机器人的激光雷达(激光之眼),用于扫描前方的地面。它会告诉机器人:“嘿,前面有个石头。”这使得机器人可以只在需要跨越石头时才多花一点能量,而在平坦路径上则节省能量。
3. 结果:自然的、高效的奔跑者
当他们在真实的机器人(Unitree Go2)上测试这种新方法时,结果令人印象深刻:
- 无需“体操”训练: 他们移除了所有关于抬腿高度或在空中停留时间多久的规则。机器人自己找到了最适合的移动方式。
- 巨大的能量节省: 与旧的、规则繁琐的方法相比,机器人的移动能耗降低了 56%。这就像是从耗油量巨大的卡车换成了混合动力汽车。
- 更少的损坏: 机器人突破“安全限制”(例如关节扭转过度)的次数减少了 96%。“安全卫士”让它远离了危险。
- 零样本迁移 (Zero-Shot Transfer): 这是“魔术时刻”。他们在计算机模拟中训练机器人,当把它放在带有真实岩石的真实机器人身上时,它能立即投入使用。他们不需要重新训练或调整设置,它直接就能上手。
大局观类比
把旧方法想象成通过给孩子一份剧本来教他们走路:“迈左脚,抬脚2英寸,等待1秒,迈右脚。”如果他们被小石子绊倒,他们就会僵住,因为剧本里没写该怎么办。
LoComposition 方法则像是通过这样教孩子走路:“走到那棵树那里,别伤到你的膝盖,尽量别让自己太累,并且看着你要走的路。”孩子会自然而然地找到最高效的走路方式,在看到小石子时跳过去,并在保护膝盖的同时保持行走,而这一切都不需要剧本。
简而言之: 这篇论文证明了你不需要将特定的行走风格(步态)硬编码进机器人中。只要给它一个明确的目标、安全限制、节省能量的理由以及观察地面的眼睛,它就会自然地学会在崎岖地形上高效且安全地行走。
技术摘要:LoComposition
问题陈述
基于学习的四足机器人运动控制在从仿真到现实(sim-to-real)的迁移以及复杂地形遍历方面取得了显著成功。然而,标准方法通常依赖于单一且复杂的奖励函数,该函数将概念上截然不同的目标纠缠在一起:任务规范(速度跟踪)、运行限制(执行器安全性)、步态偏好(例如特定的接触时机或腾空时间)以及地形适应。
作者认为,将这些不同的功能编码进单一的加权奖励公式会导致次优的学习结果。具体而言,显式的步态风格先验(如期望的腾空时间、接触计数或足端高度目标)充当了工程上的捷径,它们会使学习到的运动向特定模式偏移,从而可能阻碍更高效步态的出现,并使奖励工程过程变得复杂。
方法论:LoComposition
本文提出了 LoComposition,这是一种将运动分解为四个不同机制的学习公式,每个机制由特定的方法论组件处理,而非采用单体化的奖励。作者将其核心组件称为 LEP(限制、能量、感知)。
任务规范(速度跟踪):
任务被严格定义为跟踪操作者指定的平面及偏航速度 (vcmd)。这通过标准的奖励函数 (rtrack) 来处理,利用高斯核鼓励与速度目标对齐。
运行限制(约束):
作者并未在奖励中惩罚违反硬件限制(扭矩、关节速度、加速度等)的行为,而是使用了 约束即终止(Constraints-as-Terminations, CaT)。
- 标量限制的违反(qi≤qmax)被映射为一个随机终止概率 (δt)。
- 如果违反了限制,则以与违反程度成正比的概率终止当前回合(rollout)。
- 这会缩放每步奖励并降低持续因子,从而有效地惩罚不安全行为,而无需为每个限制进行密集的奖励塑造。
- 至关重要的是,约束仅保留给物理/运行限制,而不用于步态风格。
步态偏好(能量最小化):
该公式并非通过奖励项来规定特定的步态(如小跑或跳跃),而是最小化机械能耗。
- 在奖励中添加一个惩罚项 (ℓPower),其与所有关节的绝对机械功率之和 (∑∣τjq˙j∣) 成正比。
- 该项作为一种在可行运动之间的偏好信号,鼓励产生低运输成本(COT)的步态,而无需显式定义足端落点模式。
地形适应(外感知):
为了实现复杂地形下的预测性能量最小化,策略接收外感知观测值。
- 输入包括一个基于机身中心、分辨率为 8 cm 的 13×11 地形高度图,该图源自 LiDAR。
- 这使得策略能够仅在地形需要时才选择性地消耗能量(例如增加足端高度),从而解决能量效率与障碍物穿越之间的矛盾。
训练设置: 策略使用 PPO 算法在 Isaac Lab 环境下的 Unitree Go2 机器人上进行训练。训练课程包括程序化生成的崎岖地形、楼梯和斜坡。
核心贡献
- 运动分解: 本文提出了一种将任务跟踪、运行限制、能量最小化和感知分离到不同机制中的公式,消除了对复杂奖励函数的需求。
- 无先验的涌现步态: 作者证明了显式的步态先验(腾空时间、接触计数、足端高度)是不必要的。当学习问题按提议的方式分解时,高效且具有地形适应性的运动会自然涌现。
- 零样本 Sim-to-Real 迁移: 所得策略能够基于 LiDAR 高度图实现向物理 Unitree Go2 的零样本迁移,无需重新训练或使用特权地形信息。
实验结果与消融实验
作者通过消融研究验证了其方法,将他们的公式(LEP)与使用复杂奖励函数的基准(RP)以及各种组件移除后的情况进行了对比。
- 效率: 与复杂奖励基准(RP)相比,LoComposition (LEP) 将运输成本 (COT) 降低了 56%,并将运行限制违反率降低了 96%。
- 步态先验消融 (H1): 通过移除步态先验约束(对比 LEP vs. LCEP/LCP)表明,将先验编码为约束会损害地形遍历能力,并阻碍最有效步态(小跑)的涌现。
- 能量最小化的作用 (H2): 移除能量最小化(LP)会导致策略虽然能穿越地形,但会陷入高能耗的“跳跃”步态。加入能量最小化后,行为会转向低 COT 的小跑模式,而无需显式规定。
- 感知的角色 (H3): 移除感知(LE)会导致策略无法根据地形难度调整能量使用,导致地形穿越水平较差。感知功能允许机器人在平坦地面保持低高度,并在遇到障碍物时选择性地增加高度。
- 约束的必要性 (H4): 移除运行限制约束(EP)会导致策略利用模拟器的误差,从而导致严重的硬件限制违反(违反率为 53.4%,而 LEP 为 0.5%),使策略无法部署。
- 真实世界表现: 在零样本硬件测试中,LEP 成功穿越了复杂的障碍物序列(坡道、平台),而未进行能量最小化的变体(LP)则会失败或违反限制。在硬件上的能量效率方面,LEP 相比基准提升了 56%。
意义与主张
本文声称,对于复杂地形下的四足机器人运动,显式的步态风格先验是不必要的。通过将运行限制(通过约束处理)与步态偏好(通过能量最小化处理)分离,系统允许高效、自然的步态得以涌现。
作者将其定位为一种原则性的转变:运动学习应当围绕机器人必须协调的需求与偏好(安全性、任务、效率、感知)进行组织,而不是围绕它应该遵循的特定步态模式。这种方法产生了鲁棒、节能且可部署的策略,在仿真和现实部署中均优于复杂的奖励基准。
局限性: 作者指出,其结果是针对 Unitree Go2 及其测试的地形分布的。他们并未声称这是唯一的分解方式,也未讨论离策(off-policy)方法带来的样本效率提升,或在所使用的随机终止方法之外提供形式化的运行时安全保证。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。