想象一下,你正在尝试教一只四足机器狗如何奔跑、跳过障碍物,并在光滑的地板上行走而不摔倒。这是一项极其艰巨的任务,因为机器人必须在腿部进行复杂运动的同时完美地保持自身平衡。
本文介绍了一种名为IFM(模仿与微调模型预测控制)的新教学方法。可以将 IFM 想象为一个三步学徒计划,它结合了两个世界的优点:一位严谨、注重数学的导师,以及一位富有创造力、通过试错学习的学生。
以下是该过程的运作方式,使用简单的类比说明:
第一步:“严谨的数学导师”(专家)
首先,研究人员利用高级数学(模型预测控制,即 MPC)创建一个“完美”的控制器。
- 类比:想象一位才华横溢但僵化的国际象棋特级大师,他能完美地计算出每一步棋。这位大师完全基于物理方程,知道机器人应该如何移动。
- 问题:这位大师非常缓慢。为了计算下一步,计算机必须执行繁重的数学运算,这对于真实机器人在实时反应中来说耗时过长。此外,如果机器人踩到意想不到的东西(比如香蕉皮或移动的传送带),这位大师的严格规则可能会失效,因为它们并未针对这种特定的怪异情况编程。
第二步:“影子学生”(模仿学习)
接下来,他们训练一个神经网络(一种人工智能大脑)来模仿这位大师。
- 类比:他们让一名学生与大师同处一室。学生观察大师的走法,并尝试完全模仿。这被称为“模仿学习”。
- 结果:学生学会了大师那种完美、对称且高效的行走风格。但与大师不同,学生是一个简单的 AI,能够瞬间做出决策(速度极快)。然而,学生仍然只是一个复制品;如果情况发生剧烈变化,学生可能仍会陷入困境。
第三步:“冒险训练营”(强化学习)
最后,他们派这名学生进入一个拥有困难地形的“训练营”(如崎岖的岩石、滑溜的冰面、移动的传送带),进行自主练习。
- 类比:学生并非从零开始,而是已经掌握了良好的行走技巧。现在,他们面临一个挑战:“在不摔倒的情况下走过这条移动的跑步机。”学生尝试各种方法。如果滑倒,他们就吸取教训;如果成功,就会得到“做得好”的奖励。
- 魔力所在:因为学生拥有良好的基础(来自第二步),他们不需要数千小时的试错就能掌握基础知识。他们只需要“微调”技能,以应对混乱的现实世界。
为什么这比旧方法更好?
- 速度 vs. 智慧:最初的“数学导师”虽然聪明但缓慢。新的“学生”几乎同样聪明,但思考速度快了 15 倍。这意味着机器人可以瞬间对颠簸和打滑做出反应。
- 更优的行走姿态:如果仅仅让机器人从零开始学习(称为“基础强化学习”),它往往会学会一种怪异、抽搐或不对称的行走方式(像醉汉踉跄)。虽然可能有效,但效率低下且难以迁移到真实硬件上。IFM 方法迫使机器人保持从数学导师那里学到的“优雅”行走风格,从而保持对称性和能量效率。
- 更少的“奖励塑造”:通常,训练机器人需要人类程序员编写数十条具体的规则(奖励),以告诉机器人“不要抬腿太高”或“保持背部挺直”。这既繁琐又难以做到完美。由于 IFM 从一位优秀的导师开始,机器人已经掌握了良好姿态的基础知识。研究人员只需要几条简单的规则来引导机器人穿越困难地形。
结果
团队在名为Mini Cheetah的真实机器人上测试了该方法。
- 障碍物:机器人能够成功跳过 7.5 厘米高的台阶(约一本厚书的高度),而其他方法未能做到这一点。
- 光滑地板:它能够在摩擦系数极低的表面(如香蕉皮)上行走而不摔倒,而旧的基于数学的控制器则会打滑并撞毁。
- 移动地面:它能够在移动的传送带上行走,完美地调整步伐以保持平衡。
总之:本文提出了一种方法,首先利用数学教会机器人“完美”的行走方式,然后训练人工智能模仿这种完美风格,最后让该人工智能在崎岖地形上练习,使其成为一只稳健、快速且优雅的奔跑者。这就像先让一位大师舞者教会学生其舞蹈套路,然后派这名学生去蹦床上跳舞。
技术摘要:模仿与微调模型预测控制以实现鲁棒且对称的四足运动
问题陈述
由于腿式机器人具有欠驱动、离散且高维的动力学特性,为其设计鲁棒的运动控制器仍然是一个重大挑战。传统的基于模型的控制(例如模型预测控制或 MPC)已展现出令人印象深刻的敏捷性和鲁棒性,但通常依赖于大量的数学建模和预定义的启发式规则(如 Raibert 启发式规则)。这些模型在复杂、非传统的情境中(例如脚部打滑或遇到意外障碍物的粗糙、湿滑或传送带地形)往往难以应对。相反,基于学习的方法(例如深度强化学习或深度 RL)可以利用海量数据自动解决反直觉的问题,但通常需要大量的人工奖励塑形才能产生高质量、对称且周期性的步态。若未经过仔细调整,学习到的策略可能会表现出生硬、不对称的运动,导致无法迁移到真实硬件上。此外,现有的混合方法往往因需要高频执行 MPC 而遭受高昂的计算成本,或者无法泛化到单一参考轨迹之外。
方法论:IFM 框架
作者提出了一种新颖的“模仿与微调模型预测控制(IFM)”框架,通过三阶段过程整合了基于模型的控制和基于学习算法的优势:
阶段 0:专家模型预测控制(MPC)
该框架首先利用微分动态规划(DDP)和Raibert 启发式规则开发一个专家控制器(πE)。
- 设计:MPC 基于凸成本函数预测未来状态并生成最优控制输入。它利用摩擦锥约束处理支撑腿,并采用任务空间阻抗控制处理摆动腿。
- 局限性:虽然鲁棒,但该 MPC 计算成本高昂(每次优化约需 12.4 毫秒),且依赖于固定模型,这使得在硬件上实时执行变得困难,并限制了对未见地形的适应性。
- 动作转换:为了弥合与学习算法之间的差距,MPC 的力矩输出通过比例 - 微分(PD)逆模型转换为目标关节角度,使数据与神经网络策略兼容。
阶段 1:模仿学习(IL)
利用专家 MPC 生成数据集,用于预训练神经网络策略(πI)。
- 算法:作者采用数据集聚合(DAgger)。与简单的行为克隆不同,该策略被展开执行,专家 MPC 对未见状态下的动作进行修正,聚合这些数据以减轻分布不匹配问题。
- 架构:一个包含三个隐藏层(512、256、64 个神经元)的多层感知机(MLP),接收包括身体姿态、关节状态、历史数据和用户指令在内的观测值。
- 目标:此阶段创建一个 MPC 的“克隆体”,具有计算高效且可学习的特性,继承了专家对称且周期性的步态,同时避免了高昂的优化成本。
阶段 2:强化学习(RL)微调
使用**近端策略优化(PPO)**在具有挑战性的地形上进一步微调模仿后的策略。
- 课程学习:策略在具有递增难度(地形因子)的地形课程(粗糙、离散粗糙、台阶、悬崖)上进行训练,以防止丢失预训练的运动风格。
- 奖励公式:作者利用**简单奖励(SR)设置(跟踪速度、最小化不必要的运动、力矩正则化)和接触奖励(CR)**设置(添加接触偏置)。关键在于,与纯 RL 相比,预训练显著降低了奖励工程的负担。
- 受限探索:为了保持模仿学习期间习得的有益运动风格,RL 微调采用了受限探索(较小的初始标准差、较低的学习率以及较小的 PPO 裁剪参数)。
- 仿真到现实:应用了域随机化技术处理观测噪声、电机摩擦、PD 增益、地面摩擦和指令延迟,以确保零样本迁移到硬件。
主要贡献
- 新颖框架:提出了 IFM 框架,系统性地结合了 MPC 和 RL,利用基于模型控制的鲁棒性和基于学习方法的适应性。
- 性能提升:证明了 IFM 显著提高了专家 MPC 在粗糙、湿滑和传送带地形上的鲁棒性,同时大幅减少了计算时间(从约 15 毫秒降至约 1 毫秒)。
- 效率与质量:证据表明,与纯 RL 相比,IFM 产生了更对称、周期性更强且更节能的步态,且仅需最少的奖励塑形并实现了更快的收敛。
- 硬件验证:在Mini Cheetah机器人上成功部署,显示其在跨越障碍物和跟踪速度方面的成功率优于原始 MPC 和纯 RL 基线。
实验结果
作者在 Mini Cheetah 上进行了广泛的仿真和硬件实验:
- 鲁棒性:在仿真中,IFM 在粗糙、湿滑和未见传送带地形上优于专家 MPC 和仅 DAgger 策略。虽然 MPC 因固定的落足模式而在传送带上失败,但 IFM 有效地调整了其步态。
- 跟踪性能:在平坦地形上,IFM(SR) 实现了最低的线性跟踪误差,优于 MPC 和纯 RL。纯 RL(SR) 由于出现“跳跃”(过度的垂直运动)而表现出较差的跟踪性能,这一问题通过 IFM 的预训练得到了缓解。
- 硬件成功率:
- 障碍物跨越:IFM(CR) 在跨越 7.5 厘米障碍物时达到了90% 的成功率,而针对硬件调优的 MPC(WBIC)和 DAgger 在此高度完全失败。
- 湿滑地形:IFM 策略成功穿越了摩擦系数为 0.22 的表面,而 MPC 和 DAgger 因依赖无法处理显著打滑的 Raibert 启发式规则而摔倒。
- 运动质量:与纯 RL 相比,IFM 策略表现出更低的运输成本(CoT)和相位图指数(PPI),表明其步态更节能且更对称。IFM 的相位图显示左右腿之间近乎完美的重叠,而纯 RL 则表现出不对称的运动。
- 效率:IFM 在约 2,000 次迭代内收敛,显著快于纯 RL(约 4,000 次以上迭代)。
意义与主张
该论文声称,IFM 框架为基于模型控制的可解释性与鲁棒性同基于学习方法的适应性之间的权衡提供了一种平衡的解决方案。通过使用 MPC 作为预训练专家,该框架:
- 缩小了 RL 的搜索空间,使智能体无需复杂的奖励工程即可找到高质量、对称的步态。
- 克服了固定模型控制器(如 MPC)在动态和不确定环境中的局限性。
- 通过用轻量级神经网络替代繁重的在线优化,实现了实时控制。
作者得出结论,IFM 提供了一种结构化的方法来调节运动风格,缓解了奖励工程的挑战,同时显著提高了四足机器人在挑战性地形上的鲁棒性和效率。未来的工作建议将此方法扩展到基于视觉的运动控制,这可能需要更复杂的网络架构,如 LSTM 或 CNN。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。