想象一下,你拥有一只四足机器人狗,旨在探索像其他行星那样充满岩石和危险的地方。通常情况下,这些机器人的训练目标是在四足健全的情况下完美行走。但如果一个电机坏了,或者一条腿被卡住了,会发生什么呢?
大多数机器人的大脑就像是一个单人、极其忙碌的大厨。这个大厨试图同时学习所有的食谱:如何正常行走、如何用三条腿跛行,以及如何在两条腿失效时拖行身体。问题在于,当厨房变得过于混乱(即存在太多不同的故障模式)时,大厨会感到困惑。他们可能会在应该使用“跛行”食谱时,错误地使用了“行走”食谱,从而导致笨拙的摔倒。
这篇论文提出了一种更聪明的方式来管理这个厨房:“专家团队”法。
核心理念:专家团队
与其让一个大厨尝试做所有事情,作者构建了一个由管理者和专家团队组成的系统。
- 管理者(故障检测器): 这是一个小型且智能的模块,它不断检查机器人的健康状况。它就像一名机械师,能瞬间察觉到:“嘿,左前腿电机坏了!”或者“两条后腿都断了!”
- 专家们(专家模型): 机器人拥有针对特定情况训练出的不同“大脑”(或专家)。
- 专家 A 是正常四足慢跑的高手。
- 专家 B 是三足行走的专家。
- 专家 C 是在失去两条腿时拖行身体的专家。
- 交接: 当管理者发现问题时,它不会让团队去猜测该怎么做。它只是简单地将控制权切换给正确的专家。如果后腿失效,管理者会立即将控制权移交给“两腿缺失”专家。
为什么这种方法更好
作者在虚拟世界和真实机器人(Unitree Go2)上,将这种方法与“单人厨师”(一种标准的 AI 模型)进行了对比测试。
- 结果: 当出现故障时,“专家团队”的表现比“单人厨师”要好得多。单人厨师试图同时处理所有事情并陷入混乱,而专家团队则只是选择了最合适的工具来完成任务。
- “小脑”红利: 作者还测试了如果你缩小计算机大脑以节省能源(这对于太空机器人非常重要)会发生什么。即使使用微型大脑,“专家团队”的表现也几乎与庞大复杂的脑部模型不相上下。这是因为每个专家只需要把一件事做到极致,而不是模糊地了解所有事。
现实世界测试
他们不仅仅是在模拟,还在真实的机器人狗上进行了测试。
- 首先,让它正常走过岩石。
- 然后,关闭了两个后腿的电机。机器人切换到了它的“两腿缺失”专家模式,并成功地拖行前进。
- 最后,他们模拟了单腿失效的情况,机器人切换到了“三足”专家模式并继续移动。
代价
这里存在一个权衡。由于专家是独立的,机器人需要分别学习每一个专家。这意味着训练过程会稍微“嘈杂”一些,并且与单厨师方法相比,需要更多的练习数据(模拟实验)才能达到完美。然而,一旦训练完成,该系统就会变得极其鲁棒且高效。
简而言之: 这篇论文并没有强迫一个大脑去成为所有灾难中的大师,而是给了机器人一个专家团队,并在出状况时快速切换到正确的专家。这使得机器人更坚韧、更聪明,并且能够在更小、更便宜的计算机上运行——非常适合探索未知领域。
技术摘要:用于容错足式运动的混合专家强化学习(Mixture-of-Experts RL)
问题陈述
由于足式机器人能够穿越非结构化地形,它们在行星探测和远程作业中变得日益重要。然而,在这些环境中进行长期部署会使硬件暴露于退化和执行器故障的风险之下,这可能会严重损害其移动能力。虽然强化学习(RL)已在足式运动的鲁棒性方面展现出显著成效,但传统的单体策略(monolithic policies)难以高效地表示针对不同故障条件所需的多种多样控制策略。一个试图同时编码地形感知、标准运动以及多种截然不同的故障恢复行为的单一网络,往往会面临表征干扰和学习效率降低的问题,尤其是在任务复杂度增加时。
方法论
作者提出了一种故障感知模块化控制架构,该架构明确利用故障诊断信息来激活专门的控制专家。与依赖学习型门控网络来推断运行模式的标准混合专家(MoE)方法不同,该框架使用显式的故障信息来选择合适的专家。
控制流水线由三个主要部分组成:
- 故障感知混合专家策略: 策略网络利用共享编码器处理本体感觉观测(基座线速度/角速度、重力投影、关节位置/速度)和视觉地形高度图。该系统并未采用学习型的路由机制,而是采用基于诊断出的故障状态 k 的独热选择机制(one-hot selection mechanism)。这会激活一个针对该失效模式定制的特定专家 πk,同时保持其他专家处于非活跃状态。这种设计降低了主动推理成本(Cactive=Cenc+Ck),相比之下,密集路由的成本为(Cdense=Cenc+∑Ck)。
- 状态估计: 为了处理在严重故障(如躯干拖行)期间模型假设失效的问题,该框架采用了基于学习的状态估计器。该神经网络直接从传感器观测(包括 IMU 加速度)预测基座线速度,而不依赖于显式的接触建模,从而能够适应由执行器故障引起的动态变化。
- 故障检测: 一个专门的神经网络(ffault)通过监督学习方式进行训练,旨在根据本体感觉历史的时间窗口识别当前的执行器故障情况。该模块提供了用于触发相应专家的类别分布。
该系统是在 IsaacLab 框架内使用 PPO 算法在 Unitree Go2 机器人上进行训练的。奖励函数包括任务导向目标(速度跟踪、基座高度/姿态)和正则化项(关节能量、平滑度)。至关重要的是,特定的奖励项会根据失效腿的数量 (nf) 进行动态激活或禁用,以使学习目标适应故障的严重程度。
核心贡献
- 故障感知 MoE 策略: 提出了一种模块化 RL 框架,其中专门的专家根据诊断出的执行器故障进行显式调节,消除了对学习型路由函数的需求,并实现了条件计算。
- 约束下的效率: 通过评估证明,即使在网络容量显著降低的情况下(Small 变体),模块化策略仍能保持具有竞争力的运动性能,且优于同等规模的单体基准模型。
- 可复现性: 发布了相关代码,为社区提供了一个可复现的基准。
结果
实验在模拟环境和真实的 Unitree Go2 机器人上针对四种场景进行了测试:无故障(No Fail)、左前(LF)失效、左后(LH)失效,以及左后 + 右后(LH+RH)同时失效。
- 性能比较: 在所有故障场景下,所提出的 Mo 架构一致优于单体 PPO 基准模型。在常态条件下,两者的性能相当;但随着故障严重程度的增加,MoE 方法的优势变得愈发明显。在最严重的场景(LH+RH 失效)中,由于运动需要区别于标准小跑的拖行行为,MoE 策略实现了显著更高的累积奖励。
- 网络容量敏感性: 当网络容量减少时(从 Large 到 Small 架构),单体基准模型的性能出现了显著下降。相比之下,MoE 架构保持了稳健的性能,其“Small”变体的表现甚至可以媲美“Large”规模的单体基准模型。这表明,结构化的专业化分工使得即便在有效参数较少的情况下也能实现高效学习。
- 现实世界验证: 该框架已成功部署在物理机器人上,展示了在常态条件下穿越岩石地形、三足行走(LH 失效)以及两足拖行运动(LH+RH 失效)的能力。
意义与局限性
论文声称,显式的故障调节专业化是替代单纯增加模型规模以实现容错运动的更优方案。该架构对于计算资源受限的机器人平台(如用于空间探索的平台)具有重要意义,因为这些平台对板载资源的要求极高。通过将故障特定行为解耦到专门的专家中,该系统在不增加大规模单体网络计算开销的前提下,实现了高鲁棒性。
作者也谦虚地承认了在样本效率方面的局限性。由于专家网络并不共享所有参数,策略梯度估计的噪声较大,因为每个专家仅在其特定的故障轨迹上进行更新。虽然目前的实验(每个故障条件使用约 4,096 个智能体)已经足够,但若要扩展到更多故障条件,可能需要更多的模拟环境或更复杂的参数共享策略。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。