← 最新论文
💻 computer science

Mixture-of-Experts RL for Fault-Tolerant Legged Locomotion

本文提出了一种故障感知模块化控制架构,该架构利用强化学习和显式故障诊断信息,为不同的执行器故障激活专门的专家模型,证明了在计算受限且易发生故障的环境下,其性能和效率优于单体策略,适用于足式机器人。

原作者: Giulio Turrisi, Ozan Pali, Luca Oneto, Claudio Semini

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Giulio Turrisi, Ozan Pali, Luca Oneto, Claudio Semini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一只四足机器人狗,旨在探索像其他行星那样充满岩石和危险的地方。通常情况下,这些机器人的训练目标是在四足健全的情况下完美行走。但如果一个电机坏了,或者一条腿被卡住了,会发生什么呢?

大多数机器人的大脑就像是一个单人、极其忙碌的大厨。这个大厨试图同时学习所有的食谱:如何正常行走、如何用三条腿跛行,以及如何在两条腿失效时拖行身体。问题在于,当厨房变得过于混乱(即存在太多不同的故障模式)时,大厨会感到困惑。他们可能会在应该使用“跛行”食谱时,错误地使用了“行走”食谱,从而导致笨拙的摔倒。

这篇论文提出了一种更聪明的方式来管理这个厨房:“专家团队”法。

核心理念:专家团队

与其让一个大厨尝试做所有事情,作者构建了一个由管理者和专家团队组成的系统。

  1. 管理者(故障检测器): 这是一个小型且智能的模块,它不断检查机器人的健康状况。它就像一名机械师,能瞬间察觉到:“嘿,左前腿电机坏了!”或者“两条后腿都断了!”
  2. 专家们(专家模型): 机器人拥有针对特定情况训练出的不同“大脑”(或专家)。
    • 专家 A 是正常四足慢跑的高手。
    • 专家 B 是三足行走的专家。
    • 专家 C 是在失去两条腿时拖行身体的专家。
  3. 交接: 当管理者发现问题时,它不会让团队去猜测该怎么做。它只是简单地将控制权切换给正确的专家。如果后腿失效,管理者会立即将控制权移交给“两腿缺失”专家。

为什么这种方法更好

作者在虚拟世界和真实机器人(Unitree Go2)上,将这种方法与“单人厨师”(一种标准的 AI 模型)进行了对比测试。

  • 结果: 当出现故障时,“专家团队”的表现比“单人厨师”要好得多。单人厨师试图同时处理所有事情并陷入混乱,而专家团队则只是选择了最合适的工具来完成任务。
  • “小脑”红利: 作者还测试了如果你缩小计算机大脑以节省能源(这对于太空机器人非常重要)会发生什么。即使使用微型大脑,“专家团队”的表现也几乎与庞大复杂的脑部模型不相上下。这是因为每个专家只需要把一件事做到极致,而不是模糊地了解所有事。

现实世界测试

他们不仅仅是在模拟,还在真实的机器人狗上进行了测试。

  • 首先,让它正常走过岩石。
  • 然后,关闭了两个后腿的电机。机器人切换到了它的“两腿缺失”专家模式,并成功地拖行前进。
  • 最后,他们模拟了单腿失效的情况,机器人切换到了“三足”专家模式并继续移动。

代价

这里存在一个权衡。由于专家是独立的,机器人需要分别学习每一个专家。这意味着训练过程会稍微“嘈杂”一些,并且与单厨师方法相比,需要更多的练习数据(模拟实验)才能达到完美。然而,一旦训练完成,该系统就会变得极其鲁棒且高效。

简而言之: 这篇论文并没有强迫一个大脑去成为所有灾难中的大师,而是给了机器人一个专家团队,并在出状况时快速切换到正确的专家。这使得机器人更坚韧、更聪明,并且能够在更小、更便宜的计算机上运行——非常适合探索未知领域。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →