← 最新论文
💻 computer science

Quadruped Parkour Learning: Sparsely Gated Mixture of Experts with Visual Input

该论文提出将稀疏门控混合专家(MoE)架构应用于基于视觉的四足机器人跑酷控制,实验表明在保持推理时活跃参数数量一致的情况下,MoE 策略在跨越大型障碍物的成功率上显著优于传统多层感知机(MLP),且相比为达到同等性能而需大幅扩容的 MLP 方案,MoE 在计算效率上更具优势。

原作者: Michael Ziegltrum, Jianhao Jiao, Tianhu Peng, Chengxu Zhou, Dimitrios Kanoulas

发布于 2026-04-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael Ziegltrum, Jianhao Jiao, Tianhu Peng, Chengxu Zhou, Dimitrios Kanoulas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于如何让机器狗像跑酷运动员一样灵活跳跃的有趣故事。简单来说,研究人员给机器狗(Unitree Go2)装上了一双“慧眼”(深度相机),并给它的大脑换了一种更聪明的架构,让它能轻松跳过比它身高还高的障碍物。

下面我用几个生活中的比喻来拆解这项研究的核心内容:

1. 核心挑战:机器狗的“跑酷”难题

想象一下,你让一只机器狗在平地上走,这很容易。但如果前面有一堵高墙,或者需要跳过几个台阶,这就难了。

  • 传统做法:以前的机器狗大脑(神经网络)像是一个只会死记硬背的普通学生。它不管遇到什么情况,都要调动全身所有的脑细胞(参数)去计算下一步怎么走。这就像不管你是要解一道简单的数学题,还是要写一首复杂的诗,它都调动所有神经元,既慢又容易出错。
  • 新挑战:现在的目标是让机器狗在真实世界里(光线不好、地面不平、障碍物形状各异)也能像人一样灵活地跑酷。

2. 解决方案:给大脑装上“专家顾问团”

这篇论文提出了一种叫**“稀疏门控混合专家模型”(Sparsely Gated Mixture of Experts, MoE)**的新架构。

🌟 创意比喻:从“全员加班”到“按需点菜”

  • 旧模式(MLP):就像一家餐厅,不管顾客点的是“白开水”还是“满汉全席”,后厨的所有厨师(所有参数)都要同时动起来,每个人都试图参与烹饪。结果就是:做白开水时,厨师们也在瞎忙活,效率低,还容易把菜做乱。
  • 新模式(MoE):这家餐厅换了一种管理方式。它雇佣了16 位不同专长的顶级大厨(16 个专家网络)。
    • 当顾客点“白开水”时,系统只叫1 位擅长做简单饮品的厨师出来。
    • 当顾客点“满汉全席”时,系统只叫4 位擅长不同菜系的厨师(比如一位做肉、一位做鱼、一位做面、一位做汤)出来协作。
    • 关键点:不管点什么菜,只有少数几位厨师在干活(稀疏激活),其他人都在休息。

这样做的好处是:

  1. 更聪明:遇到跳台阶,就调用擅长跳跃的专家;遇到爬坡,就调用擅长攀爬的专家。
  2. 更省电(计算效率高):因为不需要所有“大脑神经元”同时工作,所以反应更快,计算量更小。

3. 实验结果:谁更厉害?

研究人员在真实的机器狗身上做了测试,让它去跳一个32 厘米高的箱子(这相当于机器狗身高的 80%,对机器狗来说就像人跳过一个很高的台阶)。

  • 普通学生(传统 MLP):
    • 如果让它用和“专家团”一样多的活跃脑细胞,它完全跳不过去,或者只能成功一半。
    • 如果非要让它跳过去,就得把它的脑细胞总数扩大到“专家团”的总规模。但这就像让一家餐厅为了做一杯水而雇佣了 100 个厨师,虽然能做成,但速度慢 14.3%,而且太浪费资源。
  • 专家团(MoE):
    • 在活跃参数数量相同的情况下,它的成功率是普通学生的两倍!
    • 它跳得更稳,动作更流畅,很少出现“脚滑了再调整”的狼狈样子。

4. 为什么它能适应真实世界?(视觉与训练)

机器狗不仅要有好大脑,还要有好眼睛。

  • 模拟训练:研究人员在电脑里模拟了各种糟糕的环境(光线太亮、太暗、有噪点、障碍物形状奇怪)。
  • 加噪训练:就像教小孩学走路,故意在鞋子里放点沙子,或者在走路时推它一把,让它学会适应。论文中给机器狗的训练数据加了“噪音”,让它学会在看不清、数据不准的情况下也能做出正确判断。
  • 两阶段学习:
    • 第一阶段:在完美的模拟世界里,给机器狗看“上帝视角”(知道地面有多滑、重心在哪),让它先学会怎么跳。
    • 第二阶段:把“上帝视角”拿走,只给它看摄像头拍到的模糊图片,让它学会自己猜地面情况。这就好比从“有教练手把手教”过渡到“自己独立比赛”。

5. 专家的“分工”秘密

研究人员还发现了一个有趣的现象:

  • 这些“专家”确实有分工!
  • 有些专家专门负责跑步的节奏(因为走路是循环的,专家权重会像心跳一样有规律地变化)。
  • 有些专家专门负责看深度图(判断障碍物有多远)。
  • 这种“各司其职”的机制,让机器狗在面对复杂地形时,能瞬间调用最合适的技能。

总结

这篇论文就像是在说:以前我们试图用“大力出奇迹”(堆砌计算量)的方法让机器狗跑酷,现在我们发现,用“精兵简政”(混合专家模型)的方法,让机器狗在需要时调用最合适的“专家”,不仅跳得更高、更稳,而且算得更快、更省资源。

这为未来让机器狗在灾难救援、火星探索等复杂环境中自主行动,打下了坚实的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →