这篇论文讲述了一个关于如何让机器狗像跑酷运动员一样灵活跳跃的有趣故事。简单来说,研究人员给机器狗(Unitree Go2)装上了一双“慧眼”(深度相机),并给它的大脑换了一种更聪明的架构,让它能轻松跳过比它身高还高的障碍物。
下面我用几个生活中的比喻来拆解这项研究的核心内容:
1. 核心挑战:机器狗的“跑酷”难题
想象一下,你让一只机器狗在平地上走,这很容易。但如果前面有一堵高墙,或者需要跳过几个台阶,这就难了。
- 传统做法:以前的机器狗大脑(神经网络)像是一个只会死记硬背的普通学生。它不管遇到什么情况,都要调动全身所有的脑细胞(参数)去计算下一步怎么走。这就像不管你是要解一道简单的数学题,还是要写一首复杂的诗,它都调动所有神经元,既慢又容易出错。
- 新挑战:现在的目标是让机器狗在真实世界里(光线不好、地面不平、障碍物形状各异)也能像人一样灵活地跑酷。
2. 解决方案:给大脑装上“专家顾问团”
这篇论文提出了一种叫**“稀疏门控混合专家模型”(Sparsely Gated Mixture of Experts, MoE)**的新架构。
🌟 创意比喻:从“全员加班”到“按需点菜”
- 旧模式(MLP):就像一家餐厅,不管顾客点的是“白开水”还是“满汉全席”,后厨的所有厨师(所有参数)都要同时动起来,每个人都试图参与烹饪。结果就是:做白开水时,厨师们也在瞎忙活,效率低,还容易把菜做乱。
- 新模式(MoE):这家餐厅换了一种管理方式。它雇佣了16 位不同专长的顶级大厨(16 个专家网络)。
- 当顾客点“白开水”时,系统只叫1 位擅长做简单饮品的厨师出来。
- 当顾客点“满汉全席”时,系统只叫4 位擅长不同菜系的厨师(比如一位做肉、一位做鱼、一位做面、一位做汤)出来协作。
- 关键点:不管点什么菜,只有少数几位厨师在干活(稀疏激活),其他人都在休息。
这样做的好处是:
- 更聪明:遇到跳台阶,就调用擅长跳跃的专家;遇到爬坡,就调用擅长攀爬的专家。
- 更省电(计算效率高):因为不需要所有“大脑神经元”同时工作,所以反应更快,计算量更小。
3. 实验结果:谁更厉害?
研究人员在真实的机器狗身上做了测试,让它去跳一个32 厘米高的箱子(这相当于机器狗身高的 80%,对机器狗来说就像人跳过一个很高的台阶)。
- 普通学生(传统 MLP):
- 如果让它用和“专家团”一样多的活跃脑细胞,它完全跳不过去,或者只能成功一半。
- 如果非要让它跳过去,就得把它的脑细胞总数扩大到“专家团”的总规模。但这就像让一家餐厅为了做一杯水而雇佣了 100 个厨师,虽然能做成,但速度慢 14.3%,而且太浪费资源。
- 专家团(MoE):
- 在活跃参数数量相同的情况下,它的成功率是普通学生的两倍!
- 它跳得更稳,动作更流畅,很少出现“脚滑了再调整”的狼狈样子。
4. 为什么它能适应真实世界?(视觉与训练)
机器狗不仅要有好大脑,还要有好眼睛。
- 模拟训练:研究人员在电脑里模拟了各种糟糕的环境(光线太亮、太暗、有噪点、障碍物形状奇怪)。
- 加噪训练:就像教小孩学走路,故意在鞋子里放点沙子,或者在走路时推它一把,让它学会适应。论文中给机器狗的训练数据加了“噪音”,让它学会在看不清、数据不准的情况下也能做出正确判断。
- 两阶段学习:
- 第一阶段:在完美的模拟世界里,给机器狗看“上帝视角”(知道地面有多滑、重心在哪),让它先学会怎么跳。
- 第二阶段:把“上帝视角”拿走,只给它看摄像头拍到的模糊图片,让它学会自己猜地面情况。这就好比从“有教练手把手教”过渡到“自己独立比赛”。
5. 专家的“分工”秘密
研究人员还发现了一个有趣的现象:
- 这些“专家”确实有分工!
- 有些专家专门负责跑步的节奏(因为走路是循环的,专家权重会像心跳一样有规律地变化)。
- 有些专家专门负责看深度图(判断障碍物有多远)。
- 这种“各司其职”的机制,让机器狗在面对复杂地形时,能瞬间调用最合适的技能。
总结
这篇论文就像是在说:以前我们试图用“大力出奇迹”(堆砌计算量)的方法让机器狗跑酷,现在我们发现,用“精兵简政”(混合专家模型)的方法,让机器狗在需要时调用最合适的“专家”,不仅跳得更高、更稳,而且算得更快、更省资源。
这为未来让机器狗在灾难救援、火星探索等复杂环境中自主行动,打下了坚实的基础。
论文技术总结:基于稀疏门控混合专家(MoE)与视觉输入的四足机器人跑酷学习
1. 研究背景与问题定义
背景:四足机器人在搜救、行星探索等场景中具有巨大潜力,但需要在复杂地形(如大跨度台阶、不平整地面)上实现高动态的“跑酷”(Parkour)运动。目前的四足跑酷研究多采用强化学习(RL)和 Actor-Critic 架构,其中 Actor 网络通常使用标准的多层感知机(MLP)。
问题:
- 架构局限性:标准 MLP 是稠密激活的,随着参数增加,推理时的计算量线性增长,难以在有限的计算资源下实现高性能扩展。
- 视觉集成挑战:现有的跑酷方法往往缺乏对深度视觉信息的深度整合,或者未利用稀疏计算的优势。
- 扩展性瓶颈:如何在保持推理效率的同时,提升策略在复杂障碍(如高度为机器人身高 80% 的障碍物)上的成功率?
核心目标:探索将**稀疏门控混合专家(Sparsely Gated Mixture of Experts, MoE)**架构应用于基于视觉的四足机器人跑酷控制,利用“条件计算”(Conditional Compute)在推理时仅激活部分参数,从而在同等计算预算下获得更高的性能,或在同等性能下降低计算成本。
2. 方法论 (Methodology)
2.1 两阶段训练框架 (Two-Phase Training)
为了弥合仿真到现实(Sim-to-Real)的差距并加速学习,作者采用了两阶段训练策略:
- 第一阶段(Phase 1):
- 输入:使用仿真中的“特权信息”(Privileged Information),如精确的地形高程图(Scandots)、质心偏移、摩擦系数、电机强度等。
- 架构:Actor 网络包含一个 MoE 层。
- 目标:利用特权信息快速学习复杂的跑酷策略。
- 第二阶段(Phase 2):
- 输入:移除特权信息,替换为**深度图像(Depth Images)**和基于本体感知(Proprioception)历史的估计值(如线性速度、物理参数估计)。
- 架构:深度图像通过门控循环单元(GRU)编码,与本体感知数据融合。
- 蒸馏:将第一阶段训练的 Actor 作为教师网络,通过均方误差(MSE)损失训练学生网络(即最终部署策略),并加入偏航角(Yaw)损失。
2.2 稀疏门控混合专家 (MoE) 架构
- 网络结构:Actor 包含 3 层,中间层为 MoE 层,前后为线性层(使用 ELU 激活)。
- 稀疏门控机制:
- 总共有 n=16 个专家(Experts),但在每次推理时仅激活 k=4 个专家(Top-k Gating)。
- 门控网络:计算输入与权重矩阵的乘积,并加入可学习的噪声以平衡专家利用率。
- 负载均衡损失:引入 Shazeer 等人提出的负载均衡损失项,防止所有样本都流向少数几个专家,强制专家多样化。
- 优势:总参数量大(约 160 万),但推理时激活参数量仅为总参数的一半(约 80 万),实现了“大模型能力,小模型推理成本”。
2.3 深度图像处理管道
为了模拟真实深度相机(Intel Realsense D435f)的噪声,作者在仿真中构建了复杂的图像预处理流程:
- 包括深度裁剪、梯度轮廓检测、随机裁剪、添加深度伪影(Artifacts)、高斯模糊以及下采样。
- 这种数据增强策略对于提升模型在真实环境中的鲁棒性至关重要。
2.4 奖励函数与域随机化
- 奖励函数:包含跟踪目标速度、偏航角、姿态、关节加速度、碰撞惩罚、脚部边缘检测等。
- 域随机化:在训练中对相机位置/角度、物理参数(摩擦、质量)、关节噪声等进行广泛随机化(见表 I),以增强泛化能力。
3. 关键贡献 (Key Contributions)
- 首创性应用:首次将稀疏门控 MoE 架构引入基于视觉的四足机器人跑酷控制领域,证明了条件计算在机器人运动控制中的有效性。
- 视觉融合:成功将深度相机感知集成到 MoE 框架中,实现了端到端的视觉 - 运动控制。
- 实机部署验证:在 Unitree Go2 四足机器人上进行了真实世界测试,展示了在高度为机器人 80% 的障碍物(32cm 盒子)及户外非结构化环境(滑板公园)中的鲁棒表现。
- 性能与效率的权衡分析:通过对比实验,量化了 MoE 在推理速度和成功率之间的优势。
4. 实验结果 (Results)
4.1 仿真与实机性能对比
实验在 Unitree Go2 机器人上进行了多次测试,障碍物为 32cm 高的盒子(机器人身高的 80%):
- MoE 策略:在 10 次尝试中100% 成功(10/10)。
- 标准 MLP 对比:
- Small/Medium/Large MLP(推理参数量 ≤ MoE 推理参数量):成功率极低(0% - 50%)。
- Extra-Large MLP(总参数量 = MoE 总参数量):成功率为 90%(9/10),但动作更混乱,恢复次数更多。
- 结论:MoE 在同等推理计算量下,性能远超稠密 MLP;若要达到 MoE 的性能,稠密 MLP 需要增加总参数量,但这会导致计算效率下降。
4.2 计算效率
- 在 NVIDIA RTX 2060 GPU 上,Batch Size 为 6000 的推理测试显示:
- Extra-Large MLP 的推理时间比 MoE 慢 14.3%。
- 这证明了稀疏激活带来的显著计算效率提升。
4.3 专家分析与消融实验
- 专家专业化:分析发现,不同专家在运动周期的不同阶段被激活(表现出周期性),例如某些专家专门处理深度信息,而另一些处理本体感知。这验证了 MoE 实现了“专家分工”。
- 消融实验:
- 噪声(Noise):移除观测噪声导致模型无法在真实世界成功,证明噪声是弥合 Sim-to-Real 差距的关键。
- 正则化在线适应(ROA):移除 ROA(用于估计物理参数)也导致性能大幅下降,表明在线适应环境参数的重要性。
5. 意义与结论 (Significance & Conclusion)
主要结论:
稀疏门控 MoE 架构为基于视觉的机器人运动控制提供了一种性能与计算效率的优越权衡。它允许策略拥有更大的模型容量(总参数多),从而学习更复杂的技能,同时在推理时保持较低的计算延迟(仅激活部分参数)。
实际意义:
- 突破性能瓶颈:在有限的嵌入式计算资源下,MoE 使得机器人能够处理更复杂的地形和更高的障碍物。
- 可扩展性:为未来在机器人领域应用大模型技术(如 LLM 中的 MoE 技术)提供了可行的路径。
- 鲁棒性:结合深度视觉和噪声训练,使得机器人能够在光照变化、障碍物形状各异(如户外滑板公园)的非结构化环境中稳定运行。
未来工作:
作者指出 MoE 引入了更多超参数(如专家数量、Top-k 值、负载均衡系数)需要调优。未来的工作将探索更明确的专家专业化架构,将特定专家与特定障碍物或运动阶段直接关联。
总结:这篇论文通过引入大语言模型领域的 MoE 技术,成功解决了四足机器人跑酷中“高复杂度策略”与“实时推理计算限制”之间的矛盾,并在真实机器人上取得了显著的性能提升,是机器人强化学习与高效架构设计结合的重要进展。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。