这篇论文介绍了一种名为 MoRI(混合强化学习与模仿学习专家)的新系统,旨在让机器人更聪明、更高效地完成复杂的长任务(比如把毛巾折叠好、把插座插进去等)。
为了让你更容易理解,我们可以把机器人做任务的过程想象成**“一个新手厨师在大师的指导下学做菜”**。
1. 核心难题:两个“老师”的优缺点
在教机器人做事时,通常有两种主要的学习方法,就像两个性格迥异的老师:
- 模仿学习 (IL) 老师:
- 特点: 他手里有一本“完美菜谱”(人类演示的数据)。他教学生(机器人)完全照着菜谱做。
- 优点: 上手快,动作标准,适合做那些固定的、大致的动作(比如“打开抽屉”、“拿起毛巾”)。
- 缺点: 死板。如果菜谱里没写“如果毛巾滑了一下怎么办”,学生就懵了。一旦遇到意外,学生就会因为“照本宣科”而犯错,而且越错越离谱(这叫“误差累积”)。
- 强化学习 (RL) 老师:
- 特点: 他是个“试错狂人”。没有菜谱,他让学生自己去摸索,做对了给奖励,做错了给惩罚。
- 优点: 灵活!遇到意外能自己想办法解决,适合处理精细的、充满不确定性的动作(比如“把毛巾精准地塞进盒子里”)。
- 缺点: 效率太低。为了学会一个动作,他可能得让机器人摔坏几百次东西,或者让人类老师(操作员)花大量时间去纠正,成本极高。
以前的困境: 单独用哪个老师都不完美。只用模仿学习,机器人太死板;只用强化学习,机器人太笨且危险。
2. MoRI 的解决方案:聪明的“双专家”团队
MoRI 就像是一个**“超级厨房”,它同时雇佣了这两位老师,并且安排了一位“智能主厨”(门控网络)**来指挥他们。
动态分工(谁听谁的?):
- 当任务需要**“大动作”(比如把抽屉拉开),或者动作很确定时,主厨会立刻说:“听模仿老师**的!按菜谱来,稳!”
- 当任务进入**“精细操作”(比如要把一个有点歪的插头插进插座),或者环境变得复杂、不确定时,主厨会立刻切换:“听强化老师**的!你去摸索一下,怎么插最顺!”
- 关键点: 这个切换不是瞎猜的,而是看两位老师“意见不一致”的程度。如果模仿老师很自信(动作方差小),就听他的;如果模仿老师拿不准(动作方差大),就交给强化老师去试。
安全网(正则化):
- 为了防止强化老师“试错”时把厨房砸了,MoRI 给强化老师加了一条**“安全绳”**:他的探索不能偏离模仿老师的基础动作太远。这就像让新手厨师在尝试新菜式时,必须保证不把盐当糖放,既鼓励创新又保证安全。
3. 训练过程:先“背菜谱”,再“实战演练”
MoRI 的训练分为两步,就像厨师的进修:
- 第一阶段:离线预训练(背菜谱)
- 机器人先不看现实世界,只在电脑里看人类演示的 20 次视频。
- 模仿老师学会怎么“照猫画虎”,强化老师也先看看人类是怎么做的,心里有个底。这时候还没开始真正动手,所以不会损坏任何东西。
- 第二阶段:在线微调(实战演练)
- 机器人开始真的去操作了。
- 这时候,“智能主厨”开始工作,根据刚才说的规则,决定什么时候听谁的。
- 如果机器人做错了,人类操作员只需要极少地干预一下(就像大厨偶尔点拨一句),机器人就能立刻学会并修正。
4. 效果如何?(成绩单)
论文在四个真实的复杂任务上测试了 MoRI(比如把方块放进抽屉、把毛巾折好等):
- 成功率极高: 平均成功率达到了 97.5%。这意味着几乎每次都能成功。
- 速度快: 只需要 2 到 5 小时 的在线微调就能学会。
- 省人: 相比传统的强化学习方法,MoRI 减少了 85.8% 的人类干预。以前可能需要人类手把手教几百次,现在只需要教几次。
- 更聪明: 它比单独使用模仿学习或强化学习都要强,因为它结合了前者的“稳”和后者的“灵”。
总结
MoRI 就像是一个懂得“因材施教”的超级教练。
它知道什么时候该让机器人“按部就班”(模仿学习),什么时候该让机器人“大胆尝试”(强化学习),并且用一种聪明的方法把两者无缝衔接起来。
结果就是: 机器人学得更快、摔得更少、干得更漂亮,真正具备了在复杂现实世界中完成精细任务的能力。这为未来让机器人进入家庭、工厂处理各种长流程工作铺平了道路。
MoRI: 面向长程操作任务的混合强化学习与模仿学习专家系统技术总结
1. 研究背景与问题定义
在机器人操作领域,模仿学习 (IL) 和 强化学习 (RL) 是两种主流的策略获取框架,但各自存在显著局限性:
- 模仿学习 (IL):虽然能高效地从专家演示中推导策略,但受限于演示数据的分布覆盖范围,容易在长程任务中产生误差累积 (Compounding Errors) 和分布偏移 (Distribution Shift),难以满足高精度操作的严苛要求。
- 强化学习 (RL):通过试错探索具备自主性和鲁棒性,尤其在接触丰富的任务中表现优异,但面临样本效率低、试错成本高以及收敛缓慢的问题。
- 现有混合方法的不足:现有的 IL 与 RL 融合方法在处理复杂的长程任务(Long-Horizon Tasks)时往往难以平衡效率与鲁棒性,且常需要大量的人工干预或计算资源,难以在实际部署中实现快速收敛。
核心问题:如何设计一个高效框架,结合 IL 的样本效率和 RL 的探索能力,以处理包含粗粒度运动和精细接触控制的复杂长程操作任务,同时最小化人工干预并加速收敛?
2. 方法论:MoRI (Mixture of RL and IL Experts)
本文提出了 MoRI 框架,基于混合专家 (Mixture of Experts, MoE) 架构,动态地在 IL 和 RL 专家之间切换。该系统包含两个主要阶段:
2.1 核心架构与动态调度机制
MoRI 利用专家动作的方差 (Action Variance) 作为置信度指标,通过门控网络 (Gating Network) 动态分配任务:
- IL 专家 (BC Policy):负责粗粒度运动 (Coarse Movements)。当专家动作方差较低(即策略确定性强)时,系统倾向于使用 IL 策略,处理如抓取、移动等确定性较高的子任务。
- RL 专家 (SAC Policy):负责细粒度操作 (Fine-grained Manipulations)。当接触环境复杂、不确定性高(动作方差大)时,系统切换至 RL 策略,利用其探索能力处理精细装配、接触力控制等任务。
- 硬选择机制:在每一步决策中,根据门控网络输出的权重,选择方差较小(置信度较高)的专家动作作为最终输出。
2.2 两阶段训练流程
阶段一:优势加权离线预训练 (Advantage-Weighted Offline Pre-training)
- 利用少量演示数据 (20 条) 初始化 BC 策略和 RL 策略。
- BC 策略:通过均方误差 (MSE) 损失函数拟合演示数据,建立运动基线。
- RL 策略:采用 AWAC (Advantage-Weighted Actor-Critic) 算法,在离线数据上进行初始化,平衡演示知识与探索能力,避免盲目探索。
- 离散夹爪控制:引入 DBC (Discrete BC) 损失函数,通过交叉熵直接监督离散的夹爪动作(开/保持/关),加速收敛并解决 DQN 在长程任务中的收敛慢问题。
- 注:此阶段 MoE 门控网络未训练,以避免过拟合。
阶段二:MoE 驱动的在线微调 (Online Fine-tuning)
- 数据流:维护三个数据集(演示缓冲区、成功缓冲区、回放缓冲区),分别用于 BC、SAC 和 MoE 的更新。
- RL 正则化:在 RL 的 Actor 损失函数中引入 BC 策略的正则化项(MSE 约束),确保 RL 的探索行为保持在 BC 策略的分布支持范围内,保障探索安全性并减少人工干预。
- MoE 优化:门控网络通过多目标损失函数进行优化,包括加权方差最小化(选择最确定的专家)、专家专业化 (Specialization)、负载均衡 (Load Balancing) 和熵正则化。
3. 主要贡献
- 基于动作方差的动态调度机制:在 MoE 框架内提出了一种协调 IL 和 RL 专家的新方法,根据任务需求(粗运动 vs. 精细操作)动态调整专家分配,显著提升了系统的鲁棒性。
- 离线预训练与在线微调的集成管道:利用少量演示数据初始化专家,结合离线 RL (AWAC) 和在线微调,大幅提升了协同训练效率和收敛速度。
- 基于 IL 的 RL 正则化策略:通过 IL 动作分布约束 RL 的探索空间,在保证探索安全性的同时提高了样本效率,将训练过程中的人工干预降至最低。
4. 实验结果
在四个真实的复杂操作任务(抽屉放块、带盖盒子放毛巾、插入双插座、折叠毛巾)上进行了评估:
- 成功率:MoRI 在 2-5 小时的微调后,平均成功率达到 97.5%。相比之下,基线 ConRFT 仅为 57.5%,单独的 BC 和 RL 专家分别为 37.5% 和 77.5%。
- 收敛速度:相比基线算法,MoRI 将收敛时间缩短了 21%(平均训练时间从 273.8 分钟降至 216.3 分钟)。
- 人工干预:MoRI 将人工干预比例降低了 85.8%(从 49.6% 降至 7.0%),表明其能更有效地利用高质量经验。
- 自主成功率:自主成功样本在回放缓冲区中的比例提升了 111.7%。
- 消融实验:
- 移除 BC 正则化会导致人工干预率激增至 45.4%,且成功率下降至 70%,证明了正则化对约束探索空间的关键作用。
- 使用 DBC 替代 DQN 作为夹爪专家,显著提升了长程任务中的收敛性和成功率。
- 平滑性:在专家切换过程中,由于 BC 正则化的存在,末端执行器的位置波动极小(约 0.017m),确保了动作的连续性。
5. 意义与展望
- 实际意义:MoRI 为机器人长程操作任务提供了一种兼顾效率(快速收敛、低样本需求)和鲁棒性(高精度、抗干扰)的实用解决方案。它成功解决了单一范式难以平衡的问题,特别适用于仓储、精密装配和柔性物体操作等场景。
- 局限性:目前框架在应对剧烈扰动时的泛化能力和自主恢复能力仍有提升空间。
- 未来工作:计划引入视觉 - 语言模型 (VLM) 进行高层推理和零样本迁移,利用世界模型 (World Models) 减少物理试错成本,并探索在线持续学习与稀疏专家激活以应对更复杂的长程任务。
总结:MoRI 通过巧妙的 MoE 架构和动态调度策略,成功融合了模仿学习的效率与强化学习的适应性,显著降低了机器人操作任务对人工干预的依赖,是实现高效、安全机器人自主操作的重要进展。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。