← 最新论文
🤖 AI

ExpertGen: Scalable Sim-to-Real Expert Policy Learning from Imperfect Behavior Priors

本文提出了 ExpertGen 框架,通过利用不完美行为先验初始化扩散策略并冻结其参数以引导强化学习,实现了在无需奖励工程的情况下从仿真到现实的高成功率、鲁棒且可扩展的专家策略学习。

原作者: Zifan Xu, Ran Gong, Maria Vittoria Minniti, Ahmet Salih Gundogdu, Eric Rosen, Kausik Sivakumar, Riedana Yan, Zixing Wang, Di Deng, Peter Stone, Xiaohan Zhang, Karl Schmeckpeper

发布于 2026-03-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Zifan Xu, Ran Gong, Maria Vittoria Minniti, Ahmet Salih Gundogdu, Eric Rosen, Kausik Sivakumar, Riedana Yan, Zixing Wang, Di Deng, Peter Stone, Xiaohan Zhang, Karl Schmeckpeper

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 EXPERTGEN 的新框架,它的核心目标是:教机器人如何像专家一样干活,而且不需要人类手把手教它成千上万次,甚至不需要人类教它“完美”的动作。

为了让你更容易理解,我们可以把机器人学习新技能的过程想象成**“培养一个天才学徒”**。

1. 传统的困境:要么太贵,要么太笨

以前,想训练一个机器人做复杂任务(比如把香蕉放进碗里,或者把螺丝拧进孔里),主要有两条路:

  • 真人演示(Teleoperation): 让真人拿着机器人手,一遍遍做动作。这就像让一个大师傅手把手教徒弟,非常慢,而且成本极高。
  • 纯强化学习(RL): 让机器人在模拟器里自己瞎试,试对了给糖吃,试错了给电击。但这就像让一个完全没基础的孩子在迷宫里乱撞,如果没有非常精细的“奖励规则”(比如告诉它每一步该往哪走),它可能永远学不会,或者学会了一堆奇怪的、甚至危险的怪动作。

2. EXPERTGEN 的“三步走”天才培养法

EXPERTGEN 提出了一套聪明的“三步走”策略,把“不完美”的素材变成了“专家级”的机器人。

第一步:找个“不完美”的师傅(生成行为先验)

  • 比喻: 想象你要教机器人做菜。你找不到米其林三星大厨,但你有一个只会做“家常菜”的普通厨师(甚至可能是 AI 生成的、有点笨拙的脚本)。他的动作虽然不完美,甚至偶尔会打翻盘子,但他知道大概怎么拿锅铲,知道大概怎么切菜。
  • 技术: 论文利用这些“不完美”的演示数据(可以是人类随便做的,也可以是 AI 写的脚本),训练了一个扩散模型(Diffusion Policy)。这就像给机器人装了一个“直觉”,让它知道在这个场景下,人类通常会怎么动。虽然它现在还只是个“新手”,但它懂得基本的“人类动作逻辑”,不会做出像把桌子拆了这种荒谬的事。

第二步:在“超级模拟器”里疯狂特训(扩散引导强化学习)

  • 比喻: 现在,你把这个“新手”扔进一个拥有百万个平行宇宙的巨大模拟器里。在这个模拟器里,你可以同时开 1000 个机器人去试错。
    • 关键点来了:你不允许机器人乱改它的“肌肉记忆”(也就是第一步学到的基础动作模式)。
    • 你只允许它调整**“起步时的念头”**(也就是扩散模型的初始噪声)。
    • 这就好比:你告诉学徒,“你的切菜手法(基础)保持不变,但每次下刀前,你可以微调一下手腕的角度,直到你切得又快又准”。
  • 技术: 这里使用了扩散引导强化学习(DSRL)。它利用稀疏的奖励(只有任务成功了才给奖励,中间过程没有奖励),让机器人在保持“人类风格”的前提下,通过海量试错,自己摸索出如何从“差点成功”变成“完美成功”。它学会了如何从失败中恢复(比如手滑了怎么补救),这是普通强化学习很难做到的。

第三步:把“专家”的经验“蒸馏”给“视觉大脑”(DAgger 蒸馏)

  • 比喻: 经过第二步,机器人已经是个在模拟器里的“动作专家”了,但它只看得见坐标数字(状态),看不见真实世界。
    • 现在,我们要把这个“动作专家”当作老师,教一个**“只看眼睛”的学生**(视觉策略)。
    • 学生看着摄像头里的画面,老师(专家)在旁边说:“看,那个苹果歪了,你应该往左推一点。”
    • 如果学生看错了,老师就立刻纠正。通过这种**“边做边教”**(DAgger 算法)的方式,学生学会了如何把看到的画面转化为正确的动作。
  • 结果: 最终,这个学生机器人可以直接在真实的物理世界里工作,不需要任何人类干预,就能完成高难度的任务。

3. 这个框架有多牛?(实验结果)

论文在两个著名的测试场上进行了验证:

  1. ANYTASK(日常桌面任务): 比如把香蕉拿起来、把抽屉拉开、把梨推到中间。
    • 结果: EXPERTGEN 的胜率高达 85% - 100%,远超其他方法。
  2. AutoMate(工业精密组装): 比如把 peg(销子)精准地插进孔里,容错率极低。
    • 结果: 在极其困难的工业组装任务中,EXPERTGEN 达到了 90.5% 的总成功率。

最惊人的地方在于:

  • 零奖励工程: 研究人员不需要绞尽脑汁去设计复杂的奖励函数(比如“离目标近一点给 0.1 分”),只需要告诉机器人“做成了给 1 分,没做成给 0 分”,它自己就能学会。
  • 抗干扰能力: 即使你在机器人操作时突然推它一把,或者让它松手,它也能像经验丰富的老手一样,自动调整并恢复,而不是直接失败。
  • 真机部署: 这些在模拟器里练出来的“专家”,直接放到真实的 Franka 机械臂上,不需要重新训练就能干活(Zero-shot Sim-to-Real)。

总结

EXPERTGEN 就像是一个**“超级教练”。它不要求你提供完美的教学视频,哪怕你只给它看一些笨拙的、甚至有点错误的动作演示,它也能利用这些“不完美”作为起点,在虚拟世界里通过亿万次的自我进化,提炼出专家级的策略**,最后把这些策略“教”给真实的机器人。

这就好比:你不需要教孩子如何成为奥运冠军,你只需要给他看一些普通人的跑步视频,然后让他自己在虚拟世界里跑几亿次,他就能自己悟出冠军的跑法,并且真的能在奥运会上拿金牌。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →