Set-Supervised Diffusion Policy: Learning Action-Chunking Diffusion through Corrections
本文提出了一种集合监督扩散策略(Set-Supervised Diffusion Policy, SDP),这是一种利用人类纠正动作块与机器人非理想动作块的配对对比学习来训练扩散策略的新型框架,旨在使策略对分布偏移和噪声数据具有更强的鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人完成一项精细的任务,比如组装一件家具或将一个方块推到特定位置。你扮演老师的角色,而机器人则是你的学生。
问题所在:“完美模仿者”陷阱
传统上,当我们教机器人时,会使用一种叫做**行为克隆(Behavior Cloning)**的方法。这就像是一个学生试图完美复制老师的手写字迹。如果老师写的数字“5”因为手抖而看起来有点像“6”,机器人也会试图精确地模仿那个颤抖的“6”。
在机器人领域,这是一个大问题。
- 偏离航线: 如果机器人犯了一个微小的错误,它就会进入一个老师从未见过的全新情境。机器人会陷入恐慌,从而犯下更大的错误。
- 忽略“不”: 当机器人出错时,你会介入并纠正它。你会展示正确的移动方式。但传统的训练方法只关注你做出的“正确”动作。它们完全忽略了机器人刚刚做出的“错误”动作。这就像老师说“做得好,修好了”,却从未解释为什么最初的尝试是错误的。机器人只会不断尝试复制那些“完美”的动作,却无法学会应该避免什么。
解决方案:“安全区”(集合监督扩散策略)
该论文的作者 Zhaoting Li 及其同事提出了一种新的教学方法,称为集合监督扩散策略(Set-Supervised Diffusion Policy,简称 SDP)。
他们不再告诉机器人:“请完全按照这一个特定的动作来做”,而是告诉它:“只要在这个安全区内,做任何动作都可以。”
以下是其工作原理,使用了一个简单的类比:
1. “红区”与“绿区”
想象机器人正在尝试停车。
- 机器人的错误(负面动作): 机器人试图向左靠得太近,撞到了路缘石。
- 你的纠正(正面动作): 你接过方向盘,将其转向中心位置。
在旧的方法中,机器人只是记住了“转向中心”。
而在 SDP 中,机器人学习的是一个安全区。它明白:“好吧,撞到路缘石(左侧)是不好的。中心是好的。所以,只要我不撞到路缘石,我可以在中间区域的任何地方停车。”
这个“安全区”被称为期望动作集合(Desired Action Set)。它赋予了机器人灵活性。它不需要做一个完美的模仿者,它只需要保持在规则区域内即可。
2. “扩散”的魔力
机器人是如何学习留在该区域内的呢?他们使用了**扩散(Diffusion)**技术。
把扩散想象成一位雕塑家在处理粘土。
- 起点: 机器人从一团随机、混乱的粘土(随机噪声)开始。
- 过程: 机器人分步进行“去噪”,通过剔除坏的部分来塑造形状。
- 转折点: 在 SDP 中,当机器人塑造粘土时,它有一个规则:“如果你开始将粘土塑造成撞到路缘石的形状(负面动作),请停止并将它推回安全区。”
这个过程被称为反射扩散(Reflected Diffusion)。这就像球在房间里弹跳一样。如果球撞到了墙壁(“坏区域”的边界),它会弹回房间内(“好区域”)。这确保了机器人生成的动作始终是安全且可接受的,即使它并不与你的动作完全一致。
3. 从错误中学习(对比数据)
SDP 的关键创新在于它同时利用了机器人的错误和你的纠正。
- 旧方法: “这是正确的动作。去复制它。”
- SDP 方法: “这是错误的动作(不要这样做)以及这是正确的动作(这样做)。你的目标是找到任何一个比错误动作更好、且接近正确动作的动作。”
通过学习“不该做什么”,机器人变得更加鲁棒(健壮)。如果你的纠正动作有些颤抖或带有噪声,机器人不会陷入恐慌。它只会知道:“好吧,我需要保持在这个大致区域内”,而不是试图去复制那只颤抖的手。
他们发现了什么?
研究人员在机器人执行推物体和组装家具等任务时测试了该方法。
- 更好地处理噪声: 当人类老师出现失误或数据存在“噪声”(颤抖)时,SDP 机器人依然表现良好。旧有的“模仿者”机器人则会失败,因为它们试图去复制那些错误。
- 更好的数据收集: 由于 SDP 机器人被允许在“安全区”内进行探索,而不是仅仅复制老师,因此它能收集到更广泛的经验。这为未来的训练创造了更好的“教科书”。
- 现实世界的成功: 他们在真实机器人上测试了将 T 形物体插入孔中的任务。结果显示,SDP 机器人的成功率高于标准机器人,尤其是在该任务难度最大的版本中。
总结
简而言之,SDP 改变了我们教导机器人的方式——从“复制我精确的手部动作”转变为“留在这个安全区域内并避开坏的部分”。通过将机器人的错误作为边界线,并将人类的纠正作为引导,机器人学会了变得更加灵活、更加鲁棒,并且在情况变得混乱时不太容易失败。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。