Behavior Uncloning: Distilling Mode Redirection into Policy Weights without Inference-Time Steering
本文提出了 MoRE(模式重定向),该方法通过一个简短的“去克隆”步骤,将临时模式分类器的引导蒸馏至策略权重中,从而在不增加推理时开销的情况下,永久抑制行为克隆策略中不安全或不需要的行为模式,进而显著提高多种机器人任务的部署成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人完成一项工作,比如递给你一把刀,方法是给它看数百段人类完成这项任务的视频。因为这些视频来自不同的人、在不同的厨房里,机器人学会了完成这项工作的多种方式。
有时,它学会了安全的方式(握住刀柄)。但因为它吸收了所有的信息,它也学会了危险的方式(握住刀刃)。当你把这个机器人送到真实的家庭中使用时,它可能会感到困惑,并选择那种危险的方式,尽管它其实知道如何安全地完成任务。
这篇论文介绍了一种名为 MoRE(模式重定向,Mode Redirection)的解决方案。你可以把它想象成一种“行为去学习”(behavioral unlearning)工具,它能修复机器人的坏习惯,而无需从头开始重新教导,也不会在机器人工作时降低其速度。
以下是它的工作原理,使用简单的类比进行说明:
问题所在:“杂学之士”机器人
当机器人在庞大且杂乱的数据集上进行训练时,它们变得像是一个为了考试而研读了所有可能教科书的学生。它们知道答案,但可能会选择错误的方法来达到目的。
- 问题在于: 如果你试图通过丢弃那些“坏”视频并重新训练机器人来解决这个问题,这会耗费大量的时间和金钱。
- 另一种选择: 有些人尝试在机器人工作时旁边放一个“交警”,对着它大喊:“不!要这样做!”这种方法有效,但它会减慢机器人的速度,因为交警必须每一秒都在思考并大喊大叫。
解决方案:MoRE(“内在指南针”)
MoRE 与众不同。它不是在机器人工作时添加一个“交警”,而是对机器人的大脑(其软件权重)进行一次快速的“手术”,从而永久性地改变其习惯。
以下是具体步骤:
- 临时教练: 首先,MoRE 构建一个微小的、临时的“分类器”。你可以把它想象成一位教练,他能观察机器人的当前动作并说:“噢,你正准备做那个‘先拿刀刃’的动作。那是错误的模式。”
- 温柔的推搡: 机器人尝试执行任务。当教练看到它开始向坏习惯(比如先拿刀刃)偏移时,教练会给机器人的大脑一个温柔的“推搡”(一个数学信号)。这个信号在说:“嘿,离那条路径远一点。”
- 安全网(保留损失): 机器人也需要保持它的技能。如果我们只告诉它“不要做坏事”,它可能会忘记如何完成任务。因此,MoRE 还会告诉机器人:“在你修正坏习惯的同时,确保你完美地保持好习惯。”这就像告诉一个学生:“停止作弊,但要继续努力学习正确答案。”
- “去克隆化”: 一旦机器人学会了避免坏习惯并坚持做好习惯,临时的教练就会被解雇并被丢弃。此时,机器人成为了一个独立的专家,能够自然地避开错误的动作。
为什么这很重要
论文声称 MoRE 具有优越性,因为:
- 没有减速带: 与“交警”方法不同,MoRE 在机器人实际工作时不会增加任何额外的步骤。它的运行速度与之前一样快。
- 无需重新训练: 你不需要原始视频或数周的训练时间。你只需要一些关于“好”方式与“坏”方式的对比示例即可。
- 随处适用: 作者在模拟机器人(在视频游戏中)和真实机器人(物理机械臂移动刀具和瓶子)上测试了这一点。在几乎所有案例中,机器人变得更加安全,并且能更成功地遵循你设定的特定规则,同时没有丧失完成任务的能力。
核心结论
MoRE 将一个因选项过多而感到困惑的机器人,将其偏好直接“蒸馏”到了它的脑中。这就像是拿一个虽然懂驾驶但总是在超速的学生,通过一次快速的课程,重塑他们的本能,让他们始终安全驾驶,而不需要一名驾驶教练永远坐在副驾驶座上。
论文的关键结果:
- 平均而言,与未经编辑的机器人相比,MoRE 将机器人的成功率提高了 44%。
- 它的表现几乎与仅使用“好”数据重新训练机器人的效果一样好,但速度要快得多。
- 它适用于不同类型的机器人大脑(从简单的模型到先进的 AI 模型)以及不同的任务(移动物体、行走、递送物品)。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。