← 最新论文
💻 computer science

From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback

本文介绍了 CLIC,这是一种人机回环的模仿学习框架,它用源自纠正性反馈的集合值目标取代了脆弱的逐点动作监督,从而实现了能够适应噪声、相对性及多模态人类指导的鲁棒策略学习。

原作者: Zhaoting Li, Rodrigo Pérez-Dattari, Robert Babuska, Cosimo Della Santina, Jens Kober

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhaoting Li, Rodrigo Pérez-Dattari, Robert Babuska, Cosimo Della Santina, Jens Kober

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教机器人执行一项任务,比如往杯子里倒水或接住一个球。传统的方法被称为行为克隆(Behavior Cloning)。这就像一位严厉的老师,在地图上指出一个确切的位置,然后说:“你必须精确地走到这里。”

这种方法的弊端在于,人类并非完美无缺。有时我们会疲惫,手会颤抖,或者只是给出了略微错误的方向。如果机器人将每一条人类指令都视为不可更改的完美法则,它就开始死记硬背我们的错误。它会变得“脆弱”——只要人类犯下微小的错误,机器人就会困惑并失败。这就像一个学生死记硬背了试卷上错误答案的精确坐标,结果因为无法应对任何变化而不及格。

另一方面,有些方法试图通过告诉机器人“这个动作比那个动作好”来教导它。这就像老师说:“往左走比往右走好”,却不说具体要往左走多远。虽然这种方法更灵活,但往往过于模糊。机器人可能会因此漫无目的地徘徊,因为它不知道“好”行为的边界在哪里。

新想法:“安全区”

这篇论文的作者提出了一种折中方案,称为CLIC(基于交互式校正的对比策略学习)。他们不是给机器人一个单点或一个模糊的比较,而是教它寻找一个**“安全区”或目标集合**。

这里的类比是:

  • 旧方法(点对点): 老师说:“就站在这个特定的瓷砖上。”如果老师指错了稍微偏一点的瓷砖,机器人就会站在那儿并失败。
  • 旧方法(成对比较): 老师说:“站在左侧比站在右侧好。”机器人知道不该站在右侧,但它不知道是应该站在最左侧、中间,还是仅仅稍微偏左。这太宽松了。
  • CLIC(集合值): 老师说:“不要站在红色瓷砖上(机器人出错的地方),但你可以站在绿色瓷砖周围这个蓝色圆圈内的任何地方。”

在这种新方法中,当人类纠正机器人时,他们不仅仅是在给出一个新的坐标。他们是在定义一个可接受动作的区域。

  • 如果人类将机器人的手臂稍微向左推以纠正错误,机器人会学到:“好的,正确的动作大致在这个方向,不一定精确在你推我的那个位置。”
  • 如果人类给出的校正带有噪声或手在颤抖,机器人会理解“安全区”有点模糊,但它仍然知道什么不该做(错误的一侧)以及什么大致是可接受的(该区域)。

实际运作方式

论文通过两种主要方式测试了这一想法:

  1. 模拟仿真: 他们在计算机上运行了数千次模拟,任务包括推动 T 形块、拿起罐子或用两只机械臂举起物体。

    • 结果: 当人类数据完美时,CLIC 的表现与旧方法一样好。但当人类数据存在噪声、颤抖或不完整时(例如,人类只纠正了双机械臂机器人中的一只手臂),CLIC 仍能正常工作,而旧方法则崩溃或完全失败。
    • 原因? 因为 CLIC 没有试图死记硬背那些颤抖的手部动作。它学习的是正确行为的形状。
  2. 真实机器人: 他们在真实机器人上测试了这项技术,执行的任务包括:

    • 将 T 形物插入 U 形物: 这是一个需要精确移动的复杂拼图。
    • 接住球: 这是一个快速、动态的任务,人类很难给出完美的演示,因此他们只是给出快速的方向性轻推。
    • 倒水: 这是一项需要精细控制瓶子的任务。
    • 结果: 机器人学得更快、更可靠。在接球任务中,机器人从很少接住球,变成了在两次尝试内就能稳定接住球,尽管人类只给出了粗略的方向提示。

关键要点

该论文声称,通过将人类校正视为可能性的区域而非精确目标,机器人会变得更加稳健。它们能够处理人类的错误、颤抖的双手和不完整的指令,而不会感到困惑。

这就好比一个死记硬背单个错误答案的学生,与一个理解正确答案概念的学生之间的区别。CLIC 教给机器人的是概念(“安全区”),而不仅仅是坐标,这使得它在人类参与时成为一个更好的学习者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →