← 最新论文
🤖 machine learning

Difference-Aware Retrieval Policies for Imitation Learning

原作者: Quinn Pfeifer, Ethan Pronovost, Paarth Shah, Khimya Khetarpal, Siddhartha Srinivasa, Abhishek Gupta

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Quinn Pfeifer, Ethan Pronovost, Paarth Shah, Khimya Khetarpal, Siddhartha Srinivasa, Abhishek Gupta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过向机器人展示人类专家完成任务的视频,来教它走路或拿起一个杯子。这被称为模仿学习(Imitation Learning)

这种标准的方法(被称为行为克隆 Behavior Cloning)就像雇佣一名学生去背诵教科书。这个学生学习成千上万页的“状态 A 导致动作 B”。当考试到来时,他会尝试针对他看到的每种情况回忆出答案。

问题所在:
如果学生在早期犯了一个微小的错误(比如,他向左迈出的步子稍微偏了一点),他就会陷入教科书从未展示过的境地。因为他只背诵了特定的页面,他会陷入恐慌。他可能会胡乱猜测,做出一个巨大的动作,然后摔倒。用技术术语来说,微小的误差会“累积”,机器人会因为不知道如何处理与训练数据略微不同的情况而崩溃。

解决方案:DARP
这篇论文介绍了一种名为 DARP(差异感知检索策略,Difference-Aware Retrieval Policies)的新方法。DARP 不是让机器人背诵整本教科书,而是给它一张“小抄”以及使用它的特定方式。

以下是 DARP 的工作原理,我们使用一个简单的类比:

1. “小抄”(检索)

想象一下你正在参加一场考试,允许你查看一叠包含专家动作的闪卡。

  • 旧方法 (BC): 你完全尝试从记忆中解决问题。
  • DARP 方法: 当你面对一个问题(一个“查询状态”)时,你会快速扫描你的闪卡,找到与你当前情况最相似的 3 到 5 个示例

2. “差异”技巧(秘诀)

这是最重要的一部分。如果你只是看相似的闪卡并复制答案,你可能仍然会出错,因为你的情况并不与闪卡完全相同。

DARP 教会机器人观察其当前情况与闪卡之间的差异

  • 类比: 想象你正在尝试击高尔夫球。
    • 标准 BC: 你记得,“当球在这里时,我用力挥杆。”
    • DARP: 你看了一个类似的过往击球,但你会问:“我的球在那个过往击球的右侧 2 英寸处。所以,我应该向左调整 2 英寸的挥杆。”

机器人学习预测:“基于这个相似的示例,并考虑到我与它的差异程度,这是我应该做的调整后的动作。”

3. “集体投票”(聚合)

在找到 5 张相似的闪卡并计算出 5 个调整后的动作后,机器人并不会只选其中一个。它会取所有 5 个建议的平均值(或一种智能加权平均值)。

  • 为什么这有帮助: 如果其中一张闪卡因为是一个略差的示例而建议了一个奇怪、突兀的动作,其他 4 个“正常”的建议会将其抵消掉。这会让机器人的行为变得平滑,防止那些导致崩溃的疯狂、恐慌式的错误。

论文声称的内容

作者在机器人尝试行走(如跳跃机器人)和机器人尝试进行厨房任务(如关抽屉或穿针引线)的过程中测试了该方法。

  • 结果: DARP 一致地击败了标准的“背诵”方法。在测试中,使用 DARP 的机器人在完成任务且不失败方面的表现提升了 15% 到 46%
  • 神奇之处: 他们不需要任何新数据,不需要人类老师进行实时纠正,也不需要特殊的模拟器。他们使用了与旧方法相同的数据,但处理方式不同。
  • 理论依据: 论文解释说,这种方法起到了“平滑滤波器”的作用。它阻止机器人做出突然、剧烈的逻辑跳跃,即使在踏入略微陌生的领域时,也能保持动作的稳定。

简而言之: DARP 防止机器人在犯了小错时陷入恐慌。它不再盲目猜测,而是观察它的“邻居”(相似的过往示例),计算它与这些示例的差异,并平均出一个安全、平滑的修正方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →