← 最新论文
🤖 machine learning

Learning More from Less: Reinforcement Learning from Hindsight

本文介绍了后验学习(Learning from Hindsight, LfH),这是一种通过利用视觉-语言模型将失败的轨迹重新标记为其实际完成的任务,从而增强训练视觉-语言-动作模型时样本效率的强化学习方法,进而使策略能够从稀疏奖励中学习,并在操控任务上超越标准基准。

原作者: Iris Xu, Sunshine Jiang, John Marangola, Nitish Dashora, Richard Li, Thomas Liu, Zexue He, Yuheng Zhi, Alex Pentland, Pulkit Agrawal, Zhang-Wei Hong

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Iris Xu, Sunshine Jiang, John Marangola, Nitish Dashora, Richard Li, Thomas Liu, Zexue He, Yuheng Zhi, Alex Pentland, Pulkit Agrawal, Zhang-Wei Hong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人做饭。你给它一个特定的指令:“把绿色的容器放入碗里。”但机器人可能有点笨拙,或者只是搞混了,它抓起了一块胶带并把它贴在了桌子上。

在旧的教机器人方法(称为标准强化学习)中,这完全是一场灾难。机器人会因为整个尝试过程而得到一个大大的“不及格”。计算机说:“你失败了。把这些数据扔掉吧;它们毫无用处。”机器人无法从这次混乱的胶带事件中学习到任何东西,尽管它确实成功地抓起了胶带并把它粘在了某个地方。这就像仅仅因为你想要一张狗的照片,就扔掉了一张完美的猫的照片一样。

这篇名为《从更少中学习更多》(Learning More from Less)的论文介绍了一个聪明的技巧,叫做后验学习(Learning from Hindsight, LfH)。把它想象成一个超级聪明、洞察一切的裁判(一个视觉语言模型),它观察着机器人的“失败”,然后说:“等等!你确实没有把容器放入碗里,但你确实成功地抓起了那块胶带!那是另一场游戏的胜利。”

以下是它的运作方式,分步骤进行:

“后验”的魔力
裁判不会只说“失败”,它会重写故事。它观察机器人的混乱尝试,并给出一个符合实际发生情况的新指令:“拿起胶带。”现在,那次失败的尝试变成了如何拿起胶带的一个完美范例。机器人因它实际做了什么而获得荣誉,而不仅仅是因为它本该做什么

论文表明,通过这种方式,机器人在处理棘手的新任务时,学习速度提升了 5 倍(样本效率提升了 5 倍)。这就像如果你可以通过练习滑板来学习骑自行车,然后突然发现自行车变得很容易,因为你已经学会了如何保持平衡。

这“不是”什么
作者们非常明确地说明了这种方法不是什么。

  • 它不仅仅是给机器人更多的“提示”或“部分分数”(比如说“做得好,你已经完成一半了”)。论文认为,仅仅让奖励变得“更密集”(为微小的步骤提供更多分数)的效果并不如直接改变任务本身。
  • 它不仅仅是让机器人进行随机尝试。论文发现,如果机器人只是随机乱动,这种方法就没有帮助。机器人需要真正做些有意义的事情,即使这件事对于原定目标来说是错误的。
  • 它不是能解决一切问题的魔杖。如果机器人只是原地不动,或者进行枯燥、重复的循环运动,裁判就找不到新的游戏可以玩,这种方法也就没用了。

我们有多确定?
团队通过两种方式进行了测试:

  1. 在模拟环境中: 他们在名为 LIBERO-PRO 的虚拟机器人计算机世界中进行了数千次测试。在这里,他们测量出 LfH 只用了标准训练 1/5 的步数就达到了同样的成功水平。这是一个巨大的飞跃。
  2. 在现实世界中: 他们将此方法应用于实验室中的一台 Franka 机器人手臂。结果经受住了考验!当机器人需要将绿色容器放入碗中时,标准方法在尝试 160 次后成功率仅为 22%。而 LfH 方法则跃升至 56%

代价
论文承认,这种方法取决于机器人是否真的做了有趣的事情。如果机器人只是在物体附近“悬停”而没有接触它们,裁判就无法找到新的游戏来玩。此外,裁判(负责重写指令的 AI)必须胜任其职;如果它感到困惑或编造了并未发生的事情,机器人可能会学到错误的教训。

大局观
核心思想很简单:不要丢弃你的错误。一个任务的失败往往是另一个任务的成功。通过使用一个聪明的 AI 来回顾并说,“嘿,你实际上做了这个”,我们可以教机器人从几乎每一次尝试中学习,将浪费的时间转化为宝贵的教训。这就像是意识到,每一次你在跑步时绊倒,其实都是在为另一种运动练习平衡感。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →