← 最新论文
🤖 machine learning

Generalize and Guide: Decomposing Rewards for Few-Shot Inverse Reinforcement Learning

本文介绍了多任务判别器邻近引导的逆强化学习(MPG),这是一种结合了可泛化判别器和邻近函数的小样本逆强化学习方法,能够通过有限的目标演示和相关的多任务数据,有效地学习与之存在实质差异的新任务,从而实现比现有基准方法显著更高的成功率。

原作者: Ziyi Liu, Grace Zhang

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziyi Liu, Grace Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人做一项新家务,比如清理凌乱的房间。在人工智能领域,这被称为强化学习(Reinforcement Learning)。把它想象成训练一只狗:当狗做对了某件事时,你会给它一个奖励(即“奖励”),它就会学会重复那个动作以获得更多的奖励。但问题在于:要确定究竟什么才算“对”是非常困难的。如果你只是说“把房间打扫干净”,机器人可能会感到困惑,然后把猫扔出窗外,而不是捡起袜子。

为了解决这个问题,科学家们使用了逆强化学习(Inverse Reinforcement Learning, IRL)。与其告诉机器人该做什么,不如给它看一段人类完美完成任务的视频。机器人通过观察视频,尝试推测出人类遵循的“秘密配方”(即奖励函数)。问题是,现实生活是混乱的。人类可能在家具处于某个位置时清理房间,但如果家具移动了怎么办?或者如果机器人需要拿起一个看起来略有不同的杯子怎么办?如果只给机器人展示一两个特定场景的例子,当情况发生变化时,它往往会陷入困境。这就像只在空旷的停车场教一个人开车;一旦遇到有交通流量的真实街道,他们可能会惊慌失措。这篇论文解决了如何利用来自相似任务的旧案例库,来教机器人学习新的、棘手的任务,并实现极少量样本学习的挑战。


“烹饪系学生”机器人

见见我们的机器人学生。它被要求学习一个新的、困难的食谱:“拿起红色的积木,并把它叠在蓝色的积木上。”但这里有个转折:机器人只看到了五段人类执行这项特定任务的视频。在现实世界中,积木可能会从不同的位置开始,或者桌面可能是倾斜的。由于样本如此之少,标准的机器人很可能会感到困惑并失败。

然而,这个机器人很特别。它还可以访问一个庞大的视频库,里面展示了人类进行其他堆叠任务的过程——比如把绿色积木叠在黄色积木上,或者把黑色积木叠在白色积木上。这些并不是完全相同的任务,但它们拥有相同的“神韵”和规则。论文的作者 Ziyi Liu 和 Grace Zhang 想要测试,是否可以通过这些“相关”视频,让机器人在仅有少量直接示例的情况下掌握这项新的、困难的任务。

两部分“秘制酱料”

团队构建了一个名为 MPG(多任务判别器近邻引导的逆强化学习,Multitask discriminator Proximity-Guided IRL)的新系统。可以将 MPG 想象成一个帮助机器人学习的两部分教练:

  1. “模式识别者”(多任务判别器):
    想象一位品尝过成千上万种不同菜肴的大厨。即使他从未见过这种特定的红蓝积木堆叠,他也能观察机器人的尝试并说:“嘿,那个动作看起来就像专业人士会做的!”这部分系统会观察机器人的动作,并将其与庞大的相关视频库进行对比。它学习的是所有不同任务中“优秀堆叠”的通用结构。它不仅仅是死记硬背那一段视频,而是理解了堆叠的概念。这有助于机器人在积木处于奇怪新位置时,依然能识别出正确的行为。

  2. “距离测量仪”(近邻函数):
    现在,假设机器人犯了一个错误,偏离了路径。标准的机器人可能只会得到一个“零奖励”然后停下来,因为不知道如何返回。但 MPG 的第二部分就像一个 GPS,它会说:“你离目标还很远,但如果你往这个方向移动,你就离目标更近了。”它测量机器人距离“专家”路径有多远。即使机器人在做一些大厨从未见过的动作,这个测量仪也会给予它温柔的提示:“你正接近正确的方式,继续前进!”这防止了机器人在黑暗中迷失方向。

大考:它奏效吗?

作者在充满迷宫、积木堆叠谜题和机器人手臂操作任务的数字世界中对该系统进行了测试。他们只给了机器人极少量的关于新任务的示例(有时仅为 5 段视频),但提供了大量来自相关任务的示例。

结果令人印象深刻。在这些模拟实验中,MPG 系统实现了 81.2% 的平均成功率。为了让你有直观感受,排名第二的机器人(使用最强的现有方法)平均只能取得约 56.5% 的成功率。这是一个巨大的飞跃,提升了 24.7 个百分点

论文表明,通过将“模式识别者”(从许多相似任务中学习)与“距离测量仪”(在机器人迷失时进行引导)相结合,机器人可以比以前更快、更可靠地学习新的、棘手的技能。

它不是什么(以及它是什么)

需要注意的是,这篇论文并没有声称它解决了宇宙中的所有问题。作者明确指出,旧的方法——例如仅仅复制机器人的动作(模仿学习),或者试图在没有“距离测量仪”的情况下学习奖励函数——在任务发生微小变化时会表现得很糟糕。他们还澄清,这个系统仍然需要进行在线练习——它不是一种无需任何试错就能立即生效的魔法。

论文建议,这种方法是处理现实世界“混乱性”的一种强大方式,因为在现实中,事物很少会保持完全不变。虽然结果是基于计算机模拟(如迷宫和积木任务),但作者证明了他们的方法足够鲁棒,能够处理显著的变化(如不同的起始位置或物体形状),而不需要为每一个新场景都准备海量的新数据。

简而言之,这篇论文为机器人提供了一种成为“好奇学生”的新途径:它们不仅死记硬背一个教训,还从整个相关学科的库中学习,并内置了一个指南针,以便在迷失方向时找到回家的路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →