← 最新论文
🤖 machine learning

Goal-Conditioned Agents that Learn Everything All at Once

本文介绍了“一次性学习一切”(LEO)方法,该方法通过在目标条件强化学习中联合输出所有目标的价值与动作,实现高效、并行的全目标离线策略更新,从而相较于传统重标记技术取得显著的性能提升与巨大的加速效果。

原作者: Michael Matthews, Matthew Jackson, Michael Beukman, Thomas Foster, Alistair Letcher, Scott Fujimoto, Cédric Colas, Jakob Foerster

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael Matthews, Matthew Jackson, Michael Beukman, Thomas Foster, Alistair Letcher, Scott Fujimoto, Cédric Colas, Jakob Foerster

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人在一个巨大且不断变化的迷宫中导航。在旧的方法(称为基于目标的条件强化学习)中,你会给机器人一个具体的指令,比如“去厨房”。机器人会四处游荡,撞墙,最终也许能找到厨房。

当机器人完成任务后,老师会查看它走过的路径。如果机器人被指示去厨房,却在途中不小心经过了图书馆,旧方法会说:“图书馆那部分是错误的;把它扔掉。我们只关心厨房。”

问题所在: 这是对信息的浪费!机器人在寻找厨房的过程中学到了很多关于图书馆的知识。通过丢弃这些数据,如果你以后让它去图书馆,它就必须重新学习。

旧的“修复”方案(事后经验回放):
此前,研究人员试图通过查看机器人的路径来修复这个问题,并说:“哦,它最终到了图书馆!让我们假装我们一直就想让它去图书馆。”这有所帮助,但这就像在看完一部电影后试图重新标记整部电影。这很慢,而且你一次只能针对几个不同的结局这样做。

新解决方案:“一次性学习所有事物”(LEO)
本文的作者提出了一种更聪明的方法。他们不是让机器人一次学习一个目标,而是构建了一个“超级大脑”,能够同时学习每一个可能的目标

这就像一位正在烹饪盛大宴会的厨师。

  • 旧方法: 厨师做一道菜(厨房),品尝它,扔掉关于如何切洋葱的笔记,然后重新开始做下一道菜(图书馆)。
  • LEO 方法: 厨师一次性完成整个宴会的烹饪。他们有一块巨大的板子,上面写着 512 种不同的食谱(目标)。当他们切洋葱时,他们会立即同时更新所有 512 种食谱的知识。他们会意识到:“嘿,切洋葱对汤、炖菜和沙拉都有用!”

技术原理(但很简单):
通常,一个计算机网络会问:“对于这个特定的目标,最好的动作是什么?”
LEO 改变了网络,使其现在问:“对于每一个目标,此刻最好的动作是什么?”它一次性输出针对所有可能目的地的巨大答案列表。这使得学习变得极其迅速(比旧的“重新标记”方法快 250 倍以上),因为机器人不需要重复经历同一段旅程数百次。

潜在问题:“晚期融合”问题
作者发现了一个小缺陷。因为机器人必须同时思考所有目标,它有时会感到困惑。这就像一个学生试图在同一时刻为 500 场不同的考试学习。他们可能会对材料有一个总体的感觉,但在回答特定问题时,可能不如只专攻那一门考试的学生敏锐。

在论文中,这意味着 LEO 在解决困难、复杂的目标方面表现出色,但在简单目标上有时表现较差,因为它“稀释”了它的专注力。

终极修复方案:“双重 LEO"(教师 - 学生系统)
为了解决这个问题,作者组建了一个团队:

  1. 教师(LEO): 这个网络是“数据海绵”。它学习关于一切的一切,即使有点杂乱无章。它提供了一张粗略的世界地图。
  2. 学生(标准网络): 这个网络是专家。它只专注于你当前要求它执行的具体目标。

教师对学生说:“嘿,我知道去图书馆的大致方向,即使我不完美。这是一个提示。”学生接受这个提示并将其完善,从而成为到达图书馆的专家。

结果
团队在一个名为Craftax(有点像 Minecraft)的复杂视频游戏以及一些机器人移动任务上测试了这种方法。

  • 在拥有 512 个不同目标的大型、困难版本游戏中,新的双重 LEO方法无疑是赢家,击败了所有其他方法。
  • 它学习速度快得多,并且能够处理其他方法放弃的大量任务。
  • 他们还证明了这也适用于连续运动(如机械臂的平滑移动),而不仅仅是视频游戏中的步骤。

总结
本文介绍了一种方法,让 AI 能够同时学习解决所有可能的问题,而不是一次一个。当它变得过于宽泛而失去焦点时,他们将其与一个专门利用广泛知识作为指导的“学生”网络配对。这使得机器人和游戏 AI 能够比以前更快、更高效地学习海量信息。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →