← 最新论文
💻 computer science

Abstraction for Offline Goal-Conditioned Reinforcement Learning

本文提出了一种用于离线目标条件强化学习的分层框架,该框架利用相对化选项和不同的状态表示来利用对称性和共享结构,从而实现在相似情境中的经验复用并显著提升性能。

原作者: Clarisse Wibault, Alexander Goldie, Antonio Villares, Maike Osborne, Jakob Foerster

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Clarisse Wibault, Alexander Goldie, Antonio Villares, Maike Osborne, Jakob Foerster

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何穿越一个巨大而复杂的迷宫。你有一段别人尝试解决该迷宫的视频录像,但录像很混乱。视频中的人经常卡住、走错路,或者只尝试了少数几条特定路径。这就是研究人员所称的离线强化学习:仅利用过去尝试的静态数据集来训练人工智能,而不让其通过试错在现实世界中进行探索。

问题在于,如果机器人试图将整个迷宫作为一个巨大且复杂的任务来学习,它会被视频中的糟糕部分搞糊涂。它不知道该如何处理前一个人失败的那些拐角。

这篇论文提出了一种训练机器人的新方法,称为抽象强化学习(ARL)。以下是其核心思想,通过简单的类比分解说明:

1. 问题:“绝对”陷阱

大多数机器人试图学习“绝对”指令。它们会死记硬背:“要到达那扇红门,我必须在蓝墙处左转,然后走 50 步,再右转。”

如果机器人在迷宫的不同区域看到一扇红门(也许墙壁是绿色的,或者距离不同),它就会惊慌失措。它会想:“我从未见过这种完全相同的组合!”它未能意识到,即使位置不同,左转这一动作本身是相同的。这就像一个死记硬背数学题答案的学生,一旦数字稍有变化就束手无策,因为他们没有理解概念

2. 解决方案:“相对化”选项

作者建议教机器人相对化选项。机器人不再死记硬背绝对坐标,而是学习相对指令。

  • 绝对指令:“前往坐标 (10, 20) 处的红门。”
  • 相对化指令:“前往你正前方最近的拐角。”

这就像给朋友指路。

  • 糟糕的(绝对):“走 47 步,向左转 90 度,再走 12 步。”(这只有在从完全相同的起点出发时才有效)。
  • 好的(相对):“一直走直到碰到墙,然后左转。”(无论从哪里出发都有效)。

通过学习这些“相对”子任务,机器人可以重用混乱视频中的有效部分。即使机器人在视频中只看到一个人成功通过一个拐角,它也能将那个“在拐角处左转”的技能应用到迷宫中的每一个拐角,而不仅仅是那一个特定的位置。

3. 两步策略(层级结构)

论文为机器人提出了一种双层大脑结构:

  • 老板(高层):这一层关注大局。它不在乎房间的具体细节。它只是说:“好吧,目标在那边。让我们选一个子任务,比如‘前往下一个路口’。”
  • 工人(低层):这一层处理实际移动。它听到“前往下一个路口”的指令后,会计算出到达那里的具体步骤,无论地板是地毯还是瓷砖。

创新点:论文提出了训练该系统的两种具体方法:

  1. ARLi(隐式):机器人学会自然地将对相似的动作归为一类。如果两种不同的情况都需要“左转”这一动作,机器人会自行判断它们是相似的,而无需被明确告知。
  2. ARLe(显式):机器人被强制完全忽略绝对位置。它被教导只关注当前位置与目标位置之间的差异(例如,“目标在我右侧 5 米处”)。这就像训练机器人只看到向量(箭头)而不是地图。

4. 为什么这很重要

作者在复杂任务上测试了这种方法,例如让虚拟人形机器人穿越迷宫,以及在三维空间中操作物体(如用积木解谜)。

  • 结果:在训练数据稀疏的情况下(机器人未见过太多如何解决谜题特定部分的示例),新方法(ARL)的表现显著优于旧方法。
  • 类比:想象一下,你通过观看几局棋手犯错的对局来学习下棋。标准的 AI 会卡在棋手出错的具体棋盘位置上。而新的 AI(ARL)则学习移动的原则(例如,“控制中心”,“保护国王”)。即使它从未见过完全相同的棋盘布局,它也知道如何走出好棋,因为它理解了棋子之间的相对关系。

总结

论文认为,为了利用不完美且有限的数据有效地训练机器人,我们不应强迫它们死记硬背确切的位置。相反,我们应该教它们理解相对关系(例如,“向目标移动”,“避开墙壁”)。通过将大问题分解为更小、可复用的“相对”技能,机器人能够将从混乱数据中学到的知识泛化,以解决新的、未见过的挑战。

作者将这种方法称为抽象强化学习,他们的实验表明,当机器人只有有限的练习数据可供学习时,这种方法能显著提高其解决复杂、长距离任务的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →