Recursive Value Learning for Long-Horizon Offline Goal-Conditioned RL
本文提出了 DCRL(分而治之强化学习),一种递归式的离线目标条件强化学习方法,该方法通过将轨迹分解为平衡二叉树来减少自助法深度和误差累积,从而在长时程任务上显著优于现有的扁平化和层次化基准方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,存在着一个被称为“目标条件学习”(goal-conditioned learning)的具体挑战。想象一下,你不仅是在教一个机器人走路,还要教它走向特定的椅子、特定的门或特定的灯开关,而它只能利用一系列关于其他机器人移动的过往视频库。机器人必须观察这些旧的录像,弄清楚如何从 A 点到达 B 点,然后尝试亲自实现它。这种方法对于短途旅行效果很好。如果目标只在几步之遥,机器人可以轻松地将这些点连接起来。但当旅程很长——需要数百或数千步才能到达遥远的终点时——机器人往往会迷失方向。它在试图规划终点时,难以记住路径的起点,而且由于对短步幅记忆中的微小错误不断累积,最终会导致巨大的误差。
当机器人无法通过在现实世界中进行尝试来学习时,这个问题会变得更加困难。在许多现实场景中,例如操作重型机械或在复杂的工厂中导航,犯错是过于危险或昂贵的。机器人必须完全从一个固定的过往经验数据集(这一领域被称为“离线强化学习”)中学习。研究人员早已知道,要解决长途旅行,你必须理解构成它的那些较短的片段。然而,标准的教学方法通常试图一次性学习整个旅程,或者在短片段和长片段之间随机跳跃。这种方法就像是通过随机翻阅书页来阅读一本书;机器人最终会根据一个尚未完全理解的句子来猜测一章长篇内容的含义,从而导致困惑和失败。
来自延世大学和首尔大学的研究团队提出了一种教导这些机器人的新方法,称为 DCRL。该方法不再试图一次性猜测整个路径,而是将每一次长途旅行分解为一个结构化的、循序渐进的层级体系,就像通过先掌握最小的单元,再将其组合起来,从而组织一项大型任务一样。研究人员从数据集中提取了一条长路径,并将其精确地对半拆分,然后将这些半段再次对半拆分,如此循环往复,直到达到单个步骤。接着,他们先教机器人理解这些微小的单步动作。一旦机器人对这些小步动作有了信心,它就会利用这些知识去理解稍长一点的片段,进而理解更长的片段,从而实现由底向顶的理解构建。这种“分而治之”的策略确保了机器人不会在尚未掌握构成长路径的短路径之前,就尝试学习复杂的长路线。
研究人员发现,这种结构化的方法解决了困扰以往方法的两个主要问题。首先,它防止了机器人做出过于乐观的猜测。旧的方法通常会观察许多可能的中间点,并选择看起来最好的那一个,希望能找到捷径。但由于数据有限,机器人往往会选择一个看起来不错、但实际上仅因其记忆中的错误而显得优秀的点,并基于这个错误构建整个计划。新方法通过严格遵循数据中展示的实际路径,在精确的中点进行拆分,并在不进行猜测的情况下学习该特定路线的价值,从而避免了这种情况。
在各种高难度任务(包括引导人形机器人在迷宫中导航以及解决复杂谜题)的测试中,这种新方法表现优于以往所有的方案。在他们基准测试中最具挑战性的五个长程任务中,新方法的平均成功率从 55 提高到了 64,超越了此前被认为处于领先地位的更复杂的层级系统。在一次涉及巨型迷宫中人形机器人的特定测试中,新方法达到了 93% 的成功率,而次优的方法仅达到了 79%。此外,在 CALVIN 任务中,该方法也展现了强大的能力,能够成功完成连续的四个子任务。或许最令人印象深刻的是,在处理一个需要八个独立步骤才能完成的方块任务时,该新方法是唯一能够成功完成任务的,它实现了 5% 的成功率,而所有其他方法都完全失败了。
研究人员还发现,学习的顺序与方法本身同样重要。与以往采用随机顺序学习的方法不同,DCRL 证明了“自底向上”的学习顺序是至关重要的。这项研究表明,通过尊重长途旅行对短步幅的自然依赖关系,并通过组织学习过程来反映这种依赖关系,机器人可以学习比以往更长、更复杂的路径。这项工作不仅提供了一种新算法,更提供了一种更清晰的视角,即如何扩展人工智能以处理定义现实世界的那些漫长且复杂的任务。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。