Learning to Search and Searching to Learn for Generalization in Planning
本文提出了一种自改进框架,该框架将关系图神经网络与搜索相结合,使深度强化学习智能体能够在稀疏奖励规划领域实现强大的零样本泛化能力,从而在不依赖搜索或专家演示的情况下解决规模显著更大的问题实例。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何解开一个复杂的谜题,比如一场巨大的推箱子(Sokoban,即把箱子推到特定位置)或积木世界(Blocksworld,即按特定顺序堆叠积木)游戏。
巨大的挑战不仅仅在于解开一个谜题;而在于教会机器人解开该谜题的任何版本,甚至是它从未见过的版本,无论箱子更多、起始位置不同,还是目标更大。这被称为泛化。
以下是论文《学习搜索与搜索学习》(Learning to Search and Searching to Learn)如何解决这一问题的简要说明:
1. 问题:在迷宫中迷失
在标准的 AI 训练(深度强化学习)中,机器人通常通过走一步、观察结果、再走一步来学习。这就像在黑暗的迷宫中用手摸索墙壁前行。
- 问题所在:在这些规划谜题中,“奖励”(找到解决方案)非常罕见。如果机器人只是随机游荡,它可能需要一百万年才能找到出口。它容易陷入死胡同或循环。
- 旧方法:一些方法试图先向机器人展示解决方案(就像老师展示答案钥匙),但这相当于作弊。另一些方法尝试从目标倒着走回来学习,但这并不总是适用于这些特定类型的逻辑谜题。
2. 解决方案:“智能地图”与“自我改进循环”
作者提出了一种名为**GSP(通用规划搜索,Generalized Search for Planning)**的新方法。与其盲目行走,他们赋予机器人两种相互辅助的超能力:
A. “智能地图”(启发式函数)
想象机器人拥有一张魔法地图(一个神经网络),它能观察当前的谜题并推测:“如果我在这里推这个箱子,离终点会有多近?”
- 这张地图不仅仅是猜测;它从经验中学习。
- 关键在于,这张地图是使用关系图神经网络构建的。想象谜题的碎片(积木、箱子)是故事中的角色。这张地图理解它们之间的关系(例如,“箱子 A 在箱子 B 的上面"),而不仅仅是将它们视为像素。这使得即使谜题变得巨大,地图也能理解规则。
B. “智能搜索”(探索者)
机器人不再一次走一步,而是使用最佳优先搜索(具体是一种名为**WA***的算法)。
- 类比:想象你在森林里寻找一只走失的狗。
- 标准强化学习(实时搜索): 你选择一条随机路径,走 10 步,检查狗是否在那里。如果没有,你回去再试另一条随机路径。你浪费了大量精力。
- GSP(最佳优先搜索): 你查看你的智能地图。它指出了 5 条最有希望的路径。你在脑海中同时探索这些路径,检查哪一条看起来最好。你只承诺走地图指出最有可能找到狗的那条路。
3. 魔法循环:“学习搜索,搜索学习”
这是核心创新。上述两部分在一个循环中相互反馈:
- 搜索以学习:机器人利用其当前不完美的智能地图,在谜题上运行智能搜索。它找到解决方案(或接近解决方案)。
- 数据:搜索过程产生了一笔宝贵的数据财富:“当我处于这种情况时,采取那个行动导致了解决方案。”
- 学习以搜索:机器人利用这些新数据来更新和改进智能地图。地图在猜测哪些移动是好的方面变得更擅长。
- 重复:现在,有了更好的地图,机器人可以更高效地搜索更困难的谜题。搜索发现更好的数据,使地图变得更聪明。
这是一个自我改进的循环:搜索教导地图,地图引导搜索。
4. 结果:解决不可能之事
论文在非常严峻的基准测试中验证了这一点:
- 积木世界:机器人在少于 30 个积木的谜题上接受训练。当在488 个积木的谜题(规模巨大跳跃)上进行测试时,它无需搜索就解决了问题。它只需查看地图就知道该做什么。这被称为“零样本泛化”。
- 推箱子与《见证者》(The Witness):它解决了近 100% 的此类复杂谜题,通常比其他顶级 AI 方法找到解决方案的速度更快(步数更少)。
- PushWorld:它处理了它从未见过的新的、更难的关卡,表现优于依赖随机探索的标准 AI。
总结
这篇论文介绍了一个系统,其中 AI 通过利用基于学习的智能地图来引导系统性搜索,从而学会解决逻辑谜题。
- 它不再盲目游荡,而是利用地图选择最佳路径。
- 它不再仅仅死记硬背一个谜题,而是学习物体之间的关系,从而能够解决任何规模的谜题。
- 搜索与学习相互促进,创造出一个机器人,它通过在旧问题上练习,就能更好地解决新的、未见过的难题。
简而言之:他们教会了 AI 停止猜测并开始规划,然后教会规划者如何从自己的规划中学习。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。