← 最新论文
💻 computer science

Efficient Lookahead Encoding and Abstracted Width for Learning General Policies in Classical Planning

本文提出了一种高效的全局编码与抽象IW(1)方法,该方法利用关系图神经网络克服广义规划中的可扩展性与表达性局限,在IPC 2023基准测试中超越包括经典规划器LAMA在内的先前方法,实现了最先进的性能。

原作者: Michael Aichmüller, Simon Ståhlberg, Martin Funkquist, Hector Geffner

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael Aichmüller, Simon Ståhlberg, Martin Funkquist, Hector Geffner

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人解决一个巨大且不断变化的迷宫。这个迷宫每次你玩的时候都会改变:有时有 10 个房间,有时有 10,000 个。目标是教会机器人掌握一本单一的“规则手册”(即策略),使其能够适用于迷宫的任何版本,无论其规模变得多大。

本文提出了一种教导该机器人的新方法,解决了以往方法所面临的两大主要障碍:内存过载思考缓慢

以下是他们解决方案的分解,使用了简单的类比:

1. 问题所在:“巴别图书馆”

过去,当机器人试图规划下一步行动时,它会逐一查看每一个可能的未来步骤。

  • 旧方法:想象你身处一个拥有一百万本书的图书馆。为了决定下一本读哪本书,你必须走到每一本书前,阅读第一页,记下笔记,然后再走回去。如果你有 1,000 本书,那就需要走 1,000 趟;如果你有 100 万本书,你永远无法完成。
  • 局限性:随着“迷宫”(即规划问题)变大,“书籍”(即可能的移动)的数量会呈爆炸式增长。以往的 AI 方法会耗尽计算机内存,或者思考时间过长,尤其是当对象数量(如方块或汽车)达到近期竞赛中常见的数千个时。

2. 第一项创新:“增量快照”(聚合增量编码)

作者们意识到,他们不需要每次都重读整本图书馆。他们只需要知道什么发生了变化

  • 类比:与其每次移动一本书时都拍摄整个图书馆的照片,不如只贴一张小小的“便利贴”,上面写着:“书 A 从第 1 层书架移到了第 2 层书架。”
  • 工作原理:这种新方法称为聚合增量(AD),它将机器人的规划树视为一张单一的、相互连接的地图。它不再将每一个未来状态作为单独的、沉重的图像进行处理,而是仅编码当前状态与下一个状态之间的差异(即“增量”)。
  • 结果:机器人可以一眼(即一次“前向传播”)审视整个可能性地图,而不是逐一检查。这将所需的内存减少了 10 倍以上,使机器人能够处理以前会导致计算机崩溃的庞大问题。

3. 第二项创新:“模糊镜头”(抽象宽度)

即使有了新的内存技巧,机器人仍然需要检查某个特定移动是否是“新”的或“新颖”的。在一个拥有数千个对象的世界里,检查每一个具体的细节非常缓慢。

  • 类比:想象你在停车场寻找一辆特定的红色汽车。
    • 旧方法:你逐一检查每辆车:“这是红色的福特吗?这是红色的丰田吗?这是红色的本田吗?”
    • 新方法(抽象 IW):你戴上了一副“模糊镜头”。你不再检查具体的车型。相反,你只问:“这里有红色汽车吗?”你将所有红色汽车视为同一种“类型”的对象。
  • 工作原理:他们引入了抽象 IW(AIW)。在检查一个移动是否为新时,AI 会忽略对象的具体身份(如“方块 #452"),而只关注它们的通用类型(如“方块”)。
  • 结果:这将一个随对象数量呈指数级增长的搜索,转变为一个呈线性增长的搜索。这就像检查 100 种汽车类型的列表,而不是 10,000 辆单独的汽车。这要快得多,但它仍然能找到解决谜题所需的“子目标”。

4. 成果:超级规划器

通过结合“便利贴”内存技巧与“模糊镜头”思维方式,作者们创造了一个规划器,它能够:

  • 扩展规模:它可以解决包含数百个对象的问题(例如一个由 488 个方块组成的塔),而这些问题曾让以往的 AI 束手无策。
  • 超越最佳:在 2023 年国际规划竞赛(AI 规划器的主要测试)中,他们的方法击败了之前的冠军,包括一个非常强大的经典规划器 LAMA。
  • 处理高难谜题:它解决了复杂的领域(如“卫星”和“漫游车”),这些领域所需的逻辑比大多数 AI 模型通常能处理的要高级得多。

总结

这篇论文是关于教导 AI 停止试图记忆一个巨大且变化世界中的每一个单一细节。相反,它教导 AI:

  1. 只记住变化的部分(节省海量内存)。
  2. 将相似事物归为一类(通过忽略不必要的细节来加快思考速度)。

其结果是一种通用的策略,能够高效地导航巨大而复杂的迷宫,解决以前计算机无法处理的庞大问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →