← 最新论文
💻 computer science

Neurosymbolic Reasoning with Incremental Knowledge for Sample Efficient Hierarchical Reinforcement Learning

本文提出了一种神经符号分层强化学习框架,该框架集成了增量知识(InK)与信念世界树搜索,以实现可更新的符号规划和奖励塑造的神经学习,从而显著提高了在稀疏奖励、长时程导航任务中的样本效率。

原作者: Subrat Prasad Panda, Blaise Genest, Arvind Easwaran

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Subrat Prasad Panda, Blaise Genest, Arvind Easwaran

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人如何在巨大的、不断变化的迷宫中导航。在人工智能领域,这是一个经典的挑战,被称为强化学习(Reinforcement Learning, RL)。这就像训练一只狗:当它做得对时,你给它奖励(零食),它就会学会重复那个动作。但问题在于:如果迷宫非常巨大,而零食藏得非常远,这只狗可能会徘徊一百万年,才偶然发现那条路径。这就是“样本效率”(sample efficiency)问题——AI 需要多少次尝试才能学会?

为了解决这个问题,科学家经常使用“分层强化学习”(Hierarchical Reinforcement Learning, HRL)。与其让机器人试图一次性搞定每一个细微步骤,不如给它一个“老板”和一个“工人”。老板(高层规划器)决定大目标,比如“去厨房”;而工人(底层控制器)则负责研究如何实现目标的微小肌肉运动。通常情况下,老板是一个僵化的、预先编程好的地图,永远不会改变。但如果迷宫里有只有撞上去才会出现的隐形墙壁呢?一个僵化的老板会不断尝试撞向刚刚出现的墙壁,从而浪费时间。这篇论文探索了一种更聪明的方法:一种在移动过程中学习地图的机器人,根据工人发现的情况实时更新老板的地图。


这篇论文的核心思想:一个边走边学的机器人

作者 Subrat Prasad Panda 及其团队提出了一种名为 神经符号增量知识强化学习(Neurosymbolic HRL with Incremental Knowledge, InK) 的新系统。让我们来拆解这个名字:“神经符号”(Neurosymbolic)意味着他们混合了两种类型的“大脑”。“神经”部分是一个灵活的学习大脑(类似于处理物理运动的深度学习神经网络);“符号”部分是一个逻辑性的、基于规则的大脑(类似于思考棋局的棋手),负责处理规划。

在传统系统中,逻辑大脑会在机器人开始移动之前构建一张完美的地图。这就像是在离开家之前,试图背下整个伦敦地铁图。如果某条线路关闭或新开了一个车站,你的地图就失效了,除非你重新开始。作者认为这是低效的。相反,他们的机器人使用的是 增量知识(InK)。它从一张白纸或一个粗略的猜测开始。随着“工人”机器人尝试移动并撞到墙壁时,它会告诉“老板”:“嘿,这里有一堵墙!”老板会立即更新其地图并重新计算最佳路径。这就像拥有一个能在你遇到交通拥堵的瞬间就更新路线的 GPS,而不是在等待新地图打印出来时原地踏步。

“信念世界”与树搜索

论文引入了一个巧妙的技巧来处理不确定性。想象你在一个黑暗的房间里,你知道某个地方恰好有一堵墙,但不知道具体在哪。你可以猜它在左边,或者右边,或者中间。机器人并不仅仅做一个猜测;它维持着一个“信念集”(belief set)——一个记录所有可能存在该墙壁的世界的心理清单。

为了在这些不确定性的迷雾中做出决策,作者开发了一种名为 信念世界树搜索(Belief World Tree Search, BWTS) 的算法。想象你的脑海中生长着一棵巨大的树。树干是你的当前位置。每当你需要选择一个方向时,树就会分叉。但转折在于:BWTS 不仅仅是猜测一条路径,它会同时模拟成千上万种可能的未来。它会问:“如果墙在这里,最好的移动是什么?如果墙在那里,最好的移动又是什么?”然后,它会选择在所有这些可能性中表现最平均(最优)的移动方式。

论文明确反对使用标准的“随机”猜测方法(例如一些旧算法只是通过掷骰子来决定行动)。作者发现,在迷宫中进行随机猜测往往会导致机器人在原地打转,浪费时间。相反,BWTS 使用“策略性展开”(strategic rollouts)——它利用智能的、预设的策略(例如“如果撞墙,总是向左扫过”)来模拟路径,从而在不迷路的情况下快速找到最佳路线。

研究结果:速度与智慧

团队在计算机模拟的迷宫中测试了他们的想法,范围从简单的网格到复杂的 3D 环境(其中包含一个拥有许多关节的虚拟“蚂蚁”机器人)。

  1. 巨大的速度提升: 与旧有的“先构建地图”的方法(在论文中称为 RGL)相比,新的 InK 方法在学习速度上快得惊人。在一个“四房间”(Four Rooms)迷宫中,旧方法需要大约 2,080 步 才能从头开始首次到达目标;而新的 InK 方法仅需 64.9 步。这大约减少了 30 到 100 倍 的尝试次数。
  2. 时间节省: 时间上的差异更为显著。旧方法需要超过 96 秒 才能摸索出第一条路径,而新方法仅用了 0.02 秒
  3. 先验知识的力量: 当机器人被给予关于世界的提示(例如“那里有一堵墙,但我不知道在哪”)时,BWTS 算法表现出色。在这种情况下,它使用的样本量(尝试次数)比标准规划器少了 一半,尽管它在进行复杂数学运算时耗费了更多的计算机时间。
  4. 复杂环境: 该系统甚至能在“蚂蚁迷宫 U 型室”(Ant-Maze U-Room)这种具有 29 个维度 运动的高维挑战中运行。旧方法需要大约 10,000 步 来构建地图,而新方法在约 1,507 步 内(使用 BWTS 规划器时甚至只需 1,134 步)就达到了目标。

他们没发现什么(以及他们拒绝了什么)

论文谨慎地说明了在这种特定设置下哪些方法并不奏效。他们测试了一种名为 BAMCP 的流行算法,该算法试图通过假设迷宫的每个部分都是独立的(例如假设厨房里的墙与卧室里的墙无关)来处理不确定性。作者发现,这种方法在他们的迷宫测试中表现糟糕。因为墙壁在结构上是相互关联的(如果这里有一堵墙,那么那里就不可能有墙),这种独立性假设导致了错误的决策并浪费了时间。在平均 28 到 40 步 处,BAMCP 表现不如新方法(新方法为 21 到 23 步),且运行速度更慢。

作者还指出,虽然他们的方法更快,但 BWTS 算法的计算量很大。如果你没有任何关于世界的先验知识,那么更简单的 “D*” 规划器(一种标准的增量规划器)实际上更快且足够好用。只有当你拥有可以利用的特定结构化提示时,才需要使用高级的 BWTS 树搜索。

总结

这篇论文表明,通过将灵活的学习大脑与能够实时更新地图的逻辑规划器相结合,机器人可以比以往更快地学习如何导航复杂的未知世界。他们不仅仅是在模拟一个机器人,他们还证明了在这些特定的迷宫场景中,新方法始终优于旧有的“先学完一切再行动”的方法,节省了大量的资源和时间。这是迈向让机器人能够探索新房子、学习家具位置并找到厨房,而无需为每个房间都准备一份手册的一大步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →