← 最新论文
🤖 machine learning

Planning with Transformers: Chain of Computation and Structured Context Windows

本文引入了计算链(Chain of Computation, COC),该框架将基于 Transformer 的语言模型集成到一个与结构化上下文窗口(Structured Context Window, SCW)构成的迭代循环中,旨在弥合理论上的图灵完备性与经验规划性能之间的差距,通过专门的上下文管理和算术支持,使小型模型能够在诸如 BlocksWorld 和汉诺塔(Tower of Hanoi)等复杂规划任务上实现近乎完美的成功。

原作者: Ehsan Futuhi, Nathan R. Sturtevant

发布于 2026-07-21
📖 2 分钟阅读☕ 轻松阅读

原作者: Ehsan Futuhi, Nathan R. Sturtevant

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个聪明但有点健忘的机器人如何解决一个复杂的谜题。你可能会认为,如果你给机器人一个超级聪明的大脑(大语言模型,简称 LLM),并要求它“自己去搞定”,它就会成功。但在人工智能的世界里,这些模型更像是出色的模式匹配器,当被要求规划一段长期的、多步骤的旅程时,它们有时会显得力不从心。它们擅长写故事或聊天,但面对严格的逻辑谜题——比如移动方块或解决汉诺塔问题——它们经常会迷失方向,忘记规则或刚刚采取的步骤。这是一个大问题,因为如果我们希望 AI 能帮助我们处理现实世界的任务,比如组织仓库或引导机器人导航,它就需要能够在不犯低级错误的情况下进行前瞻性规划。研究人员一直在问一个核心问题:是 AI 真的太笨了无法进行规划,还是它只是在使用错误的工具?

这篇论文提出,AI 并不一定是笨,它只是试图一次性做太多事情。作者 Ehsan Futuhi 和 Nathan R. Sturtevant 提出了一种被称为“计算链”(Chain of Computation, COC)的新思维方式。与其要求 AI 用一口气写出整个解决方案(这就像要求人类一次性记住一整本书),不如将 AI 置于一个循环中,并配备一个特殊的“便签本”,称为“结构化上下文窗口”(Structured Context Window, SCW)。把这想象成一个带着便签本的机器人。它不需要记住整个计划,而是看一眼便签上的一个指令,执行那一个小步骤,然后在便签上写下下一个指令,并指向下一个指令的位置。这就像是一个“跟着领头人走”的游戏,机器人既是领头人又是跟随者,不断更新自己的地图。

研究人员在三个经典谜题上测试了这个想法:汉诺塔(在柱子间移动圆盘)、BlocksWorld(堆叠方块)和煎饼问题(通过翻转来排序煎饼)。他们发现,当给 AI 这个“便签本”系统时,即使是完全从头训练的相对较小的 AI 模型,也能以惊人的准确率解决这些谜题——在方块和煎饼问题上的成功率超过 99.89%。这个神奇的技巧在于,AI 不需要记住整个历史;它只需要读取当前的指令,通过计算得出下一步,然后写下下一步该看向哪里。

然而,论文也发现了一个特定的弱点。当谜题变得非常大时(比如有很多圆盘的汉诺塔),AI 开始出错,但这并不是因为它忘记了计划。事实证明,AI 是被简单的数学题难住了。当机器人需要计算“圆盘编号 7 减 1”来确定下一步时,它有时会算错数字,尤其是当它从未见过那个特定数字时。作者展示了,如果通过帮 AI 完成数学计算(或者使用一种不需要复杂数学的特殊“栈”系统),AI 甚至可以完美解决最难版本的汉诺塔(多达 20 个圆盘)。这表明 AI 的规划大脑其实相当强大,但它需要一些关于算术和内存管理的帮助,才能发挥其全部潜力。

大局观:为什么 AI 在规划方面表现挣扎

要理解这篇论文的重要性,我们首先需要了解这两个主要角色:大语言模型(LLMs)规划(Planning)

LLMs 是你可能听说过的超聪明 AI 大脑,比如那些写文章或写代码的模型。它们在海量文本上进行训练,学习预测句子中的下一个词。因为读过的东西很多,它们非常擅长识别模式。如果你让它们写一个关于龙的故事,它们可以做到,因为它们见过成千上0个龙的故事。然而,“规划”是另一回事。规划就像解迷宫或组织旅行:你必须思考好几步,记住你做了什么,并确保你没有违反规则。

长期以来,科学家们注意到,虽然 LLMs 擅长聊天,但在规划方面却表现得很糟糕。如果你要求一个 LLM 在不掉落任何方块的情况下将一叠方块从一个地方移动到另一个地方,它往往会给出一个违反规则或遗漏步骤的计划。这令人沮丧,因为我们希望 AI 在现实世界中发挥作用,而在现实世界中,事情必须按正确的顺序完成。

有一种理论认为 LLMs 实际上是“图灵完备的”,这是一个高级数学术语,意思是它们应该能够完成任何计算机能做的计算,包括复杂的规划。但在实践中,它们似乎失败了。这篇论文探讨的核心问题是:为什么? 是 AI 的大脑在规划方面本质上有缺陷,还是仅仅因为我们要求它做事的方式不对?

问题所在:“单次尝试”陷阱

想象你在尝试玩魔方。如果有人要求你在不停止思考的情况下,用一个单一的句子写出整个解法(即 20 或 30 步的序列),你可能会出错。你可能会忘记中间步骤或弄混颜色。

这就是当我们要求标准 LLM 进行规划时发生的情况。我们通常给它一个提示词,比如“解决这个谜题”,它会尝试一次性生成整个动作列表。论文称之为“单次通过,全上下文”(Single-Pass, Full Context)。问题在于,随着谜题变大,动作列表也会变长。AI 必须同时在它的“脑海中”(上下文窗口)保留所有这些动作。随着列表增长,AI 开始失去掌控。这就像是在一边和朋友交谈的同时,还要同时记住购物清单、电话号码和一个数学题。最终,AI 会感到困惑,在早期出错,然后整个计划就会崩溃。

作者认为,AI 并不是不擅长规划;它只是不擅长在脑海中持有一个巨大且无序的指令列表。

解决方案:“计算链”(COC)

为了解决这个问题,作者构建了一个名为**计算链(COC)**的新系统。他们不再要求 AI 一次性写出整个计划,而是将 AI 置于一个循环中。

想象 AI 是一个在工厂工作的机器人。你不是给机器人一份巨大的整个工厂的蓝图,而是给它一个结构化上下文窗口(SCW)。把 SCW 想象成一卷很长的纸带,就像旧电脑使用的纸带或一张很长的便签纸。

以下是机器人在这个新系统下的工作方式:

  1. 读取: 机器人查看纸带上的第一条指令。
  2. 思考: 它根据那一条指令计算下一步该做什么。
  3. 写入: 它在纸带末尾写下一条新指令。
  4. 指向: 它写下一个“指针”(就像一个箭头),说:“去查看这条指令之后的下一条指令。”
  5. 重复: 机器人将“眼睛”移向新的指令,并再次执行。

机器人永远不需要记住整个计划。它只需要专注于当前的指令,并决定下一步该做什么。这就像是一个“跟着领头人走”的游戏,机器人不断为自己更新地图。

论文引入了一个特殊的工具——指针。这个指针告诉机器人下一步应该看纸带的哪个部分。这至关重要,因为它让机器人的“注意力”集中在一个小而可控的信息块上,而不是淹没在海量的文本中。

实验:测试机器人

作者在三个著名的谜题上测试了这个新机器人,以观察它是否能更好地学习规划。

1. BlocksWorld
这是一个谜题,你有一堆方块堆在桌子上,你需要将它们重新排列成特定的形状。你只能移动堆叠顶部的方块。

  • 结果: 机器人在这个任务上表现得极其出色。即使谜题变得非常复杂(有 40 个方块),机器人的成功率依然是完美的 100%。它学会了“拆除所有堆叠,然后重新堆叠”的策略,并能将其应用于它从未见过的任何新方块排列。

2. 煎饼问题
在这个谜题中,你有一叠大小不一的煎饼。你只能翻转堆叠的顶部部分(就像在平底锅里翻转煎饼一样)来重新排序。目标是按大小排序。

  • 结果: 与 BlocksWorld 类似,机器人的表现也非常出色。它几乎解决了所有的谜题,即使是有 40 个煎饼。它唯一“失败”的情况是当煎饼已经排好序时,它仍然尝试去翻转它们。但由于翻转后再翻转回来并不会破坏最终结果,所以它最终还是达到了目标。这表明机器人已经掌握了该谜题的核心逻辑。

3. 汉诺塔 (TOH)
这是最难的谜题。你有三个柱子和一叠大小不一的圆盘。你必须把整个堆叠从一个柱子移动到另一个柱子,但你绝不能把大圆盘放在小圆盘上面。所需的移动次数呈指数级增长(变得非常庞大)。

  • 结果: 在这里,机器人表现不错,但并不完美。当圆盘数量较少(最多 15 个)时,它解决了大约 92% 的谜题。但随着谜题变得越来越难,它开始出错。

谜团:为什么机器人失败了?

作者并没有止步于“它成功了”。他们想知道机器人为什么在最难的谜题上失败了。他们仔细检查了机器人在汉诺塔问题中犯下的错误。

他们发现,机器人失败并不是因为它不懂计划。它完全知道该移动哪个圆盘以及把它放在哪里。问题在于数学

为了追踪计划,机器人必须进行简单的算术,例如“如果我有 7 个圆盘,我需要先移动顶部的 6 个”。它必须计算“7 减 1”来得到“6”。论文发现,当机器人遇到一个它从未见过的数字(比如一个非常大的圆盘编号)时,它会算错。它可能会把“7 减 1”算成“5”或“8”,然后整个计划就会偏离轨道。

这是一个重大的发现。这意味着机器人的“规划大脑”实际上运作得非常完美。失败不在于逻辑,而在于计算器。

修复方案:辅助数学与内存管理

为了证明这一点,作者尝试了两种不同的修复方法:

修复 1:符号数学 (Symbolic Math)
他们告诉机器人不要再尝试自己做数学运算。相反,他们给了它“符号化”的指令。例如,机器人不再说“移动圆盘 6”,而是说“移动圆盘 (n-1)”。然后,一个独立的、简单的计算机程序(算术模块)会进行实际的数学计算,并告诉机器人真实的数字。

  • 结果: 当他们这样做时,机器人的成功率上升了。它可以完美地解决谜题,因为它不必担心把数字算错。这证明了规划部分本身是没有问题的;瓶颈在于数学。

修复 2:栈 (PDA)
作者意识到,对于汉诺塔,机器人甚至不需要在纸带上到处跳跃寻找不同的指令。它只需要查看“栈”的顶部,并将新指令添加到顶部。这正是计算机科学中“栈”(Stack)的工作方式(后进先出,LIFO)。
他们将机器人的任务重新定义为像一个确定性下推自动机 (Deterministic Pushdown Automaton, PDA)。这是一个专门使用“栈”的机器的专业术语。

  • 结果: 使用这种新设置,机器人100% 解决了汉诺塔问题,即使是拥有 20 个圆盘(这需要超过 100 万次移动!)的情况。它不需要进行复杂的数学运算来寻找下一个指令,因为“栈”自动处理了这一切。

这意味着什么

这篇论文表明,大语言模型(LLMs)本质上并不擅长规划。问题在于我们要求它们一次性做太多事情:记住整个计划、进行数学计算并确定下一步,同时还要盯着一大片文本。

通过将任务分解为小的、迭代的步骤,并给 AI 一个用于管理内存的“便签本”(SCW),AI 可以非常有效地学习规划。论文显示,即使是从头开始训练的小型 AI 模型,如果给予正确的工具,也可以学习复杂的规划策略。

核心结论是,AI 的“推理”能力很强,但它的“算术”和“内存管理”需要帮助。如果我们将规划逻辑与数学分离,并给 AI 一个结构化的方式来管理其步骤,它就能解决那些此前被认为过于困难的问题。

作者总结道,虽然他们在这一领域取得了重大进展,但仍有许多值得探索的地方。他们希望进一步研究“指针”系统究竟是如何帮助 AI 的,以及这种方法是否可以用于未来更复杂的现实世界规划任务。但就目前而言,他们已经证明了,只要有一点结构化的辅助,AI 确实可以成为一个非常优秀的规划者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →