← 最新论文
🤖 machine learning

Barriers to Universal Reasoning With Transformers (And How to Overcome Them)

本文表明,尽管标准思维链 Transformer 因在复制和检索方面的固有局限而无法泛化到更长的推理轨迹,但通过采用不断增长的词汇表,结合独特的路标标记和值变化编码来克服这些障碍,它们能够实现具有长度泛化能力的图灵完备性。

原作者: Oliver Kraus, Yash Sarrof, Yuekun Yao, Alexander Koller, Michael Hahn

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Oliver Kraus, Yash Sarrof, Yuekun Yao, Alexander Koller, Michael Hahn

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《Transformer 通用推理的障碍(及如何克服它们)》的通俗解释,辅以生动的类比。

宏观图景:那个会“遗忘”的“优等生”

想象一位非常聪明的学生(即Transformer)正在学习解决复杂的谜题。为了帮助他们,老师给他们提供了一块“草稿纸”,让他们可以一步步写下思考过程。这被称为思维链(Chain-of-Thought, CoT)

先前的研究表明,有了这块草稿纸,这位学生在理论上可以解决任何谜题,无论其多么困难。这就像赋予了他们一种超能力。

然而,本文的作者发现了一个重大缺陷:这位学生擅长解决他们练习过的谜题,但当谜题变长时,他们会彻底失败。 如果你让他们训练解决一个 10 步的谜题,他们甚至无法解决一个 20 步的谜题,即使逻辑完全相同。他们似乎撞上了一道“天花板”,导致其推理能力崩溃。

本文提出了一个问题:为什么会发生这种情况,我们能修复它吗?


两大障碍

作者发现,这位学生的“大脑”(即 Transformer)存在两个特定的“故障”,阻碍了他们将能力泛化到更长的任务中。

1. “复印机”故障(重复复制)

想象这位学生需要从一本书中把一长串指令抄写到草稿纸上。

  • 问题所在: 如果列表很短,他们可以轻松抄写。但如果列表很长,他们就会感到困惑。他们无法可靠地从长页面的中间找到确切需要复制的那一行,从而迷失方向。
  • 论文观点: 标准的 Transformer 难以在长度变化时“复制”任意的信息字符串。他们会在文本中间迷失。

2. “最后所见”故障(检索)

想象这位学生正在追踪一个变量,比如"X 的值”。

  • 问题所在: 如果学生写下"X = 5",随后写下"X = 7",接着又写下"X = 5",他们需要知道当前的值是多少。在长长的思维链中,学生往往会忘记哪个"5"是最近出现的。他们可能会抓取页面开头那个旧的"5",而不是新的那个。
  • 论文观点: 模型难以在漫长的变更历史中找到最新的更新。这就像试图在一本有 1000 页条目的日记中,找出你最后一次吃苹果的时间。

解决方案:书写草稿纸的新方法

作者提出了两个巧妙的技巧来修复这些故障。他们并没有改变学生的“大脑”,只是改变了如何在草稿纸上书写指令

技巧一:“姓名标签”(路标标记)

为了解决复印机故障,作者建议给谜题中的每个项目分配一张独特的 ID 卡或“姓名标签”。

  • 工作原理: 指令不再是“去第 50 行”,而是“去带有姓名标签 #42 的项目”。
  • 为何有效: 即使列表变长,学生也不必通过数数来找到第 50 行。他们只需寻找特定的姓名标签。这就像拥有一个图书馆,每本书都有唯一的条形码,因此你无需扫描整个书架就能找到你需要的那一本。

技巧二:“变更日志”(值变更编码)

为了解决最后所见故障,作者建议改变学生写下内容的方式

  • 旧方法: 学生每次都写下完整的当前状态(例如"X 是 5",然后"X 是 7",接着"X 是 5")。这会产生大量噪音,让人难以分辨哪个是最新的。
  • 新方法: 学生只写下发生了什么变化
    • 与其写"X 是 7",不如写"X 从 5 变成了 7"。
    • 与其再次写"X 是 5",不如写"X 从 7 变成了 5"。
  • 为何有效: 为了找到当前值,学生只需计算变更次数。如果他们看到“从 5 到 7",接着看到“从 7 到 5",他们就知道当前值是 5。这就像记录交易账本,而不是每次花掉一美元时都重写你的整个银行余额。

结果:理论与现实

论文通过两种方式测试了这些想法:

  1. 数学证明(理论):

    • 坏消息: 如果你坚持使用固定的词汇集(有限字母表)和标准的书写风格,这位学生无法学会解决超过特定复杂度的谜题(具体来说,他们无法超越称为TC0的一类问题)。他们在数学上被卡住了。
    • 好消息: 如果你允许学生使用无限供应的独特姓名标签(路标),并采用“变更日志”方法,那么他们在理论上可以解决任何谜题,无论其长度如何。
  2. 实验(现实):

    • 作者从头开始训练小型计算机模型,以应对三项高难度任务:
      • 奇偶校验(Parity): 计算一串数字中 1 的数量是奇数还是偶数。
      • 布尔求值(Boolean Evaluation): 解决复杂的逻辑谜题(真/假)。
      • S5 排列(S5 Permutation): 追踪 5 个物体被交换移动的过程。
    • 结果:
      • 使用标准方法训练的模型,在谜题变长时失败了。
      • 使用姓名标签变更日志训练的模型,在解决从未见过的更长谜题时表现要好得多。
    • 他们还在大型预训练 AI 模型(如 Llama 和 Mistral)上测试了这一点。即使不重新训练这些模型,仅仅提示它们在回答中使用姓名标签和变更日志,也能显著提高它们解决长难问题的能力。

核心启示

论文得出结论:思维链并非魔法。 如果 AI 的思考方式容易在长列表中迷失,那么仅仅告诉 AI“一步步思考”是不够的。

为了让 AI 在长期推理中真正可靠,我们需要以避开两大陷阱的方式来格式化“思考”:

  1. 给每一步分配独特的姓名标签,以防任何内容丢失。
  2. 仅记录变更,以免模型被旧信息混淆。

通过修复推理的格式,我们可以帮助 AI 模型突破当前的限制,解决更困难的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →