← 最新论文
🤖 machine learning

Transformers Provably Learn to Internalize Chain-of-Thought

本文首次提供了理论证明,表明采用新颖的 Log-ICoT 课程训练的多层 Transformer 能够以多项式样本效率和的对数训练阶段可证明地学习kk-奇偶性问题,从而在实现显式思维链推理的样本效率的同时,通过内化的中间步骤消除了其推理开销。

原作者: Yixiao Huang, Hanlin Zhu, Zixuan Wang, Jiantao Jiao, Stuart Russell, Somayeh Sojoudi, Song Mei

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Yixiao Huang, Hanlin Zhu, Zixuan Wang, Jiantao Jiao, Stuart Russell, Somayeh Sojoudi, Song Mei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《Transformer 可证明地学会内化思维链》的通俗解释,辅以类比说明。

核心难题:大声思考太慢

想象你正在尝试解决一个极其棘手的数学谜题。

  • 旧方法(显式思维链): 你在纸上写下每一个步骤以得出答案。这有助于你得到正确答案(非常准确),但耗时很长,因为你必须在说出最终结果之前写下每一步。在人工智能术语中,这被称为“显式推理”,它导致计算机运行缓慢且成本高昂。
  • 目标: 我们希望人工智能在“脑海”(即其隐藏状态)中进行思考,从而能够瞬间直接输出答案,而无需写下步骤。这被称为隐式思维链(ICoT)

挑战:如何教会人工智能“静默思考”

研究人员试图通过逐步从训练数据中移除“思考步骤”来教会人工智能这样做。

  • 标准方法: 想象你在教一名学生解谜题。你首先向他们展示完整的解决方案。然后,你隐藏一个步骤。接着隐藏两个步骤。然后隐藏三个。你持续这样做,一次隐藏一步,直到他们必须在脑海中解决整个问题。
  • 问题: 如果谜题有 1,000 个步骤,这种方法需要 1,000 次训练会话。这太慢且效率太低。

解决方案:Log-ICoT(“几何”捷径)

本文作者提出了一种更聪明的训练人工智能的方法,称为Log-ICoT

他们不是逐个隐藏步骤,而是以几何块的方式隐藏(每次隐藏的数量翻倍)。

  • 类比: 想象你在教一名学生攀登一个 16 级的梯子。
    • 标准方法: 你遮住第 1 级,然后第 2 级,然后第 3 级……一直遮到第 16 级。(需要 16 次训练会话)。
    • Log-ICoT 方法:
      • 第 1 次会话:展示全部 16 级。
      • 第 2 次会话:遮住底部 8 级。(学生必须在脑海中推算出下半部分)。
      • 第 3 次会话:遮住底部 12 级。
      • 第 4 次会话:遮住底部 14 级。
      • 第 5 次会话:遮住底部 15 级。
    • 结果: 你只需要5 次会话(因为 25=322^5 = 32,足以覆盖 16),而不是 16 次。论文从数学上证明,这种“几何”方法既快又同样有效。

实验:“奇偶性”游戏

为了证明这行之有效,研究人员使用了一个经典的逻辑游戏,称为k-奇偶性(k-Parity)

  • 游戏: 你得到一串数字(1 和 -1)。你需要找出其中的一组秘密数字并将它们相乘。如果结果是 1,答案为“是”;如果是 -1,答案为“否”。
  • 为何困难: 在没有帮助的情况下,这对计算机来说极难快速学习。这就像试图在一堆不断改变形状的干草堆中寻找一根针。
  • 树状结构: 研究人员意识到这个问题看起来像一棵家谱树。要解决大问题,你首先解决两个小问题,然后将它们的答案结合起来解决下一级,依此类推。

人工智能如何学习(“门控”架构)

本文介绍了一种构建人工智能(Transformer)的具体方式,以使这种学习成为可能。他们使用了三个关键技巧:

  1. “门控”门: 想象人工智能有许多层房间。通常,信息自由流动,但有时会变得浑浊或混乱(这被称为“表示崩溃”)。作者在房间之间的门上安装了“门”。这些门被预设为仅在特定时间允许特定信息通过。这就像一名保安,只允许谜题的“下半部分”进入第一个房间,而将“上半部分”送入第二个房间,防止房间之间产生混淆。
  2. “因果”掩码: 这是一条规则,规定“你只能查看过去的信息,不能查看未来的信息”。在他们的特定设置中,他们调整了这条规则,使人工智能只查看解决当前谜题所需的特定“子”节点,而忽略其他所有内容。
  3. 整数舍入: 在每个训练步骤之后,他们强制人工智能的内部数字变为整数(舍去小数)。这就像一个“冻结”按钮。一旦人工智能的某一层学会了谜题的一部分,舍入就会将该知识锁定,防止其在人工智能学习下一个更难的部分时受到干扰。

结果

论文从数学上证明:

  1. 速度: 使用他们新的Log-ICoT方法,人工智能学习复杂谜题所需的步数随谜题规模的增长非常缓慢(呈对数级增长)。
  2. 效率: 人工智能的学习效果与在纸上展示所有步骤(显式 CoT)时一样好,但它学会了在“脑海”(隐藏状态)中完成这一过程。
  3. 推理: 一旦训练完成,人工智能可以在单次前向传递中瞬间解决谜题,而无需生成长长的思考令牌列表。

总结

该论文表明,我们不必在“聪明但缓慢”(写出思考过程)和“快速但愚蠢”(猜测)之间做出选择。通过以特定的结构化方式训练人工智能(按大块而非逐个隐藏步骤),并使用特殊的“门控”架构,我们可以教会人工智能内化复杂的推理。它在其层深处习得逻辑,使其能够快速解决难题,而无需承担生成长思维链的沉重代价。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →