← 最新论文
💬 NLP

Mechanistic Interpretability of Chain-of-Thought Reasoning via Sequential Activation Patching

本文引入了一种序列激活补丁框架,通过追踪跨越标记位置的时间扩散效应,并通过针对性消融验证其功能重要性,来识别在大型语言模型中因果性支持思维链推理的分布式注意力头子电路。

原作者: Murat Dura, Serkan Öztürk, Selma Tekir

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Murat Dura, Serkan Öztürk, Selma Tekir

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是许多现代人工智能工具背后的引擎,能够生成类人文本、解决问题并回答问题。当这些模型面临复杂任务(例如困难的数学应用题)时,如果先要求它们写出逐步思考的过程再给出最终答案,它们的表现通常会好得多。这种被称为“思维链”(chain-of-thought)提示的技术,鼓励模型将问题分解成更小、更易于处理的部分,就像人类可能会在纸上草拟计算过程一样。然而,一个悬而未决的谜团在于:这些书写的步骤究竟是在帮助模型思考,还是仅仅是一种礼貌性的表演?目前尚不清楚模型是真的利用中间文本来引导其内部逻辑,还是仅仅在生成听起来合理的词汇,而实际上秘密地依赖于另一种隐藏的过程来得出答案。理解这一区别至关重要,因为如果模型并非真的在进行推理,那么它的解释可能会具有误导性,其在关键情况下的可靠性也将值得怀疑。

为了解开这个谜团,伊兹密尔理工大学(İzmir Institute of Technology)的研究人员决定在模型工作时观察其内部的“大脑”。他们专注于一种被称为“Transformer”的特定人工智能类型,这种模型通过一个庞大的互联路径网络来处理信息。他们想要确切知道思维链过程是如何以及在何处改变模型的内部活动的。研究人员并没有仅仅观察最终输出,而是使用了一种称为“激活修补”(activation patching)的技术。想象一下,模型的内部状态是流经建筑中不同房间的数据流。在一次“标准”运行中,模型在不写出步骤的情况下解决问题。在一次“洁净”运行中,它在写出步骤的同时解决同一个问题。研究人员提取了“洁净”运行过程中流经某些特定路径的具体数据,并将其交换到“标准”运行中。通过这样做,他们可以观察注入“思考”数据是否会让“非思考”运行的模型突然开始正确地解决问题,仿佛它已经获得了缺失的步骤。

团队发现,模型的推理能力并非存储在一个单一、孤立的地方,而是分布在按特定顺序激活的分布式路径网络中。当他们用一个正在思考的模型所发出的信号替换掉一个不进行思考的模型的信号时,那个不思考的模型开始表现得像正在思考的模型一样。它向正确答案迈进,并开始遵循相同的逻辑路径。这表明,思维链提示不仅仅是在屏幕上添加文本;它们还积极地重组了模型的内部计算,将其引导至推理模式。研究人员发现,当他们交换来自同一个特定问题的信号时,这种效果最为显著,但即使在交换来自完全不同问题的信号时,虽然强度减弱,但仍然有效。这表明模型已经学会了如何思考问题的通用模式,而不仅仅是如何解决某个特定的等式。

为了证实这些路径确实是必不可少的,研究人员进行了第二次实验,即直接关闭了识别出的这些路径。当他们这样做时,模型的性能崩溃了。它不仅把最终数字算错了,还失去了保持故事连贯性的能力,经常将示例问题中的细节与新问题混淆,或者甚至无法按预期格式给出最终答案。模型有时会一遍又一遍地重复同一个短语,或者生成毫无意义的数字。这些失败表明,研究人员识别出的这些路径不仅仅是为了编写解释;它们是维持模型推理轨迹、帮助其区分示例与实际任务、并确保生成正确数字的关键电路。

该研究还排除了这些改进仅仅是随机噪声或改变模型任何部分的副作用的可能性。当研究人员交换入随机、无意义的数据而非特定的“思考”信号时,模型并没有得到改善。这证实了这些路径所携带的特定信号才是关键所在。研究人员发现,这些关键路径集中在模型的中间层和后期层,而不是在最开始或最后阶段。它们作为一个支持系统,帮助模型维持思路,将最终答案锚定在正确的数字上,并防止示例问题污染新问题。

最终,这项工作表明,思维链提示之所以奏效,是因为它征用了由一组专门用于支持逐步推理的分布式内部电路。这些电路并不是一个独立于模型之外的“推理模块”;相反,它们是模型在被要求大声思考时会动态使用的重叠组件。当模型未被提示进行思考时,这些电路不会被充分激活,模型在处理复杂任务时就会感到吃力。当模型受到提示时,这些电路会被激活,引导模型通过必要的步骤以得出解决方案。这些发现为这些强大工具的运作方式提供了更清晰的图景,表明它们解释自身推理的能力不仅仅是一种语言现象,更是其处理信息方式发生真实、内部转变的体现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →