← 最新论文
💬 NLP

Language Model Circuits Are Sparse in the Neuron Basis

本文证明了语言模型中的 MLP 神经元本质上是稀疏且可解释的,从而能够实现一种高效、无需训练的基于梯度的流水线,用以识别并引导控制特定模型行为的微小且具有因果有效性的神经元电路。

原作者: Aryaman Arora, Zhengxuan Wu, Jacob Steinhardt, Sarah Schwettmann

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Aryaman Arora, Zhengxuan Wu, Jacob Steinhardt, Sarah Schwettmann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个庞大且复杂的工厂(即 AI 语言模型),它负责生产问题的答案。长期以来,试图理解这个工厂运作方式的科学家们一直在研究错误的蓝图。他们认为工厂内部的“工人”(神经元)过于混乱且无序,无法单独理解。因此,他们制造了昂贵且定制化的“翻译设备”(称为稀疏自编码器或 SAEs),试图将工厂产生的混沌噪声翻译成一份清晰、有序的指令清单。

这篇论文认为,我们并不需要那些昂贵的翻译设备。原本的工人其实比我们想象的要组织得更有序。

以下是使用简单类比对该论文研究结果的拆解:

1. “混乱的工人”神话 vs. 现实

旧观点: 科学家认为,如果你观察单个神经元(一个工人),它会同时从事太多不同的工作,就像一个既当清洁工,又在做饭、写代码和开叉车,同时兼顾所有工作的杂工。由于这种“混乱性”,他们认为你无法将特定的任务(比如“检查语法”)归因于仅仅几个工人。你需要通过翻译设备来将它们理顺。

新发现: 作者发现,如果你在观察这些工人完成最终报告之前(具体指 MLP 激活值),他们实际上是非常专注的。事实证明,大约 100 个工人组成的小组就足以处理特定任务,比如确保句子的语法正确。这些工人的组织程度与那些通过昂贵翻译设备发现的工人一样高,但你不需要制造那些设备就能找到他们。

2. “手电筒”升级

要找到这些工人,你需要一把好的手电筒(一种归因方法)来观察谁在做什么。

  • 旧手电筒(积分梯度法/Integrated Gradients): 这就像一盏昏暗、闪烁的灯,需要你在工厂里走上 10 遍才能得到清晰的图像。它速度缓慢,且经常错失目标。
  • 新手电筒(RelP): 作者使用了一种全新的、超亮的单次穿透式手电筒,只需走一遍就能看清。这束新光揭示了工人甚至比旧灯所暗示的还要更有组织性。它缩小了“混乱”的工人与“整洁”的翻译设备之间的差距,证明了这些工人已经准备好可以直接被研究。

3. “城市-州-首府”侦探游戏

为了证明这在现实中可行,作者与 AI 进行了一场侦探游戏。他们问了 AI 一个多步骤的问题:“包含达拉斯的那个州的首府是什么?”

  • 步骤: AI 必须思考:达拉斯 \rightarrow 得克萨斯州 \rightarrow 奥斯汀。
  • 结果: 使用他们的新方法,他们找到了仅由 23 个特定神经元组成的微型电路,处理了这个思维链条。
    • 有些神经元像是“达拉斯探测器”。
    • 有些是“得克萨斯探测器”。
    • 有些是“首府探测器”。
  • 操控(Steering): 他们甚至可以“操控”这些神经元。如果他们告诉“得克萨斯探测器”神经元停止工作,AI 就会忘记得克萨斯州并猜错另一个州。这证明了这些特定的神经元确实是机器大脑中转动的齿轮,而不仅仅是随机的噪声。

4. 为什么这很重要(根据论文观点)

该论文声称,我们第一次可以通过直接观察原始“神经元”来理解这些 AI 模型是如何工作的,而无需训练额外的、昂贵的模型来翻译数据。

  • 无额外成本: 你不需要花费金钱或时间去训练新的工具(SAEs)来理解模型。
  • 直接访问: 原本的模型部分本身就已经足够稀疏(有序),可以直接追踪。
  • 更好的控制: 因为我们可以找到这些特定的“齿轮”,所以我们可以理解 AI 的推理步骤(例如达拉斯 \rightarrow 得克萨斯 \rightarrow 奥斯汀这一链条),并有可能通过操控它们来改变输出。

简而言之: 论文说:“别再建造昂贵的翻译机来理解工厂了。工人其实已经佩戴了名牌;我们只是需要一把更好的手电筒来阅读它们。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →