← 最新论文
💬 NLP

Mechanistic Interpretability as Statistical Estimation: A Variance Analysis

本文认为,机械解释性本质上是一个统计估计问题,受困于因果中介得分极高的内在方差,这导致电路发现流水线产生不稳定且脆弱的结果,从而使得转向严谨的统计稳健性和稳定性报告成为必要。

原作者: Maxime Méloux, François Portet, Maxime Peyrard

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Maxime Méloux, François Portet, Maxime Peyrard

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心大意:试图用一个摇晃的指南针绘制城市地图

想象一下,你正试图绘制一张复杂的城市(神经网络)地图,以了解它是如何从 A 点到达 B 点的(如何解决问题)。机械解释性(Mechanistic Interpretability)领域的科学家就像是城市探险家。他们想要找到这个城市在做决策时所使用的特定“道路”和“交叉口”(神经元和连接)。他们将这些特殊的路线称为“电路”(circuits)

本文指出,目前的探险家们使用的指南针正在疯狂旋转。他们认为自己正在寻找唯一真实的地图,但实际上,由于天气微小的随机变化或持握指南针的方式不同,他们每次观察时画出的都是不同的地图。

核心问题:“旋转的指南针”(方差)

研究人员发现,用于寻找这些电路的工具在本质上是不稳定的。他们将这个问题分解为三个层面的不稳定性:

1. 原始信号具有噪声(内在变异性)

类比: 想象你在测量一场风暴中特定气流的强度。如果你在某一秒钟精确测量,你会得到一个数值。如果你一秒钟后再次测量,风速可能会因为随机的湍流而变得稍强或稍弱。
论文观点: AI 特定部分的“重要性”并不是像石头重量那样固定的数值。它更像是风速。它会根据你观察的具体输入(即“风暴”)而剧烈变化。论文表明,即使你完美地计算出这个分数,单个连接的分数也会产生巨大的波动,以至于很难判断它究竟是真的重要,还是仅仅是一个随机的阵风。

2. 工具增加了额外的噪声(近似误差)

类比: 因为完美测量风速太耗时,探险家们使用廉价、快速的传感器(近似方法,如 EAP)来猜测风速。但这种廉价传感器本身也是抖动的。它在原本就多变的风速之上,又叠加了自身的静态噪声和误差。
论文观点: 科学家为了节省时间而使用的快速方法(如边缘归因修补法/Edge Attribution Patching)引入了更多的噪声。这些方法往往会让得分看起来比原本就更不稳定。其“信噪比”如此之低,以至于这些工具往往只是在捕捉静态噪声,而非真实的信号。

3. 地图随每一步而改变(聚合不稳定性)

类比: 为了绘制最终的地图,探险家会对 100 次不同的测量结果进行平均。但由于测量值非常不稳定,如果仅仅稍微改变这 100 次测量的列表(比如用一个替换掉另一个),最终的地图就会完全不同。今天,地图显示的是一条高速公路;明天,它显示的可能是一条土路。
论文观点: 当科学家结合这些不稳定的得分来构建“电路”时,结果是极其脆弱的。

  • 数据变化: 如果他们使用一套略有不同的示例来训练他们的地图,他们会发现一个完全不同的电路。
  • 方法变化: 如果他们微调了一个设置(例如改变他们对数字取平均值的方式),他们会发现另一个电路。
  • 扰动变化: 如果他们改变了“破坏”AI 以进行测试的方式(即反事实测试),所发现的电路也会随之偏移。

“死鱼效应”(The "Dead Salmon" Effect)

论文提到了当前方法容易产生“死鱼效应”伪影。
类比: 在神经科学领域,研究人员曾发现即便是在一只死鱼(文中为死鲑鱼)身上也能检测到“大脑活动”,仅仅是因为他们没有对统计噪声进行修正。论文暗示,AI 研究者可能也在做同样的事情:发现了一些看起来很真实的“电路”,但它们实际上只是偶然凑巧排列在一起的随机噪声。

研究人员的发现(证据)

他们在不同的 AI 模型(如 GPT-2 和 Llama)以及不同的任务(如数学或语法)上进行了实验。

  • 结果: 当他们使用略微不同的数据将同一实验重复运行 100 次时,他们发现的“电路”几乎没有重叠。有时,重叠率甚至不到 10%。
  • 结论: 并不存在一个等待被发现的单一“真实电路”。相反,存在着一团可能的电路云,而目前的方法只是从这团云中随机选取了一个点,并将其称之为真相。

提出的解决方案:停止猜测,开始测量不确定性

作者并不是说要放弃对 AI 的解释,而是说:“停止假装我们比实际掌握的更多。”

新的规则手册:

  1. 报告方差: 不要只展示一张地图。展示 100 张地图,并说明:“这是平均值,而这是它们的差异程度。”
  2. 检查稳定性: 在声称发现了一个电路之前,先检查当数据发生轻微变化时,该电路是否保持不变。如果一个电路会随着微小的变化而消失,那么它就是不可靠的。
  3. 拥抱不确定性: 将这些发现视为天气预报(例如,“降水概率 70%”)而非绝对的事实(例如,“一定会下雨”)。

总结

论文认为,机械解释性目前正试图在不承认自己在处理统计学问题的情况下进行科学研究。这就像是在蹦床上测量一座山的高度。作者希望该领域停止寻找单一、完美的“地面真相”(ground truth)电路,转而开始报告他们的发现实际上有多么摇摆不定和多变。只有通过承认这种不稳定性,我们才能信任我们正在绘制的 AI 心智地图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →