← 最新论文
🤖 machine learning

When Attribution Patching Lies: Diagnosis and a Second-Order Correction

本文将下游网络中的非线性特征确定为归因补丁(attribution patching)误差的主要来源,并引入了一种计算高效的 Hessian 向量积修正方法,该方法显著提高了各种模型规模下机械可解释性电路的准确性与可靠性。

原作者: Luyang Zhang, Jialu Wang

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Luyang Zhang, Jialu Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心背景:试图寻找 AI 的“脑细胞”

想象你拥有一台巨大且复杂的机器(大型语言模型),它能够写故事、解数学题并与你聊天。科学家们想要确切地知道这台机器中哪些特定的部分负责特定的行为。例如,哪个“神经元”决定使用“苹果”而不是“香蕉”这个词?

为了找到这些部分,研究人员使用了一种叫做**激活补丁(Activation Patching)**的技术。你可以把它想象成对这台机器进行“手术”:

  1. 你用一个正常的句子运行机器(例如:“猫坐在垫子上”)。
  2. 你用一个被破坏的句子再次运行(例如:“狗坐在垫子上”)。
  3. 你将第一次运行时的内部“大脑活动”替换到第二次运行中。
  4. 如果机器突然开始表现得好像又在讨论“猫”一样,你就知道那个特定的部分至关重要。

问题在于: 对现代 AI 的每一个部分都进行这种手术,就像试图测试摩天大楼里的每一块砖头来观察哪一块支撑着屋顶一样。这太耗费时间和计算资源了。

捷径:“归因补丁”(Attribution Patching)

因为完整的“手术”太慢,研究人员使用了一种名为归因补丁的捷径。他们不是真的去替换零件,而是使用一种数学上的猜测(“一阶近似”)来预测哪些部分可能会产生影响。

可以这样理解:

  • 真实手术(激活补丁): 你真的更换汽车的发动机,然后看它是否能正常运行。这很准确,但需要耗费数小时。
  • 捷径(归因补丁): 你观察发动机,做一个快速计算,然后猜想:“没错,这个发动机可能就是问题所在。”这很快,但有时猜错了。

发现:为什么捷径会撒谎

论文作者提出了一个问题:“这个捷径在什么时候会失效,以及为什么会失效?”

他们发现,捷径之所以失效,并不是因为零件本身的问题,而是因为该零件之后发生的事情

多米诺骨牌的比喻:
想象一排多米诺骨牌。

  • 捷径的错误: 捷径观察你推的第一块骨牌,并假设:“如果我推这块,整排都会倒下。”它假设推力会沿着一条直线、可预测的路径传播。
  • 现实情况: 在复杂的 AI 中,“推力”会通过其他骨牌经过一条弯曲的路径。有时,路径会发生弯曲,或者力量会被放大,或者被其他力量抵消。捷径看不见这些弯曲;它只能看到眼前的这一推。

论文证明,最大的误差源于捷径忽略了信号通过网络其余部分时所经历路径的曲率(Curvature)。这就像仅仅通过观察方向盘来驾驶汽车,却忽略了前方的道路充满了急转弯。

解决方案:“筛选-标记-修复”流水线

作者提出了一个三步工作流来解决这个问题,且不会降低速度。他们称之为 Screen-Flag-Fix(筛选-标记-修复)

1. 筛选 (Screen) —— 快速猜测

首先,对 AI 的每个部分运行快速、廉价的捷径(归因补丁)。这会给你一个谁比较重要的粗略名单。

  • 比喻: 你快速扫描人群,试图猜出谁是 VIP。你得到了 100 个嫌疑人的名单。

2. 标记 (Flag) —— 可靠性检查

接下来,使用一个新的“可靠性评分”来检查你的名单。这个评分会询问:“前方的路是否可能很弯曲?”

  • 如果分数低,说明捷径很可能是正确的。
  • 如果分数高,说明由于路径太复杂,捷径很可能在撒谎。
  • 比喻: 你看着你的 100 个嫌疑人名单。你意识到对于其中 90 个人来说,路径是直的,所以你的猜测没问题。但对于另外 10 个人,路径充满了急转弯。你将这 10 个人**标记(Flag)**为“不可靠”。

3. 修复 (Fix) —— 有针对性的手术

最后,你只对被标记出的项目进行昂贵且精确的“手术”(使用海森矩阵-向量积HVP)。

  • 比喻: 你不需要重新检查整个人群。你只对那 10 个被标记出的可疑人员进行深度背景调查。这节省了 90% 的时间,但依然能抓到真正的 VIP。

为什么这很重要

论文表明,这种方法效果极佳:

  1. 它很准确: 它修复了由 AI 大脑中“弯曲道路”引起的错误。在某些测试中,它将误差降低了 80% 以上。
  2. 它很快: 因为它只修复那些真正出错的部分,所以比对所有部分进行完整手术要便宜得多。
  3. 它具有可扩展性: 其他试图修复这些错误的方法(如“积分梯度”)在面对巨大的 AI 模型(如 80 亿参数的模型)时会变得无法使用。而这种新方法即使在这些庞大的模型上也能运行。

总结

这篇论文告诉我们,用于理解 AI 大脑的常见捷径往往是不可靠的,因为它忽略了信号在网络后续阶段所经历的复杂路径。通过使用一种聪明的“清单”来找出那些不可靠的猜测,并仅修复这些特定的部分,我们可以获得完整手术的准确性,同时拥有快速猜测的速度。这有助于科学家们更准确地绘制出 AI 模型实际思考方式的地图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →