← 最新论文
🤖 machine learning

Continuous-Depth Field Theory for Transformer Patching and Mechanistic Interpretability

本文提出了一种连续深度场论框架,该框架将 Transformer 激活修补建模为局部源插入,并通过格林函数响应预测下游行为变化,从而建立一种关于敏感性与传播场的数学语言,以组织和推断机制性干预。

原作者: David N. Olivieri, Antonio F. Pérez Rodríguez

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: David N. Olivieri, Antonio F. Pérez Rodríguez

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,Transformer(GPT-2 等模型背后的 AI 类型)并非一堆计算机代码,而是一条巨大、流动的河流

在这条河流中:

  • 深度是水流从源头流向海洋所行进的距离。
  • Token(句子中的单词)就像在河中并排漂浮的不同船只。
  • 残差流就是水流本身,它在模型的一层流向下一层时,承载着所有信息。

本文提出了一种理解如何“微调”或“修补”这些 AI 模型以改变其行为的新方法。作者不再仅仅猜测代码的哪一部分需要修复,而是将模型视为一个物理场,在其中我们可以精确预测微小的变化将如何在系统中产生涟漪。

以下是他们利用日常类比对观点的拆解:

1. “池塘里的涟漪”(修补即源头)

通常,当研究人员想要了解 AI 的特定部分在做什么时,他们会执行“激活修补”。这就像在特定时刻拍摄 AI 大脑的快照,将其与不同场景下的快照交换,然后观察输出如何变化。

作者将这一过程描述为向河中投掷一块石头

  • 石头:即“修补”(你所做的更改)。
  • 涟漪:即向下游传播并穿过模型其余部分的效果。
  • 理论:他们主张,如果你知道河流的形状(模型的结构),你就能精确预测涟漪将如何扩散、会变得多大、以及会击中哪些船只(Token),而无需为了查明结果而投掷一百万次石头。

2. “敏感性地图”(预测效果)

要预测涟漪会流向何处,你需要一张地图。作者引入了一个敏感性场

  • 将其想象为显示风速的天气图。河流中的某些位置非常敏感(小石头会激起巨浪);而其他位置则很平静(石头几乎激不起水花)。
  • 论文表明,你可以一次性计算出这张“风图”。一旦拥有它,你就不需要测试每一个可能投掷石头的方向。你可以从数学上预测:“如果我在这里、朝这个方向投掷石头,波浪将以多大的力量击中答案。”
  • 结果:他们发现,对于微小的变化,这种预测极其准确。这就像知道微风会吹动羽毛,而飓风会吹倒树木。

3. “格林函数”(涟漪传播者)

论文使用了一个称为格林函数的概念。简单来说,这就是一本“涟漪规则手册”。

  • 它回答了这个问题:“如果我在 A 点扰动水流,B 点的水流会如何移动?”
  • 作者发现,这些涟漪并不只是径直向下传播;它们会向侧面扩散到其他单词(Token),并深入模型内部传播。
  • 他们通过测量某一层的变化如何影响下游更深层的层来测试这一点。他们发现,“涟漪规则手册”是有效的,但前提是变化不能太大。如果你投掷一块巨石(巨大的变化),水流会变得混乱,简单的规则就会失效。但对于微小的推动,规则完全适用。

4. “逆向工程”(寻找正确的石头)

通常,研究人员会尝试随机的修补来看看会发生什么。本文则反其道而行之。他们提出了一个逆问题

  • 目标:“我希望 AI 说‘巴黎’而不是‘伦敦’。”
  • 旧方法:尝试修补每一层和每一个单词,直到碰运气成功。
  • 新方法:利用“涟漪规则手册”(格林函数)和“敏感性地图”,从数学上精确计算出应该在哪里以及如何投掷石头,以产生特定的波浪。
  • 这就像一位音响工程师,知道确切应该转动哪个旋钮来修正歌曲中的特定频率,而不是随机转动每一个旋钮。

5. 模型间的“翻译”(扩展)

最后,作者提出了一种将知识从小模型转移到大模型的方法。

  • 想象你有一个小池塘(一个小 AI 模型)和一个巨大的海洋(一个大 AI 模型)。
  • 如果你在池塘里投掷一块石头并观察涟漪,你可以利用这种模式来猜测在海洋中哪里投掷石头能获得类似的结果。
  • 他们称之为“共享潜在响应几何”。本质上,信息流动的“物理机制”在小模型和大模型中可能是相同的,只是尺度不同。这可能让我们能够通过先研究微小模型,从而找出如何修复巨型模型。

研究结果总结

作者在 GPT-2 模型上测试了这些想法,发现:

  1. 微小变化表现可预测:如果你轻轻推动模型,数学预测的结果几乎完美。
  2. 涟漪会扩散:变化不会停留在局部;它们会穿过各层传播,并以结构化的方式影响不同的单词。
  3. 存在高敏感点:只有河流中少数特定的“落点”对最终答案最为重要。
  4. 提示词变化只是涟漪:改变输入句子(例如,从“西班牙的首都”改为“法国的首都”)在数学上等同于在河中投掷特定的石头。模型以可预测的方式对这种“位移”做出反应,从而使我们能够引导答案。

简而言之:这篇论文提供了一种数学上的"AI 物理学”,将试错式的修补转变为一种可预测、可计算的科学。它表明,我们可以将 AI 干预视为工程问题,在其中我们可以计算出获得预期结果所需的精确力度和位置。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →