想象一下,Transformer(GPT-2 等模型背后的 AI 类型)并非一堆计算机代码,而是一条巨大、流动的河流。
在这条河流中:
- 深度是水流从源头流向海洋所行进的距离。
- Token(句子中的单词)就像在河中并排漂浮的不同船只。
- 残差流就是水流本身,它在模型的一层流向下一层时,承载着所有信息。
本文提出了一种理解如何“微调”或“修补”这些 AI 模型以改变其行为的新方法。作者不再仅仅猜测代码的哪一部分需要修复,而是将模型视为一个物理场,在其中我们可以精确预测微小的变化将如何在系统中产生涟漪。
以下是他们利用日常类比对观点的拆解:
1. “池塘里的涟漪”(修补即源头)
通常,当研究人员想要了解 AI 的特定部分在做什么时,他们会执行“激活修补”。这就像在特定时刻拍摄 AI 大脑的快照,将其与不同场景下的快照交换,然后观察输出如何变化。
作者将这一过程描述为向河中投掷一块石头。
- 石头:即“修补”(你所做的更改)。
- 涟漪:即向下游传播并穿过模型其余部分的效果。
- 理论:他们主张,如果你知道河流的形状(模型的结构),你就能精确预测涟漪将如何扩散、会变得多大、以及会击中哪些船只(Token),而无需为了查明结果而投掷一百万次石头。
2. “敏感性地图”(预测效果)
要预测涟漪会流向何处,你需要一张地图。作者引入了一个敏感性场。
- 将其想象为显示风速的天气图。河流中的某些位置非常敏感(小石头会激起巨浪);而其他位置则很平静(石头几乎激不起水花)。
- 论文表明,你可以一次性计算出这张“风图”。一旦拥有它,你就不需要测试每一个可能投掷石头的方向。你可以从数学上预测:“如果我在这里、朝这个方向投掷石头,波浪将以多大的力量击中答案。”
- 结果:他们发现,对于微小的变化,这种预测极其准确。这就像知道微风会吹动羽毛,而飓风会吹倒树木。
3. “格林函数”(涟漪传播者)
论文使用了一个称为格林函数的概念。简单来说,这就是一本“涟漪规则手册”。
- 它回答了这个问题:“如果我在 A 点扰动水流,B 点的水流会如何移动?”
- 作者发现,这些涟漪并不只是径直向下传播;它们会向侧面扩散到其他单词(Token),并深入模型内部传播。
- 他们通过测量某一层的变化如何影响下游更深层的层来测试这一点。他们发现,“涟漪规则手册”是有效的,但前提是变化不能太大。如果你投掷一块巨石(巨大的变化),水流会变得混乱,简单的规则就会失效。但对于微小的推动,规则完全适用。
4. “逆向工程”(寻找正确的石头)
通常,研究人员会尝试随机的修补来看看会发生什么。本文则反其道而行之。他们提出了一个逆问题。
- 目标:“我希望 AI 说‘巴黎’而不是‘伦敦’。”
- 旧方法:尝试修补每一层和每一个单词,直到碰运气成功。
- 新方法:利用“涟漪规则手册”(格林函数)和“敏感性地图”,从数学上精确计算出应该在哪里以及如何投掷石头,以产生特定的波浪。
- 这就像一位音响工程师,知道确切应该转动哪个旋钮来修正歌曲中的特定频率,而不是随机转动每一个旋钮。
5. 模型间的“翻译”(扩展)
最后,作者提出了一种将知识从小模型转移到大模型的方法。
- 想象你有一个小池塘(一个小 AI 模型)和一个巨大的海洋(一个大 AI 模型)。
- 如果你在池塘里投掷一块石头并观察涟漪,你可以利用这种模式来猜测在海洋中哪里投掷石头能获得类似的结果。
- 他们称之为“共享潜在响应几何”。本质上,信息流动的“物理机制”在小模型和大模型中可能是相同的,只是尺度不同。这可能让我们能够通过先研究微小模型,从而找出如何修复巨型模型。
研究结果总结
作者在 GPT-2 模型上测试了这些想法,发现:
- 微小变化表现可预测:如果你轻轻推动模型,数学预测的结果几乎完美。
- 涟漪会扩散:变化不会停留在局部;它们会穿过各层传播,并以结构化的方式影响不同的单词。
- 存在高敏感点:只有河流中少数特定的“落点”对最终答案最为重要。
- 提示词变化只是涟漪:改变输入句子(例如,从“西班牙的首都”改为“法国的首都”)在数学上等同于在河中投掷特定的石头。模型以可预测的方式对这种“位移”做出反应,从而使我们能够引导答案。
简而言之:这篇论文提供了一种数学上的"AI 物理学”,将试错式的修补转变为一种可预测、可计算的科学。它表明,我们可以将 AI 干预视为工程问题,在其中我们可以计算出获得预期结果所需的精确力度和位置。
技术摘要:用于 Transformer 补丁与机制可解释性的连续深度场论
问题陈述
机制可解释性旨在通过对激活进行干预(例如激活补丁、因果追踪、路径补丁)来识别负责 Transformer 行为的内部电路。虽然这些方法成功定位了具有行为意义的位点和方向,但它们通常依赖于对层、令牌(token)和子空间的穷举枚举。本文探讨了一个互补性问题:能否利用一种统一的、跨越深度和令牌位置的场论框架来组织、预测和重构此类干预?作者提出将残差流(residual stream)视为连续场而非离散层序列,从而将补丁操作表述为线性响应形式论中的局部源插入问题。
方法论
本文发展了一种连续深度场论,其中 Transformer 的残差流 R(t,x) 被建模为深度 - 令牌晶格上的场。在此模型中,层索引 ℓ 被映射为深度坐标 t∈[0,T],令牌索引被映射为空间坐标 x。
场论表述:
- 作为源插入的补丁: 激活补丁被建模为添加到深度演化方程中的局部源项 J(t,x):∂tR(t,x)=Ft[R](x)+J(t,x)。
- 响应对象: 该框架定义了两个主要的响应对象:
- 灵敏度场(a(t,x)): 可观测值 y(例如对数几率差)关于残差场的泛函导数,a(t,x)=δy/δR(t,x)。这用于预测补丁的效果。
- 格林函数(G(t,x;t′,x′)): 两点响应函数 δR(t,x)/δR(t′,x′),描述了 (t′,x′) 处的扰动如何传播到 (t,x)。
- 线性响应: 在局部线性机制中,可观测值的变化近似为 δy≈∫dtdxa(t,x)J(t,x)。
- 逆问题(补丁推断): 该框架将补丁位点推断重新表述为一个约束变分问题。给定期望的行为偏移,寻找一个稀疏源 J 以满足积分方程 ΔRtarget≈∫GJ。这通过伴随场(协态)λ(t,x) 的作用原理求解,该伴随场对应于灵敏度场。
实证验证:
该理论在基于 GPT-2 风格的自回归 Transformer 上使用离散残差流干预进行了测试。实验测量了:
- 局部线性性与叠加性: 验证微小扰动是否表现出线性缩放,以及组合干预的效果是否线性相加。
- 灵敏度预测: 将实测的补丁效果与基于一阶灵敏度(自动微分梯度)推导出的预测值进行比较。
- 残差传播: 测量由局部补丁诱导的下游残差场 δR,以表征“格林响应”。
- 组合性: 测试通过中间层的传播是否近似于格林算子的乘积(G(t2;t0)≈G(t2;t1)G(t1;t0))。
- 降维表示: 分析“切片”格林算子(固定位点间的分量级传播)和灵敏度位点得分,以降低维度。
- 提示位移: 将两个提示之间的差异视为局部源,测试其是否充当变换方向。
主要贡献
- 场论框架: 本文建立了一种形式体系,将补丁视为局部源插入,将归因视为灵敏度场预测,将传播视为经验格林函数响应。
- 伴随推断表述: 它将补丁位点推断表述为可通过伴随变分原理求解的逆问题,超越了简单的枚举,转向约束重构问题。
- 实证线性响应机制: 作者在 GPT-2 模型中识别出一个有界的局部线性机制,其中一阶灵敏度能准确预测补丁效果,且叠加性成立。
- 结构化传播: 实验表明,残差扰动以结构化的各向异性方式跨越深度和令牌位置传播,表现出与线性化理论一致的近似组合性质。
- 简化描述: 本文表明,高灵敏度位点和切片格林算子提供了对原本高维残差响应空间的可处理、低维描述。
- 缩放假设: 提出了一个理论假设,即响应几何(格林函数指纹)可能在模型尺度间共享。这表明,只要使用局部锚点,较小模型的响应信息就可以为较大模型定义候选补丁位点图。
结果
- 线性性: 局部扰动表现出有界的线性机制,在测试范围内,对于中等幅度的扰动,非线性和叠加误差保持较低(低于 20%)。
- 预测精度: 自动微分灵敏度(a(t,x))成功预测了各种残差位点和方向上的实测标量补丁效果,验证了一阶近似的有效性。
- 传播结构: 局部干预生成了结构化的下游响应场,这些场呈各向异性扩散。组合性测试证实,中间残差场保留了足够的信息,以便在微扰机制内重现下游响应。
- 位点集中性: 灵敏度得分(∥a(t,x)∥)高度不均匀,集中在少量层 - 令牌位点上,这使得干预搜索空间得以缩减。
- 提示位移: 提示之间的差异充当局部变换方向。它们的效果可由因果灵敏度预测,在较深层中最为有效,并能成功改变词汇表中目标答案的排名。
意义与主张
本文声称提供了一种“实用语言”来组织补丁实验,将范式从枚举干预转变为估计响应量(灵敏度和核函数)。通过实证建立线性响应基础,这项工作使得内部机制的重构在数学上成为适定问题:格林函数作为逆问题的前向算子,用于识别补丁位点和方向。
作者谦逊地将缩放假设表述为对未来工作的激励而非已证实的结果,指出其依赖于“共享潜在响应假设”,并且需要局部锚点(权重、激活或稀疏补丁)才能可行。主要贡献在于将机制可解释性工具(补丁、追踪、引导)统一于单一的连续深度场论之下,提供了一条从测量到推断、并可能扩展到模型尺度迁移的原则性途径。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。