Polymorphism Is Rotation: Operational Mechanistic Interpretability from a Two-Layer Transformer to Pythia-70m
本文证明,独立训练的 Transformer 使用相互不可理解但通过均匀随机旋转相关联的内部坐标来计算相同的函数,这一被称为“多态性”的现象可通过单一的正交 Procrustes 拟合加以解决,从而无需重新训练即可直接转移特征字典和引导向量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你和一位朋友正根据同一本说明书,各自搭建一座完全相同的复杂乐高城堡。最终,你们两座城堡的外观一模一样,功能也完全一致(它们拥有相同的门、窗和塔楼)。
然而,在城堡内部,关于砖块如何排列的“蓝图”却截然不同。事实上,差异之大以至于如果你试图用朋友的内部蓝图来理解你自己的城堡,你会感到困惑。这并不是说你们的城堡不同,而是你们在用两种不同的“内部语言”来描述同一事物。
本文将这种现象称为"多态性"(Polymorphism)。它意味着“功能相同,内部坐标不同”。
以下是研究人员发现的要点,辅以简单的类比:
1. “解码器”与“编码器”(字典问题)
在人工智能研究中,科学家通常通过观察模型的“特征”(如同概念字典)来理解模型在想什么。他们发现,如果观察过程的末端(即“解码器”),两个不同模型之间的字典看起来几乎完全相同。这就像两个人使用完全相同的字典来写故事。
转折点:研究人员意识到,虽然“字典”(解码器)是相同的,但“阅读字典的方式”(编码器)却完全混乱。
- 类比:想象两个人在读一本书。A 正常阅读,而 B 将书旋转了 90 度并倒着读。如果你只看他们指向的单词(解码器),它们完美匹配。但如果你尝试用 A 的视角去解读 B 的笔记,这些笔记就毫无意义了。这些“笔记”(激活值)处于一个旋转的参考系中。
2. 灾难性的失败
当研究人员试图将模型 A 的“特征字典”直接应用于模型 B 时,完全失败了。对模型内部思想的还原效果甚至不如直接猜测平均答案。
- 类比:这就像试图用纽约市的地图在伦敦导航。地标(解码器列)在列表中可能看起来相似,但街道(内部坐标)的朝向却不同。如果你在伦敦遵循纽约的地图,你会立刻迷路。
3. 神奇的修复:一次矩阵乘法
这篇论文最大的发现是如何解决这个问题。你不需要重新训练模型或改变它们的“大脑”。你只需要应用一次数学上的“旋转”(一种称为 Procrustes 拟合的特定数学运算)来对齐两个模型。
- 类比:想象你和朋友都在看一座雕塑,但你们站在旋转平台的两侧。你们看到的是同一个物体,但角度不同。如果你只是旋转你的平台以匹配朋友的位置,你们的视角就会瞬间完美对齐。
- 结果:一旦将这种单一的“旋转”应用于模型 B 的内部数据,模型 A 的字典就能在模型 B 上完美运行。“内部语言”被瞬间翻译通了。
4. 这是特定的旋转还是随机的?
研究人员想知道:这种旋转是一个特定的、有意义的偏移,还是仅仅是随机的混乱?
- 发现:它本质上是随机的。两个独立训练的模型之间的旋转就像轮子上的随机旋转。它不是一个“特殊”的角度,仅仅是一个均匀随机的旋转。
- 类比:如果你随机旋转地球仪并停下,其朝向是随机的。论文表明,每当两个 AI 模型从头开始训练时,它们最终得到的“地球仪”相对于彼此都停在了一个随机的角度上。
5. 这对“操控”(改变行为)意味着什么
该论文还测试了“操控向量”——用于微调模型行为使其表现不同的工具(例如,使其更礼貌或更具创造力)。
- 发现:如果你在没有先修正旋转的情况下,试图将模型 A 的“操控微调”应用于模型 B,它通常会失败,甚至产生与你期望相反的效果。
- 类比:想象你有一个玩具车(模型 A)的遥控器。如果你试图用这个遥控器去控制另一辆朝向不同的玩具车(模型 B),按下“前进”键可能会导致第二辆车向“左”或向“后”移动。你必须先弄清楚第二辆车朝向何方(即旋转角度),并相应地调整遥控器的信号。
“规则”总结
该论文确立了这些模型之间关系的三条主要规则:
- 功能相同,坐标不同:两个独立训练的模型执行相同的任务,但使用不同的内部“地图”。
- 解码器具有欺骗性:仅仅因为“末端”特征看起来相似,并不意味着模型以相同的方式理解事物。
- 修复成本很低:你可以通过一次简单的数学计算(一次矩阵乘法)来对齐两个完全不同的模型,而无需重新训练它们。
发现的规模
研究人员在两个层面上证明了这一点:
- “玩具”模型:一个微小、简单的模型(104,000 个参数),他们可以检查每一块砖,以确保理论成立。
- “真实”模型:一个更大、现实世界中的语言模型(Pythia-70m),拥有 7000 万个参数。同样的“随机旋转”规则在这里也成立。
核心结论:AI 模型就像说着同一种语言但口音和朝向不同的双胞胎。它们做着相同的事情,但要相互理解,你只需要旋转你的视角。一旦你这样做了,它们的内部秘密就变得可读。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。