← 最新论文
🤖 machine learning

Intrinsic Structure: Spectral Identifiability for Mechanistic Interpretability

本文通过证明模型的 Koopman 谱是可从数据中恢复的、与坐标无关的内蕴指纹,从而将结构属性与方法论伪影区分开来,并揭示了统计可识别特征与人类可理解电路之间的根本解离,从而建立了机械解释性领域的第一个可识别性定理。

原作者: Ashim Dhor, Pin-Yu Chen

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Ashim Dhor, Pin-Yu Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

侦探的困境:寻找机器内部的真相

想象你是一名侦探,正试图在一个巨大的“黑盒工厂”里破解谜团。这个工厂是一种被称为“神经网络”或“Transformer”的人工智能。它接收文字并吐出答案,但没人确切知道它是如何思考的。多年来,科学家们一直试图拆解这个工厂,寻找那些被称为“电路”的微小齿轮和杠杆,以了解其运作机制。他们使用像“稀疏自编码器”(sparse autoencoders)这样的工具——这本质上是高级的分拣机,试图将工厂内部的信号归类为整齐、可理解的类别。

问题在于,这些分拣机并不完全可靠。如果你用略微不同的设置或起点将同一个工厂通过分拣机运行两次,你可能会得到两份完全不同的“齿轮”清单。一次,机器说写诗的秘密是一个特定的齿轮;下一次,它却说那是另一个完全不同的齿轮。这让科学家们感到困惑:这些齿轮是工厂真实的组成部分,还是仅仅由分拣机创造出来的幻觉?如果这些齿轮不是真实的,那么建立在它们之上的任何安全规则或科学理论都可能建立在流沙之上。这篇论文提出了一个根本性的问题:我们能否找到一个真实的、不可改变的、且不依赖于我们观察工具的工厂“指纹”?

论文的核心思想:工厂不可变的指纹

这篇题为《内在结构:机械可解释性的谱识别》(Intrinsic Structure: Spectral Identifiability for Mechanistic Interpretability)的论文,提出了一种观察这些 AI 工厂的新方法。作者不再试图将信号分类成整齐的堆叠,而是将 AI 的思考过程视为一个动力系统(dynamical system)——一种高级说法,即他们将 AI 的各层视为一部随时间上演的电影。他们使用一种称为 Koopman 算子(Koopman operator) 的数学工具,将这部电影提升到一个更高的维度,在那里,混乱、非线性的运动变成了简单的直线运动。

你可以这样理解:想象你在描述过山车的路径。它扭曲、旋转、翻转,让人难以预测。但如果你能通过一个特殊的角度从空中观察过山车,你可能会发现它实际上只是沿着一条简单的直线轨道移动。 “Koopman 谱”(Koopman spectrum)就是那条直线轨道的独特签名。作者在数学上证明了,这个签名是一个无坐标不变量(coordinate-free invariant)。用通俗的话说,这意味着它是 AI 工厂本身的属性,而不是测量工具的属性。无论你如何旋转视角或改变你的词典,这个“谱”(描述轨道的数字列表)都会保持完全一致,仅存在简单的重新排列。

他们的发现:真实的指头,但不是你想要的那个

团队在三个真实的 AI 模型上测试了这个理论:GPT-2 smallGemma-2-2BQwen3-8B-Base。他们收集了数百万个 AI 内部活动的样本,并尝试恢复出这种“谱”。

好消息是: 理论是成立的。在最大的模型 Qwen3-8B-Base 上,谱收敛速率为 −0.506 ± 0.031。这与完美的数学预测值 −0.5(或 M1/2M^{-1/2})相匹配,意味着随着他们增加数据,误差缩小的速度完全符合数学预期的速度。这是第一次有人证明,AI 内部结构的特定部分可以从数据中识别出来,并且带有保证的误差范围。他们还证明了这种谱是最优的;没有任何其他方法能超越这种速度。

坏消息(以及转折): 虽然这个“指纹”是真实且不可变的,但事实证明它并不易于阅读。作者发现,在“可识别性”(identifiable)与“可读性”(legible,即人类易于理解)之间存在脱节

  • 他们测试了这些新的“Koopman 模式”是否能解释一种著名的 AI 行为——间接宾语识别(Indirect Object Identification, IOI)(例如,AI 学习说“球在盒子里”而不是“球在杯子里”)。
  • 结果是:新的模式虽然比随机猜测要好,但比标准的主成分分析(PCA)更差。当他们移除前 8 个方向的新模式时,仅消除了 25% 的行为;而当他们移除前 8 个标准 PCA 方向时,则消除了 60% 的行为。
  • 论文证明,由于 AI 的内部数学是“非正规的”(non-normal,这是一个技术术语,指其结构复杂且扭曲),因此承载最多信息的方向(谱)不可能与承载最多方差的方向(易于观察的模式)是相同的。

这对未来意味着什么

论文得出了一个冷静但重要的结论:可识别的对象与可读的对象并不是同一个对象。

我们现在拥有了一个数学保证,可以找到 AI 内部动力学的“指纹”,它是真实的,而不是我们工具产生的伪影。然而,这个指纹并不是人类可理解的电路图。它是一个严谨的科学证书,在说:“是的,模型的这一部分是真实的,”但它并不一定能以人类容易理解的方式告诉我们那部分究竟在做什么。

作者还表明,以往方法(如稀疏自编码器)中看到的变异性不仅仅是代码中的 Bug,而是它们所使用的数学结构的必然结果。他们甚至提出了一个修复方案:在训练过程中添加一个惩罚项,以强制词典尊重“Koopman 不变性”。当他们尝试这样做时,谱变得更具可重复性(提升了 41%),但词典本身却变得不再稳定。

简而言之,这篇论文为我们提供了一个全新的、具有数学实力的工具,用以证明 AI 的某些部分是真实的。但它同时也警告我们:仅仅因为某样东西是真实的且可识别的,并不意味着它会易于理解。那个“指纹”确实存在,但它使用的是一种需要全新词典才能解读的语言。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →