← 最新论文
💬 NLP

Many Circuits, One Mechanism: Input Variation and Evaluation Granularity in Circuit Discovery

本文挑战了通过发现的电路结构差异来判定其具有不同机制的假设,通过“幻象特化”(phantom specialization)现象证明了变化的输入统计特性会产生结构多样但功能等效的子图,从而揭示了标准的评估实践往往掩盖了电路结构与模型功能之间存在的多对一映射关系。

原作者: Alireza Bayat Makou, Jingcheng Niu, Subhabrata Dutta, Iryna Gurevych

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Alireza Bayat Makou, Jingcheng Niu, Subhabrata Dutta, Iryna Gurevych

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有一台巨大且复杂的机器(一个大型人工智能模型),它能表演一个特定的戏法:观察一组字母模式,并将其中一个字母复制到行末。科学家们想知道这台机器是如何完成这个戏法的。他们试图寻找机器内部负责这个戏法的特定“布线”。他们把这种布线称为电路(circuit)

长期以来,研究人员一直认为,如果他们在稍微不同的条件下发现了一套用于执行相同戏法的不同布线图,那就意味着机器开发出了一种新的、专门的实现方式

这篇论文说:别急,先别下结论。

作者们发现,看似是一个全新的、专门化的机器,实际上只是同一台机器在执行相同的戏法,只不过上面多挂了一些额外的、不必要的导线。他们将此称为**“幻影专门化”(Phantom Specialization)**。

以下是使用简单类比进行的详细拆解:

1. 实验: “复读机”游戏

研究人员使用了一个名为“字面序列复制”(Literal Sequence Copying)的游戏。

  • 任务: AI 看到一个序列,例如 A B C D ... A B C,然后必须猜出下一个字母(D)。
  • 转折点: 他们在 AI 训练中经常出现的词汇(如“the”)和极少出现的词汇(如晦涩的专有名词)上进行这个游戏。
  • 预期: 他们认为:“也许 AI 对稀有词汇会使用一套与常用词汇不同的内部布线。”

2. 发现: “殊途同归”问题

当他们观察常用词与稀有词的布线图时,图表看起来是不同的。

  • “稀有词”电路的导线更多。
  • “常用词”电路的导线较少。
  • 它们看起来像是两份不同的蓝图。

然而,当他们测试功能时:

  • 他们把“稀有词”的导线拿来复制“常用词”,运行完美。
  • 他们把“常用词”的导线拿来复制“稀有词”,也运行完美。
  • 结论: “稀有词”电路中多出来的那些导线并不是在做任何特别的事情。它们仅仅是装饰品。机器在处理两者时使用的是完全相同的核心逻辑。

3. 类比:“副产物”或“额外的背包”

想象你在徒步。

  • 场景 A: 你为短途步行准备了一个小巧、高效的背包。
  • 场景 B: 你为长途跋涉准备了一个巨大、沉重的背包。

如果你观察这两个背包,它们看起来完全不同(结构)。你可能会想:“那个大背包是长途徒步的专业工具!”

但如果发现两个背包里装的其实是完全相同的水壶和地图呢?大背包里多出的空间要么是空的,要么只是装了一些凑巧在那里的随机物品。如果你带着小背包去长途徒步,你依然能生存;如果你带着大背包去短途徒步,你也依然能生存。

“幻影专门化”就是一种错觉,让你觉得那个大背包是一个不同种类的工具,而实际上它只是同一个工具加上了一些多余的、无用的重量。

4. 为什么会这样?(“贪婪”的机械师)

研究人员发现,寻找这些电路的方法有点像一个试图修理汽车的贪婪机械师

  • 机械师想要找到让汽车运转所需的最小一组导线。
  • 有时,存在多条执行相同任务的导线(冗余性)。
  • 当机械师观察“稀有词”输入时,汽车的内部状态略有不同。于是,贪婪的机械师会选择保留其中的一组导线,并剪掉其余的。
  • 当观察“常用词”时,内部状态又发生了微小的变化,于是机械师又选择了另一组不同的导线来保留。

结果如何?两套不同的布线图,但都能让汽车完美运行。差异并不在于汽车需要不同的引擎,而在于机械师在同样优秀的选项之间做了不同的随机选择。

5. “变焦镜头”问题(评估粒度)

论文还发现,科学家们经常是用错误的“镜头”在观察这些电路。

  • “源级”镜头(远景/缩放倍数低): 这关注的是整个组件(比如整个芯片)。只要芯片上的任何一根导线处于激活状态,整个芯片就被计为“正在工作”。这使得电路看起来非常忠实且各不相同。
  • “边级”镜头(近景/缩放倍数高): 这关注的是具体的导线。当你放大观察时,你会发现许多被选中的导线实际上是没必要的。

论文指出,如果你只从远处看(源级),你会看到“幻影专门化”。如果你放大观察(边级),你会发现这些电路实际上在做着完全相同的事情。

核心要点总结

  1. 不同的导线 \neq 不同的逻辑: 仅仅因为两套电路在纸面上看起来不同,并不意味着它们的功能不同。
  2. “幻影”: 这种表象上的专门化是由我们提取和测量这些电路的方式所造成的错觉。
  3. 冗余是真实的: AI 模型拥有许多备份路径。如果一条路径被切断,另一条就会接管。这使得寻找“唯一的真实电路”变得困难。
  4. 如何解决: 要理解 AI 如何运作,我们不应只观察单一电路。我们需要:
    • 测试该电路在不同类型输入上的表现(迁移测试)。
    • 观察具体的导线,而不是宏观的组件(边级评估)。
    • 进行多次提取并观察哪些部分保持不变(多次提取)。

简而言之: AI 并没有为稀有词构建一个新引擎;它只是戴了一顶不同的帽子。帽子看起来不同,但底下的引擎是一样的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →