← 最新论文
💬 NLP

How Much Do Circuits Tell Us? Measuring the Consistency and Specificity of Language Model Circuits

本文表明,尽管已识别的语言模型电路高度一致且对任务执行至关重要,但由于存在显著的跨任务重叠,它们缺乏任务特异性,从而削弱了该框架在针对性干预和理解方面的效用。

原作者: Michael Li, Nishant Subramani

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael Li, Nishant Subramani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个庞大而复杂的工厂(即大型语言模型),它能够解决各种问题,从做数学题到讲笑话。长期以来,科学家们一直在试图弄清楚,这个工厂内部究竟是哪些机器负责哪些工作。他们将这些特定的机器群组称为“电路”。

本文提出了关于这些电路的两个简单问题:

  1. 一致性:如果工厂执行同一项任务(例如加法运算)十次,它每次是否都使用完全相同的机器?
  2. 特异性:如果工厂执行数学任务,它使用的机器是否与执行历史任务时使用的机器不同?

以下是研究人员利用简单类比所发现的结论:

1. “一致性”测试:是的,它们是可靠的。

研究人员检查了工厂是否为同一项任务使用相同的工具。

  • 发现:是的!如果工厂被要求做加法,它几乎在每一个数学问题上都可靠地使用一组特定的机器(主要是"MLP 层”,它们就像工厂的重型工作台)。
  • 类比:这就像一位厨师制作特定的蛋糕。每次制作该蛋糕时,他们都会使用相同的搅拌机和烤箱,而不会在半途切换到搅拌机或烤面包机。研究人员发现,如果“拔掉”这些特定机器的电源,工厂几乎完全无法执行该任务。这证明这些机器确实在干活,而不仅仅是坐在那里装忙。

2. “特异性”测试:不,它们并非独一无二。

这是令人惊讶的部分。研究人员原本预期,“数学”所使用的机器与“历史”或“逻辑”所使用的机器会完全不同。

  • 发现:他们错了。用于数学的机器与用于历史、逻辑甚至阅读理解的机器几乎完全相同。
  • 类比:想象你有一个工具箱。你原本以为“数学盒”里只装有数学工具(尺子、计算器),而“历史盒”里只装有历史工具(地图、书籍)。但当你打开它们时,却发现两个盒子里都装有 90% 相同的工具
    • 如果你把“数学工具”从工具箱中取出,工厂就无法做数学题。
    • 但是,如果你取出这些相同的工具,工厂也无法进行历史或逻辑推理。
    • 事实证明,工厂依赖一个巨大的、共享的“基础设施”(即工作台/MLP 层)来完成所有任务。这些工具是所有任务的基础,而不仅仅是某一项任务的基础。

3. “隐藏瑰宝”:极少量的独特性。

任务之间是否有任何区别?

  • 发现:是的,但非常微小。在那一大堆共享工具内部,有一小部分专门化的工具(约占总量的 10-30%)是特定任务独有的。
  • 类比:回到工具箱:虽然 90% 的工具是共享的,但“数学盒”里有一个微小的、特殊的计算器,而“历史盒”里没有。如果你只移除那个计算器,数学就会失败,但历史仍然可以正常进行。然而,由于共享的 90% 如此巨大且重要,移除整个“数学盒”会导致一切崩溃,这让人误以为数学工具是唯一重要的东西。

大局观

该论文得出结论:当我们从“注意力头”和"MLP 层”(工厂中那些巨大且可见的部分)的层面观察语言模型时,我们主要看到的是建筑的通用基础设施,而不是每项任务的具体蓝图。

  • 这对理解意味着什么:我们可以轻松找到模型使用的“工作台”,但我们无法轻易分辨哪个工作台用于数学,哪个用于历史,因为它们都被两者共同使用。
  • 注意事项:研究人员建议,要找到真正独特的“专用工具”(那微小的 10%),我们可能需要看得更仔细,也许是关注单个螺丝或电线(即神经元或特征),而不是整个工作台。

简而言之:模型具有一致性(它对同一项任务使用相同的工具),但不具备特异性(它对每一项任务都使用相同的工具)。我们发现的“电路”大多是模型的共享基础,而非单一任务的独特指令。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →