← 最新论文
💬 NLP

Architecture, Not Scale: Circuit Localization in Large Language Models

本文挑战了机械可解释性随模型规模扩大而必然恶化的假设,转而证明诸如分组查询注意力等架构选择以及特定的扩展阈值,能够在大语言模型中促成更集中且稳定的电路定位。

原作者: Sohan Venkatesh

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Sohan Venkatesh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图理解一台巨大而复杂的机器是如何运作的。长期以来,研究人员认为,随着这些机器(大型语言模型)变得更大、更强大,它们将变得无法拆解和理解。当时的观点是:“机器越大,线路就越纠缠、越混乱。”

本文挑战了这一观点。它指出,机器的构建方式比其规模重要得多

以下是研究人员发现内容的简要分解,并辅以一些日常类比:

1. 两种类型的机器

研究人员比较了两类不同的 AI 模型家族:

  • “标准”团队(Pythia): 这些模型采用一种称为**多头注意力(MHA)**的设计。想象一下,这就像一个大办公室,每位员工(头)都拥有自己独立的电话线和专属的文件柜。他们虽然协同工作,但并不真正共享资源。
  • “分组”团队(Qwen2.5): 这些模型采用一种称为**分组查询注意力(GQA)**的设计。想象一下,这就像一个现代化办公室,员工被组织成小组。几名员工共享同一条电话线和同一个文件柜。由于他们 literally 共享相同的工具,因此被迫紧密协作。

2. 实验:寻找“秘密开关”

研究人员希望看看是否能在这些模型内部找到使它们执行特定任务的具体“开关”(电路),例如:

  • 间接宾语识别: 确定句子中谁接收了物品(例如,“约翰把芒果给了玛丽")。
  • 归纳: 发现模式(例如,如果你看到"A, B, A,",预测下一个字母是"B")。
  • 事实回忆: 记住事实(例如,“法国的首都是……")。

他们测试了从很小到非常大的各种规模的模型。

3. 重大发现:规模无关紧要,设计才关键

普遍的看法是,更大的模型会将它们的“开关”分散到数百名员工身上,使其无法被隔离。

他们实际发现的是:

  • “标准”团队(MHA): 无论模型变得多大,“开关”都混乱且分散。要中断一项任务,你通常需要在数十甚至数百个地方切断线路。这就像试图通过拔掉大型体育场中随机扬声器的插头来停止一首歌;你几乎必须拔掉所有扬声器才能让音乐静音。
  • “分组”团队(GQA): 这些模型出奇地整洁。即使它们非常庞大(数十亿参数),“开关”也集中在仅一两个地方
    • 类比: 在 GQA 模型中,由于员工共享同一个文件柜(KV 头),如果你拔掉那个文件柜,整个团队就会停止工作。这个“开关”是一个单一的关键瓶颈。

4. 稳定性:“坚如磐石”与“变幻莫测”

研究人员还注意到这些开关在可靠性方面存在差异:

  • “标准”团队: “开关”会根据任务的难易程度而移动。如果句子很简单,一组员工会完成工作;如果很难,另一组员工会接手。这使得难以监控或预测模型正在做什么。
  • “分组”团队: 无论任务有多难,“开关”都保持在完全相同的位置。它在机制上是稳定的。这就像拥有一个单一、不可移动的总开关来控制灯光,无论你是在为派对开灯还是仅仅在读书。

5. “相变”惊喜

关于“分组”团队,还有一个有趣的发现。当他们观察不同规模的模型时,发现了一个“临界点”。

  • 最小的分组模型有点混乱(像标准团队一样)。
  • 但只要模型稍微长大一点,它就会突然进入超级集中状态。“开关”移动到一个单一、特定的位置并停留在那里。这不是缓慢、渐进的变化;它就像拨动电灯开关一样。

结论

该论文得出结论:架构(蓝图)比规模(大小)更重要

仅仅因为一个模型很大,并不意味着它无法解释。如果它采用“分组”设计(GQA)构建,那么它实际上比采用“标准”设计(MHA)构建的较小模型更容易理解和拆解。研究人员指出,由于目前使用的许多最大、最强大的 AI 模型已经采用了这种“分组”设计,它们可能比我们之前认为的更加透明、更容易研究。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →