← 最新论文
🤖 machine learning

Scalable Circuit Learning for Interpreting Large Language Models

本文介绍了 CircuitLasso,这是一种可扩展的稀疏线性回归方法,它能够高效地学习大型语言模型中稀疏自编码器特征上的可解释电路,在匹配高成本干预技术准确度的同时,以极低的计算成本实现有效的领域泛化。

原作者: Naiyu Yin, Dennis Wei, Tian Gao, Amit Dhurandhar, Karthikeyan Natesan Ramamurthy, Yue Yu

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Naiyu Yin, Dennis Wei, Tian Gao, Amit Dhurandhar, Karthikeyan Natesan Ramamurthy, Yue Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

把大型语言模型(LLM)想象成一座巨大且极其复杂的工厂。在这座工厂内部,数以百万计的微小工人(神经元)互相传递笔记,从而产生最终的输出:一个句子或一个答案。

长期以来,试图理解这座工厂如何运作的科学家们面临着一个重大问题:这些工人非常混乱。 一个工人可能同时被“苹果”、“红色”和“健康”这三个概念激活。因为一个工人同时承担了许多不相关的任务,所以很难确定究竟是哪个工人负责了最终句子的特定部分。这就像是在试图弄清楚是谁烤了蛋糕,但厨房里的每一位面包师都在同时玩着面粉、鸡蛋和画笔的杂耍。

新工具:“特征检测器”

为了解决这个问题,研究人员开始使用一种特殊的工具——稀疏自编码器(Sparse Autoencoder, SAE)。你可以把它想象成一个坐在工厂工人与外部世界之间的翻译官。与其直接观察那些混乱的工人,这个翻译官会将他们的活动归类为非常具体、用途单一的“特征”。

现在,不再是一个工人同时处理多种事物,而是拥有了专门的“体育迷”特征、“语法警察”特征或“饥饿感”特征。每个特征只为一种清晰的概念而亮起。这使得工厂的内部运作变得更容易阅读。

问题所在:数据量过大

这里有一个难点:虽然这些“特征”变得更加清晰了,但它们的数量却有数以千计。试图绘制出这数千个特征之间是如何相互通信的地图,就像是在开着一辆时速只能走一英里的汽车,试图绘制出一座巨型城市中每一条道路的地图。

过去用于绘制这些连接的方法需要进行“干预”。想象一下,如果你想了解一张道路地图,你必须逐一封锁每一条街道,看看会发生什么。这极其缓慢、昂贵,且对于大型模型来说在计算上是不可能的。

解决方案:CircuitLasso

该论文的作者引入了一种名为 CircuitLasso 的新方法。

CircuitLasso 不再像“逐一封锁街道”那样工作,它更像是一个拿着放大镜并使用统计学捷径的超级聪明侦探。它观察已经自然发生的交通模式(数据),并使用一种称为“稀疏回归”的数学技术来确定其中的连接。

  • 类比: 想象你想知道汤里哪些配料是必不可少的。
    • 旧方法(干预): 你尝一口汤,然后去掉一种配料,再尝一口,放回配料,再去掉另一种,再尝一口……对每一种香料都这样做。这太慢了。
    • CircuitLasso: 你查看所有配料清单和最终的味道,然后使用一种智能算法,瞬间计算出哪些配料真正发挥了关键作用。它更快,而且不需要去折腾那锅汤。

他们的发现

该论文主要提出了三点结论:

  1. 速度与质量并存: CircuitLasso 比旧的“封锁街道”方法快得多。在标准基准测试中,它的速度提高了 3 倍,但它找到的“电路”(连接图谱)具有相同的准确度。
  2. 更清晰的故事: 由于它处理的是清晰的“特征”(如“饥饿”或“语法”)而非混乱的神经元,它绘制的地图对人类来说非常易于理解。他们发现了展示一个概念(如“饥饿”)如何流经模型各层并最终导致行动(如“进食”)的“树状”路径。他们甚至发现了“伪相关”现象——即模型认为“饥饿”与“自我”相关,仅仅是因为这些词在训练数据中经常一起出现。
  3. 实际应用价值: 他们在一个任务上测试了该方法,即让模型根据个人简历猜测其职业。该模型存在偏见(例如,假设所有护士都是女性)。通过使用 CircuitLasso 来识别并移除导致这种偏见的特定“性别”特征,他们能够修正模型的预测。他们完成这一过程的成本更低、速度更快,且达到了相似甚至更好的效果。

核心总结

这篇论文提出了一种高效的新方法,用于逆向工程 AI 模型是如何思考的。通过从观察混乱的神经元转向观察清晰的、单用途的特征,并利用快速的数学捷径而非缓慢的暴力测试,作者创造了一个可以快速且清晰地绘制大型 AI 模型“大脑”地图的工具。这不仅帮助我们理解 AI 说了什么,更帮助我们理解它为什么这么说,以及当它犯错时如何修复它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →