When Pruning Meets Interpretability: Preserving Sparse Autoencoder Robustness in LLMs
本文证明了像 Wanda 和 SparseGPT 这样具有激活感知能力的剪枝方法通过控制扰动能量,比幅度剪枝能更好地保持大语言模型中稀疏自编码器的鲁棒性,同时也揭示了中间层对剪枝具有独特的敏感性,并提出了一种用于提高模型效率的逐层稀疏分配策略。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大型语言模型是庞大的数字大脑,通过学习人类几乎所有的书面历史来预测句子中的下一个词。为了理解这些模型的思考方式,研究人员开发了一种名为“稀疏自编码器”的工具。可以将这个工具想象成一个翻译器,它倾听模型的内部电信号,并将其转化为简单的、人类可读的概念列表,例如“正在讨论‘国王’这个词”或“正在进行一项数学运算”。这种翻译至关重要,因为它让科学家能够看清模型在黑盒内部的具体运作情况,从而帮助他们发现隐藏的偏见或危险行为。然而,随着这些模型变得越来越大且运行成本越来越高,工程师们正越来越多地尝试通过移除不必要的连接来缩小模型规模,这一过程被称为“剪枝”,旨在使其运行得更快、更便宜。关键的问题在于,这种缩减过程是否会破坏这个翻译器。如果模型被改变了,翻译器是否仍能理解新的信号,还是会开始产生乱码?
俄亥俄州立大学的一个研究小组致力于回答这个问题,他们研究了在翻译器已经构建完成后,对大型语言模型进行缩减会发生什么。他们发现,缩减模型所使用的方法比缩减的程度更为重要。一些常见的手段——即简单地移除网络中最小的连接——就像一种粗鲁的钝器,会扰乱内部信号。当使用这些方法时,即使模型在标准测试中看起来表现良好,翻译器也会失去识别概念的能力。研究人员发现,这是因为这些粗鲁的方法忽略了流经模型的数据形态,有效地扭曲了翻译器所依赖的信号本身。相比之下,更先进、更复杂的方法会观察数据在网络中实际是如何移动的,这些方法保留了翻译器的准确性,使内部信号保持清晰,概念依然可辨。
这项研究揭示了这些模型中一个令人惊讶的结构性弱点。位于输入层和输出层之间的中间层,其脆弱程度显著高于开头或结尾部分。当研究人员对模型进行剪枝时,中间部分受到的损害最为严重,导致即使模型的整体性能看起来尚可,翻译器也会失效。这一发现催生了一种新的缩减模型策略:与其在整个网络中均匀地移除连接,工程师应该对中间层更加谨慎,而对后期层可以更加激进。通过遵循这种不均匀的进度表,他们能够在缩减模型的同时保持翻译器完美运行,从而在效率与理解力之间实现更好的平衡。
为了得出这些结论,研究人员不仅仅观察模型是否仍能正确回答问题。他们使用了一套专门用于检查翻译器是否仍在“说实话”的综合测试。他们检查了翻译器是否仍能重建原始信号,单个概念是否仍能正确触发,以及移除特定概念是否仍会按预期方式改变模型的行为。他们的结果表明,旧有的、简单的缩减模型方法会导致翻译器发生“无声失效”:模型可能仍能生成优秀的文本,但其内部的概念图谱已经破碎。而新的、更智能的方法则能保持图谱完整。这项工作为任何想要在压缩这些强大模型的同时,又不失去对其运作原理理解能力的人提供了清晰的指南,确保我们在使这些系统变得更小、更快的同时,不会丢失开启其内在逻辑的关键钥匙。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。