Pruning via Causal Attribution Preserves Reasoning Performance in Large Language Models
本文介绍了因果归因剪枝(Causal Attribution Pruning, CAP),这是一种无需训练的方法,它通过基于注意力头(attention heads)的因果影响而非简单的幅度或激活指标来识别并剪枝权重,从而在适度的稀疏水平下保持大语言模型的推理性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
把大语言模型(LLM)想象成一座巨大的、繁忙的图书馆,里面存放着数十亿本书籍(参数)。为了回答一个复杂的问题,图书馆会派出研究团队(注意力头)去寻找正确的信息并将其拼凑起来。问题在于,这座图书馆如此庞大,以至于运行它需要耗费大量的时间和能量,导致它很难在日常设备上使用。
这篇论文介绍了一种缩减这座图书馆规模的新方法,且不会破坏其解决难题的能力。他们称这种方法为因果归因剪枝(Causal Attribution Pruning,简称 CAP)。
以下是它的工作原理,使用了简单的类比:
旧方法的问题
以往缩减这些模型的方法,就像是一个只根据书脊有多薄或封面墨水有多少来扔掉书籍的图书管理员。他们假设:“如果一本书看起来很小或不重要,那它一定是不需要的。”
但在推理的世界里,这是一个错误。一本微小的、薄薄的书可能包含了解决数学问题所需的唯一关键事实,而一本巨大、厚重的书可能只是充满了废话。如果你根据大小扔掉那本薄书,模型就会失去逻辑思考的能力。
新方案:“如果……会怎样?”测试
CAP 采取了不同的方法。它不是根据大小来猜测,而是进行一系列“如果……会怎样?”的实验。
校准阶段(测试运行):
研究人员给模型一组棘手的逻辑谜题(如数学应用题或科学问题)。然后,他们在模型内部的研究员(注意力头)之间玩一场“捉迷藏”游戏。- 他们暂时“遮蔽”(隐藏)某一个特定的研究员。
- 他们让模型再次尝试解决这些谜题。
- 评分: 如果隐藏这个研究员会导致模型无法解决谜题,那么该研究员会被标记为**“关键型”。如果模型在没有他们的参与下依然能顺利解决谜题,则该研究员被标记为“冗余型”**。
剪枝阶段(清理工作):
一旦知道了哪些研究员是关键的,他们就不会直接解雇整个团队。相反,他们会观察每一位研究员办公桌里的单个笔记和工具(权重)。- 如果一位研究员是**“关键型”**,即使他们的工具看起来很小或不重要,也会受到保护。
- 如果一位研究员是**“冗余型”**,他们的工具就可以被视为可以丢弃的对象。
- 随后,他们会移除那些最不重要的特定工具,从而创建一个更小的“稀疏”模型,同时保留核心思考者。
结果:保留逻辑
研究人员在两个流行模型(Llama-3 和 Mistral)上测试了该方法,并将其与旧有的“基于大小”的方法(称为 Wanda)进行了对比。
- 黄金区间(10% 到 20% 的缩减): 当他们对模型进行适度缩减时,CAP 表现得非常出色。在一项名为 ARC-Challenge 的科学推理测试中,新方法使模型的智能保持水平比旧方法高出 61%。它成功地保留了“逻辑电路”,同时剔除了废话。
- 极限值(50% 的缩减): 当他们试图将模型缩减一半时,情况变得混乱了。该方法对于“思考”部分(注意力头)效果很好,但在“事实存储”部分(MLP 层)却遇到了困难。因为该方法对事实存储部分缺乏细粒度的测试手段,导致它不小心扔掉了太多东西,导致模型崩溃。
核心结论
把 CAP 想象成一位聪明的编辑,他不仅仅根据字体大小来删减文字。相反,这位编辑会阅读故事,询问:“如果我删掉这句话,会发生什么?”并且只剪掉那些不会改变情节的句子。
这使得模型可以变得更小、更快,同时保持其解决复杂的、多步骤推理问题的能力——但前提是你不能剪得太深。 如果你试图剪掉太多,这种方法就会失效,因为它无法完全理解如何保护模型的记忆库。
关键启示: 要想让 AI 保持优秀的思考能力,你需要衡量缺失部分时它实际做了什么,而不仅仅是看这些部分看起来有多大。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。