← 最新论文
💻 computer science

LLMs can Compress LLMs: Adaptive Pruning by Agents

本文介绍了一种智能体引导的剪枝框架,其中基础模型通过敏感性剖面和自我反思来自适应地确定层级稀疏率,在无需重新训练的情况下,相比现有方法在事实知识保留和困惑度方面取得了显著改进。

原作者: Sai Varun Kodathala, Rakesh Vunnam

发布于 2026-01-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Sai Varun Kodathala, Rakesh Vunnam

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:过重的负担

想象一下,你拥有一个庞大且极其聪明的图书馆(即大语言模型,简称 LLM)。它几乎无所不知,但规模如此之大,以至于需要占据整个仓库,并且需要一支卡车车队才能搬运它。你想把它缩小到可以装进背包的大小,以便在普通电脑上运行,但你不能随手扔掉随机的书籍。如果你这样做,这个图书馆可能会忘记如何计时,或者失去回答关于历史问题的基本能力。

目前的缩减方法就像是在使用饼干切割器。它们从每一层书架上切掉相同数量的“东西”,而不管那一层放的是至关重要的历史书,还是仅仅是一些旧目录。这通常会导致一个虽然体积变小了、但却丢失了最重要知识的图书馆。

解决方案:一位聪明的图书管理员智能体

论文作者提出了一种缩减这些模型的新方法。他们没有使用饼干切割器,而是使用了一位**聪明的图书管理员(AI 智能体)**来决定究竟该扔掉什么。

以下是他们的“智能体引导剪枝”(Agent-Guided Pruning)的工作原理:

1. 检查(敏感度剖析)

在图书管理员开始扔东西之前,他们会对每一层书架进行详细检查。他们观察两件事:

  • 书籍被使用的频率:(权重-激活指标)。
  • 如果移除这本书,图书馆的“声音”会发生多大的变化:(梯度重要性)。

他们将这些观察结果转化为一个简单的分数(“z 分数”)。低分意味着:“这本书很少被使用,丢了也不会被察觉。”高分意味着:“这本书至关重要;不要碰它。”

2. 决策者(LLM 智能体)

这是神奇之处。与其使用一个盲目遵循“从每层书架切掉 10%”这类规则的计算机程序,第二个 AI(智能体)会观察这些分数。

  • 该智能体扮演着战略编辑的角色。它阅读检查报告并说道:“好吧,历史部分的敏感度很高,所以我们只修剪边缘。但‘随机事实’部分很健壮,我们可以从那里多切掉一些。”
  • 智能体以迭代的方式做出这些决策,这意味着它先切掉一点,检查结果,然后再决定下一步切什么。

3. 安全网(自我反思与回滚)

智能体并非完美。有时它可能会过于贪婪,切掉了太多,导致图书馆的“声音”变得语无伦次(即“困惑度”激增,困惑度是衡量模型有多困惑的指标)。

  • 安全网: 系统在每次切割前都会保存一个检查点。如果图书馆开始变得过于混乱,系统会立即回滚到上一个良好的版本。
  • 自我反思: 智能体会收到反馈:“你刚才犯了个错误;你切得太多了。”智能体会从这种反馈中学习,调整其策略以应对下一轮,从而变得更加谨慎。

结果:一个更小、更聪明的图书馆

研究人员在两个版本的 Qwen3 模型(40 亿和 80 亿参数)上进行了测试。他们希望将这些模型缩小约 45%(使其小于原始尺寸的一半)。

以下是与旧有的“饼干切割器”方法相比的结果:

  • 通用知识 (MMLU): 旧方法使模型忘记了如何回答一般性问题。新的智能体引导方法使模型的准确率比最好的旧方法高出 56%
  • 事实记忆 (FreebaseQA): 这是最大的胜利。旧方法导致模型几乎丢失了所有的事实记忆(比如忘记谁是总统)。新方法保留的事实知识比旧方法多出 19 倍
  • 困惑度 (Perplexity): 新方法使模型的困惑程度远低于旧方法。

核心总结

这篇论文证明了一个 AI 可以有效地教导另一个 AI 如何实现自我缩减。

通过使用一个具有自我反思能力的智能体来决定哪些部分需要进行剪枝,而不是仅仅进行随机或统一的切割,他们能够创造出一个更小的模型,同时仍能记住事实并正确回答问题。智能体通过学习自身的错误(通过回滚机制),找到了在缩小模型体积与保持智能化之间取得完美平衡的方法。

简而言之: 他们用一位知道哪些页面可以撕掉、同时又能保证书本依然可读的“深思熟虑的编辑”,取代了盲目的饼干切割器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →