← 最新论文
🤖 machine learning

CRePE: Convolution-aware Relative Importance in Post-training Pruning with Efficient Search

本文介绍了 CRePE,这是一种通过引入 2D 局部上下文和自适应系数来增强相对重要性评分的训练后剪枝方法,并提出了 PHO 以在数分钟而非数小时内高效优化这些超参数,从而在多种模型和稀疏设置下均实现了最先进的性能。

原作者: Cheonjun Park

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Cheonjun Park

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有一座巨大且极其聪明的图书馆(大语言模型),它几乎无所不知。问题在于,这座图书馆实在太庞大了,占据了整个仓库,甚至需要一个庞大的图书管理员团队才能找到一本书。你想把这座图书馆缩小到可以装进背包的大小,同时又不损失它讲好故事或回答问题的能力。

这篇论文介绍了一种名为 CRePE 的新方法来帮助缩小这些“图书馆”,并提供了一种超级快速的方法来寻找最佳的缩小方案。

以下是使用简单类比进行的拆解:

1. 问题所在:“一维”错误

以往的方法试图通过一种非常简单的方式来决定丢弃哪些书(权重)。想象一位图书管理员正在观察书架:

  • 旧方法 (RIA): 管理员只看(书所在的架子)和(书上方和下方的垂直堆叠)。如果一本书在这些直线方向上有许多邻居,他们就会认为这本书很重要。
  • 缺陷: 这就像仅凭左/右和上/下邻居就来判断一本书的重要性。但实际上,书也会受到其对角线相邻书籍的影响。此外,旧方法将“行”和“列”视为同等重要,但作者发现,观察“行”实际上比观察“列”更有帮助。

2. 解决方案:CRePE(“二维邻域”图书管理员)

作者创建了 CRePE,一位更聪明的图书管理员,它采用了 2D 邻域 方法。

  • 环顾四周: CRePE 不仅仅是看上下左右,它还会观察特定书籍周围的一整个小方块区域(例如 3x3 或 5x5 的网格)。它明白,一本书的价值受其整个局部邻域的影响,而不仅仅是一个十字形区域。
  • 自适应权重: CRePE 还意识到某些方向更为关键。它使用“可调节的旋钮”(系数)来决定在多大程度上信任行、列以及对角线邻居。它不会把它们都同等对待,而是通过学习来确定哪些方向对于保持图书馆知识完整性最为关键。

结果: 通过使用这种更聪明的 2D 视角,即使在丢弃了一半书籍后,CRePE 也能比旧方法更好地保留图书馆的智能。

3. 速度问题:“试吃”瓶颈

这里有一个限制。为了找到这些“可调节旋钮”的最佳设置,旧方法需要管理员实际缩小图书馆,测试其效果(通过阅读一本测试书),然后再次尝试。

  • 旧方法: 这个“试吃”过程对于一个大型图书馆来说需要大约 11 小时。这违背了追求快速高效的初衷!

4. 修复方案:PHO(“水晶球”捷径)

为了解决速度问题,作者发明了 PHO(基于代理的超参数优化)。

  • 洞察: 他们发现了一个被称为 基尼系数 (Gini Coefficient) 的“水晶球”指标。与其测试整个图书馆,他们只观察第一个层级(模型的第一个层)的第一部分内容。
  • 神奇之处: 他们发现这个微小部分的“不均匀性”(基尼系数)与整个图书馆的表现几乎完全相关(95% 的匹配度)。
  • 结果: PHO 不进行 11 小时的完整测试,而是对这个微小的部分进行快速模拟。它能在约 20 分钟 内找到最佳设置。这实现了 30 倍的加速

5. 它在任何地方都有效吗?

作者在许多不同的“图书馆”(如 LLaMA、Qwen、Phi 和 DeepSeek 等模型)以及不同的缩小方式(随机切割 vs. 有结构的 2:4 模式)上测试了 CRePE。

  • 一致的赢家: CRePE 始终优于之前的最佳方法。
  • 兼容并蓄: 它像一个通用适配器。你可以将 CRePE 与其他技巧(如打乱书籍顺序或稍后重新切割图书馆)结合使用,使其效果更好。
  • 一次搜索,多种模型: 如果你找到了一个小图书馆(LLaMA-7B)的最佳设置,这些相同的设置也可以完美适用于更大的图书馆(LLaMA-13B),而无需重新搜索。

总结

  • CRePE 是一种更聪明的决定如何裁剪 AI 部分的方法,它通过观察数据的 2D 邻域而非仅仅是十字形区域来进行判断。
  • PHO 是一个快速搜索工具,它利用一个微小的“代理”测试,在 20 分钟内找到最佳设置,而不是 11 小时。
  • 两者结合,使缩小 AI 模型变得更快、更智能,在保持 AI “大脑”完整的同时,使其体积大幅缩小。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →