← 最新论文
🤖 machine learning

Locality-Aware Redundancy Pruning for LLM Depth Compression

本文提出了 LoRP,这是一种无需训练的单次深度剪枝框架,它基于一种新颖的表示局部性得分动态分配层移除策略,从而在保持性能的同时有效减少大语言模型中的冗余。

原作者: Vincent-Daniel Yun, Youngrae Kim, Woosang Lim, YoungJin Heo, Minkyu Kim, Sunwoo Lee

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Vincent-Daniel Yun, Youngrae Kim, Woosang Lim, YoungJin Heo, Minkyu Kim, Sunwoo Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一座庞大且深不可测的知识图书馆(即大型语言模型)。这座图书馆有数百层楼(层),每一层都有一支图书管理员团队(神经元)协助处理信息。问题是,这座图书馆规模巨大、运行成本高昂且导航缓慢。你希望移除一些楼层以加快速度,但你又担心如果移除了错误的楼层,图书馆将不再具有意义。

本文介绍了一种决定移除哪些楼层的新方法,称为LoRP(局部感知冗余剪枝)。其工作原理如下,简单解释:

旧方法:猜测与检查

此前,人们尝试通过两种主要策略来缩减这些图书馆:

  1. “局部”方法:他们单独审视每一层楼,并说:“这一层似乎很弱,让我们移除它。”他们假设每一层都是独特且独立的。
  2. “连续”方法:他们假设冗余(不必要的重复)仅发生在特定的楼层区块中,例如第 10 层到第 15 层。因此,他们直接切掉整个区块。

问题所在:作者发现,不同的图书馆(AI 模型)具有不同的“架构”。在某些图书馆中,多余且无用的工作集中在一个特定的区块;而在其他图书馆中,多余的工作则均匀分布在整个建筑中。旧方法采用“一刀切”的规则,往往导致切除了重要的楼层,或留下了无用的楼层。

新方法:LoRP(智能建筑师)

LoRP 就像一位智能建筑师,在做出任何切割之前先走进图书馆,观察楼层之间实际的相互关系。它不需要重新训练图书馆(它是“免训练”的);它只需观察图书管理员们如何相互交流。

以下是分步过程:

1. “回声”测试(测量相似性)

建筑师将几个示例句子送入图书馆,并倾听“隐藏思想”(表示)如何随楼层变化。

  • 如果第 5 层和第 6 层几乎在说完全相同的内容,它们就是冗余的。
  • 如果第 5 层说的内容与第 6 层完全不同,它们就是独特的。

2. “局部性分数”(RLS)

建筑师计算一个名为**表示局部性分数(RLS)**的分数。你可以将其视为一个“聚集度计”:

  • 高分(聚集型):图书馆存在“回声室”。第 10 层到第 20 层都在重复相同的想法。冗余是局部化的。
  • 低分(分散型):图书馆存在“弥散回声”。重复现象散布在整个建筑中,从地下室到屋顶。冗余是全局分布的。

3. 楼层分组(聚类)

根据该分数,建筑师将楼层分组为具有相似思维的“社区”(簇)。

  • 如果图书馆是“聚集型”,社区就是由相同楼层组成的紧密群体。
  • 如果图书馆是“分散型”,社区则更加多样化。

4. 两阶段切割(剪枝)

现在,建筑师使用两步策略来决定移除哪些楼层:

  • 步骤 1(覆盖):首先,他们确保从每个社区中移除层楼。这确保他们不会意外抹去整个独特的社区。
  • 步骤 2(清理):然后,他们查看每个社区中剩余的楼层。他们继续移除最“冗余”(最重复)的楼层,直到达到目标规模。

为何效果更好

该论文在多种不同类型的 AI 模型(如 LLaMA、Mistral 和 Qwen)上测试了此方法。

  • 对于“聚集型”模型:LoRP 正确识别出可以安全地从一个特定区域移除一大块楼层。
  • 对于“分散型”模型:LoRP 正确意识到需要从许多不同区域各取一点,而不是切掉一个大块。

结果
由于 LoRP 能适应图书馆的具体形状,与旧的“一刀切”方法相比,它在保持 AI 更聪明、更准确方面表现更佳。即使在移除了大量楼层后,它也能更好地保留图书馆回答问题及理解语言的能力。

简而言之

这就像剪辑一部电影。

  • 旧方法就像盲目地每隔 10 个场景就剪掉一个,或者剪掉整整 5 分钟的片段,因为它们假设电影以某种特定方式重复。
  • LoRP则像一位导演,先观看整部电影,确切地看到对话在哪里重复,然后剪掉具体的冗余台词,同时保持故事流畅,无论电影最初的结构如何。

该论文得出结论:理解信息在 AI 中何处以及如何重复,是高效缩减其规模而不破坏其功能的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →