← 最新论文
💬 NLP

High-Layer Attention Pruning with Rescaling

本文介绍了高层注意力剪枝与重缩放(High-Layer Attention Pruning with Rescaling, HARP),这是一种新颖的无需训练的方法,它通过策略性地移除大语言模型高层中的注意力头,并应用自适应重缩放以保持表示幅度,从而在各种生成和判别任务中实现了比现有结构化剪枝技术更优越的性能。

原作者: Songtao Liu, Peng Liu

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Songtao Liu, Peng Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有一个超级聪明的机器人大脑,一个“大语言模型”(LLM),它能写故事、解数学题,还能像人类一样聊天。这些大脑极其强大,但也极其庞大——就像试图把一整个图书馆装进你的背包里。因为它们太大了,运行起来很慢且占用大量空间,这使得它们很难在普通的手机或笔记本电脑上使用。为了解决这个问题,科学家们使用了“剪枝”(pruning)技术。把剪枝想象成修剪盆栽:你仔细地剪掉那些没做什么工作的枝条,让树木保持健康的同时变得更小、更快速。

通常,当人们修剪这些机器人大脑时,他们会观察“注意力头”(attention heads)——这些是模型大脑中帮助决定哪些词语彼此重要的微小部分。想象一下,这些注意力头就像是在房间里的侦探小组,每个侦探都在观察不同的线索。旧的剪枝方法只是从每一个房间里随机挑选几个侦达并把他们踢出去,希望团队仍能正常运作。但这篇文章表明,这并不是最聪明的做法。事实证明,在建筑物的最高层(模型的更高层),侦探们往往只是在重复下面的人已经说过的话。他们并没有增加多少新的价值。作者 Songtao Liu 和 Peng Liu(来自宾夕法尼亚州立大学)想要研究,如果我们只修剪高层楼的侦探,而留下那些在底层辛苦工作的侦探,是否能获得更好的结果。他们还想出了一个聪明的窍门,以确保在移除这些高层侦探时,大脑不会感到混乱。

核心理念:从顶端切除,而非从中间

研究人员提出了一种名为 HARP(高层注意力重缩放剪枝,High-layer Attention Rescaled Pruning)的新方法。他们的主要发现是,大语言模型的“高层”实际上比低层更不重要。要理解这一点,请想象一场接力赛。起跑阶段的选手(底层)正在进行繁重的体力活,理清单词和句子的基本形态。随着接力棒向赛道上方移动到高层,选手们只是在传递接力棒。当接力棒到达最顶端时,选手们已经如此同步,以至于他们都在做完全相同的事情。如果你从赛道的顶端移除一名选手,比赛其实不会发生改变,因为他们无论如何都只是在模仿下面的人。

作者发现,如果你在这些高层中进行剪枝(切除)注意力头,模型的效果实际上比随机从各处切除要好。他们在 LLaMA3.1-8B、Mistral-7B、Qwen2-7B 和 Gemma2-9B 等几个著名模型上进行了测试。在实验中,他们从模型最高的 8 层中移除了特定的注意力头。

“音量旋钮”窍门

不过,这里有一个问题。当你移除那些高层侦探时,大脑发出的信号会变得比以前稍弱或稍强。这就像如果你从音响系统中移除了一个扬声器;音乐可能仍在播放,但音量不对,声音可能会失真。为了修复这个问题,作者引入了一个“重缩放参数”。把它想象成一个音量旋钮或调光开关。在切除那些高层之后,你旋转这个旋钮来调整信号的大小,确保剩余的部分仍然能清晰地听到彼此的声音。他们并没有靠猜来确定正确的设置;而是使用了一种智能搜索方法来找到完美的音量水平,通过测试不同的数字,直到模型听起来效果最好为止。

他们的发现

结果非常令人印象深刻。当他们在 27 个不同的任务(从回答常识问题到解决复杂的数学问题以及总结长文档)上测试 HARP 方法时,它始终优于其他流行的剪枝方法。

  • 生成任务(Generation Tasks): 这是模型需要创造新内容的任务,比如逐步解决数学问题。在这里,HARP 表现得最为出色。例如,在 LLaMA3.1-8B 模型上,HARP 在生成任务上的平均得分达到了 31.10%,而次优的方法仅为 20.58%。这是一个巨大的飞跃!
  • 长文本处理(Long Context): 论文还研究了模型处理超长故事或文档(高达 65,536 个 token)的能力。由于注意力机制是处理长文本时变慢的部分,修剪高层使模型显著变快。他们发现,对于 65,536 个 token 的序列,他们的剪枝模型比原始未剪枝的模型快了 16.7%,同时保持了高质量。
  • 判别任务(Discriminative Tasks): 这些是模型只需从列表中选出正确答案的任务(比如多选题)。在这里,提升虽然较小但依然是正向的。HARP 的表现与其它方法持平或更好,这表明切除高层并没有破坏模型理解事实的能力。

为什么这很重要

作者认为,这种方法是让 AI 运行得更快、更便宜,且无需从头开始重新训练整个模型的游戏规则改变者。通过意识到 AI 大厦的高层是最“冗余”(做最少独特工作)的部分,我们可以“去脂而不伤肌肉”。“重缩放”窍门确保了当你移除这些部分时,模型不会感到晕眩。

简而言之,本文认为我们不应该把 AI 的所有部分都同等对待。就像摩天大楼一样,顶层对结构的贡献可能不如底层。通过仔细修剪顶端并调节音量,我们可以让这些庞大的 AI 大脑变得更小、更快,并准备好用于日常使用。该方法的代码已开放供任何人尝试,作者希望这能让长文本 AI(比如在几秒钟内阅读整本书)在现实世界中变得更加实用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →