← 最新论文
🤖 machine learning

Ghosted Layers: Unconstrained Activation Alignment for Recovering Layer-Pruned LLMs

本文提出了一种无需训练的“幽灵层”方法,通过推导一个闭式最优线性算子来对齐幸存层之间的激活分布,从而恢复层剪枝大语言模型的性能,在保持效率提升的同时超越了现有的约束基线方法。

原作者: Vincent-Daniel Yun, Junhyuk Jo, Sai Praneeth Karimireddy, Sunwoo Lee

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Vincent-Daniel Yun, Junhyuk Jo, Sai Praneeth Karimireddy, Sunwoo Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位才华横溢、训练有素的厨师(即大型语言模型),他花费数年时间学习烹饪复杂菜肴。这位厨师在一个拥有 32 个不同工作站的大型厨房中工作,每个工作站都会为菜肴增添特定的风味或质地。

问题:切除中间部分
为了让厨房运行得更快、成本更低,有人决定一次性移除中间的一大块工作站——例如,一次移除 7 个或 11 个工作站。这被称为“层剪枝”。

问题在于,被切除部分之前和之后的工作站,原本是通过那些缺失的工作站相互协作的。当你移除中间部分后,紧接在切口之后的工作站接收到的“食材”,与其预期的样子截然不同。这就像一位面包师期待得到完美揉好的面团,却收到了一团生硬、结块的烂泥。面包师(即下一层)感到困惑,食谱分崩离析,最终菜肴(即 AI 的回答)难以下咽。

旧有的修复方案:试图填补空缺
以往试图修复这一问题的方法,就像试图把方形的木桩硬塞进圆形的孔里。

  • 有些方法试图仅仅“拉伸”现有食材,使其看起来更像预期的样子,但它们过于僵化。
  • 其他方法则尝试使用一种非常具体、对称的工具来修复不匹配之处。论文指出,这就像试图仅用一把只能上下移动而不能左右移动的尺子,去修复一个歪斜的相框。这是一种受限的工具,无法达到完美的解决方案。

新方案:“幽灵层”
作者提出了一种名为“幽灵层”的新方法。你可以将其想象为一位“幽灵厨师”,或一座恰好出现在缺失工作站位置的魔法桥梁。

以下是其工作原理的简单说明:

  1. 校准(味觉测试):在永久改变厨房之前,团队会取一小份食材样本(几段文本),让它们通过原始的完整厨房。他们记录下食材在进入缺失工作站之前的确切状态,以及离开这些工作站之后的确切状态。
  2. 数学魔法:他们计算出“之前”状态与“之后”状态之间的精确差异。他们不是靠猜测或使用受限工具,而是利用数学公式,找出将“之前”状态转化为“之后”状态所需的完美且无限制的转换。
    • 类比:如果缺失的工作站将红苹果变成了绿苹果,受限的工具可能只能将其涂得稍绿一些。而“幽灵层”则能计算出将红苹果完美转变为绿苹果所需的精确化学变化,无论这种变化多么复杂。
  3. 结果:他们将这个完美的“幽灵层”插入到经过剪枝的厨房中。现在,当食材从切口前的工作站流向切口后的工作站时,它会穿过这个幽灵,瞬间被转化为下一工作站所期望的确切状态,烹饪得以顺畅继续。

为何更优
论文声称,以往的方法就像试图用半套拼图来解谜,或使用过于简单的工具。“幽灵层”则用完整的拼图和最灵活的工具解决了这个谜题。

  • 无需重新训练:你无需重新教导厨师如何烹饪。只需安装这座新的“幽灵桥梁”,厨房即可恢复运作。
  • 速度相同:尽管设计幽灵的数学计算很复杂,但一旦构建完成,它并不会拖慢厨房的运行速度。其运行速度与以往那些受限的修复方法一样快。
  • 味道更佳:在测试中,当移除大量厨房部分时,该方法产生的结果(更高的准确率和更低的困惑度)远优于以往的方法。

总结
当你切除智能 AI 的部分组件时,剩余部分会因信息流中断而感到困惑。“幽灵层”充当了一个完美、无形的翻译器,瞬间修复了断裂的信息流,使 AI 能够在无需重新训练的情况下,以全速继续工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →