← 最新论文
💻 computer science

SHIFT-LLM: Distribution Shift Correction in Depth-Pruned LLMs

SHIFT-LLM 是一个无需训练的剪枝后框架,它通过插入通过闭式回归校准的轻量级线性残差适配器,来恢复深度剪枝大语言模型的准确度,从而纠正因移除 Transformer 块而导致的分布偏移。

原作者: Ali Bahri, Hang Li, Hongliang Li, Zhitang Chen

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Ali Bahri, Hang Li, Hongliang Li, Zhitang Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是当今许多最先进人工智能工具背后的引擎,它们能够创作故事、解决问题并回答复杂的问题。这些系统由一层层堆叠在一起的数字处理单元构建而成,非常像一座多层建筑,每一层都在对从下一层传递上来的信息进行精炼。建筑的楼层越多,其最终输出就越详细、越复杂,但这也使得结构变得异常沉重且运行成本高昂。对于许多实际应用场景,尤其是对于电力或内存有限的设备而言,这些庞大的模型实在过于庞大而无法使用。为了使它们变得更小,研究人员开发了移除整个“楼层”的方法,这一过程被称为深度剪枝(depth pruning)。虽然这成功减轻了负载并提高了模型的运行速度,但往往会导致剩余的楼层出现踉跄。因为被移除的楼层原本是设计用来向其上方传递特定类型信息的,拿走它们会导致上层变得困惑,接收到的信号不再符合它们训练时所预期的模式。这种不匹配被称为分布偏移(distribution shift),它会导致模型失去准确性并产生错误,迫使开发者投入大量的时间和计算资源来重新训练模型以修复这些错误。

华为诺亚方舟实验室的一个研究团队推出了一种名为 SHIFT-LLM 的新方法,旨在无需重新训练的情况下解决这一问题。该方法并非试图重建缺失的楼层或重新教导剩余的楼层,而是在每一个移除层的部位插入一个微小的、轻量级的修正模块。想象一下,如果你从一栋建筑中移除了一个楼层,你会安装一个简单的、定制的坡道来完美地填补这个缺口,确保上层的人们仍能接收到与缺失楼层存在时完全相同的指令。在数字世界中,这个“坡道”是一个线性适配器(linear adapter),它在保持信息直接路径的同时,增加了一个微小的、经过计算的调整。这种调整旨在模拟被移除层本应做出的特定贡献,有效地“欺骗”模型的其余部分,使其认为缺失的楼层仍然存在。

这种方法的精妙之处在于它如何计算这种调整。研究人员并没有通过数千小时的训练来弄清楚缺失层应该做什么,而是使用一小组样本数据来精确测量丢失了哪些信息。然后,他们使用一种直观的数学计算来确定恢复该丢失信息所需的精确修正量。这个过程是完全自动化的,不需要基于梯度的优化(即通常修复损坏模型时所需的复杂、迭代的学习过程)。通过使用这种闭式解(closed-form)计算,团队可以在短短几分钟内,仅利用几百个样本,便完成对模型内部状态的修正,而无需耗费数天的计算时间。其结果是,剪枝后的模型既保留了层数减少带来的速度和效率,又能保持与原始庞大模型几乎一致的准确性。

在实验中,研究人员在五个不同家族的大语言模型上测试了这一技术,规模从 15 亿参数的小型模型到 140 亿参数的版本不等。他们采用了六种不同的方法来决定移除哪些层,并在七个旨在测试通用知识和推理能力的基准测试上进行了评估。研究结果是一致的:修正模块在几乎所有配置下都成功恢复了剪枝过程中损失的准确性。在一个涉及 80 亿参数模型的显著案例中,该方法在一个标准基准测试上恢复了惊人的 15.7 个百分点的准确度,而这种增益通常需要进行大规模且昂贵的重新训练。即使在模型剪枝后已经进行了微调的情况下,添加这个修正模块依然提供了额外的提升,这表明这两种方法可以很好地结合使用,以进一步推高性能。

研究人员还展示了这些修正模块可以进一步压缩以节省空间,并且可以在连续移除多个层时进行合并,从而确保剪枝带来的效率收益不会被修复过程本身的开销所抵消。这项工作表明,使大语言模型变小的主要障碍不仅在于移除部件,更在于破坏了它们之间的信息流。通过专注于使用简单、有针对性的调整来修复这种信息流,SHIFT-LLM 提供了一种通用且高效的方法,使强大的 AI 模型能够应用于日常使用。这项研究证实,只要有正确的修正,我们就可以剥离掉这些数字大脑中沉重且冗余的部分,而不损失其清晰思考的能力,从而为更快、更便宜、更易于获取的人工智能打开了大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →