← 最新论文
💬 NLP

Batch-wise Adaptive Pruning: Periodic Neuron Activation-Aware Weight Pruning for Language Reasoning Model

本文提出了一种针对大语言推理模型的无需训练、批次自适应剪枝方法,该方法利用周期性 top-k 选择和激活记忆机制来克服现有方法在批次推理中存在的精度下降问题,在保持高水平推理性能的同时实现了显著的加速。

原作者: Yongmin Kim, Shota Takashiro, Yusuke Iwasawa, Takeshi Kojima, Yutaka Matsuo

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Yongmin Kim, Shota Takashiro, Yusuke Iwasawa, Takeshi Kojima, Yutaka Matsuo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试解决一个非常难的谜题,比如一个复杂的数学问题或一个棘手的逻辑谜题。你有一个聪明但非常“饥饿”的助手(一个大型推理模型),它能够通过思考各个步骤来找到答案。问题在于,这个助手如此彻底,以至于在给出最终答案之前,它会写下一份极其庞大的、循序渐进的思维日记。虽然这种“思维链”让这个助手变得异常聪明,但也让它运行起来既慢又昂贵,就像试图用一颗单节 AA 电池来驱动一台超级计算机一样。

为了让这个助手变快,科学家们经常尝试对其进行“剪枝”——基本上,就是告诉助手忽略某些它在当前时刻似乎并不需要的脑细胞(神经元)。这就像一位厨师在准备一场盛大宴席时,决定停止为那些尚未被点的菜肴切菜。问题在于,当你试图同时为一大群人烹饪时(批处理推理),旧的方法在决定“切哪些菜”时就会失效。这些方法使用一个固定的规则,这在只为一个人的时候有效,但应用到一群人时就会产生混乱。它们使用一个固定的规则,这在处理单个请求时表现良好,但当应用于一组请求时,由于“活动水平”发生了变化,会导致原本的规则不再匹配新的现实。结果就是,AI 会不小心关掉错误的神经元,导致它的“大脑”变得模糊,并开始重复胡言乱语。本文介绍了一种更聪明的方法来决定如何“切菜”,确保助手在为人群服务时依然保持敏锐。


问题所在:“一刀切”的错误

想象你是一位正在指挥管弦乐队的指挥家。如果你只有一个小提琴手,你可以很容易地告诉他:“现在大声演奏,稍后轻声演奏。”但如果你有一整组小提琴手在共同演奏(一个批次),而你根据一个普通小提琴手通常的表现给他们下达完全相同的指令,音乐可能会变成一场灾难。

当目前的 AI 模型尝试同时处理多个请求时,情况正是如此。现有的加速模型的方法使用了一种“阈值”规则。这就像是在说:“如果一个神经元的活动高于 5,就保留它;如果低于 5,就关闭它。”当 AI 独自思考时,这运行得很好。但当你输入一批不同的问题时,神经元的“活动水平”会混合在一起,从而改变了平均值。旧的规则(阈值 5)不再符合新的现实。结果是?AI 会意外地关闭错误的神经元,它的“大脑”变得模糊,并开始在推理任务上失败。论文显示,当你尝试在 4 个请求的批次中运行这些模型时,现有的最佳方法几乎失去了所有的聪明才智,准确率大幅下降(有时超过 50 个百分点)。

解决方案:带有记忆的周期性“Top-K”策略

作者提出了一种名为**批次自适应剪枝(Batch-wise Adaptive Pruning)**的新方法。他们不再使用僵化的“通过/失败”界限(阈值),而是使用一种更聪明、更灵活的方法,包含两个主要技巧。

首先,他们不再使用固定的界限,而是开始使用 “Top-K”选择。想象你有 100 名跑步者(神经元),但车上只有 50 个座位。与其说“只有跑得快于 10 秒的人才能上车”,不如直接说:“最快的 50 名跑步者可以上车。”无论今天的跑步者普遍是快还是慢,你始终挑选最好的 50 名。这解决了导致旧方法失效的“分布偏移”问题。

其次,他们意识到重要的神经元并不会跳动一次就消失;它们有一个节奏。论文观察到,在长期的推理任务期间,最重要的神经元倾向于以一种规律的模式“重新激活”(苏醒并开展工作),大约每 22.8 个 token(文本块)一次。为了捕捉到这种节奏,新方法仅周期性地(每 20 步)更新其剪枝掩码,而不是每产生一个词就更新一次。这节省了时间,因为计算机不必在每一个微小的瞬间都停下来重新计算保留哪些神经元。

但最聪明的部分在于:他们添加了一个激活记忆(Activation Memory)。把这想象成一段“精彩集锦”或一张便利贴。如果一个神经元在第一批思考中非常重要,记忆就会记录下这一点。即使该神经元在几步之内处于安静状态,记忆也会确保它不会仅仅因为短暂的“小睡”就被踢下车。通过这种方式,AI 能够保留那些在一段时间内持续重要的神经元,防止其忘记最初建立的逻辑。

结果:快速、聪明且能应对人群

作者在强大的推理模型(具体为 DeepSeek-R1-Distill-Qwen-7B 和 DeepSeek-R1-Distill-Llama-8B)上测试了这种新方法,使用了困难的数学和科学基准测试。结果令人瞩目。

当以 4 的批次大小(同时处理四个问题)运行并旨在将模型规模削减 50% 时:

  • 旧的最佳方法(TEAL)崩溃了,平均准确率仅为 14.3% 左右。
  • 新方法保持了强劲的 54.0% 平均准确率。
  • 这是一个 39.7 个百分点 的巨大提升。

此外,新方法实际上让模型变快了。通过剪掉不必要的工作,它实现了比运行完整的、未剪枝模型快 1.40 倍 的速度。论文指出,这种加速在计算机繁忙(计算受限)时尤其有用,这种情况通常发生在处理大量请求时。

这意味着什么

作者谨慎地指出,这种方法是“无需训练的(training-free)”,这意味着它不需要重新教导模型,而只是调整模型运行的方式。他们还指出,虽然其他方法可能适用于简单任务,但在处理批处理时的复杂推理时会惨败。这种新方法通过使用周期性更新和对重要性的记忆,在保持 AI 推理敏锐的同时,使其能够高效处理现实世界的负载,即许多用户同时提问的情况。这是一个实用的修复方案,它让这些庞大、聪明的模型在运行得更快的同时,不会失去深度思考的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →