← 最新论文
💬 NLP

Exploring the Limits of Pruning: Task-Specific Neurons, Model Collapse, and Recovery in Task-Specific Large Language Models

本文通过在特定任务语言模型上进行的系统性剪枝实验表明,神经元对性能的贡献并非均匀分布,揭示出少量高度专业化的神经元对任务成功至关重要,而剩余网络则表现出可安全剪枝并通过微调随后恢复的冗余性。

原作者: M. K. Khalidi Siam, Md. Tausif-Ul-Islam, Md. Reshad Romim Khan, Mohammed Ali Hossain, Mushfiqul Amin, Labib Hasan Khan, Niloy Farhan, Farig Sadeque

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: M. K. Khalidi Siam, Md. Tausif-Ul-Islam, Md. Reshad Romim Khan, Mohammed Ali Hossain, Mushfiqul Amin, Labib Hasan Khan, Niloy Farhan, Farig Sadeque

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个大型语言模型(LLM)是一座拥有数百万名工人(神经元)的庞大、繁忙的城市。每位工人都有自己的工作,但在一个通用型城市中,大多数工人都是“通才”——他们既能修管道,也能写诗歌,样样略通。

本文提出了一个简单的问题:如果我们将这座城市专门化,只用于一项工作(例如解决数学问题或编写代码),是否所有工人都必须留在那里?或者,有些工人实际上只是被其他工作“分心”了?

以下是研究人员发现的真相,通过日常类比进行解释。

1. “专家”与“分心者”

研究人员考察了专门针对数学代码训练的模型。他们想知道:哪些工人实际上在做数学,而哪些工人只是在白日做梦想着别的事情?

他们开发了一种测量“专注度”的方法。想象给每位工人进行一次测试。

  • 专家: 当你提出数学问题时,这位工人会非常兴奋(高激活),但当你询问历史时,他则保持冷静。
  • 分心者: 这位工人对历史感到兴奋,却忽略了数学。

团队发现,在这些专用模型中,有一群独特的“专家神经元”对任务至关重要,而许多其他神经元只是“分心者”,对具体工作并无实质帮助。

2. “剪枝”实验(解雇工人)

“剪枝”是指解雇工人,使城市变得更小、更便宜、更快速的过程。研究人员尝试了三种不同的解雇方式:

  • 随机剪枝(彩票): 他们完全随机地解雇工人。
    • 结果: 城市变小了,但性能迅速下降。这就像从医院里随机解雇人员;你可能会不小心解雇掉唯一的外科医生。
  • 选择性剪枝(明智的削减): 他们只解雇“分心者”——那些对错误事物感到无聊或兴奋的工人。
    • 结果: 城市显著缩小(最多缩小 35%),而剩余的工人(专家)几乎像以前一样维持着城市的运转。这证明了并非所有工人都同等重要;你可以在不损失“信号”的情况下移除“噪音”。
  • 反向剪枝(破坏): 他们做了相反的事。他们首先解雇那些最兴奋、最重要的“专家”工人。
    • 结果: 彻底崩溃。 一旦解雇了大约 10% 的顶级专家,城市就完全停止运转。模型无法解决任何数学问题。这表明关键信息集中在一个非常小且脆弱的神经元群体中。

3. “鲁棒性阈值”(崩溃点)

研究人员发现了一个“临界点”,即在你把事情搞乱之前可以解雇多少工人。

  • 安全区(0% 到 15%): 你可以解雇多达 15% 的工人,城市仍能正常运行。它甚至可能运行得更快。
  • 危险区(15% 到 20%): 这是悬崖边缘。如果你解雇超过 20%,模型就开始崩溃。
  • “陷阱”: 当模型被推得太远(解雇太多)时,它不仅仅会给出错误的答案;它会陷入一个循环。想象一个机器人试图回答问题,说出答案,然后忘记停止说话,只是无限重复同一句话。研究人员称这些为“退化循环”或“陷阱”。

4. “恢复”(重新培训幸存者)

在解雇了这么多人之后,城市受到了损害。但研究人员有一个妙招:微调
把这想象成给剩余工人上的速成班。他们利用一种称为 LoRA 的技术,对经过剪枝(变小)的模型进行了一点额外的训练。

  • 结果: 模型恢复了!即使是那些被重度剪枝(缩小 35%)的模型,也重新获得了大部分解决数学和编写代码的能力。
  • 关键洞察: 剩余的工人是有能力的,但他们只需要一点“重新定向”,以记住如何在没有已解雇同事的情况下高效协作。

5. 大城市与小城市

他们在两种规模的模型上测试了这一点:一个7B 模型(一座巨大的城市)和一个1.5B 模型(一个较小的城镇)。

  • 大城市(7B): 能承受更多的解雇。它拥有如此多的冗余工人,以至于即使失去很多人,仍能运作良好。
  • 小城镇(1.5B): 更加脆弱。它失去正确工作能力的速度要快得多,因为它没有那么多多余的工人可以牺牲。

6. 核心结论

本文用简单的逻辑证明了三点:

  1. 专业化是真实的: 在针对特定任务训练的模型中,存在专门负责该任务的特定“脑细胞”,而其他细胞只是噪音。
  2. 你可以缩小它们: 通过仔细移除“噪音”工人,你可以使模型更小、更快,而不会失去其智能。
  3. 不要切断心脏: 如果你切除了最重要的工人,模型会立即死亡。但如果你切除了不重要的工人,然后给幸存者一次快速的培训复习,模型就能生存并蓬勃发展。

权衡: 虽然缩小模型可以节省内存并使其运行更快(就像更轻的汽车跑得更快),但你必须小心,不要削减过多导致汽车散架。最佳点似乎在于 15–20% 的剪枝,超过这个范围,模型陷入“循环”的风险会急剧增加。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →