← 最新论文
💬 NLP

Continual LLM Upcycling: A Predictor-Gated Bank-Wise Sparsity Training Recipe for Dense-to-Sparse LLMs

本文提出了一种持续训练方案,通过在训练过程中集成预测器门控路由机制,将稠密的 Qwen2.5-8B 模型向上回收(upcycle)为硬件高效的通道稀疏大语言模型,同时通过针对性的修复算法解决了特定的长文本上下文失效模式。

原作者: Ruixuan Huang, Jinyuan Shi, Hantao Huang, Yifan Huang, Ziyi Guan, Hao Zeng, Ian En-Hsu Yen, Minghui Yu

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruixuan Huang, Jinyuan Shi, Hantao Huang, Yifan Huang, Ziyi Guan, Hao Zeng, Ian En-Hsu Yen, Minghui Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有一座规模宏大、极其聪明的图书馆(即大型语言模型,LLM),它几乎无所不知。但问题在于:每当有人提问时,图书管理员都必须跑遍图书馆里的每一本书来寻找答案,尽管实际上只有极小部分的书籍与问题相关。这既缓慢又昂贵,而且浪费能量。

这篇论文介绍了一种训练这些“图书管理员”的新方法,让他们在不损失智慧的前提下变得超级高效。他们将这个过程称为“从稠密到稀疏的向上转型”(Dense-to-Sparse Upcycling)。

以下是该方法的简单拆解:

1. 问题所在:“全书式”方法

在标准的 AI 模型中,每当模型处理一个词时,它都会激活庞大的内部“神经元”网络(可以把这些神经元想象成书架上的书)。即使模型只需要 4 个特定书架上的信息,它目前也会为了保险起见而打开全部 16 个书架。这就是“稠密”(Dense)方法。这种方法效果很好,但非常沉重且缓慢。

2. 解决方案:“智能预测器”

作者希望教会模型只打开 16 个书架中最重要的 4 个。这被称为“稀疏性”(Sparsity)。

然而,你不能仅仅靠猜测来决定打开哪些书架。如果你猜错了,模型就会变笨。

  • 旧方法: 一些方法会在书架被打开之后,再观察书里的内容来判断它们是否有用。这太晚了;能量已经浪费掉了。
  • 新方法(本论文): 他们在书架打开之前,安装了一个微型且超快速的“预测器”(就像一个聪明的图书管理员助手)。
    • 这个助手会观察问题和当前的上下文。
    • 它能瞬间预测出每 16 个书架中哪 4 个是最需要的。
    • 它告诉主系统:“只打开这 4 个;忽略另外 12 个。”

3. “银行”系统

为了让这一切更有组织性,他们将书架分成了被称为**“组/库”(Banks)**的单元。

  • 想象一个“库”里有 64 个书架。
  • 规则很简单:对于每一个问题,助手会选出该“库”中最好的 16 个书架,并忽略其余部分。
  • 这将工作量减少了 4 倍(4 倍稀疏度)。

4. 训练配方:“在做中学”

你不能直接拿一个已经完成的、沉重的模型,然后试图强迫它变得“懒惰”;这样做通常会导致模型崩溃。相反,他们使用了一种特定的训练配方:

  1. 从沉重开始: 他们首先训练一个标准的、沉重的模型(支持高达 8,000 个词的上下文)。
  2. 扩展记忆: 他们教会模型处理更长的对话(高达 32,000 个词)。
  3. 引入助手: 只有在模型已经变得足够聪明之后,他们才加入了“预测器助手”。
  4. 练习: 他们让模型和助手一起进行训练。模型学会了依赖助手的预测来节省能量,而助手则学会了如何更准确地猜测正确的书架。

5. 结果:更聪明,也更快

他们将这种新的“稀疏”模型与另外两种模型进行了对比测试:

  • 沉重模型: 原始的、缓慢的版本。
  • “天真型”稀疏模型: 一个在没有经过预测器训练的情况下,只是简单或粗暴地关闭书架的版本。

胜出者: 这个“预测器门控”(Predictor-Gated)模型几乎和“沉重模型”一样聪明,但效率更高。而“天真型”版本则明显变笨了。这证明了从一开始就训练模型的稀疏性至关重要;你不能在后期仅仅通过“打补丁”的方式来实现它。

6. “悬崖”与修复

在测试过程中,他们发现了一个奇怪的故障。模型在处理短中长度的问题时表现出色,但当对话变得非常长(大约 12,000 到 16,000 个词)时,它会突然失效。就像图书管理员在面对一个非常长的故事时感到困惑,甚至忘记了如何找书。

他们发现这并不是整个图书馆的问题。这只是**某一个特定的书架(第 7 层)**出了问题。

  • 修复方法: 他们创建了一个“修复补丁”,告诉模型:“如果对话变得太长,对于这一个特定的书架,请忽略那个聪明的助手,转而使用完整的、沉重的版本。”
  • 这个简单的修复让模型在处理长篇故事时再次完美运行。

总结

这篇论文表明,你可以通过教给模型一个知道针对每个词该使用大脑哪部分的“预测器”,从而将一个沉重、缓慢的 AI 模型“向上转型”为一个轻量、快速的版本。这就像是教会一位厨师在做菜时只抓取所需的特定香料,而不是把整个香料架都倒进锅里。其结果是一个效率提升了 4 倍,但几乎保留了所有智能的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →