← 最新论文
🤖 machine learning

Memory-Efficient LLM Training with Dynamic Sparsity: From Stability to Practical Scaling

本文介绍了一种稀疏内存高效训练(SMET)框架,该框架通过预热和密度感知学习率缩放来解决优化器冷启动问题,从而稳定了针对大语言模型的动态稀疏训练,同时通过仅为活跃参数存储状态来降低内存消耗。

原作者: Qiao Xiao, Boqian Wu, Patrik Okanovic, Tomasz Sternal, Maurice van Keulen, Elena Mocanu, Mykola Pechenizkiy, Decebal Constantin Mocanu, Torsten Hoefler

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Qiao Xiao, Boqian Wu, Patrik Okanovic, Tomasz Sternal, Maurice van Keulen, Elena Mocanu, Mykola Pechenizkiy, Decebal Constantin Mocanu, Torsten Hoefler

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个巨大的图书库(大型语言模型)如何写出新的故事。通常情况下,你会雇佣一支庞大的编辑团队(参数)来处理每一页的内容。但这样做极其昂贵且缓慢,因为你需要一个巨大的办公室(内存)和大量的电力(计算资源)来维持所有人的工作。

为了节省成本,科学家们尝试了一种叫做**动态稀疏训练(Dynamic Sparse Training, DST)**的技术。你可以把它想象成雇佣一支规模较小、轮换制的编辑团队。与其让所有的编辑在所有页面上都保持工作状态,不如每隔几天解雇一些人并雇佣新人,希望这些新人能找到更好的方式来修改故事。这能让团队规模保持较小,办公成本也更低。

然而,本文的作者发现,当这种“轮换团队”的方法应用于巨型 AI 模型时,存在一个重大问题:新员工会导致混乱。

问题所在:“冷启动”恐慌

在旧的方法中,当一名新编辑(新“再生”的参数)被雇佣时,他们会被立即投入到深水区,承受与资深编辑相同的极高期望。

由于这些新编辑没有任何历史经验或积累(没有“优化器状态”),他们一上来就会犯下巨大的、疯狂的错误。这就像是雇佣了一名实习生,然后立刻要求他在一小时内重写整部百科全书。他们会陷入恐慌,犯下巨大的错误,导致整个项目的进度(“损失值/loss”)剧烈飙升,破坏了工作的平稳流动。

论文将此称为**“冷启动效应”(Cold-Start Effect)**。每当团队进行轮换时,项目就会遇到颠簸、踉跄,然后不得不重新恢复,这使得训练过程变得不稳定且效率低下。

解决方案:SMET(稀疏内存高效训练)

作者提出了一个名为 SMET 的新系统来解决这个问题。他们使用了三个主要技巧,让轮换团队能够平稳运作:

  1. “试用期”(优化器预热/Optimizer Warm-up):
    SMET 不会将新编辑直接扔进深水区,而是让他们进入一段“试用期”。在最初的几个步骤中,他们的工作会受到严格的监督。他们的更新幅度会被控制得非常小且温和,就像新员工在接受工作引导时的循序渐进一样。这防止了因恐慌性失误导致的“损失值飙升”。

  2. “团队规模调整”(密度感知学习率/Density-Aware Learning Rate):
    因为团队规模较小(稀疏),剩下的编辑必须更加努力地去覆盖同样的工作量。SMET 意识到,如果你的人手变少了,你就需要调整节奏。它会稍微提高“学习率”(学习的速度),以补偿活跃员工数量的减少,确保项目不会因为团队规模小而进展缓慢。

  3. “精简办公室”(内存效率/Memory Efficiency):
    在传统方法中,即使只有少数编辑在工作,公司仍然会为“所有人”租用办公空间(存储所有可能参数的数据)。SMET 改变了这一点:它只为当前正在工作的编辑租用办公空间。如果一名编辑被解雇(剪枝/pruned),他们的办公桌会立即清空。这节省了大量的内存,使得这些巨型模型可以在更小、更便宜的计算机上进行训练。

研究发现

研究人员在类似于 LLaMA(一个流行的 AI 系列)的模型上进行了测试。

  • 稳定性: 使用 SMET 后,训练曲线非常平滑。在团队轮换时不再出现可怕的飙升。
  • 性能: 使用 SMET 训练的模型表现几乎与那些庞大且昂贵的“全员团队”模型一样出色,尽管它们使用的资源要少得多。
  • 可扩展性: 模型越大,SMET 的效果就越好。看起来,只要管理得当,巨型模型对于这种规模较小的轮换团队是非常宽容的。

核心结论

这篇论文表明,我们可以通过使用“轮换团队”策略来更廉价、更高效地训练巨型 AI 模型,但前提是我们在初期要温柔地对待新成员。 通过给新参数一个“预热期”并仅为活跃的工作者存储数据,SMET 使稀疏训练成为了未来 AI 领域一个切实可行且稳定的现实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →