← 最新论文
🤖 machine learning

BOOST: BOttleneck-Optimized Scalable Training Framework for Low-Rank Large Language Models

本文介绍了 BOOST,这是一个高效的训练框架,其特色在于瓶颈感知张量并行以及多种优化措施,通过克服标准三维并行在通信和资源利用方面的局限,显著加速了大规模低秩瓶颈架构的训练。

原作者: Zhengyang Wang, Ziyue Liu, Ruijie Zhang, Avinash Maurya, Paul Hovland, Bogdan Nicolae, Franck Cappello, Zheng Zhang

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengyang Wang, Ziyue Liu, Ruijie Zhang, Avinash Maurya, Paul Hovland, Bogdan Nicolae, Franck Cappello, Zheng Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图建造一座庞大且极其复杂的乐高城堡(大型语言模型)。城堡越大,所需的积木就越多,建造时间也越长。在人工智能领域,建造这些“城堡”既昂贵又缓慢,耗资数百万美元,并需要超级计算机运行数月。

为了加快速度,研究人员一直在尝试使用“智能捷径”。其中一个流行的捷径是低秩瓶颈。你可以将其想象为使用一种更薄、更轻的特殊积木来建造城堡。你不再为墙的每一部分都使用巨大的重型积木块,而是使用一条薄而高效的条带,它能完成同样的工作,但占用空间更小,移动速度更快。

问题:交通堵塞
论文指出,虽然这些“薄积木”(低秩模型)在节省空间和计算方面表现出色,但当你试图让一群工人(GPU)协作建造城堡时,它们会引发一个新问题。

想象你有一个由 4 名工人组成的团队。在标准设置中,他们互相传递装满积木的大而重的箱子,以保持工作流畅。

  • 旧方法(原生并行): 当团队尝试使用“薄积木”时,他们仍然沿用旧有的传递箱子的方法。但由于积木现在被排列成一种奇怪且狭窄的形状,工人们不得不停下来传递更多的箱子,而且这些箱子对于狭窄的通道来说仍然太大了。这导致了交通堵塞。工人们花在互相沟通上的时间比实际建造的时间还要多。
  • 结果: 由于大量时间浪费在沟通上,“薄积木”方法实际上变得比“重型积木”方法更慢。

解决方案:BOOST
作者创建了一个名为BOOST(瓶颈优化可扩展训练框架)的新框架。你可以将 BOOST 想象为一套新的施工规则,它重新组织了工人们传递“薄积木”的方式。

以下是 BOOST 使用的四个主要技巧,简单解释如下:

  1. “窄桥”策略(感知瓶颈的张量并行):
    BOOST 不再在每一步都传递沉重的箱子,而是等到积木到达最薄点(即“瓶颈”)时,才将它们传递给下一位工人。

    • 类比: 想象一场接力赛。在旧方式中,跑步者在每次交接时都传递一根巨大而沉重的接力棒。而在 BOOST 中,他们等到接力棒缩小成一根微小且轻便的小棍时再进行传递。这意味着跑步者花在手握接力棒上的时间更少,而花在奔跑上的时间更多。
  2. “群聊”技巧(在线 RMSNorm):
    有时,工人们在继续之前需要检查一条全局规则(例如“确保墙壁是直的”)。在旧方式中,他们会停下来,召开会议,检查规则,然后继续。这很慢。

    • 类比: BOOST 允许工人们在传递接力棒的同时检查规则。他们同时做两件事。他们不会让流水线停下来,只是在奔跑时低声传达规则。这节省了大量时间。
  3. “捆绑”方法(线性层分组):
    有时工人必须连续执行几个小任务。旧的方法是执行任务 A,停下来,执行任务 B,停下来,执行任务 C。

    • 类比: BOOST 说:“让我们把这些任务捆绑起来。”工人不再停顿三次,而是抓起执行 A、B 和 C 所需的所有工具,一气呵成地完成它们。这减少了他们必须停止和启动的次数。
  4. “内存节省器”(低秩检查点):
    在建造巨大的城堡时,你有时不得不扔掉笔记以节省空间,如果出错,稍后再重建它们。这种“重建”通常非常耗时,并且需要来回传递笔记。

    • 类比: 由于 BOOST 使用“薄积木”,重建所需的笔记非常小。此外,由于采用了“窄桥”策略,他们不需要将这些笔记传递给其他工人来重建。他们可以立即自己完成。这节省了巨大的内存和时间。

结果
论文在不同规模的 AI 模型(从小型到巨型)上测试了这个新系统。

  • 速度: 与旧的“薄积木”方法相比,BOOST 使训练速度提高了1.5 到 2.3 倍
  • 与重型积木相比: 即使重型积木通常是速度的标准,BOOST 也比使用传统重型积木快1.5 到 1.9 倍
  • 效率: 工人们(GPU)大部分时间实际上都在忙于工作,而不是在交通堵塞中等待。

总结
论文认为,仅仅使用“薄积木”(低秩模型)是不够的;你必须改变团队如何协作以匹配这些积木。BOOST 就是这套新规则。它重新安排了工作流程,使团队减少沟通时间,增加建造时间,从而使训练巨型 AI 模型的速度比以往更快,成本更低。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →