← 最新论文
⚡ electrical engineering

SPARe: Stacked Parallelism with Adaptive Reordering for Fault-Tolerant LLM Pretraining Systems with 100k+ GPUs

本文提出了 SPARe 框架,通过堆叠并行与自适应重排序技术,在超大规模(10 万至 60 万张 GPU)LLM 预训练系统中以仅 2~3 倍的恒定计算开销实现了高可用性,相比传统复制方法将训练时间缩短了 40%~50%。

原作者: Jin Lee, Zhonghao Chen, Xuhang He, Robert Underwood, Bogdan Nicolae, Franck Cappello, Xiaoyi Lu, Sheng Di, Zheng Zhang

发布于 2026-03-03
📖 2 分钟阅读☕ 轻松阅读

原作者: Jin Lee, Zhonghao Chen, Xuhang He, Robert Underwood, Bogdan Nicolae, Franck Cappello, Xiaoyi Lu, Sheng Di, Zheng Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 SPARe 的新方法,旨在解决在超大规模人工智能(AI)模型训练时遇到的一个致命问题:电脑硬件(GPU)太容易坏,导致训练经常中断,浪费大量时间。

想象一下,你要用 10 万到 60 万个 超级计算器(GPU)一起拼一幅巨大的拼图(训练大模型)。

1. 核心问题:为什么现在的训练这么慢?

现状:

  • 故障是常态: 当机器数量达到 10 万级别时,坏机器不再是“意外”,而是“日常”。就像你让 10 万人一起搬砖,平均每隔几分钟就有人生病或摔倒。
  • 重启成本极高: 以前,坏了一台机器,大家停下来,把之前的进度存好,然后所有人重新集合、重新握手、重新对齐,再开始干活。
    • 比喻: 想象一个 10 万人的合唱团。只要有一个音唱错了,指挥喊“停”,所有人必须放下乐谱,重新排队、重新对音准、重新握手,然后才能从刚才那个小节重新开始。这个“重新排队”的时间,可能比大家真正唱歌的时间还要长!
  • 结果: 大部分时间都花在“重新集合”上,而不是“唱歌”上。

现有的笨办法:

  • 备份法(传统复制): 为了防止有人掉队,给每个人都配 2 个、3 个甚至 20 个“替身”。
    • 缺点: 虽然坏了人还能继续唱,但你需要买 20 倍的机器,算 20 倍的乐谱。成本太高,就像为了防感冒,给每个人配 20 个保镖,太浪费了。
  • 存档法(检查点): 经常保存进度。
    • 缺点: 一旦坏人多,存档也救不了,因为“重新集合”的时间太长,根本来不及。

2. SPARe 的解决方案:聪明的“堆叠”与“换座”

SPARe 的核心思想是:不要给每个人配 20 个替身,而是让这 10 万人互相“搭伙”,并且灵活换座位。

比喻一:乐高积木的“堆叠” (Stacked Parallelism)

想象你在用乐高积木搭一座塔。

  • 传统做法: 每个人手里都拿一套完整的积木(100% 复制)。如果一个人手滑了,旁边的人有备份,但每个人都要背 20 套积木,太重了。
  • SPARe 做法: 把积木分成很多小块(数据碎片)。
    • 大家手里拿的积木块是重叠的。比如,A 手里有第 1、2、3 块;B 手里有第 2、3、4 块;C 手里有第 3、4、5 块。
    • 只要大家凑在一起,就能拼出完整的塔。
    • 关键: 不需要每个人都拿全套,只要整体有备份就行。

比喻二:餐厅的“换座” (Adaptive Reordering)

这是 SPARe 最天才的地方。

  • 场景: 假设 A 生病了(机器坏了),他手里的“第 2 块积木”没人拿了。
  • 笨办法: 所有人停下来,重新找谁有第 2 块,或者重新分配任务,这很乱。
  • SPARe 的“换座”:
    • 系统发现 A 病了,立刻看一眼:哦,B 手里其实也有第 2 块(因为之前重叠了),C 手里也有。
    • 系统立刻指挥:“大家不用重新排队,B 和 C 你们俩换个顺序,先把手里的第 2 块拼上去,其他人接着拼第 3 块。”
    • 动态调整: 就像餐厅里有人退场了,服务员立刻调整剩下客人的座位,让每个人都能拿到自己该拿的盘子,不需要重新装修餐厅,也不需要所有人重新点菜

3. SPARe 带来的巨大优势

  1. 极低的“额外成本”:

    • 传统备份法:如果要防 20 次故障,你需要 20 倍的机器(20x 成本)。
    • SPARe:即使要防 20 次故障,你只需要多算 2 到 3 倍 的工作量。
    • 比喻: 传统方法是给每个人配 20 个保镖;SPARe 是大家互相照应,只需要多派 2-3 个机动人员,就能达到同样的安全效果。
  2. 大幅缩短训练时间:

    • 在模拟 60 万块 GPU 的极端环境下,SPARe 比传统方法快 40% 到 50%
    • 比喻: 以前训练一个模型要 100 天,其中 60 天都在“重新集合”;现在只需要 60 天,其中只有 20 天在“重新集合”。
  3. 智能的“止损”:

    • 系统会计算:是继续拼下去划算,还是停下来存档划算?它会自动找到最佳平衡点,既不多做无用功,也不浪费进度。

4. 总结

SPARe 就像是一个超级聪明的“乐队指挥”:

  • 以前,只要有一个乐手生病,整个乐队就要解散、重新排练、重新握手,浪费大量时间。
  • 现在,SPARe 指挥让乐手们互相备份(你也会拉我的曲子,我也会拉你的),并且随时调整站位
  • 一旦有人生病,指挥立刻让旁边的人补位,大家无缝衔接,继续演奏,几乎感觉不到有人缺席。

最终结果: 在拥有 10 万甚至 60 万台机器的超级计算机上,训练 AI 模型不再被“机器故障”拖慢,能以惊人的速度完成,大大降低了训练超级 AI 的成本和时间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →