← 最新论文
💬 NLP

Decoupled DiLoCo for Resilient Distributed Pre-training

本文提出了“解耦 DiLoCo"(Decoupled DiLoCo)框架,通过打破传统 SPMD 范式中的严格同步限制,利用异步通信、最小法定人数聚合及动态令牌加权合并等机制,在大规模分布式预训练中实现了零全局停机时间的高容错性与高吞吐效率。

原作者: Arthur Douillard, Keith Rush, Yani Donchev, Zachary Charles, Nova Fallen, Ayush Dubey, Ionel Gog, Josef Dean, Blake Woodworth, Zachary Garrett, Nate Keating, Jenny Bishop, Henry Prior, Edouard Yvinec
发布于 2026-04-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Arthur Douillard, Keith Rush, Yani Donchev, Zachary Charles, Nova Fallen, Ayush Dubey, Ionel Gog, Josef Dean, Blake Woodworth, Zachary Garrett, Nate Keating, Jenny Bishop, Henry Prior, Edouard Yvinec, Arthur Szlam, Marc'Aurelio Ranzato, Jeff Dean

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 Decoupled DiLoCo(解耦的 DiLoCo)的新方法,旨在解决大规模人工智能(AI)模型训练中的一个巨大痛点:当训练集群中有一台机器出问题时,整个训练过程就会被迫停下来。

为了让你更容易理解,我们可以把训练一个超级大的 AI 模型想象成组织一场全球规模的“接力赛”

1. 旧方法:严丝合缝的“同步接力赛” (SPMD)

在传统的训练方法(论文中称为 SPMD)中,所有的训练机器(我们叫它们“选手”)必须像步调完全一致的仪仗队一样行动。

  • 规则: 每跑一步,所有选手必须停下来,互相确认:“大家都跑完这一圈了吗?好,我们一起迈下一步。”
  • 问题: 只要有一个选手摔倒了(硬件故障)、或者跑得慢了一点(网络卡顿),所有人都必须停下来等他。
  • 后果: 想象一下,如果有一万名选手,只要其中一个人系鞋带慢了 10 秒,剩下 9999 个人都要干等着。在大规模训练中,机器故障是常态,这种“等待”浪费了巨大的计算资源和时间,就像让全世界的人都在等一个人系鞋带一样荒谬。

2. 新方法:自由的“异步马拉松” (Decoupled DiLoCo)

Decoupled DiLoCo 彻底改变了规则。它不再要求所有人步调一致,而是把训练过程变成了一场自由的马拉松

核心概念:解耦 (Decoupling)

  • 独立奔跑: 现在,每个选手(称为"Learning Learner")都只关注自己的跑道。他们不需要等别人,跑完一步就立刻跑下一步。
  • 中央协调员 (The Syncer): 有一个“中央协调员”(Synchronizer)在终点线附近。选手跑完一段路后,会把自己的“进步报告”(参数更新) asynchronously(异步地)发给协调员。
  • 容错机制: 如果某个选手摔倒了(机器坏了),其他人完全不受影响,继续奔跑。协调员会忽略那个摔倒的选手,直接汇总其他健康选手的报告,继续推进训练。

3. 关键创新点:如何保证大家跑的是同一个方向?

既然大家步调不一致,怎么保证最后训练出来的 AI 模型是好的,而不是乱七八糟的?论文提出了几个聪明的“魔法”:

  • 碎片化接力 (Fragmentation):
    想象模型是一个巨大的拼图。旧方法要求所有人同时交换整块拼图。新方法把拼图切成很多小块(碎片)。选手只交换一小块拼图,而且交换是轮流进行的。这大大减少了交通拥堵(网络带宽压力)。

  • 最小多数派原则 (Minimum Quorum):
    协调员不需要等所有人(比如 100 个人)都汇报才做决定。只要大部分(比如 80 个人)汇报到了,协调员就立刻汇总大家的意见,更新全局模型。

    • 比喻: 就像开董事会,不需要等所有董事都到场才投票,只要达到法定人数(Quorum),决议就生效。
  • 智能加权 (Token-weighted Merging):
    跑得快的选手(处理数据多的)和跑得慢的选手,他们的贡献权重不同。协调员会根据他们跑了多远(处理了多少数据)来给他们的建议打分,确保跑得快的选手意见更重,跑得慢的(或者刚修好重启的)选手意见较轻,防止“慢吞吞”的数据拖后腿。

  • 自适应“宽限期” (Adaptive Grace Window):
    协调员不会在收到第 80 个人的报告后立刻关门。它会稍微等一小会儿(比如几毫秒),看看能不能多收到几个人的报告。如果网络通畅,就多等几个;如果网络卡,就立刻行动。这就像公交车司机在发车前会稍微等几秒,看有没有人跑过来,但不会为了一个人等半小时。

4. 为什么这很厉害?(实验结果)

论文通过“混乱工程”(Chaos Engineering)——也就是故意在模拟环境中制造大量的机器故障——来测试这个方法:

  • 旧方法(弹性数据并行): 即使有备用机器,一旦故障发生,系统也要停下来重新配置,导致40% 的时间都在浪费
  • 新方法(Decoupled DiLoCo): 即使有 120 万块芯片在模拟运行,且故障频发,系统依然能保持99% 的正常运行时间(Uptime),几乎零停机
  • 效果: 最终训练出来的 AI 模型,在回答问题、看图说话等任务上的表现,和传统方法一样好,甚至更好。

5. 总结:从“整齐划一”到“灵活应变”

Decoupled DiLoCo 的核心思想是:
在大规模 AI 训练中,“可用性”(Availability)比“绝对一致性”(Consistency)更重要。

  • 以前: 我们追求完美的同步,哪怕为此牺牲效率,只要有一台机器坏了,全盘皆输。
  • 现在: 我们接受一定程度的“不同步”,允许部分机器故障或变慢,让系统像蜂群一样,即使损失几只蜜蜂,整个蜂群依然能高效工作,继续采蜜(训练模型)。

一句话总结:
这就好比以前训练 AI 像举重比赛,必须所有人同时举起杠铃,一个人不行就全停;现在 Decoupled DiLoCo 像自由泳比赛,每个人按自己的节奏游,裁判(协调员)只统计大家游过的总距离,哪怕有人中途抽筋退赛,比赛依然精彩继续,且最终成绩一样优秀。

这种方法让未来的 AI 训练可以利用更廉价、更分散、甚至更不稳定的硬件资源(比如利用世界各地闲置的算力),大大降低了训练超级大模型的门槛和成本。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →