← 最新论文
💬 NLP

Can Model Merging Improve Aggregation in DiLoCo?

本文通过证明将 Iso-C 合并技术与 Nesterov 动量相结合(IsoLoCo)在低通信分布式训练中显著优于现有的 DiLoCo 方法(特别是在本地工作节点数量增加时),弥合了模型合并与分布式学习之间的鸿沟。

原作者: Stefan Horoi, Benjamin Thérien, Guy Wolf, Eugene Belilovsky

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Stefan Horoi, Benjamin Thérien, Guy Wolf, Eugene Belilovsky

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图训练一个巨大的、超级聪明的 AI 大脑。为了实现这一点,你需要海量的计算能力。通常,公司会使用“数据并行”(data-parallel)的方法:他们把数百台计算机并排排列在一起,让它们在同一时间处理完全相同的任务,并且不断地向彼此发送更新。这种方法很快,但需要昂贵的高速电缆将每一台计算机连接起来。如果其中一台计算机变慢了,或者电缆性能变弱了,整个队列都必须停下来等待。

问题:“孤岛”法(The "Island" Approach)
为了节省成本并使用较弱的连接,研究人员开发了一种名为 DiLoCo 的方法。想象一下,与其使用单一的队列,不如拥有许多独立的“孤岛”:

  1. 每个孤岛在一段时间内(例如 30 个步骤)独立训练它自己的 AI 大脑版本。
  2. 在这 30 个步骤中,它们互不通信。
  3. 30 个步骤结束后,它们会将各自学到的总结(即“伪梯度”)发送到一个中央枢纽。
  4. 枢纽会对这些总结进行平均,并更新主大脑。

故障:
论文发现这种“孤岛”法存在一个缺陷。随着你增加孤岛(工作站)的数量,或者让它们在交流前训练的时间过长,AI 开始变得混乱。这就像一群人试图共同画一幅画却不说话:如果他们在独自创作时工作得太久,他们开始画出不同的东西,当他们试图合并作品时,结果就会变得一团糟。用技术术语来说,来自不同孤岛的“更新”开始相互冲突,从而降低了 AI 的性能。

灵感:合并专家模型(Merging Expert Models)
另外,另一组研究人员正在研究 模型合并(Model Merging)。想象一下,你有一个学习意大利菜的专家厨师和另一个学习日本菜的专家厨师。你想拥有一个既能做意大利菜又能做日本菜的厨师。

  • 旧方法: 直接平均他们的食谱。这通常会失败,因为食材会发生冲突(例如,将酱油和奶油混合在一起)。
  • 新方法(任务算术/Task Arithmetic): 我们不再是平均整个食谱,而是观察专家最终食谱与原始基础食谱之间的差异。然后,你仔细地组合这些差异。

这篇论文的大发现是:意识到 DiLoCo 实际上就是在循环中进行模型合并

  • “基础模型”是大家上次交流时的那个 AI 大脑。
  • “孤岛”是那些独立训练的专家。
  • 它们传回的“更新”就是“差异”(或任务向量)。

论文认为,DiLoCo 随着孤岛增多而变得混乱的原因,与模型合并变得混乱的原因是一样的:干扰(Interference)。来自不同孤岛的更新正在互相争斗。

解决方案:IsoLoCo
作者决定借鉴模型合并领域中“最好的食谱”来修复 DiLoCo。他们测试了几种合并技术,发现一种名为 Iso-C(各向同性合并)的技术效果最好。

可以将 Iso-C 想象成更新过程中的一个“协调器(harmonizer)”。当孤岛们传回它们的更新时:

  1. 协调器会观察更新的“形状”。
  2. 如果某个孤岛在特定方向(特定的数学方向)上叫得太大声,协调器会将这个音量调低,以匹配平均水平。
  3. 这可以防止任何单个孤岛占据主导地位或产生冲突,从而创造出一个更平滑、更平衡的组合更新。

他们将这个“协调器”与一个“动量(momentum)”特性(就像一个即使路面颠簸也能保持速度的跑步者)相结合,创造出了一种名为 IsoLoCo 的新方法。

结果
他们在不同规模的 AI 模型和不同数量的孤岛(从 1 到 128 个)上测试了该方法。

  • 胜出者: IsoLoCo 一贯优于原始的 DiLoCo 方法。
  • 差距: 你增加的孤岛越多,IsoLoCo 的优势就越大。在 128 个孤岛的情况下,原始方法变得非常混乱,但 IsoLoCo 依然保持得干净且高效。
  • 速度: 他们还利用一种数学捷径(Newton-Schulz 迭代)为 IsoLoCo 制作了一个“快速模式”,这使得过程变得更快,且不会损失质量。

总结
这篇论文表明,通过将分布式 AI 训练视为一个“专家合并”问题,我们可以使用先进的数学技巧来阻止计算机之间的争斗。这使得我们能够在许多连接较弱的计算机上训练大规模 AI 模型,而不会损失性能,从而使大规模 AI 训练变得更便宜、更具可扩展性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →