世界上最强大的人工智能模型正变得过于庞大,以至于无法容纳在单栋建筑内。训练这些系统需要数千台计算机协同工作,但电力和空间的物理限制意味着没有任何单一的数据中心能够容纳它们。相反,研究人员必须将计算能力分散到多个地点,有些地点甚至相隔大洋。这创造了一个难题:计算机需要不断相互通信以保持同步,但跨越长距离传输海量数据既缓慢又昂贵。这些远距离站点之间的连接通常很窄且不均匀,导致计算机在等待信息到达时处于闲置状态。如果计算机无法快速共享它们的进度,整个训练过程就会减慢,从而浪费宝贵的时间和能源。
来自 DoubleZero 基金会的一个研究小组提出了一种通过将网络本身转变为主动助手来解决这一瓶颈的新方法。他们建议不要将互联网连接视为仅仅传输数据的被动管道,而是使用网络内的专用硬件来管理信息流。他们的方法以一种创新的方式结合了两种现有的技术,用于广域连接。首先,他们使用一种称为“组播”(multicast)的方法,该方法允许一台计算机发送一条消息,由网络自动复制并将该消息同时传递给许多不同的目的地,而不是向每个目的地分别发送副本。其次,他们在每个计算机集群附近的网络边缘放置了被称为 FPGA 的可编程芯片。这些芯片充当智能聚合器,收集来自许多不同来源的传入数据流,并在数据到达本地计算机之前将其合并为一个单一、干净的数据流。通过在网络内部完成复制和合并这些繁重的工作,该系统减轻了远距离站点之间有限连接的压力。
为了使该系统有效运行,研究人员还开发了一种新的数学框架,用以决定计算机应该何时以及如何进行通信。在传统设置中,每台计算机都可能尝试同时与所有其他计算机通信,这会堵塞网络。新的框架将网络视为一张具有特定道路和交通规则的地图。它计算出最佳方式,将计算机分组为小型、轮转的通信圈。在每一轮中,特定的计算机组交换信息,而其他组则等待,然后在下一轮中,这些组会发生移动。目标是在计算机等待时间的长短与它们共享的信息量之间找到完美的平衡。研究人员使用基于一个跨越三个大洲、涵盖九个城市的真实可编程网络的模拟实验测试了这个想法。他们模拟了东京、纽约和伦敦等城市之间的实际旅行时间和连接速度,以观察不同的分组策略表现如何。
模拟结果显示,最佳策略在很大程度上取决于硬件的能力。当网络芯片的内存非常小时,最高效的方法是形成由三台计算机组成的小组,并在不同的组合中轮转。这使得数据能够快速流动,而不会超出系统存储信息的能力。然而,当研究人员为芯片提供更多内存时,最优策略发生了彻底改变。当拥有足够的内存来处理长距离旅行带来的延迟时,系统可以支持每台计算机同时与所有其他计算机通信的策略。这种此前在长距离环境下无法实现的“全对全”(all-to-all)方法变成了最快的方法,因为它允许信息在最短时间内传播给所有人。研究表明,通过将这些智能网络技术与适应硬件限制的调度方案相结合,缩小分布在全球各地的训练计算机与并排坐在同一个房间里的计算机之间的差距是可能的。
研究人员强调,他们的工作目前是基于一个仍在建设中的实时网络的模拟。虽然 DoubleZero 网络已经存在并承载着流量,但它目前还没有足够多的连接计算机集群来在现实世界的测试中训练大型模型。所呈现的结果是一个概念验证,证明了理论上的收益是真实的,并且正确的网络硬件与调度逻辑的结合可以克服传统的障碍。研究结果表明,未来训练巨型人工智能模型不仅依赖于更快的计算机,还依赖于更智能的网络,让网络主动参与学习过程,将数据中心之间的巨大距离从弱点转变为系统可以管理的组成部分。
技术摘要:利用智能网络进行分布式训练
问题陈述
大规模模型的分布式训练正日益受到单个数据中心在电力、许可和数据主权法规方面的限制。虽然在单个数据中心内进行训练由于具备高带宽、低延迟和对称连接性而具有可行性,但将其扩展到广域网(WAN)时会引入严重的瓶颈。主要挑战包括:
- 带宽限制: WAN 链路(特别是计算岛屿的入站/出站链路)极其昂贵且容量有限。标准的同步随机梯度下降(SGD)方法需要每秒数个太比特(Tbps)的带宽来交换完整的模型更新,这在现实中是不可行的。
- 延迟与不对称性: WAN 拓扑具有异构性,表现为高延迟(毫秒级 vs 微秒级)和非对称带宽。这会导致计算资源在等待同步或结果时出现显著的空闲,或者导致使用过时的参数。
- 拓扑异构性: 不同距离和链路容量的计算岛屿使得标准的同步方案(如环形全归约 Ring All-Reduce)变得低效,甚至无法实现。
现有文献通常通过降低通信频率(如 DiLoCo)、压缩数据(量化/稀疏化)或容忍陈旧性来使算法适应网络。然而,这些方法通常将网络视为被动的约束,而非主动的参与者。
方法论
本文提出了一个双管齐下的方法,使网络能够积极参与训练过程,将特定的系统技术与一种新型的算法优化框架相结合。
1. 系统方案:主动网络技术
作者提出利用两种特定技术来缓解跨 WAN 的入站和出站瓶颈:
- 用于优化出站的组播(Multicast): 与发送 N−1 个单播流(每个接收者一个)的发送岛屿不同,网络使用组播。发送方传输单个有效载荷,网络在分布树的各个分支点进行复制。这消除了核心网络上的重复流量,并大幅减少了出站带宽的使用。
- 用于入站聚合的在线 FPGA(In-Line FPGAs): 为了解决原本一个岛屿需要接收 N−1 个不同流的入站瓶颈,在网络边缘部署了现场可编程门阵列(FPGA)。这些 FPGA 在数据到达岛屿的访问链路之前进行聚合。
- 内存管理: 与数据中心交换机不同,WAN FPGA 必须处理由于延迟不同而导致的异步到达。系统利用高带宽内存(HBM)来缓冲传入的权重。当权重到达时进行聚合,并通过哈希方案(权重 ID)和驱逐准则(完成、超时或冲突)进行管理。
- 丢包恢复: 由于组播无法使用 TCP,系统通过在聚合后的数据包中附加序列号来处理丢包。FPGA 保留一个特定的重传窗口(tresend)内的重传缓冲区,以便接收岛屿可以请求丢失的数据包,从而保护关键的最后一跳。
2. 算法方案:优化框架
作者开发了一个优化框架,根据网络的物理拓扑和技术能力生成“丰富的同步调度方案”。
- 旋转团(Rotating Cliques): 每次轮次中,岛屿被划分为不相交的“团”(即小组)。这些团随时间轮转,以确保全局混合。
- 目标函数: 其目标是最小化代表信息陈旧性的代价函数。
- 该函数结合了轮次时间 (T) 和平均分歧寿命 (A)。
- A 是通过衡量特定代参数更新如何在所有岛屿间扩散的“生存曲线”推导而出的。
- 目标函数是最小化 T(A+1/2),即在轮次的时间成本与混合质量之间进行权衡。
- 可行性约束: 只有在符合轮次时间 T 和 FPGA 内存约束 (M) 的情况下,调度方案才是有效的。
- 完成约束: 最后一个字节到达目的地的时间必须 ≤T。
- 内存约束: FPGA 必须在从第一个流到达到最后一个流到达期间持有字节。如果内存不足,岛屿必须错开它们的传输偏移量 (tj) 以对齐到达时间,这会增加 T。
- 求解策略: 通过迭代候选的“团”拓扑,计算每个拓扑的最小可行 T(通过求解关于偏移量和流速率的线性规划),并选择使目标函数最小化的调度方案。
核心贡献
- 系统创新: 将组播和网络内聚合(通过 FPGA)从数据中心环境扩展到 WAN。这是首个专门利用这些技术来解决分布式训练中 WAN 带宽不对称和延迟问题的提案。
- 算法框架: 一个显式结合了网络拓扑、延迟、带宽和硬件内存约束的同步调度框架。它超越了静态或启发式的调度,转向一种基于优化的方法,生成量身定制的“旋转团”。
- 集成设计: 本文证明了系统的组成部分与算法组件是相互增强的。算法利用了组播和 FPGA 的能力,而硬件则使算法能够实现此前认为在 WAN 上无法实现的混合特性。
结果
作者使用基于 DoubleZero 网络的模拟对所提方案进行了评估,该网络是一个连接了北美、欧洲、亚洲三个地区九个城市的实时可编程 WAN,具有真实的延迟和 100 Gbps 的核心链路。
- 调度对比: 研究对比了四种调度方案:“三角形”(区域性团进行跨区域轮转)、“配对”(线性匹配)、“全对全”(All-to-All)以及“区域性”。
- 无 FPGA 内存时: “三角形”调度表现最好,平衡了快速误差衰减与可行的轮次时间(约 565ms)。“全对全”由于无法在没有内存缓冲的情况下协调九个同时发送者,因此是不可行的。
- 有 FPGA 内存时(32 GB): “全对全”调度变得可行,轮次时间约为 676ms。由于其完美的混合特性,“全对全”的表现优于所有其他调度方案,证明了硬件能力直接决定了最优的算法策略。
- 与同步 SGD 的比较:
- 标准同步 SGD(环形全归约)要求 GPU 在等待全局同步时会有约 80% 的时间处于空闲状态。
- 所提系统通过容忍极小的参数陈旧性(1 秒),实现了 5 倍的训练吞吐量提升。
- 即使在同步 SGD 内部,利用所提硬件(组播/FPGA)也比标准的基于主机的聚合显著减少了空闲时间。
意义与声明
本文声称,通过使网络成为积极的参与者,可以缩小分布式 WAN 训练与“金标准”——同地训练之间的差距。
- 新颖性: 作者指出,虽然组播和 FPGA 在数据中心领域已为人熟知,但在 WAN 中将其应用于训练是具有新颖性的。同样,该同步框架的独特之处在于它深度嵌入在网络的物理属性中,而非将网络视为黑盒。
- 研究范围说明: 作者承认 DoubleZero 网络目前是一个用于金融市场的实时网络,尚未连接足够多的 GPU 集群来进行真正的、针对同行系统的完整实证比较。因此,目前展示的结果是基于现实拓扑的模拟结果。
- 未来展望: 作者将这项工作定位为下一代模型的理论与系统基础,认为拥有定制控制和充足内存的私有化、可编程 WAN 是克服单个数据中心扩展极限的必要基础设施。他们明确反对认为此类方法仅适用于有限基础设施的观点,认为主动网络与优化调度的结合才是未来分布式训练的关键。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。