← 最新论文
🤖 machine learning

Distributed Training using an Intelligent Network

本文提出了一种用于广域网分布式训练的智能网络框架,该框架结合了组播与线内 FPGA 聚合技术以及优化的同步调度方案,以克服带宽和延迟限制,从而缩小与同机房训练之间的性能差距。

原作者: Nihar Shah, Ben Blier

发布于 2026-08-28✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Nihar Shah, Ben Blier

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

世界上最强大的人工智能模型正变得过于庞大,以至于无法容纳在单栋建筑内。训练这些系统需要数千台计算机协同工作,但电力和空间的物理限制意味着没有任何单一的数据中心能够容纳它们。相反,研究人员必须将计算能力分散到多个地点,有些地点甚至相隔大洋。这创造了一个难题:计算机需要不断相互通信以保持同步,但跨越长距离传输海量数据既缓慢又昂贵。这些远距离站点之间的连接通常很窄且不均匀,导致计算机在等待信息到达时处于闲置状态。如果计算机无法快速共享它们的进度,整个训练过程就会减慢,从而浪费宝贵的时间和能源。

来自 DoubleZero 基金会的一个研究小组提出了一种通过将网络本身转变为主动助手来解决这一瓶颈的新方法。他们建议不要将互联网连接视为仅仅传输数据的被动管道,而是使用网络内的专用硬件来管理信息流。他们的方法以一种创新的方式结合了两种现有的技术,用于广域连接。首先,他们使用一种称为“组播”(multicast)的方法,该方法允许一台计算机发送一条消息,由网络自动复制并将该消息同时传递给许多不同的目的地,而不是向每个目的地分别发送副本。其次,他们在每个计算机集群附近的网络边缘放置了被称为 FPGA 的可编程芯片。这些芯片充当智能聚合器,收集来自许多不同来源的传入数据流,并在数据到达本地计算机之前将其合并为一个单一、干净的数据流。通过在网络内部完成复制和合并这些繁重的工作,该系统减轻了远距离站点之间有限连接的压力。

为了使该系统有效运行,研究人员还开发了一种新的数学框架,用以决定计算机应该何时以及如何进行通信。在传统设置中,每台计算机都可能尝试同时与所有其他计算机通信,这会堵塞网络。新的框架将网络视为一张具有特定道路和交通规则的地图。它计算出最佳方式,将计算机分组为小型、轮转的通信圈。在每一轮中,特定的计算机组交换信息,而其他组则等待,然后在下一轮中,这些组会发生移动。目标是在计算机等待时间的长短与它们共享的信息量之间找到完美的平衡。研究人员使用基于一个跨越三个大洲、涵盖九个城市的真实可编程网络的模拟实验测试了这个想法。他们模拟了东京、纽约和伦敦等城市之间的实际旅行时间和连接速度,以观察不同的分组策略表现如何。

模拟结果显示,最佳策略在很大程度上取决于硬件的能力。当网络芯片的内存非常小时,最高效的方法是形成由三台计算机组成的小组,并在不同的组合中轮转。这使得数据能够快速流动,而不会超出系统存储信息的能力。然而,当研究人员为芯片提供更多内存时,最优策略发生了彻底改变。当拥有足够的内存来处理长距离旅行带来的延迟时,系统可以支持每台计算机同时与所有其他计算机通信的策略。这种此前在长距离环境下无法实现的“全对全”(all-to-all)方法变成了最快的方法,因为它允许信息在最短时间内传播给所有人。研究表明,通过将这些智能网络技术与适应硬件限制的调度方案相结合,缩小分布在全球各地的训练计算机与并排坐在同一个房间里的计算机之间的差距是可能的。

研究人员强调,他们的工作目前是基于一个仍在建设中的实时网络的模拟。虽然 DoubleZero 网络已经存在并承载着流量,但它目前还没有足够多的连接计算机集群来在现实世界的测试中训练大型模型。所呈现的结果是一个概念验证,证明了理论上的收益是真实的,并且正确的网络硬件与调度逻辑的结合可以克服传统的障碍。研究结果表明,未来训练巨型人工智能模型不仅依赖于更快的计算机,还依赖于更智能的网络,让网络主动参与学习过程,将数据中心之间的巨大距离从弱点转变为系统可以管理的组成部分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →