← 最新论文
🤖 machine learning

DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism

DisagMoE 是一种新颖的混合专家训练系统,它通过将注意力层和前馈层解耦至独立的 GPU 组并采用多阶段流水线,在大规模集群上提升效率,有效重叠通信与计算以克服全对全通信瓶颈,从而实现高达 1.8 倍的训练加速。

原作者: Zhichen Zeng, Chi-Chih Chang, Jiayi Wang, Zezhou Wang, Ningxin Zheng, Zheng Zhong, Cesar A. Stuardo, Dongyang Wang, Mohamed S. Abdelfattah, Haibin Lin, Banghua Zhu, Ang Li, Ziheng Jiang

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhichen Zeng, Chi-Chih Chang, Jiayi Wang, Zezhou Wang, Ningxin Zheng, Zheng Zhong, Cesar A. Stuardo, Dongyang Wang, Mohamed S. Abdelfattah, Haibin Lin, Banghua Zhu, Ang Li, Ziheng Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在运营一家大规模、高速运转的工厂,专门制造巨大的“思维机器”(AI 模型)。这家工厂拥有两类主要工人:

  1. “上下文”团队(注意力机制): 这些工人就像侦探。他们审视整个故事的全貌,以理解正在发生什么。他们非常擅长思考,但不需要四处移动。
  2. “专家”团队(专家/前馈神经网络): 这些是实际的建造者。有成千上万名这样的工人,但对于任何单一任务,只需要其中少数几位。他们擅长承担繁重的体力劳动,但分散在整个工厂车间的各个角落。

问题:交通堵塞

在旧式的工厂运营模式(称为专家并行)中,“上下文”团队和“专家”团队被挤在同一个房间里。

情况是这样的:

  1. “上下文”团队完成了他们的思考。
  2. 他们必须隔着房间向专家们大喊:“嘿,你,你,还有你!过来处理这个!”
  3. 专家们完成他们的工作。
  4. 他们必须喊回来:“结果在这里!”

问题出在哪?这种“喊叫”(在计算机之间发送数据)非常缓慢,尤其是当工厂变得巨大,而工人们位于不同楼层(不同的服务器节点)时。专家们经常坐在那里无所事事,等待“上下文”团队喊完,反之亦然。工厂陷入了交通堵塞,花在交谈上的时间比实际工作的时间还要多。

之前的尝试试图解决这个问题,就像试图让工人们在工作的同时“边做边聊”。但由于“上下文”团队思考需要很长时间(尤其是面对长故事时),而“专家”团队建造速度很快,两者的节奏始终无法完全匹配。总有一些多余的“喊叫”时间无法被掩盖。

解决方案:DisagMoE(解耦工厂)

这篇论文的作者 DisagMoE 决定不再试图让这两个团队在同一个房间里工作。相反,他们建立了一条两阶段装配线

1. 分离团队(解耦)
他们将“上下文”团队移到一组机器上,而将“专家”团队移到完全不同的另一组机器上。

  • 团队 A(上下文): 所有“侦探”层都位于一组计算机上。
  • 团队 B(专家): 所有“建造者”层位于另一组计算机上。

2. 新的装配线(AF-Pipe)
他们不再进行混乱的喊叫,而是创建了一个平滑的单向传送带系统:

  • “上下文”团队完成一批思考,将工作滑下传送带交给“专家”团队。
  • 当“专家”团队在处理第 1 批任务时,“上下文”团队已经开始第 2 批任务。
  • 当“专家”团队完成第 1 批任务并将结果发回时,“上下文”团队已经在处理第 3 批任务。

这被称为流水线技术。这就像一场接力赛,接力棒传递得如此顺畅,以至于没有任何一名跑步者会停下来。

3. 智能管理者(自适应分配)
这里是巧妙之处。论文意识到,“上下文”团队和“专家”团队有不同的需求。

  • “上下文”团队就像一位深思熟虑者;他们需要强大的大脑(计算能力),但对快速网络连接的需求没那么高。
  • “专家”团队就像一名跑步者;他们需要一条超高速的公路(网络带宽),以便将数据快速送达正确的人手中。

在旧工厂里,每个人都获得相同数量的网络带宽和计算能力。而在 DisagMoE 中,管理者是聪明的。如果故事非常长,他们会给“专家”团队分配更多的“网络车道”,给“上下文”团队分配更多的“脑力”。他们不断调整资源,以确保没有任何一个团队在等待另一个团队。

结果

通过分离团队并让管理者调整资源,工厂不再浪费时间等待消息。

  • 速度: 他们发现,这种新系统使训练速度比旧的标准方法快了 1.8 倍
  • 效率: 他们将计算机仅用于“交谈”(等待数据)的时间减少了高达 88%。

核心要点

这篇论文认为,你不能仅仅通过向问题投入更多的网络带宽来使其变快。你必须审视 AI 的每个部分正在执行的具体任务。通过将“思考”与“建造”分离,并为每个团队提供恰好所需的资源量,你可以快得多地构建这些巨大的 AI 模型。

简而言之: 他们不再试图强行将方钉塞进圆孔,而是通过分离工人、建造更优的传送带,并聘请一位确切知道如何平衡工作负荷的管理者来实现这一目标。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →