← 最新论文
🤖 machine learning

Understanding and Improving Communication Performance in Multi-node LLM Inference

本文对多节点大语言模型推理进行了性能研究,指出 all-reduce 操作是关键瓶颈,并提出了 NVRAR——一种基于 NVSHMEM 的分层 all-reduce 算法,与标准 NCCL 实现相比,该算法显著降低了延迟并提升了 Llama 3.1 405B 等大型模型的端到端性能。

原作者: Prajwal Singhania, Siddharth Singh, Lannie Dalton Hough, Akarsh Srivastava, Harshitha Menon, Charles Fredrick Jekel, Abhinav Bhatele

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Prajwal Singhania, Siddharth Singh, Lannie Dalton Hough, Akarsh Srivastava, Harshitha Menon, Charles Fredrick Jekel, Abhinav Bhatele

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一个庞大而复杂的拼图。在人工智能的世界里,这个拼图就是“大语言模型”(LLM)——一种超级聪明的计算机大脑,能够撰写故事、回答问题并解决难题。随着这些大脑变得更大、更聪明,它们变得过于庞大,以至于单台计算机无法承载。

为了解决这个问题,科学家们将拼图碎片分散到许多协同工作的计算机(称为“节点”)上。本文旨在探讨如何使这些计算机高效地相互通信,从而避免浪费时间等待。

以下是研究人员发现并构建内容的简明分解:

1. 问题:“传话游戏”瓶颈

当计算机协同工作时,它们必须不断共享信息。

  • 设置:想象一个由 32 人(GPU)组成的团队试图解决这个拼图。他们被分成若干组(节点)。在组内,他们可以瞬间互相喊话(就像使用一种名为 NVLink 的超快速内部对讲机)。但是,要与其他组交谈,他们必须使用较慢的长途电话线(节点之间的网络)。
  • 问题:研究人员发现,当计算机尝试解决拼图的“解码”部分(即逐字生成内容)时,它们需要彼此发送非常小的消息。
  • 类比:想象你正在参加接力赛。如果你必须跑很长一段距离才能将一张小纸条传递给下一位选手,而接收纸条的人接收速度很慢,那么你大部分时间都在等待。论文发现,标准的“电话线”软件(称为 NCCL)在处理不同建筑物(节点)之间这些微小且频繁的消息时表现极差。这就像当你需要瞬间传递一个秘密握手时,却试图通过缓慢的邮政服务发送一张明信片。

2. 比较:两种团队组织方式

研究人员测试了两种主要的团队组织方式:

  • 张量并行(TP):所有人同时处理拼图的同一部分,但他们必须不断与其他所有人核对,以确保意见一致。这对于大块工作非常有效,但会被大量的核对(通信)所拖累。
  • 混合并行(HP):他们将拼图分成大块,并将不同的块分配给不同的人。这减少了对核对的需求,但对于任务的“逐字”生成部分来说,效率不够高。

发现:对于任务的“逐字”部分(这也是大部分时间发生的情况),TP通常更好,但前提是团队能够足够快地相互交谈。标准的交谈方式太慢了,导致团队停滞不前。

3. 解决方案:NVRAR(“快速通道”)

为了解决通信缓慢的问题,研究人员构建了一个名为NVRAR的新工具。

  • 工作原理:他们不使用标准的缓慢邮政服务,而是利用一种名为 NVSHMEM 的技术,构建了一条定制的“快速通道”。
  • 类比:将旧的方式想象成发送一封信,这封信必须经过盖章、分拣,并由卡车投递。而 NVRAR 就像拥有一架专用无人机,直接从一个人飞向另一个人,瞬间放下便条并取回回复。
  • “递归倍增”技巧:他们将通信组织得像一场“传话游戏”,每个人在每一步中都将交谈的人数翻倍。不是每个人都逐一与所有人交谈,而是他们两两配对、合并、再次配对、再次合并。这对于大型群体来说要快得多。

4. 结果:加速团队

当他们将这个新的“快速通道”(NVRAR)接入系统时:

  • 更快的交谈:对于这些 AI 任务中使用的小消息,新系统比标准系统快了1.9 到 3.6 倍
  • 更好的拼图解决:当他们使用这个新系统运行庞大的"Llama 3.1 405B"模型(一个巨大的 AI 大脑)时,生成答案所需的时间显著下降。在某些情况下,团队完成的速度比之前快了1.72 倍
  • 现实世界测试:他们在现实世界的流量(模拟数千名用户提问)上进行了测试,发现该系统可以在不减速的情况下处理每秒更多的请求。

总结

这篇论文本质上是在阐明:当一支庞大的计算机团队试图解决 AI 拼图时,最大的延迟并非来自思考,而是来自交谈。不同建筑物之间标准的交谈方式对于所需的那些微小且频繁的消息来说太慢了。作者构建了一个定制的、高速的通信系统(NVRAR),它像一条快速通道,使团队能够瞬间协调,从而更快地解决拼图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →