← 最新论文
🤖 machine learning

HetCCL: Enabling Collective Communication For Mixed-Vendor Heterogeneous Clusters

letCCL 是一个创新的框架,通过引入主机-设备免拷贝 P2P 传输、厂商无关的边界通信器机制以及分层拓扑抽象,实现了在混合厂商异构集群中的高效集合通信,其带宽比 Gloo 高出高达 19 倍,并将大语言模型(LLM)训练速度提升了 16.9%。

原作者: Yuejie Wang, Tao Chang, Yuanyuan Zhao, Yulong Ao, Zeyu Gu, Zhiyu Li, Yanmin Jia, Yan Zhang, Mingjun Zhang, He Liu, Yongzhe He, Yonghua Lin, Guyue Liu

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuejie Wang, Tao Chang, Yuanyuan Zhao, Yulong Ao, Zeyu Gu, Zhiyu Li, Yanmin Jia, Yan Zhang, Mingjun Zhang, He Liu, Yongzhe He, Yonghua Lin, Guyue Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图组织一场规模宏大的全球接力赛,目的是为了训练一个超级智能的 AI(大语言模型)。在过去,你只能使用来自同一个特定国家(即一个硬件厂商,比如 NVIDIA)的选手。他们穿着同样的鞋子,说着同样的语言,并且完全知道如何传递接力棒。这使得比赛既快速又顺畅。

但今天,只用一个国家的选手来跑比赛太贵了,或者因为供应不足而无法实现。所以,你决定混合使用来自不同国家的选手(如 NVIDIA、AMD、华为等)。问题在于?这些选手语言不通,鞋子也不同,而且不知道如何互相传递接力棒而不掉落。

这就是 HetCCL 所解决的问题。以下是它的工作原理,通过简单的概念进行拆解:

1. 问题所在:“教练”瓶颈

在过去的混合赛事尝试中,如果 A 国的选手需要将接力棒交给 B 国的选手,他们必须先跑到中央的“教练”(即 CPU)那里。教练接过接力棒,把它记录在剪贴板上,然后跑到另一边,再把它交给新的选手。

  • 问题在于: 这个“教练”步骤很慢。它浪费了在跑来跑去上的时间,而且教练与选手之间的路径是一条狭窄拥挤的走廊(即 PCIe 瓶颈)。

2. 解决方案:“直连线”(P2P 传输)

HetCCL 发明了一种新的传递接力棒的方式。它不再使用教练,而是在不同国家的选手手之间建立一条直接的高速隧道

  • 工作原理: HetCCL 让“控制”(关于何时奔跑的指令)保留在教练手中,但“数据”(实际的接力棒)在整个过程中始终留在选手的手中。
  • 类比: 想象教练发送了一条短信说:“开始!”然后选手们通过一条超高速隧道直接将接力棒传给彼此,完全跳过了教练的办公室。这消除了那种缓慢的“来回奔波”的时间。

3. “边境警卫”技巧(厂商无关的归约/Reduction)

有时候,比赛不仅仅是关于传递接力棒,还涉及合并信息。例如,如果选手 A 有数字“5”,而选手 B 有“3”,他们需要在把结果传下去之前,先把它们相加得到“8”。

  • 问题: 不同国家的选手使用不同的计算器。你不能直接要求选手 A 使用选手 B 的计算器。
  • 解决方案: HetCCL 创建了一个“边境警卫”系统。它从不同的选手那里获取数字,并将它们移动到一个特定的“边境站”,在那里使用一个标准的、通用的计算器(该计算器内置于每个国家的现有软件中)来进行数学运算。这就像是在边境有一个通用的翻译员负责为所有人做加法,这样就没人需要学习新语言。

4. “流水线”(层级化与流水线设计)

在拥有许多队伍的大型比赛中,如果每个人都要等待前一个团队完成后才开始,比赛就会变慢。

  • 解决方案: HetCCL 将比赛组织成一个层级化的流水线
    • 第 1 步: 同一国家的选手首先完成他们的本地交接。
    • 第 2 步: 在他们进行这些操作的同时,“边境警卫”开始在不同国家之间传递数据。
    • 第 3 步: 最后在国家内部再次进行交接。
  • 类比: 不再是等待整条线停下来,而是当上一批选手腾出赛道时,下一批选手立即开始移动。这让“隧道”(网络带宽)始终保持充实和忙碌,而不是处于闲置状态。

他们证明了什么?

研究人员构建了这个系统(称为 HetCCL),并使用来自四家不同公司的真实硬件对其进行了测试。以下是他们的发现:

  • 速度: 在混合赛事场景中,HetCCL 比旧有的“教练”模式(Gloo)快了 17 到 19 倍
  • 效率: 它实现了几乎与所有人都来自同一个国家时相当的速度,即使是在混合不同硬件的情况下。
  • 现实世界的影响: 当他们使用它来训练 AI 模型(如 Llama 3)时,与旧方法相比,每一步的训练速度提升了高达 16.9%

简而言之: HetCCL 是一个通用翻译器和快速通道,它允许不同类型的计算机芯片协同工作,像一个团队一样协作,而不会互相拖后腿,从而使构建大规模 AI 系统变得更便宜、更快速。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →