← 最新论文
🤖 AI

UBEP: Re-architecting Expert Parallelism Communication Library for Production Superpods

UBEP 是一个生产就绪的通信库,它通过克服序列化、同步和负载不均衡的瓶颈,为高带宽超级计算集群(superpods)重构了混合专家模型(MoE)的 All-to-All 原语,从而将 All-to-all 延迟降低高达 52.4%,并将推理单 Token 延迟(TPOT)降低高达 11.1%。

原作者: Yipeng Liu, Chang Liu, Si Shen, Jiaqi Zheng, Mingfan Li, Yuyang Yang, Guanhua Li, Yuquan Zhang, Yimeng Xu, Zhongzhe Hu, Zhiyuan Huang, Qihang Duan, Junsong Wang, Wenkai Ling, Baochuan Yang, Xianzhi Yu
发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Yipeng Liu, Chang Liu, Si Shen, Jiaqi Zheng, Mingfan Li, Yuyang Yang, Guanhua Li, Yuquan Zhang, Yimeng Xu, Zhongzhe Hu, Zhiyuan Huang, Qihang Duan, Junsong Wang, Wenkai Ling, Baochuan Yang, Xianzhi Yu, Han Bao, Yijie Chen, Guihai Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文《UBEP: 为生产级 Superpod 重构专家并行通信库》的解释,采用了通俗易懂的语言和创意类比。

大局观:一个超级快递系统

想象一下,你正在经营一家规模宏大、高科技的披萨工厂(Superpod),数百名厨师(AI 芯片)正齐心协力制作数百万份披萨(AI 模型 Token)。

在这个工厂里,有一个特殊的规则:每一份披萨订单并不会只发给一位厨师。相反,订单会被拆分,特定的配料会被发送到专门负责某种食材的“专家”厨师那里。这就是所谓的混合专家模型(Mixture-of-Experts, MoE)

问题在于?目前这些厨师之间的沟通方式就像一条缓慢且官僚主义的装配线。尽管工厂拥有世界上最快的传送带(高速连接),但厨师们却陷入了互相等待、核对清单以及无所事事地站着的困境。

UBEP 是一个旨在解决这一问题的全新管理系统。它将缓慢的装配线转变为一场混乱但高速、完美协调的舞蹈,让工厂的运行速度大幅提升。


三大问题(瓶颈)

作者发现,即使在最快的硬件上,当前系统之所以缓慢,主要有三个原因:

1. “停下并等待”的交通拥堵(BSP 序列化)

旧方式: 想象一辆校车,司机规定在所有学生都站起来并举手之前,谁也不准下车。即使某个学生只需 1 秒就能准备好,他也必须等待那个需要 10 秒才能准备好的学生。
现实情况: 在 AI 工厂中,系统使用“批量同步并行”(BSP)模型。它强制要求所有芯片在进入下一步之前,必须停止并等待一个全局的“全员通过”信号。因为新的超级工厂运行得太快了,等待这个信号的时间现在成了最大的瓶颈,而不是移动数据的时间。

2. “挥旗子”的税收(同步开销)

旧方式: 想象一场接力赛,在每个跑者传递接力棒之前,他们都必须停下来,挥一下旗子,等待下一个跑者也挥一下旗子,然后才能继续跑。
现实情况: 芯片花费了大量时间仅仅是在发送“我准备好了”这类信号(旗帜)以及检查“你做完了吗?”这类消息。在这些全新的超高速机器上,挥舞这些数字旗帜所花费的时间甚至比实际干活的时间还要长。

3. “一刀切”的地图(拓扑无关调度)

旧方式: 想象一名快递员,他认为城市里的每家每户距离都是一样的。他没有意识到有些房子就在隔壁(1 跳),而有些则在城另一头(2 跳)。他用处理邻居包裹的逻辑去处理远方房子的包裹,从而导致了延迟。
现实情况: 新型工厂的布局非常复杂。有些芯片紧挨着彼此(快),而有些则隔着几个交换机(慢)。旧软件对它们的处理方式完全一样,这会导致重型流量涌向慢速路径,从而产生“掉队者”(慢跑者),拖累整个团队。


UBEP 的解决方案:他们是如何修复它的

作者构建了 UBEP(统一总线专家并行,Unified-Bus Expert Parallelism)来解决这三个问题,并使用了三个聪明的技巧:

1. 打破装配线(算子分解)

与其等待所有人完成步骤 A 之后再开始步骤 B,UBEP 将工作拆解成微小的部分。

  • 类比: 与其用一辆校车等待所有人,不如使用一支出租车车队。只要有一位乘客准备好了,出租车就立即带走他们。当一些厨师还在切洋葱时,其他人可能已经在铺放奶酪了。
  • 结果: 系统实现了任务重叠。当一组芯片正在发送数据时,另一组芯片已经在计算下一批数据的去向了。没有人会闲置。

2. 隐藏旗帜(数据即旗帜)

UBEP 不再使用独立的“我准备好了”旗帜。

  • 类比: 厨师不再挥舞单独的旗子来说“我做完了”,而是直接在披萨盒上写下“我做完了”。下一个人只需看一眼盒子就知道准备好了。
  • 结果: 因为硬件可以在瞬间写入一整盒数据(512 字节),所以“旗帜”和“数据”是同时到达的。这消除了浪费在挥舞独立旗帜上的时间。

3. 智能 GPS(层级化 Token 调度)

UBEP 使用了一张智能地图,清楚地知道每块芯片与其他芯片之间的距离。

  • 类比: 快递员现在拥有了一个 GPS,知道哪些房子是“隔壁”,哪些是“城另一头”。他们将“隔壁”的派送任务分配给跑得快的选手,将“城另一头”的任务分配给跑得慢的选手,从而平衡负载,使所有人几乎同时完成任务。
  • 结果: 不再有掉队者。系统平衡了工作量,使得慢速路径不会过载,保持整个工厂平稳运行。

结果:有多快?

作者在规模巨大的真实工厂(华为 CM384 superpod,拥有 256 块 AI 芯片)上测试了这个新系统。

  • 速度提升: 他们将芯片之间移动数据的时间(All-to-All 延迟)降低了高达 52.4%。这相当于把等待时间缩减了一半以上。
  • 现实影响: 对于最终的 AI 模型(如聊天机器人),这使得生成每个词所需的时间(每个输出 Token 的时间)降低了 11.1%

总结

该论文指出,为了充分利用这些极其快速的新型 AI 超级工厂,我们不能再使用为更慢、更简单的机器设计的旧软件。我们需要停止让芯片互相等待,停止挥舞不必要的旗帜,并开始使用智能地图来平衡工作。UBEP 正是为此而生的新软件。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →