← 最新论文
💬 NLP

GEM: GPU-Variability-Aware Expert to GPU Mapping for MoE Systems

GEM 是一个框架,它通过将专家根据硬件差异和令牌负载模式映射到 GPU,从而优化混合专家(MoE)模型的推理延迟,以此缓解拖尾效应并将端到端性能提升高达 16.5%。

原作者: Sourish Wawdhane, Avinash Kumar, Poulami Das

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Sourish Wawdhane, Avinash Kumar, Poulami Das

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在经营一家高端餐厅的厨房(即GPU 集群),你有一支由专业厨师(即专家)组成的团队,同时为众多顾客准备大量的菜肴。

在现代“混合专家”(MoE)AI 模型中,厨房并非由一位全能的大厨包揽所有工作,而是拥有许多更小型的、专业化的厨师。对于 AI 生成的每一个词(即一个“token”),一位经理(即路由器)会决定哪两位厨师负责烹饪该特定词汇。

问题:“最慢厨师”规则

在这个厨房里,有一条严格的规定:整个团队必须等待最慢的人完成任务后,才能进入下一步。

如果你有 8 位厨师,其中 7 位在 10 秒内完成了任务,但有一位厨师因为速度较慢或工作量过大而花费了 12 秒,那么整个厨房都会被迫多等待这额外的 2 秒。在 AI 领域,这种等待时间被称为"拖后腿者"(straggler),它会扼杀整个系统的速度。

该论文指出,导致厨师成为“拖后腿者”的主要原因有两个:

  1. 分配不当:经理不小心将最繁忙、最受欢迎的食谱全部分配给了某一位厨师,而其他厨师则处于闲置状态。
  2. 硬件差异:即使工作被完美分配,由于特定硬件(如较旧的烤箱或疲惫的手臂)的原因,某些厨师天生就比其他厨师慢。论文发现,在一组外观相同的 GPU 中,最快的那台比最慢的那台快了近28%

旧方法:“工作量相等,时间相等”

之前的解决方案试图通过给每位厨师完全相同数量的菜肴来解决这个问题。他们的想法是:“如果每个人的工作量相同,大家就会同时完成。”

但这行不通,因为:

  • 速度差异:一位快速厨师在相同时间内能比慢速厨师多烹饪 14% 的菜肴。如果你给他们完全相同的工作堆,快速厨师会提前完成并等待,而慢速厨师仍在挣扎。
  • 隐藏模式:有些厨师几乎一直很忙(一致性专家),而另一些厨师则只在短暂而强烈的爆发期一起忙碌(时间性专家)。旧方法忽略了这些“突发性”模式。如果两位总是在完全相同时间变得忙碌的厨师被分配到同一台慢速机器上,整个厨房就会陷入停滞。

新方案:GEM(感知 GPU 差异的专家映射)

作者提出了GEM,这是一个智能系统,就像一位天才厨房经理,确切知道每位厨师的速度以及订单是如何到来的。

GEM 运用了两个巧妙的策略:

1. “比例负载”策略
GEM 不是给每个人相同数量的菜肴,而是给快速厨师更多菜肴,给慢速厨师更少菜肴。

  • 类比:想象一场比赛。如果一名跑步者比另一名快 14%,你不会给他们相同的距离。你会给快者更长的赛道,这样他们就能在同一时刻冲过终点线。
  • GEM 精确计算快速 GPU 能额外处理多少工作量,以确保所有人同时完成该层计算

2. “模式侦探”策略
GEM 会观察厨房一小段时间(仅 16 个步骤),以了解两件事:

  • 谁一直很忙?(一致性专家)。
  • 谁会同时变得忙碌?(时间性专家)。
  • 类比:如果厨师 A 和厨师 B 总是在同一时间迎来巨大的订单高峰,GEM 会确保他们被分配到同一台慢速烤箱上。它会将他们分散到不同的工作站,以免彼此形成瓶颈。

GEM 的工作原理(四步流程)

  1. 观察与学习:GEM 会观察 AI 极短的一瞬间,看看哪些专家被使用以及何时被使用。
  2. 测试硬件:它运行快速测试,以确切了解每台特定 GPU 在不同负载下的速度。它通过仅在特定的“里程碑”处进行测试(例如每 32 英里检查一次车速,而不是每英里都检查)来智能地节省时间。
  3. 搜索:它运行模拟,以寻找厨师与烤箱的完美排列。它会尝试交换厨师的位置,直到找到一种设置,使得“最慢”的厨师尽可能快地完成。
  4. 部署:它锁定这种新排列。AI 开始运行,由于工作是根据机器的实际速度进行平衡的,整个系统运行得更加顺畅。

结果

当作者在五个不同的高性能 AI 模型上测试此方法时:

  • 速度提升:AI 完成任务的平均速度提高了7.9%
  • 最佳情况:在某些情况下,速度提高了16.5%
  • 更流畅的体验:“尾部延迟”(即导致用户感觉 AI 卡顿的最坏情况延迟)改善得更为显著,最高达16.9%

简而言之,GEM 通过给快速部分分配更多工作、给慢速部分分配更少工作,并确保没有两个“忙碌”的专家被卡在同一个慢速机器上,从而阻止 AI 等待系统中最慢的部分。它将硬件差异从弱点转化为提升性能的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →