← 最新论文
💻 computer science

TEMPO: Makespan-Aware Expert-Parallel Load Balancing Across Memory- and Compute-Bound Regimes

TEMPO 引入了一种感知完成时间(makespan-aware)的专家并行负载均衡调度器,该调度器对跨越内存受限与计算受限机制的非线性专家执行时间进行建模,以动态优化 Token 分布,在传统基于线性计数的方法失效的混合机制场景中,实现了高达 15.5% 的吞吐量提升和显著的延迟降低。

原作者: Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在为一座永不眠城的超大规模、高速运转的披萨外送业务进行管理。你拥有一支完全相同的配送员队伍(即 GPU),以及一个拥有数百名不同专业厨师(即 AI 模型中的“专家”)的中央厨房。每当有客户订购披萨时,系统必须决定由哪些厨师来制作这块饼,以及由哪位司机来运送成品。在人工智能的世界里,特别是在一种被称为“混合专家”(Mixture-of-Experts,简称 MoE)的模型中,情况正是如此。这些模型就像是由数千个更小的、专门化的子大脑组成的巨型大脑。当 AI 进行思考时,它并不会同时动用整个大脑,而是挑选出几个特定的专家来处理这项任务。

巨大的挑战在于如何保持整个团队的运行速度一致。如果一名司机因为接到了一个极其复杂的大订单而陷入停滞,而其他所有人都处于闲置状态,那么整个配送过程都会被延误。多年来,平衡工作负载的标准规则一直很简单:“只需将订单数量均匀分配即可。”如果你有 100 个订单,就给 10 名司机每人分 10 个。这看起来很合乎逻辑,就像是平均分配一堆苹果。但如果有些苹果是沉重的石头,而另一些是轻盈的羽毛呢?或者如果厨房有一条规定,无论你做多少个披萨,挑选一位新厨师所花费的时间都是固定的。旧有的规则假设时间总是与订单的数量直接相关的。但这个研究提出了一个疑问:如果这个假设是错误的呢?

来自 KlingAI 的这些研究人员发现,旧有的“计算订单数量”规则实际上是一个陷阱。他们发现,在现代 AI 硬件中,处理一个专家的耗时不仅仅取决于它看到了多少个 Token(单词或数据块)。它是一个具有两面性的“怪兽”。有时,时间主要消耗在从内存库中加载专家的“食谱”(权重)这一纯粹的体力活上,无论订单量多小,这部分时间都是固定的。而另一些时候,一旦食谱加载完成,时间就会随着订单数量的增加而线性增长。旧的方法只关注订单数量,从而忽略了加载食谱的隐藏成本。他们试图通过计数来平衡一堆羽毛和石头,而不是通过称重。

为了解决这个问题,团队构建了一个新的调度器——TEMPO(基于时间建模的专家并行优化)。TEMPO 不仅仅是计数 Token,它更像是一个理解厨房物理规律的智能交通控制器。它使用了一种特殊的“成本模型”,精确测量加载专家食谱所需的时间以及烹饪披萨所需的时间。它意识到,如果你有一个“冷门”专家(即一段时间没被使用过的专家),将其微小的订单拆分给两个驱动程序将是一场灾难,因为你必须支付两次“加载费”。但如果你有一个拥有海量订单的“热门”专家,拆分它则是完全可以接受的。

论文表明,TEMPO 不仅仅是在靠直觉猜测;它能在毫秒级时间内为每一批次的请求计算出完美的平衡点。他们在真实的 AI 模型上进行了测试,发现旧方法往往会导致 15% 的速度下降,或者导致排队序列中最后几位客户面临显著的延迟。然而,TEMPO 能让排队流程平稳运行。这就像是从“每个人得到相同数量的苹果”这一规则,转变为“每个人承担相同的工作量”这一规则,同时也考虑到了有些苹果很重,而有些厨师醒来很慢。

研究人员非常谨慎地展示了这种新方法在何处有效,以及在何处无效。他们证明,如果“热门”专家过于密集,以至于系统仅仅是被庞大的数据量所淹没(即进入“计算受限”阶段),那么旧的 Token 计数法其实也是可以接受的。但在现实世界中,当某些专家正忙碌而另一些专家正在休息,且“加载费”很高时,TEMPO 的优势便会显现出来。他们甚至绘制了一张“相图”(Phase Diagram),这就像是 AI 交通的“天气预报图”,能够准确预测何时新方法能节省时间,以及何时旧方法已经足够好。

最终,这篇论文不仅仅是关于一种更快的算法;它是关于我们如何思考 AI 任务平衡方式的变革。它告诉我们,在现代 AI 这种复杂且高速运转的世界里,你不能仅仅是计数。你必须理解移动数据的隐藏成本以及工作的具体形态。通过衡量完成工作的实际时间,而非仅仅计数项目,TEMPO 让 AI 模型变得更快、更高效,并能应对未来的巨大需求。它将一个混乱的厨房变成了一台运转良好的精密机器,确保没有任何一名司机会在披萨放在保温灯下等待时,还只能干等着。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →