← 最新论文
🤖 machine learning

Lynx: Enabling Efficient MoE Inference through Dynamic Batch-Aware Expert Selection

Lynx 是一个与负载无关的系统,它通过利用训练诱导的激活偏斜,并采用一种新颖的亲和分桶(AffinityBinning)技术来动态重映射令牌到专家的分配,从而减少被调用的专家数量,在不过度牺牲准确性的前提下将吞吐量提升高达 1.30 倍。

原作者: Vima Gupta, Jae Hyung Ju, Kartik Sinha, Ada Gavrilovska, Anand Padmanabha Iyer

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Vima Gupta, Jae Hyung Ju, Kartik Sinha, Ada Gavrilovska, Anand Padmanabha Iyer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你经营着一家名为“混合专家厨房”(The MoE Kitchen)的超大规模高端餐厅。

在这间厨房里,你并非拥有一位试图烹饪每一道菜品的巨型主厨,而是拥有一支由 64 位专业副厨(即“专家”,Experts)组成的团队。还有一位领班(即“路由器”,Router),他会查看每一道订单(即“词元”,Token),并决定哪 8 位特定的厨师来烹饪这道菜。

这种设置非常精妙,因为它高效:你无需为所有 64 位厨师处理每一道订单而支付费用,只需为所需的 8 位付费。现代人工智能模型(如 Qwen 或 Llama)正是如此运作——它们体量巨大,但在生成每个词时,仅“唤醒”其大脑中的一小部分。

问题:高峰时段的交通拥堵

该论文阐述了一个当餐厅变得繁忙(即“批处理”,Batching)时出现的主要问题。

当你只有一位顾客时,领班会将订单发送给 8 位特定的厨师。这很简单。
但当你有一批 16 位顾客时,领班会查看所有 16 份订单。由于每位顾客都不同,领班最终需要调用“几乎全部 64 位厨师”来处理整个群体。

瓶颈:
厨房的布局是将食材(即厨师们的知识)存储在一个巨大的高速储藏室(即"GPU 显存”)中。为了烹饪,厨师们必须跑去储藏室取他们特定的食材。

  • 问题所在: 当 16 位顾客到达时,储藏室会人满为患。厨师们花在往返取食材上的时间比实际烹饪的时间还要多。厨房变慢了,因为“奔跑”(内存带宽)成为了瓶颈,而非“烹饪”(计算)。
  • 结果: 尽管人工智能本应快速高效,但在同时处理多个请求时,它会因卡在数据获取上而变得极其缓慢。

解决方案:LYNX(智能领班)

作者们创造了一个名为LYNX的新系统。可以将 LYNX 想象为一位超级聪明、动态的管理者,他仅在厨房繁忙时(即“解码”阶段,这好比餐厅一口一口地供餐)介入。

LYNX 不会解雇任何厨师或更改菜单。相反,它使用一种称为亲和分箱(AffinityBinning)的巧妙技巧(一种“按置信度分组”的 fancy 说法)。

以下是 LYNX 逐步工作的过程:

  1. “置信度”检查:
    有时,领班 100% 确定厨师 A 是这道菜的最佳人选。其他时候,领班不确定,只是根据“必须选择 8 个不同人”的规则选择了厨师 B。论文发现,这些“不确定”的选择往往是冗余的。

    • 类比: 如果你问朋友电影推荐,他们说“我不确定,但也许是《电影 X》或《电影 Y》”,他们其实对两者都没有真正的承诺。如果你再问一次,他们可能还是会选《电影 X》。
  2. “分箱”策略:
    LYNX 查看领班的置信度分数,将订单分组到不同的“桶”中。

    • 高置信度: “这道订单必须交给厨师 A。”(LYNX 对此保持不变)。
    • 低置信度: “这道订单只是有点适合厨师 B。”(LYNX 会说:“实际上,让我们把它交给厨师 A 吧,因为厨师 A 已经在这批订单的其他任务中在厨房忙活了。”)
  3. 重新映射:
    LYNX 将这些“低置信度”的订单重新定向给那些已经被该批次使用的厨师。

    • 神奇之处: 厨房不再需要为 64 位不同的厨师跑去储藏室取食材,而只需为例如 30 位厨师跑去取。
    • 结果: 厨师们花在奔跑上的时间更少,花在烹饪上的时间更多。厨房运转得更快了。

为何这很特别

论文强调了 LYNX 之所以重要的三个关键原因:

  • 它是“工作负载无关”的: LYNX 不需要针对特定类型的顾客或菜单进行训练。它每次都能即时找出模式。这就像一位管理者能瞬间学会人群的习惯,而无需查阅手册。
  • 它不会破坏任何东西: LYNX 不解雇厨师,也不改变食谱。它只是重新安排在特定时刻谁做什么。论文表明,食物(即人工智能的回答)味道一样好,有时甚至更好,因为它不再强迫厨师去烹饪他们不确定的菜品。
  • 它能与他人良好协作: LYNX 可以叠加在其他加速技巧之上(例如缩小厨师的围裙或将他们送往不同的建筑),使它们变得更快。

结果

当作者在真实世界的人工智能模型(如 Qwen、Mixtral 和 Llama)上测试该方法,涵盖编码、数学和推理等任务时:

  • 速度: 在最坏的情况下,系统速度提升了1.3 倍(即 30% 的加速)。
  • 准确性: 答案的准确性保持不变,甚至略有提升。在最坏的情况下,准确率下降不到 1%,几乎难以察觉。
  • 效率: 它允许系统在不减速的情况下同时处理更多顾客。

总结

LYNX 就像繁忙人工智能厨房的交通警察。它注意到,当一批订单涌入时,厨房因要为太多不同的厨师跑去储藏室而浪费时间。因此,它巧妙地将那些“也许”的订单重新定向给已经在工作的厨师,从而减少交通拥堵,让食物更快端出,同时不改变菜单也不解雇任何人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →