← 最新论文
🤖 machine learning

Diagnosing Overhead in Dispatch Operations: Cross-architecture Observatory

本文引入 DODOCO 以证明混合专家模型中的 AlltoAll 调度开销是由内在的、特定于架构的路由不平衡所驱动,而非专家放置或模拟基准测试,从而揭示模型设计(例如 MLA/GDN 与 MHA/Mamba 的对比)对负载分布的决定性影响远大于并行规模或合成数据假设。

原作者: Bole Ma, Jan Eitzinger, Harald Koestler, Gerhard Wellein

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Bole Ma, Jan Eitzinger, Harald Koestler, Gerhard Wellein

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在运营一座庞大且高速运转的图书馆,成千上万本书(数据)需要被分类并发送给特定的专家(专用计算机),由他们负责解读。现代人工智能模型中的“混合专家”(Mixture of Experts, MoE)架构正是如此运作。

这座图书馆最大的瓶颈并非阅读书籍,而是邮件收发室。每当一本书到达,路由器就会决定将其分配给哪位专家。如果路由器将 90% 的书籍分配给专家 A,而仅将 1% 分配给专家 B,那么专家 A 就会不堪重负(成为“拖后腿者”),导致整座图书馆必须等待其完成工作后才能继续推进。

本文 DODOCO 深入探讨了计算机科学界长期以来关于如何解决这一邮件收发室瓶颈的三个主要误区。

测试的三个误区

误区一:“只需增加更多邮件收发室,负载就会自动平衡。”

  • 旧有观念: 如果某位专家手中的书籍过多,只需雇佣更多专家(扩展系统规模)。理论认为,将工作分散给更多人自然会使负载均匀。
  • 现实检验: 研究人员通过在系统中增加更多“邮件收发室”(节点)来测试这一观点。他们发现,增加更多专家并不能解决负载不均的问题。
  • 类比: 想象一家受欢迎的咖啡店,所有人都点“拿铁”。如果你开设 10 个新收银台,但所有人依然只点拿铁,那么制作拿铁的咖啡师仍然是瓶颈。问题的根源在于人们点单的模式(模型的决策),而非收银台的数量。这种不平衡是“ baked into”(内嵌于)AI 的“大脑”之中,而非硬件问题。

误区二:“我们可以用伪造的随机书籍来测试邮件收发室。”

  • 旧有观念: 由于获取真实书籍(数据)困难,研究人员使用“模拟令牌”(如"1、5、9、2"等随机数字)来模拟流量。他们假设这些随机数字的表现与真实语言无异。
  • 现实检验: 这是一个巨大的错误。研究人员发现,伪造数据会让问题看起来比实际情况严重得多。
  • 类比: 这就像通过向十字路口投掷随机石块来测试交通信号灯系统。石块可能会造成大规模、混乱的拥堵(高负载不均)。但当你切换到真实车辆在道路上行驶(真实文本)时,交通流动会顺畅得多,因为车辆遵循模式和规则。伪造数据高估了拥堵程度,最高达 2.35 倍。更糟糕的是,伪造数据暗示更大的交通批次会导致更多混乱,而真实交通无论批次大小如何都保持稳定。

误区三:“所有 AI 模型都一样;我们可以用同一种方式对待它们。”

  • 旧有观念: 既然所有这些模型都执行相似的任务,我们就可以设计一套适用于所有人的邮件收发室系统。
  • 现实检验: 研究人员发现,这些模型分成了两个截然不同的阵营,表现出完全不同的行为:
    • “数据稳健”阵营(MHA, Mamba-2): 这些模型如同纪律严明的学生。当面对真实文本时,它们几乎完美均匀地分配工作。它们易于管理。
    • “持续集中”阵营(MLA, GDN): 这些模型如同混乱的艺术家。无论给予它们什么文本(即使是真实文本),它们始终将 80% 的工作倾倒在少数几位特定专家身上。它们天生就不平衡。
    • “中间派”(GQA): 这一类介于两者之间。

核心结论

该论文指出,多年来,工程师们一直在试图解决一个并不存在的问题(“批次大小扩展”误区),并使用错误的地图(伪造数据)来设计系统。

作者建议,与其试图通过增加硬件来强行使每个模型达到平衡,不如首先对模型进行分类

  1. 如果你拥有数据稳健型模型,可以使用标准、简单的网络架构,因为其流量天然平衡。
  2. 如果你拥有持续集中型模型,则需要专门设计的复杂网络架构,以应对一两位专家始终不堪重负的事实。

简而言之: 你无法仅通过增加计算机数量来修复糟糕的路由决策。你也无法基于随机石块模拟来设计交通系统;你必须观察真实车辆的实际行驶方式。AI 模型本身的“形态”才是决定其产生多少流量的最关键因素。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →