想象一下,你正在运营一座庞大且高速运转的图书馆,成千上万本书(数据)需要被分类并发送给特定的专家(专用计算机),由他们负责解读。现代人工智能模型中的“混合专家”(Mixture of Experts, MoE)架构正是如此运作。
这座图书馆最大的瓶颈并非阅读书籍,而是邮件收发室。每当一本书到达,路由器就会决定将其分配给哪位专家。如果路由器将 90% 的书籍分配给专家 A,而仅将 1% 分配给专家 B,那么专家 A 就会不堪重负(成为“拖后腿者”),导致整座图书馆必须等待其完成工作后才能继续推进。
本文 DODOCO 深入探讨了计算机科学界长期以来关于如何解决这一邮件收发室瓶颈的三个主要误区。
测试的三个误区
误区一:“只需增加更多邮件收发室,负载就会自动平衡。”
- 旧有观念: 如果某位专家手中的书籍过多,只需雇佣更多专家(扩展系统规模)。理论认为,将工作分散给更多人自然会使负载均匀。
- 现实检验: 研究人员通过在系统中增加更多“邮件收发室”(节点)来测试这一观点。他们发现,增加更多专家并不能解决负载不均的问题。
- 类比: 想象一家受欢迎的咖啡店,所有人都点“拿铁”。如果你开设 10 个新收银台,但所有人依然只点拿铁,那么制作拿铁的咖啡师仍然是瓶颈。问题的根源在于人们点单的模式(模型的决策),而非收银台的数量。这种不平衡是“ baked into”(内嵌于)AI 的“大脑”之中,而非硬件问题。
误区二:“我们可以用伪造的随机书籍来测试邮件收发室。”
- 旧有观念: 由于获取真实书籍(数据)困难,研究人员使用“模拟令牌”(如"1、5、9、2"等随机数字)来模拟流量。他们假设这些随机数字的表现与真实语言无异。
- 现实检验: 这是一个巨大的错误。研究人员发现,伪造数据会让问题看起来比实际情况严重得多。
- 类比: 这就像通过向十字路口投掷随机石块来测试交通信号灯系统。石块可能会造成大规模、混乱的拥堵(高负载不均)。但当你切换到真实车辆在道路上行驶(真实文本)时,交通流动会顺畅得多,因为车辆遵循模式和规则。伪造数据高估了拥堵程度,最高达 2.35 倍。更糟糕的是,伪造数据暗示更大的交通批次会导致更多混乱,而真实交通无论批次大小如何都保持稳定。
误区三:“所有 AI 模型都一样;我们可以用同一种方式对待它们。”
- 旧有观念: 既然所有这些模型都执行相似的任务,我们就可以设计一套适用于所有人的邮件收发室系统。
- 现实检验: 研究人员发现,这些模型分成了两个截然不同的阵营,表现出完全不同的行为:
- “数据稳健”阵营(MHA, Mamba-2): 这些模型如同纪律严明的学生。当面对真实文本时,它们几乎完美均匀地分配工作。它们易于管理。
- “持续集中”阵营(MLA, GDN): 这些模型如同混乱的艺术家。无论给予它们什么文本(即使是真实文本),它们始终将 80% 的工作倾倒在少数几位特定专家身上。它们天生就不平衡。
- “中间派”(GQA): 这一类介于两者之间。
核心结论
该论文指出,多年来,工程师们一直在试图解决一个并不存在的问题(“批次大小扩展”误区),并使用错误的地图(伪造数据)来设计系统。
作者建议,与其试图通过增加硬件来强行使每个模型达到平衡,不如首先对模型进行分类:
- 如果你拥有数据稳健型模型,可以使用标准、简单的网络架构,因为其流量天然平衡。
- 如果你拥有持续集中型模型,则需要专门设计的复杂网络架构,以应对一两位专家始终不堪重负的事实。
简而言之: 你无法仅通过增加计算机数量来修复糟糕的路由决策。你也无法基于随机石块模拟来设计交通系统;你必须观察真实车辆的实际行驶方式。AI 模型本身的“形态”才是决定其产生多少流量的最关键因素。
技术摘要:诊断调度操作中的开销:跨架构可观测性(DODOCO)
问题陈述
AlltoAll 调度是混合专家(MoE)专家并行(EP)中的主要瓶颈。互连社区提出了四类缓解方案:预测性样本放置、自适应专家重排、分层集合通信以及 EP 感知拓扑。这些解决方案依赖于两个未经检验的假设:
- 可纠正性(假设 A):路由不平衡是一种工作负载属性,可以通过足够智能的系统层加以降低。
- 基准测试有效性(假设 B):模拟令牌基准测试(使用均匀随机 ID)能够真实反映生产环境中的路由行为。
本文认为,这些假设尚未被正面检验,可能导致系统针对虚构工作负载进行优化。
方法论
作者引入了DODOCO,这是一项实证研究,旨在通过5×6 因子设计,在五种不同的 MoE 架构和六种数据条件下检验上述假设。
架构:该研究涵盖了跨越主要模型家族的五个序列混合器设计:
- DeepSeek-V2-Lite:多头潜在注意力(MLA)。
- DeepSeek-MoE-16B:标准多头注意力(MHA)。
- Qwen3-30B-A3B:分组查询注意力(GQA)。
- Nemotron-30B-A3B:Mamba-2(状态空间模型)。
- Qwen3.5-35B-A3B:门控 Delta 网络(GDN)。
- 注:MLA 和 MHA 配对构成了受控比较,两者在专家数量、top-k、门控机制和负载均衡策略上保持一致,仅注意力机制不同。
数据条件:六种条件隔离了令牌流的独立属性:
- 模拟(Mock):均匀随机令牌 ID(标准基准测试默认设置)。
- 打乱(Shuffled):真实 WikiText 令牌,经全局置换(保留频率,破坏序列)。
- 重映射(Remapped):真实序列,经词汇 ID 置换(保留序列,破坏嵌入)。
- 罗曼什语(Romansh):低资源罗曼语族的真实文本(未见过的语言结构)。
- Opus:截断后的英文推理轨迹(未见过的内容)。
- WikiText:英文维基百科(熟悉的结构和内容)。
硬件与规模:实验在 H100 GPU 上运行(NHR@FAU Helma 超级计算机),采用节点内 NVLink 和节点间 InfiniBand。研究包括匹配的窗口 EP 扫描(4、8、16、32 个秩)和全局批量大小(GBS)扫描(64 至 2048)。
指标:该研究利用发送计数矩阵(S)的三个标量摘要:
- 每专家最大/平均比率:用于衡量独立于专家到秩映射的路由决策偏斜。
- 基尼系数(Gini Coefficient):用于衡量每秩的负载不平衡。
- 拟合对称狄利克雷 α:用于解析在基尼系数压缩值的情况下,近均匀区域中的差异。
主要发现
1. EP 扩展并不能减少拖尾者(Q1)
与“增加 EP 度可平滑负载分布”的假设相反,研究发现扩展 EP 并不能减少路由不平衡。
- 在每种架构内部,每专家最大/平均令牌比率在 EP 范围(4 至 32)内基本保持平坦(变化 ≤ 5%)。
- 拖尾者是模型所做出的路由决策的固有属性,而非专家如何映射到秩的属性。扩展 EP 会改变哪个秩持有特定专家,但不会改变哪些专家接收令牌。
- 因此,EP 度并非改善路由平衡的杠杆;偏斜的下限由一个 EP 不变的集中度所界定。
2. 模拟令牌高估不平衡并伪造趋势(Q2)
模拟令牌基准测试严重歪曲了生产环境的路由情况。
- 误差幅度:与真实文本(WikiText)相比,模拟令牌将路由基尼系数高估了高达2.35 倍。在 Nemotron 模型上,狄利克雷 α 指标的差异达到了47 倍。
- 批量大小伪影:模拟数据表现出一种虚假趋势,即不平衡随批量大小(GBS)增加而加剧。真实数据则显示基尼系数在不同批量大小下基本保持平坦。依赖模拟数据的从业者可能会错误地得出结论,认为更大的批量会恶化不平衡。
- 机制:路由器需要同时具备序列结构和 learned embeddings。打乱的真实文本(保留频率,破坏序列)或重映射的文本(保留序列,破坏嵌入)的表现与模拟令牌一样差。
3. 涌现的架构类别(Q3)
这五种架构并非可互换地运作;它们根据真实数据如何影响路由,分化为两个稳定的类别:
- 数据弹性(MHA, Mamba-2):这些模型在真实文本下实现了低基尼系数(分别为 0.105 和 0.150),并且从模拟数据到真实数据表现出显著改善。它们的路由趋向均匀。
- 持续集中(MLA, GDN):这些模型无论数据条件如何,都保持高度集中,即使在 WikiText 上基尼系数也保持在 0.24 以上,在模拟数据上达到 0.29–0.38。
- 中间态(GQA):介于两者之间,显示出适度的改善,但仍处于中间带。
- 深度分析:“数据弹性”配对在第一个 MoE 层开始时接近均匀,并随深度增加而集中(U 型);而“持续集中”配对则从第一层开始就处于集中状态。
意义与主张
本文主张,用于设计和评估 MoE 感知互连的工作负载模型,至多是一个常数因子近似,至多是一个幻影。
- 系统设计影响:“两类分类法”(数据弹性 vs. 持续集中)比 EP 度或模拟数据概况是更有效的系统设计输入。
- 对于数据弹性模型,流量主要受带宽限制;均匀负载模型已足够。
- 对于持续集中模型,需要感知局部性的调度以及利用特定节点对集中性的拓扑设计。
- 基准测试:作者建议 MoE 通信基准测试应同时报告模拟和真实数据条件,以揭示批量大小扩展伪影和架构类别差异。
- 局限性:该研究刻画了路由决策和 AlltoAll 统计特征,但未测量系统干预带来的端到端训练加速。它并未声称不平衡不重要,而是指出关于其可纠正性和测量的假设存在缺陷。
本文结论认为,路由不平衡是一种模型与数据属性,系统层可以对其进行定位并部分利用,但无法仅通过 EP 扩展使其均匀化。当前使用的合成基准测试在两个方面忽略了这一现实:高估不平衡,以及伪造不存在扩展趋势。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。