The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism
本技术综述通过将混合专家(Mixture-of-Experts)架构在大型语言模型中的演进组织成一个依赖图,并从四个控制平面(专家拓扑、路由、平衡和专家并行)对其进行分析,以此阐明该领域如何从单纯地激活稀疏参数转向解耦语义路由、计算预算与物理执行。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,一个超智能计算机的大脑就像一座巨大且繁忙的图书馆。在过去,为了回答一个问题,计算机需要派出一名图书管理员去阅读架子上每一本书,逐一阅读,以确保万无一失。这既缓慢又浪费能量。后来,工程师们发明了一种更聪明的方法:“混合专家模型”(Mixture of Experts)。不再是让一名图书管理员阅读所有内容,而是雇佣了成千上万名专家。当关于烹饪的问题进来时,只有“厨师”专家会打开书本;当关于空间的问题进来时,只有“天文学家”会醒来。这就是大型语言模型(LLMs)中**混合专家模型(MoE)**的核心思想:它让 AI 模型能够变得极其庞大和聪明,而无需在处理每个单词时都进行所有的计算。
但问题的关键在于:如果你有百万计的专家,你该如何决定谁来承担工作?如果你把所有的“空间”问题都交给天文学家,他们会被压垮并拖慢整个速度,而“厨师”却在闲置。这就是“路由”(routing)问题。这就像是在管理一场巨大的音乐会,你必须瞬间决定哪位音乐家演奏哪一个音符,确保没有人过载,没有人无聊,且音乐流畅进行。如果你搞砸了路由,整个系统就会陷入停滞。
这篇由 Jiguo Li 于 2026 年 8 月撰写的论文,深入探讨了这些“专家”系统是如何随时间演进的。作者认为,MoE 的历史不仅仅是逐年发布更新、更大模型的列表。相反,这是一个解决一个接一个特定“交通拥堵”问题的过程。作者指出,该领域已经经历了八个主要的“里程碑”,从简单的统计技巧转向了复杂的动态系统——在这种系统中,计算机不仅可以决定谁来帮忙,还可以决定需要多少帮助,甚至决定那份帮助在计算机硬件中的物理位置。论文发现,未来不仅仅是增加更多的专家,而是要解开“AI 在思考什么”的逻辑与“计算机如何运行”的物理现实之间的纠缠,从而实现更聪明、更快、更高效且不会陷入交通拥堵的 AI。
八大里程碑的故事
将 MoE 的演进想象成一座城市公共交通系统的历史。它始于一辆到处停靠的单辆巴士,然后演变为可以叫出租车的系统,最终变成了高度高效、自我组织的无人机和地铁网络。论文将这段旅程分为八个不同的阶段,即“里程碑”,其中每一步都解决了一个主要瓶颈,但也创造了新的挑战。
1. 统计性的分工(旧式巴士)
在早期,其核心思想很简单:设置一个“门控”(gate)来决定哪个“专家”(大脑的一个小部分)应该处理任务。但在开始阶段,每个人仍然会贡献一点力量。这就像一辆巴士,即使乘客并不下车,每个人也都要站起来向司机挥手。这是一种统计性的分劳,但并没有节省任何能量。计算机仍在做所有的工作,只是用了一种稍微聪明一点的方式。
2. “Top-K”开关(出租车服务)
随后迎来了重大突破:稀疏条件计算(Sparse Conditional Computation)。想象一个开关,它说:“只有前 2 名专家可以工作,其余 98 名回家。”这就是 Top-K 路由。突然之间,计算机可以拥有海量的知识库(数百万个参数),但对于每个单词仅使用其中的极小一部分。这就是“容量杠杆”:你可以让模型变得更聪明,而不使其变慢。但它引入了一个新问题:如果“厨师”接到了 1,000 个订单,而“天文学家”一个也没接到怎么办?系统开始变得不平衡。
3. 集群规模化(地铁网络)
随着模型增长到需要分布在数千个计算芯片(GPU)上,数据传输成为了问题。如果“厨师”住在芯片 A,“天文学家”住在芯片 B,你该如何把食材运过去?这一时期引入了**专家并行(Expert Parallelism)**和 All-to-All 通信。这就像建立了一个庞大的地铁网络,Token(单词)是乘客,它们必须搭乘列车才能到达正确的专家那里。挑战从“谁来做数学题”转向了“如何在不被堵塞的情况下快速移动数据”。
4. 开源权重时代(公共交通 App)
随后,像 Mixtral 这样的模型证明了这种复杂的系统实际上可以为普通人使用,而不仅仅是大型实验室。它们证明了你可以拥有一个庞大、粗粒度的 MoE(大专家)并向所有人开放使用。但当时的“专家”仍然过于庞大且笨拙。它们往往会重复学习一些基本的东西(比如如何说“你好”),这造成了空间的浪费。
5. 细粒度与共享专家(专业化小摊位)
为了解决笨拙的问题,工程师开始将大专家拆分为许多微小的细粒度专家。这就像是用数百个小型摊位取代一个巨大的“综合商店”:一个卖“辣味食物”,一个卖“甜点”,一个卖“素食选项”。这实现了更精确的路由。他们还加入了共享专家(Shared Experts)——一条通往每个人都需要的基础知识(如基本语法)的永久路径——这样路由系统就不必在基础问题上浪费时间。这使系统变得更快、更聪明,但也创造了一个新的交通拥堵:太多的微型摊位意味着地铁的行程过于琐碎,从而减慢了速度。
6. 超稀疏扩展(百万专家图书馆)
接着,研究人员问道:“如果我们有更多的专家,但专家规模更小呢?”像 Kimi K2 和 PEER 这样的模型开始使用数百个微型专家(有时超过一百万个!)。其理念是拥有如此庞大的候选池,以便 AI 能为每一个单词找到最完美的专家。但论文指出一个问题:如果你有太多专家,计算机在查找谁来帮忙(检索)和移动数据方面花费的时间,会比实际执行工作的时长还要长。“权重 I/O”(加载专家的脑部信息)成为了新的瓶颈。
7. 动态计算(灵活的预算)
在此之前,每个单词获得的帮助量都是相同的(例如,“Top-2”专家)。但有些词很难(如“量子物理”),有些词很简单(如“的”)。**动态计算(Dynamic Compute)**改变了规则:AI 可以决定对简单的词使用 1 个专家,对难的词使用 4 个专家。有些模型甚至使用“零计算”插槽,即 AI 直接说“我知道这个,不需要调用任何人”。这节省了能量,但也带来了新的风险:如果大量难词同时出现,系统可能会过载,导致延迟(尾部延迟)。
8. 解耦逻辑与物理执行(传送网络)
最后的疆界是语义路由与物理执行脱钩(Semantic Routing Decoupled from Physical Execution)。目前,如果 AI 决定调用“天文学家”,数据必须立即物理传输到天文学家所在的芯片。新的想法(如 ScMoE 或 异构专家 Heterogeneous Experts)表明,我们可以将决策与移动分离。也许 AI 决定使用天文学家,但数据会在缓冲区等待,或者天文学家的规模会根据任务而变化。这就像是一个传送网络,目的地是在逻辑上决定的,但物理运输是独立优化以避免交通拥堵的。
四个控制平面
论文将所有这些变化组织成四个“控制平面”,它们就像大型公司中不同层级的管理部门:
- 对象层(拓扑结构 - The Object Layer): 这是“组织架构图”。它定义了专家是谁、有多大,以及是否共享办公桌。它问的是:“我们是有 8 个大专家,还是 128 个小专家?”
- 决策层(路由 - The Decision Layer): 这是“调度员”。对于每一个单词,它决定:“我要找谁?”它使用“Top-K”规则来挑选最佳专家。
- 控制层(平衡 - The Control Layer): 这是“人力资源经理”。它负责监督,确保没有专家在 24/7 全天候工作而其他人在睡觉。如果“厨师”过载,它可能会通过特殊的数学技巧(如 无辅助损失平衡 Auxiliary-Loss-Free)轻轻引导系统将订单转给“面包师”,而不会干扰 AI 的学习。
- 执行层(专家并行 - The Execution Layer): 这是“物流团队”。它负责研究如何跨越物理芯片移动数据、处理流量,并确保数学运算快速完成。
论文排除了什么,又建议了什么
作者非常明确地指出,并没有所谓的“万能灵药”。他们反对认为存在一种适用于所有 MoE 模型的“完美”结构。他们认为,如果系统无法快速移动数据,仅仅增加更多专家并不是解决办法。他们还指出,尽管 Soft MoE(专家之间是连续融合而非直接挑选)在理论上听起来很美好,但尚未被证明能在我们今天使用的这种大规模现实系统中表现良好。
论文建议,未来的核心在于解耦。我们需要停止将“智能决策”(使用哪个专家)与“物理现实”(该专家位于哪个芯片上)捆绑在一起。他们提出,最好的系统将使用动态预算(根据难度改变工作量)和运行时放置(runtime placement)(在计算机运行期间移动专家位置以避开交通拥堵)。
然而,论文也谨慎地指出,这些并非已“解决”的问题。例如,虽然异构专家(Heterogeneous Experts)(大小不一的专家)听起来很棒,但论文提到它们仍处于“研究前沿”阶段,尚未在万亿参数级别的超大规模模型中得到充分测试。同样,跨层共享(Cross-layer sharing)(即第 1 层的专家帮助第 100 层)是一个很酷的想法,但作者表示我们需要更多证据来观察它是否能在不引起混乱的情况下发挥作用。
总结
简单来说,这篇论文告诉我们,让 AI 变得更聪明的过程不仅仅是构建一个更大的大脑,而是要构建一个更好的交通系统。我们已经从单辆巴士进化到了由出租车、地铁和无人机组成的复杂网络。下一步不仅仅是增加更多的车辆,而是要让红绿灯更聪明、道路更灵活,并让调度员能够在高峰时段处理好交通而不至于崩溃。作者总结道,下一代 AI 不会是一个单一的新模型,而是由这些智能路由技巧、动态预算和物理优化协同工作的整体。这提醒我们,在超智能计算机的世界里,有时最难的部分不是“思考”,而是“抵达”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。