← 最新论文
💬 NLP

MoE-Prism: Disentangling Monolithic Experts for Elastic MoE Services via Model-System Co-Designs

MoE-Prism 是一个模型-系统协同设计的框架,通过将单体专家分解为细粒度的子专家并实现 kk-感知运行时,使混合专家(MoE)服务能够实现请求级的计算弹性,从而显著提高异构工作负载的吞吐量并降低延迟。

原作者: Xinfeng Xia, Xiaofeng Hou, Jiacheng Liu, Wenfeng Wang, Mingxuan Zhang, Peng Tang, Chao Li, Minyi Guo

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinfeng Xia, Xiaofeng Hou, Jiacheng Liu, Wenfeng Wang, Mingxuan Zhang, Peng Tang, Chao Li, Minyi Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在经营着一座规模宏大、超级智能的图书馆,书不是由人类编写的,而是由一个名为“大语言模型”(LLM)的巨型数字大脑创作的。这些大脑每天都在变得更大、更聪明,但它们也对电力和计算能力有着惊人的渴求。为了让它们运行得更快、更便宜,科学家们发明了一个聪明的技巧,叫做“混合专家”(Mixture-of-Experts,简称 MoE)。不要把 MoE 模型看作一个单一的巨型大脑,而要把它看作一个由许多小型专家组成的团队在协同工作。当你提出一个问题时,系统并不会唤醒整个团队,而只是召集几个最擅长该主题的特定专家。这就像是请一位图书管理员只去“科幻小说”区取书,而不是把整座图书馆都搬到你的桌前。

然而,这里有一个问题。目前的这些系统有点僵化。无论你问的是像“今天天气怎么样?”这样简单的问题,还是像“分析这份 50 页的法律合同”这样复杂的问题,系统通常都会唤醒相同数量的专家。这就像是雇佣了一整个建筑施工队来挂一个相框,或者派一个实习生去建造摩天大楼。这在处理简单任务时浪费了能量,而在处理困难任务时又提供的力量不足。一个大问题是研究人员正在探讨的:我们能否让这些 AI 团队变得更加灵活,让我们能够根据任务的难易程度来调高或调低专家的数量,同时保持系统快速且高效?

这正是 MOE-PRISM 背后的研究人员致力于解决的问题。他们意识到,虽然“调高或调低”专家数量的想法听起来很棒,但现有的技术实现起来过于笨拙。他们发现现有的系统将每个专家都视为一个巨大的、不可分割的“砖块”——你不能使用半块砖。如果你需要稍微减少一点动力,你必须移除一整个专家,而这种巨大的跨度往往会破坏答案的质量。此外,当系统尝试同时处理许多请求时(比如在一个繁忙的图书馆里),它倾向于将所有请求组合在一起,并为所有人使用“最大”设置,从而在处理简单的任务时浪费能量,仅仅是为了保持批处理大小(batch size)不变。

为了解决这个问题,团队构建了一个名为 MOE-PRISM 的新框架。他们从两个角度入手:一个是“模型”(大脑本身),另一个是“系统”(图书馆管理员)。

首先,在模型端,他们发明了一种将那些巨大的“专家砖块”分解成更小、更精细的碎片的方法。想象一下,把一块巨大的、沉重的奶酪切成许多小方块。他们通过观察 AI 内部的神经元(专家内部微小的处理单元)在工作时是如何“点亮”的来实现这一点。他们注意到,对于任何给定的任务,只有神经元的特定子集才是真正重要的。因此,他们将专家切分为更小的“子专家”,将这些重要的神经元组合在一起。这使得系统可以选择,例如 12.5 个子专家,而不是被迫在 12 个或 13 个完整专家之间做出选择。这为他们提供了一个更平滑的“旋钮”来控制计算能力的消耗,而无需从头开始重新训练整个 AI。

其次,在系统端,他们创建了一个更聪明的“图书馆经理”。这个新经理不再是将所有请求扔进一个大堆中并为所有人使用最高设置,而是将需要相似动力程度的请求进行分组。如果来了许多简单的问题,它们会被一起处理并使用低功率设置。如果来了许多困难的问题,它们将拥有自己的高功率组。这防止了系统为了保持批处理完整而通过过度服务简单任务来浪费能量。他们还构建了一个特殊的“交通控制器”来高效处理计算机图形(CUDA 图),确保即使在处理所有这些不同设置时,系统也不会因为内存问题而陷入停滞。

当他们在三个不同的流行 AI 模型上测试 MOE-PRISM 时,结果令人振奋。他们发现,通过使用这些更细粒度的专家和更聪明的调度,他们可以将可用的“功率设置”增加 4 倍。在测试中,这使离线任务的处理吞吐量(throughput)提升了 33.9%。对于速度至关重要的在线任务,它降低了在处理混合工作负载时获取第一个词的时间(Time-to-First-Token)。

论文指出,这种方法不仅能节省电费,还能让 AI 变得更具适应性。它证明了你可以拥有一个单一的、具有“弹性”的 AI 模型,它能为困难任务拉伸计算能力,也能为简单任务收缩计算能力,且不会造成破产或降低速度。虽然目前的测试是在特定的两块显卡配置下进行的,但结果表明,这种对 AI 内部结构的“重构”以及对工作调度方式的“重新思考”,可能是迈向更高效、更灵活的现实世界 AI 的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →