← 最新论文
💻 computer science

Predatory MoE: Serving Mixture-of-Experts with a Sequence-Local Expert Roster

本文提出了一种序列局部专家轮转策略,通过在训练和推理过程中一致地应用该约束,为每个序列固定一小组专家,从而大幅减少 MoE 模型推理过程中的内存占用和专家传输,以显著减少常驻权重量,实现接近全常驻的吞吐量。

原作者: ChaeWoo Son

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: ChaeWoo Son

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代生成文本的人工智能系统通常依赖一种被称为“混合专家”(mixture of experts)的设计。想象一个拥有大量专业知识工作者的庞大图书馆,其中每个工作者都是某个特定、狭窄领域的专家。当系统需要回答问题时,它并不会同时激活所有的工作者。相反,它只会为那一瞬间选择极少数最相关的专家。这种方法使得系统能够变得极其庞大且功能强大,但在生成每个词时消耗的计算资源却相对较少。然而,在标准计算机上运行这些系统存在一个显著的瓶颈。尽管在任何给定时刻只使用了少数专家,但计算机的内存必须准备好容纳整个图书馆的所有专家,因为系统无法预知下一步需要哪些专家。这一要求迫使总内存容量必须与整个图书馆的大小相匹配,而不是仅匹配正在使用的那一小组专家,这使得在内存有限的设备上运行这些强大的模型变得十分困难。

研究人员曾尝试通过将未使用的专家存储在硬盘上,并在需要时才将其加载到内存中来解决这个问题。但这产生了一个新问题:由于系统选择专家的方式是分散且不可预测的,它最终会不断地进行专家抓取,从而降低了速度。由独立研究员 ChaeWoo Son 领导的一个团队提出了一个不同的问题:与其试图让计算机更快地抓取分散的专家,是否可以改变系统,使其在单次对话期间自然地固定在一个较小的、一致的专家组中?他们想看看是否可以将系统训练成“序列局部化”(sequence-local)的,即一旦对话开始,同一支精简的专家团队就会处理整个对话线程,从而允许计算机仅将该团队保留在内存中。

研究人员首先尝试直接教导系统这种行为。他们试图训练模型去偏好在当前对话中已经使用过的专家,希望这种习惯能成为系统智能中持久的一部分。他们发现,虽然这种技巧在训练过程中有效,但这种行为并不能固定下来。一旦移除了训练压力,系统就会恢复到旧有的、分散的行为模式。即使他们尝试通过让系统从自身的偏见选择中学习来强化这种行为,过程也会变得不稳定,且生成的文本质量也会下降。研究得出结论,系统并非在学习一项新技能,而是在对一个临时规则做出反应。研究人员意识到,试图强迫系统内化这种行为是错误的途径。

与其试图改变系统的“大脑”,研究人员决定改变“游戏规则”。他们施加了一个严格且永久的规则,该规则在训练期间和实际使用期间均适用。在这项新规则下,每场对话都会根据前几个词被分配到一个精简且固定的专家团队。一旦选定了这个团队,系统在剩下的对话过程中就不允许切换到其他人。这个规则就像是一个预算限制:计算机只需要在快速内存中保留这个特定的精简团队,而图书馆的其余部分可以留在较慢的存储驱动器中。因为团队在整个对话期间是固定的,所以计算机不需要不断地在专家之间进行切换。

研究结果令人瞩目。当研究人员将此规则应用于一个测试模型,并给予其一段短时间的重新训练以适应新的约束条件后,该系统的表现几乎与没有该规则时一样出色,但内存占用量大幅减少。在测试中,他们能够仅将总专家的四分之一保留在内存中,同时仍能获得与保留全部专家时几乎相同的速度。与旧方法相比,该系统将必须从慢速存储驱动器中抓取数据的次数减少了 32 倍。虽然文本质量确实略有下降——在极端节省内存的情景下下降了约 5%——但这种权衡使得模型可以在更小、更易获取的硬件上运行。

这项研究还揭示了一个关于这些系统如何学习的意外洞察。研究人员发现,如果一个模型在没有这些内存约束的情况下训练时间越长,事后将其强行转变为这种高效模式就越困难。系统这种自然分散注意力的倾向似乎会随着时间推移而增强,使得在事后进行适配以满足内存限制的成本变得更高。这表明,如果我们希望这些模型在日常设备上高效运行,我们可能需要在它们最初学习时就教导它们具备高效性,而不是在它们已经学会了如何分散处理后再去试图修复问题。

这项工作并不声称解决了所有可能的情况,研究人员也谨慎地指出,他们的测试是基于合成数据和较小的模型进行的。他们观察到,如果对话在中途突然改变主题,固定的专家团队可能会显得力不从心,尽管测试显示即使发生主题切换,系统也能通过牺牲少量质量来进行适应。该研究作为一个概念验证,证明了通过将内存约束视为一种规则而非学习目标,我们可以使这些庞大的模型变得更加实用。它将重点从构建更快的硬件转向设计更聪明的规则来管理系统如何使用资源,为让强大的人工智能在目前容量尚不足以承载它们的设备上运行打开了大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →