← 最新论文
🤖 machine learning

MAPLE: MoE Adaptive Plug-and-play Layer-wise Expert allocation

MAPLE 是一个即插即用的框架,它通过基于敏感度在不同层之间进行分析式和遗传式的异构专家预算重新分配,从而优化预训练混合专家(MoE)模型的效率,在无需修改权重或重新训练的情况下实现更高的准确率和显著的延迟降低。

原作者: Lie Li, Wen Li, Junxiao Shen, Gusheng Hu

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Lie Li, Wen Li, Junxiao Shen, Gusheng Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代人工智能通常依赖于被称为“Transformer”的海量数字大脑,它们通过将信息传递到长长的层链中来处理语言。可以将这些层想象成一系列处理站,模型通过这些处理站学习理解上下文、语法和含义。近年来,工程师们通过使用一种称为“混合专家模型”(Mixture-of-Experts)的设计,使这些模型变得更加高效。这种设计不再让每个处理站都使用相同数量的计算能力,而是针对它读取的每一段文本,仅激活少数几个专门的子网络,即“专家”。这使得系统能够规模宏大且功能强大,而不会消耗无法承受的巨大能量。然而,一直有一条标准规则在支配着这些专家的使用方式:链条中的每一层都被迫激活完全相同数量的专家,无论该层是否真的需要那么多帮助。

布里斯托大学的一个研究小组挑战了这一统一规则,他们提出不同的层对需求的需求是截然不同的。有些层非常敏感,需要许多专家才能正常运行,而有些层则是冗余的,可以在不损失准确性的情况下使用更少的专家进行操作。他们开发了一种名为 MAPLE 的新方法,它是一个“即插即用”的工具。这意味着它可以应用于现有的、预训练好的模型,而无需对其进行重新训练或更改其内部权重。该系统首先通过测试如果减少每一层使用的专家数量,其性能会下降多少来进行工作。然后,它利用这些测量结果来创建一个定制的地图,将计算预算从可以节省的层转移走,并将其导向那些最需要的层。

这种方法的结果令人瞩目。当研究人员在四个不同的语言大模型上测试 MAPLE 时,他们发现,仅仅是重新分配现有资源就比均匀使用所有资源更有效。在一次使用名为 DeepSeek-MoE-16B 模型的特定测试中,这种新方法在仅使用 75% 可用专家的情形下,表现优于原始的全负载模型。在几项推理基准测试中,准确率显著提高了;例如,在科学问答任务中,得分从 65.09 跳升至 71.40,在逻辑推理测试中,得分从 48.49 上升至 51.50。这表明,旧有的统一性假设限制了模型的表现,而更智能、不均匀的精力分配能产生更好的结果。

除了让回答变得更聪明之外,这种方法还使模型的运行速度更快、成本更低。由于激活的专家更少,计算机在回答每个问题时要做的工作也更少。当研究人员在实际的推理系统中实现 MAPLE 时,他们测量出在单张显卡上生成响应的时间减少了 32.2%。与此同时,系统每秒可以处理更多的请求,增加了 47.4%。这些收益是在没有改变模型核心结构或丢弃任何已学知识的情况下实现的;系统只是学会了更高效地使用其现有部分。研究人员证实,这种改进并非特定测试中的偶然现象,而是一个稳健的发现,它在不同类型的推理任务中,甚至在模型进行缩放时都能保持一致。

该研究还探讨了这种方法如何处理复杂的“多步推理”任务,即模型必须生成一段长长的思维链来解决问题。即使在这些高要求的场景下,重新分配资源的模型也能保持其准确性,同时在某些情况下将解决问题所需的总时间缩减了一半以上。研究人员表明,该方法具有灵活性,可以适用于不同的模型,并且它创建的分配方案可以重复用于各种任务,而无需每次都重新计算。通过证明“一刀切”的方法并非最优方案,这项工作为使大型人工智能系统更高效、更强大以及更易于投入实际应用提供了一种实用且有原则的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →