← 最新论文
💬 NLP

Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource

本文证明,通过识别一个在不同模型规模下保持一致的最优激活率,混合专家(MoE)语言模型在总参数量、计算量和数据量严格相等的资源约束下,能够超越稠密模型,这一发现已通过训练近 250 个模型和处理 50 万亿个词元的广泛实验得到验证。

原作者: Houyi Li, Ka Man Lo, Shijie Xuyang, Ziqi Wang, Wenzhen Zheng, Haocheng Zhang, Zhao Li, Shuigeng Zhou, Xiangyu Zhang, Daxin Jiang

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Houyi Li, Ka Man Lo, Shijie Xuyang, Ziqi Wang, Wenzhen Zheng, Haocheng Zhang, Zhao Li, Shuigeng Zhou, Xiangyu Zhang, Daxin Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在建造一座庞大的知识图书馆。你有一个严格的预算:你只能购买特定数量的书籍(参数),只能花费特定时间阅读它们(计算量),并且只能获取特定数量的独特故事来阅读(数据)。

很长一段时间以来,建造这座图书馆的标准方法是雇佣一位超级聪明的巨型图书管理员,让他为每一个问题阅读图书馆里的每一本书。这就是论文中所称的稠密模型(Dense Model)。它很可靠,但速度慢且成本高昂,因为那位唯一的图书管理员必须承担所有繁重的工作。

最近,一种名为**混合专家模型(Mixture-of-Experts, MoE)**的新理念变得流行起来。你不再雇佣一位巨型图书管理员,而是雇佣一个由 100 位专业化专家组成的团队。当一个问题提出时,一位“经理”(门控机制)会迅速挑选出少数几位最合适的专家来回答问题,而其余专家则去喝杯咖啡休息。这种方法更快,并且允许你拥有规模大得多的图书馆(更多的总书籍量),而不会降低阅读速度。

核心问题
这篇论文提出了一个非常具体且棘手的问题:如果我们给“一位巨型图书管理员”和“专家团队”完全相同的书籍、时间和独特故事的预算,专家团队真的能获胜吗?

以往的研究经常通过给专家团队更多的书籍或更多时间来作弊。这篇论文旨在观察在规则严格对等的情况下,团队是否仍能获胜。

实验:寻找最佳平衡点
研究人员并没有盲目地砸钱解决问题,而是像大师级建筑师一样行事。他们构建了近 200 种不同版本的图书馆,以寻找完美的设计方案。

  1. 架构:他们确定了安排专家的最佳方式。他们发现,在开头设置一个“通才”层(类似于标准的稠密层),随后接专家层,效果最好。
  2. 激活率(“喝咖啡”比例):这是最重要的发现。在 MoE 团队中,“激活率”是指实际醒来处理问题的专家所占的百分比。
    • 如果唤醒的专家太少(比率过低),团队的脑力就不够。
    • 如果唤醒的专家太多(比率过高),团队会感到困惑并失去其特有的专注力。
    • 黄金法则:研究人员发现了一个“最佳平衡点”,即恰好有**20%**的专家被唤醒。无论图书馆规模是小型(20 亿本书)还是中型(70 亿本书),这 20% 的规则始终能产生最佳结果。

数据问题:复用故事
这里有一个陷阱。由于专家团队非常高效,他们需要阅读更多的故事才能达到与巨型图书管理员同等的学习效果。如果你给他们的独特故事数量与巨型图书管理员相同,他们就会落后。

为了解决这个问题,研究人员尝试了一种称为**数据复用(Data Reuse)**的策略。想象一下,巨型图书管理员将故事阅读一次。而专家团队阅读同一个故事,但他们会阅读两次或三次(复用数据)。

  • 结果:即使专家团队被迫通过重读来阅读与巨型图书管理员相同的独特故事,只要他们坚持 20% 的激活率,他们仍然能够超越巨型图书管理员。

结论
论文得出结论:是的,专家团队可以击败巨型图书管理员,即使他们拥有完全相同的总资源(书籍、时间和独特故事)。

然而,这只有在满足以下条件时才有效:

  1. 完美设计团队布局。
  2. 将专家的“唤醒”率保持在神奇的20%
  3. 允许团队额外重读几次相同的故事,以弥补效率差距。

简而言之,这篇论文证明,凭借正确的设计和一点点“重读”,一个专业化的专家团队比单一的庞大工作者是构建智能系统更强大的方式,即使预算完全相同。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →