← 最新论文
💬 NLP

EMO: Pretraining Mixture of Experts for Emergent Modularity

EMO 引入了一种新颖的混合专家架构,该架构在预训练阶段利用文档边界,以实现涌现的、语义专业化的专家模块化,从而允许选择性部署专家,且与标准单体模型或传统混合专家模型相比性能下降极小。

原作者: Ryan Wang, Akshita Bhagia, Sewon Min

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Ryan Wang, Akshita Bhagia, Sewon Min

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《EMO:预训练混合专家以实现涌现模块化》的通俗解释,辅以生动的类比。

问题:那个“全有或全无”的巨人

想象你拥有一座无所不知的巨型图书馆(即大型语言模型),里面收藏了人类写过的每一本书,从前沿的量子物理到烹饪食谱,再到编程手册。

目前,如果你只想问一个关于如何烤蛋糕的简单问题,你就必须打开整座大楼,点亮所有的灯,并雇佣每一位图书管理员待命,尽管你其实只需要那位懂烘焙的图书管理员。这既极其昂贵,又非常缓慢。

有些人试图用**混合专家(MoE)**模型来解决这个问题。这就像一座拥有数百位专业图书管理员的图书馆。当你提问时,系统只会挑选几位管理员来协助你。

  • 其中的陷阱: 在标准的 MoE 模型中,系统是混乱的。如果你问了一个关于烘焙的问题,系统可能会意外地唤醒那位懂语法的管理员、那位懂历史的管理员,以及那位懂编程的管理员。因为“错误”的管理员仍然处于活跃状态,你无法直接解雇那位编程管理员来省钱;如果你试图只使用烘焙专家,系统就会崩溃。你仍然必须为整个团队支付薪水。

解决方案:EMO(有序的图书馆)

作者引入了EMO,这是一种训练这些模型的新方法,使其能够自然地组织成整齐、独立的团队。

秘密武器:“文档”规则
核心思想很简单:同一文档中的所有内容通常属于同一个主题。

  • 如果你正在阅读一篇关于编程的文档,那么该文档中的每一句话都是关于编程的。
  • 如果你正在阅读一篇关于医学的文档,那么每一句话都是关于医学的。

EMO 在训练过程中利用这一事实作为规则。它告诉系统:“对于这份特定的文档,挑选一小群专家(一个‘池’),并强制该文档中的每一个词都只使用该群体中的专家。”

这就像告诉一群学生:“对于这篇特定的文章,你们必须只使用科学区的资源。不要去历史区。”

由于模型遵循这一规则处理了数百万份文档,它学会了自然地将其专家分组。“编程”专家学会彼此靠拢,“数学”专家彼此靠拢,“医学”专家也彼此靠拢。它们不再与不相关的主题混合。

结果:在不破坏系统的情况下削减团队

作者构建了一个巨大的模型(总共有 140 亿个参数,但每次仅激活 10 亿个),并进行了测试。

  1. 全员表现: 当他们使用所有专家团队时,EMO 的表现与标准模型一样好。它既聪明又准确。
  2. “削减”测试: 这是 EMO 大放异彩的地方。他们尝试仅使用25% 的专家(例如,仅使用数学专家)来运行模型。
    • 标准模型: 如果你尝试只使用标准模型的 25%,它会崩溃。性能会下降 10–15%,因为剩余的专家是一个随机且混乱的混合体。
    • EMO: 如果你只使用 EMO 的 25%,性能仅下降1%。模型依然保持聪明,因为那 25% 是一个组织完善、高度专业的团队。

类比:

  • 标准 MoE: 就像工具箱里杂乱无章的工具。如果你拿走一半的工具,你可能会失去锤子和螺丝刀,只剩下扳手和锯子。你就无法建造房子了。
  • EMO: 就像工具被分类放入贴有标签的抽屉中的工具箱。如果你只需要修理漏水,你只需打开“管道”抽屉。你拥有完成该工作所需的所有工具,而且不需要随身携带“园艺”或“电气”抽屉。

专家们实际上学到了什么

研究人员深入模型内部,观察专家们在做什么。

  • 旧模型: 专家们在学习低级的技巧,比如“我处理单词'the'"或“我处理逗号”。这就像一位只知道按书脊颜色分类图书的图书管理员。
  • EMO: 专家们学习了高级主题。一组成为了“数学团队”,另一组成为了“编程团队”,还有一组成为了“医学团队”。这就像拥有一位真正精通学科内容的图书管理员。

为什么这很重要

这篇论文表明,我们可以构建巨大且强大的模块化AI 模型。与其无论走到哪里都背着一个巨大沉重的背包(完整模型),不如根据你当前正在执行的具体任务,携带一个小型的专用工具包。

  • 内存效率: 如果你只需要做数学运算,就不需要将整个模型加载到内存中。
  • 灵活性: 你可以混合搭配这些专家群体。
  • 无需人工标签: 模型完全靠自己发现了这一点。研究人员不需要告诉它“你是数学专家”。模型仅仅通过遵循“文档规则”,就自行发现了数学专家。

简而言之,EMO 将一个庞大、昂贵且单一的巨人,变成了一套乐高积木。你可以根据需要将其拼接在一起或拆解,而不会失去建造城堡的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →