← 最新论文
💬 NLP

Marco-MoE: Open Multilingual Mixture-of-Expert Language Models with Efficient Upcycling

Marco-MoE 是一个完全开放、高度稀疏的多语言混合专家模型系列,它利用高效的升级转换技术,实现了与更稠密竞争对手相比更优的算力性能比和跨语言可扩展性。

原作者: Fan Jiang, Yu Zhao, Chenyang Lyu, Tianqi Shi, Yichao Du, Feihu Jiang, Longyue Wang, Weihua Luo

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Fan Jiang, Yu Zhao, Chenyang Lyu, Tianqi Shi, Yichao Du, Feihu Jiang, Longyue Wang, Weihua Luo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图建造一座包含 64 种不同语言书籍的庞大图书馆。过去建造这座图书馆的方法是雇佣一位超级聪明、巨型的图书管理员,他必须 memorize(熟记)每一种语言中的所有内容。问题出在哪里?这位图书管理员不堪重负。当他试图学习一门新语言时,开始遗忘旧语言,或者变成了“样样通,样样松”。研究人员将这种现象称为“多语言诅咒”。

Marco-MoE 是一种更聪明的建造这座图书馆的新方法。作者没有雇佣一位巨型图书管理员,而是组建了一支由专家组成的团队,他们协同工作,但针对任何特定任务,只有少数几位专家会上岗。

以下是他们是如何做到的,分解为简单的概念:

1. “专家团队”(混合专家模型,Mixture-of-Experts)

将 Marco-MoE 模型想象成不是一个单一的大脑,而是一个拥有 200 位不同私人教练(专家)的健身房。

  • 旧方法(稠密模型): 每次你提出一个问题,所有 200 位教练都试图同时回答。这既嘈杂、昂贵,又低效。
  • Marco 方法(稀疏 MoE): 当你用西班牙语提问时,系统只会唤醒 8 位 精通西班牙语的特定教练。当你用日语提问时,另一组 8 位不同的教练会被唤醒。
  • 结果: 图书馆非常庞大(拥有海量的总知识),但对于任何单个问题,它只使用其大脑能力的极小部分(约 5%)。这使得它运行起来极其快速且成本低廉,尽管它懂得很多。

2. “改造”(高效升级再利用)

通常,从零开始组建一支 200 人的教练团队需要数年时间并耗资数百万美元。Marco-MoE 使用了一个巧妙的技巧,称为“升级再利用”(Upcycling)。

  • 想象他们取用了一位现有的、训练有素的“通才”图书管理员(一个名为 Qwen3 的稠密模型),他已经在许多方面表现出色。
  • 他们没有解雇他并从头开始,而是改造了办公室。他们将通才的知识切割成更小、更专业的部分。
  • 然后,他们给这些部分进行了一点“震荡”(添加随机噪声),以防它们都以相同的方式思考。这使得他们能够将一个庞大、缓慢的图书管理员转变为一个快速、专业的团队,而无需从零开始重新训练所有内容。

3. “课程”(他们如何学习)

团队并非随意阅读书籍。他们遵循了一个严格的四阶段学习计划:

  1. 第一阶段: 他们从高质量的英语和推理书籍开始,以建立坚实的基础。
  2. 第二阶段: 他们增加了更多的数学和科学问题,以 sharpen( sharpen)他们的逻辑。
  3. 第三阶段: 他们引入了 9 种更难学习的新语言(如乌尔都语和哈萨克语),确保团队不会忽视“长尾”语言。
  4. 第四阶段: 他们 heavily(重点)关注文化。他们不仅学习单词,还学习语境。他们研究当地新闻、文化故事和区域历史,以便模型理解人们为什么这样说,而不仅仅是说什么

4. “实战演练”(训练后)

在学习完书籍后,团队需要学习如何与人类交流。

  • 步骤 1(SFT,有监督微调): 他们练习回答具体问题并遵循指令。
  • 步骤 2(同策略蒸馏): 这就像学生向大师学习。模型生成自己的答案,然后由一位“超级导师”(一个更大的人工智能)进行纠正。模型随后从自己的错误中学习, refine( refine)其风格,使其更具帮助性和准确性。

结果:小巧而强大

该论文声称,这种方法创建了两个主要模型:

  • Marco-Nano: 一个微小的模型,仅激活 6 亿个参数。它远超其体量的表现,性能优于激活参数多 3 到 14 倍的更大模型。
  • Marco-Mini: 一个稍大的模型(激活参数为 8.6 亿),击败了激活参数多 3 到 14 倍的竞争对手。

关键要点:
Marco-MoE 证明,你不需要一个庞大、昂贵的大脑就能很好地讲 64 种语言。通过采用“专家团队”方法和聪明的改造策略,他们创建了比当前巨头更快、更便宜、更擅长处理多元文化的模型,同时完全开放供任何人使用和研究。

他们还发现,该模型自然地学会了将语言分组(例如将西班牙语、法语和意大利语分组),就像人类语言学家会做的那样,这表明它真正理解了语言之间的关系,而不仅仅是死记硬背。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →