← 最新论文
💬 NLP

Dense vs Sparse Pretraining at Tiny Scale: Active-Parameter vs Total-Parameter Matching

在参数量低于 2500 万的微型预训练设定中,当按活跃参数量匹配时,混合专家模型优于稠密基线模型,但当按总参数量匹配时,则未能超越它们。

原作者: Abdalrahman Wael

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Abdalrahman Wael

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个小机器人讲故事。你只有有限的“脑力”(计算资源)可以投入这个项目。这篇论文提出了一个简单的问题:是给机器人一个强大单一的大脑更好,还是给它一组可以切换使用的小型专业化大脑更好?

这就是稠密模型(一个大脑)与混合专家模型(MoE,许多小专家)之间的区别。

以下是研究人员 Abdalrahman Wael 在单个计算机芯片上使用名为"TinyStories"的微型数据集进行这些实验后发现的内容。

两种“公平”比较的方式

比较这两种“大脑”时,棘手之处在于如何定义“公平”。论文测试了两种不同的公平定义,就像两种不同的比赛评判方式:

1. “活跃”匹配(“你实际使用什么”规则)
想象你有一个由 4 位厨师组成的团队(MoE 模型)。对于他们做的每一道菜,只允许 2 位厨师实际工作,而另外 2 位则休息。

  • 公平性测试:我们将这个团队与一位单干厨师(稠密模型)进行比较,这位厨师的工作强度仅相当于团队中那 2 位活跃厨师的总和。
  • 结果:4 位厨师组成的团队(MoE)轻松获胜。尽管他们在任何时刻只使用了一半的员工,但拥有额外的“后备”人员可供调用,使他们比独自工作的单干厨师学得更好、讲的故事也更好。
  • 类比:这就像你有一个装有 10 种工具的工具箱,但每次只使用其中 2 种。如果你将自己与只拥有 2 种工具的人进行比较,你会做得更好,因为你拥有为特定任务挑选完美工具的选择权,即使你并非每秒都使用全部 10 种工具。

2. “总量”匹配(“你拥有什么”规则)
现在,让我们改变规则。我们将 4 位厨师组成的团队(MoE)与一位单干厨师(稠密模型)进行比较,这位厨师的“大脑”大小相当于所有四位厨师的总和。

  • 公平性测试:我们给予这位单干厨师与整个团队完全相同的“大脑存储”总量。
  • 结果:单干厨师(稠密)获胜,但优势微乎其微。厨师团队依然非常出色,但在训练的最后阶段,那个单一的巨大大脑略胜一筹。
  • 类比:如果你给单干厨师一个巨大的图书馆(总存储量),其规模等于 4 位厨师图书馆的总和,那么这位单干厨师可以阅读并记住所有内容。厨师团队拥有相同的总图书馆,但他们必须将其分割。在这个特定的微型测试中,拥有整个图书馆的一个人略微胜出。

重大发现

这篇论文的主要观点是:你如何定义“公平”会改变获胜者。

  • 如果你关心效率(每秒完成多少工作),MoE(专家团队) 是明确的赢家。当将其与执行相同活跃工作量的模型进行比较时,它学得更快、更好。
  • 如果你关心总存储容量(模型内存中能容纳多少数据),稠密(单一巨人) 模型仍然略胜一筹,尽管差距非常小。

他们如何修复“团队”

研究人员还发现,你不能只是把一群专家扔在一起就指望他们能工作。

  • 问题:起初,专家们很懒惰。他们都试图做同样的工作,或者一位专家包揽了所有任务,而其他专家则无所事事。这被称为“坍塌”。
  • 修复:研究人员添加了一位“经理”(路由系统),强制专家们平均分担工作。
    • Top-1 与 Top-2:让经理只挑选一位专家是不够的。让经理为每项任务挑选前 2 位专家,是让团队高效工作的秘诀。
    • "Z-Loss":这是对经理规则的一个小调整,旨在防止专家们变得过于兴奋或过于无聊。它有助于稳定性,但并非成功的主要原因。

结论

在这个微小的、受控的实验(使用小型数据集和单台计算机)中:

  1. 如果你根据模型每秒实际执行的工作量来评判,MoE 模型非常强大。它们优于具有相同活跃规模的稠密模型。
  2. 如果你根据模型持有的总内存量来评判,稠密模型仍然略强,但随着训练时间的延长,差距正在缩小。
  3. 稳定性至关重要:你需要良好的“管理”(平衡和路由)来让专家们协同工作;否则,系统就会崩溃。

该论文得出结论,条件计算(在专家之间切换)即使在非常小的规模下也是有用的,前提是你将其与正确的基线进行公平比较。它并没有证明 MoE 是所有人工智能的终极未来,但它表明,当规则设置正确时,“专家团队”的方法效果出奇地好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →