← 最新论文
🤖 machine learning

Beyond Sunk Costs: Boosting LLM Pre-training Efficiency via Orthogonal Growth of Mixture-of-Experts

本文提出了一种“正交增长”策略,通过扩展现有已收敛的混合专家模型检查点的深度和宽度来复用它们,证明该方法利用先前的“沉没成本”实现了更高的准确率,在相同的计算预算下显著优于从头训练。

原作者: Ruizhe Wang, Yucheng Ding, Xiao Liu, Yaoxiang Wang, Peng Cheng, Baining Guo, Zhengjun Zha, Yeyun Gong

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruizhe Wang, Yucheng Ding, Xiao Liu, Yaoxiang Wang, Peng Cheng, Baining Guo, Zhengjun Zha, Yeyun Gong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《超越沉没成本:通过混合专家的正交增长提升大语言模型预训练效率》的通俗解读,辅以生动的类比。

核心难题:“沉没成本”陷阱

想象一下,你花费数年时间、数百万美元建立了一座庞大且技艺精湛的图书馆(即预训练好的 AI 模型)。你利用海量数据对其进行了训练,它非常擅长处理各类任务。但随后你意识到,为了应对更复杂的问题,你需要一座更大的图书馆。

旧的做法是:拆掉现有的图书馆,从零开始建造一座更大的新馆。这种做法极其昂贵且浪费,因为你抛弃了所有已完成的工作。用商业术语来说,这就是“沉没成本”——那些已经投入且无法收回的资金和精力。

这篇论文提出了一个疑问:我们能否回收利用这座旧图书馆,而不是将其丢弃? 我们能否在现有训练良好的模型基础上进行“生长”,使其变得更大、更好,而无需从头开始?

解决方案:“正交增长”

作者提出了一种名为正交增长的方法。这里的“正交”意指“成直角”或“相互独立”。他们发现了两种截然不同的扩展模型的方法,且这两种方法互不干扰。它们的执行顺序可以任意调整,就像先穿袜子再穿鞋,或者先穿鞋再穿袜子,最终结果都是一样的。

1. 深度增长:增加楼层(“插入”技巧)

想象你的模型是一座拥有 20 层的摩天大楼。要让它变高,你可以直接在第一座建筑上面再叠放一座 20 层的新楼。

  • 旧方法(堆叠): 如果你只是简单地将新楼叠在旧楼之上,电梯(数据流)就必须从旧楼的顶层直接跳跃到新楼的底层。这会造成剧烈的断层,大楼的“氛围”会突然改变。
  • 新方法(插入): 作者建议插入现有楼层的副本,置于原始楼层之间
    • 类比: 想象一个音阶。如果你拥有 C、D、E、F、G...等音符,想要让歌曲变长,你并不是在结尾重复整首歌,而是在第一个 C 之后插入第二个 C,在第一个 D 之后插入第二个 D,依此类推。这样能保持旋律的平滑与连贯。
    • 为何有效: 论文发现,训练良好的模型在其层级运作中具有特定的“节奏”。插入副本能保留这种节奏,而堆叠则会破坏它。这种方法在模型已经充分训练(收敛)时效果最佳。

2. 宽度增长:增加专家(“专家”技巧)

现在,想象模型是一家医院。在每个房间(层)里,都有几位医生(专家),他们各自擅长不同的领域。模型拥有一个“路由器”,负责决定为特定病人呼叫哪位医生。

  • 旧方法: 如果你只是完全复制医生,房间里就会出现两位完全相同的医生。他们会做完全一样的事情,这既冗余又令人困惑。
  • 新方法: 作者建议复制医生,但给新复制的医生添加一点点“静电”或“噪声”。
    • 类比: 想象你有一位主厨。你雇佣了一位该主厨的克隆体,但给克隆体配备了一个略有不同的香料架,或者在他们的围裙上留下一个微小的划痕。这种微小的差异迫使克隆体发展出自己独特的风格,专注于略有不同的菜肴,而不是完美地复制主厨。
    • 为何有效: 这微小的噪声有助于新专家学习承担不同的工作(实现专业化),同时不会破坏原有专家已掌握的知识。

成果:更高的投入产出比

研究人员在参数规模从 30 亿到 700 亿的模型上测试了该方法。他们的发现如下:

  1. 回收利用有效: 你可以将一个较小的、已充分训练的模型“生长”成巨大的模型。
  2. 优于从头开始: 当他们比较“生长”模型与利用相同额外计算资源从头训练一个新的大模型时,“生长”出来的模型准确率提高了 10.6%
  3. 投入越多,效果越好: 在“生长”之前,你在原始小模型上投入的“沉没成本”(训练时间和数据)越多,最终的大模型表现就越好。这就像投资于坚实的基础;你在此基础上建得越高,大楼就越稳固。
  4. 顺序无关紧要: 你可以先加楼层再加专家,或者先加专家再加楼层。最终结果是一样的。

核心结论

这篇论文为“可持续”的 AI 发展提供了一份蓝图。与其不断烧钱从头构建新模型,我们不如利用现有的模型,通过这两种技巧(插入层和添加带噪声的专家)进行精心扩展,从而以更低的成本获得更智能、更庞大的模型。它将“沉没成本”的浪费转化为了一项宝贵的资产。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →