← 最新论文
💻 computer science

Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model

该论文介绍了混合训练(Mixture of Training, MoT),这是一种脚手架式的模块化预训练框架,它将 Transformer 划分为可独立训练的层块,并能将其重新组合成一个连贯的模型,证明了这种分解运行可以在实现与单体训练质量相当的同时,通过可重用的脚手架提供潜在的计算优势。

原作者: Mohammed Sabry, Sean Augenstein, Keith Rush, Lucio Dery

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohammed Sabry, Sean Augenstein, Keith Rush, Lucio Dery

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图用乐高积木搭建一座宏大而精巧的城堡。通常情况下,唯一的办法是让一个庞大的建筑团队同时在整个结构上协作。如果一个人掉落了一块积木,整个团队都必须停下;而且如果团队规模变得太大,房间会变得拥挤,项目也会变得极其昂贵且难以修复。这就是科学家们通常构建“大语言模型”(LLM)的方式——那些能写故事、回答问题并与我们聊天的超级智能计算机大脑。它们是作为一个巨大的、不可分割的整体进行训练的。但如果,你可以把城堡建成一个个独立的、较小的房间,让不同的团队独立地完成每个房间的建造,然后在最后将它们全部拼装在一起呢?这正是这篇论文所提出的核心问题:我们能否将智能人工智能的训练分解成更小、更易于管理的碎片,并在稍后重新组装它们,同时又不丢失那份“魔力”?

这项研究背后的研究人员正在开展一项名为“混合训练”(Mixture of Training,简称 MoT)的项目,他们决定测试这个想法。他们不仅仅是在凭空猜测;他们构建了一个拥有 13 亿参数的人工智能模型(一种“Gemma 式”模型),并尝试对其进行“切片式”训练。他们并没有一次性训练整个模型,而是将模型分成了两个大块。为了确保这些块稍后能够完美契合,他们使用了一个聪明的技巧:一个“脚手架”。想象一下,这是一套辅助训练轮或一个刚性的框架,在各个部分被建造时将其固定在原位。他们冻结了这个框架(称为“对齐器”,aligner)使其保持不变,然后在这个框架内分别训练每一块人工智能。通过这种方式,即使每一块是在分别训练的,它们也能学会使用相同的“数据语言”。

结果既有“成功了!”也有“视情况而定”的情况。团队发现,他们确实可以将这些独立训练的块拼接在一起,并得到一个可以运行的人工智能。然而,就在他们将这些块拼在一起的那一刻,人工智能变得有些困惑,犯错也变多了(困惑度得分从标准的 15.0 上升到了 19.3)。但有趣的部分在于,经过一段非常短的“微调”过程(即让他们让整个模型进行一段时间的自我对话),人工智能就变得和传统的“巨型整体块”方法一样出色了。事实上,他们发现了一种训练方法,其消耗的计算能力与标准方法相同,且能达到完全相同的质量。

但这里有一个限制。论文指出,这种方法并不是一个能让所有人立即省钱的“魔杖”。“脚手架”本身在最初建造时需要消耗大量的能量。如果你只建造一个人工智能,脚手架会让整个过程比传统方法更昂贵。然而,如果你重复使用同一个脚手架来建造许多个不同的人工智能(比如使用同一套辅助训练轮来建造三座或更多城堡),那么每座城堡的成本就会下降,这种方法也就成为了赢家。研究人员还发现,如果你试图将人工智能拆分成过多的微小碎片,它们就会变得难以拼凑,质量也会下降。因此,虽然这目前还不能完全取代那种“巨型一体化”的训练方法,但它证明了将人工智能训练分解为更小、可重用且可并行的任务是可行的。它为人工智能的实验开辟了一种新途径,使得修复错误、重启部分工作以及在未来训练更智能的模型变得更加容易,而不再需要一个规模如城市般巨大的超级计算机。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →