← 最新论文
💻 computer science

Where to Begin: Efficient Pretraining via Subnetwork Selection and Distillation

本文提出了一种用于预训练小语言模型(SLMs)的高效框架,该框架结合了用于识别结构化稀疏子网络初始化的进化搜索与来自更大模型的知识蒸馏,在实现与标准基准线相当的性能的同时,显著降低了计算成本。

原作者: Arjun Krishnakumar, Rhea Sanjay Sukthanker, Hannan Javed Mahadik, Gabriela Kadlecová, Vladyslav Moroshan, Timur Carstensen, Frank Hutter, Aaron Klein

发布于 2026-01-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Arjun Krishnakumar, Rhea Sanjay Sukthanker, Hannan Javed Mahadik, Gabriela Kadlecová, Vladyslav Moroshan, Timur Carstensen, Frank Hutter, Aaron Klein

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大问题:建造一座巨大的图书馆成本极高

想象一下,你想建造一座拥有海量知识的巨大图书馆(即大语言模型,LLM),使其能够回答任何问题。传统上,为了建造这座图书馆,你必须雇佣数百万名员工(参数),给他们每人发一本空白笔记本,并让他们从头开始阅读整个互联网。这需要耗费大量的时间、金钱和电力。

虽然“小语言模型”(SLMs)因为规模较小而构建成本较低,但对于大多数普通研究人员或小型公司来说,从零开始构建它们仍然过于昂贵。他们需要一个捷径。

解决方案:“Whittle”框架

该论文的作者提出了一种构建这些小型图书馆的新方法。他们将这个框架称为 Whittle。与其雇佣新员工并从空白笔记本开始,不如从现有的、知识渊博的巨大图书馆(大型“教师”模型)中,尝试寻找一个能够完美胜任工作的更精简的小型团队。

他们通过三个主要技巧来实现这一点:

1. 寻找“黄金子团队”(子网络选择)

想象一下,这座巨大的图书馆是一个拥有数千名音乐家的庞大管弦乐队。你并不需要整个乐队来演奏特定的曲目,你只需要正确的乐器组。

  • 旧方法: 通常,如果你想要一个小模型,你只需随机挑选一些音乐家,然后祈祷他们能演奏好。
  • 新方法: 作者使用了一种智能搜索工具(称为进化搜索)在庞大的管弦乐队中进行搜寻,寻找那些已经完美掌握了那首曲子的特定音乐家组合。他们不只是随机挑选人,而是寻找已经在承担核心任务的特定“子网络”神经元。
  • 结果: 他们发现,这些经过预先筛选的“子团队”比同等规模的随机组合学习能力更强。

2. “聪明模仿者”法(知识蒸馏)

一旦有了这个小型子团队,他们并不会让这群人仅从互联网中学习。相反,他们会将这群人放在一个由原始巨大图书馆(教师模型)组成的教室里。

  • 运作方式: 教师不仅会说“答案是 A”。教师还会说:“答案是 A,但它非常有可能是 A,稍微有点可能是 B,且不太可能是 C。” 这给了小型团队对世界更丰富的理解。
  • 类比: 这就像一位名厨在教徒弟。大师不仅展示最终的菜肴,还会解释细微的味道和技巧。徒弟的学习速度更快,也犯更少的错误。

3. “搜索空间”(尝试不同的组合)

作者意识到,并非所有的“子团队”都是平等的。有时你需要减少层数(比如移除建筑中的楼层),有时你需要减少宽度(比如移除柱子)。

  • 他们测试了四种不同的切割模型的方法:
    • 粗粒度 (Coarse): 切割大块内容(如移除整个楼层)。
    • 细粒度 (Fine-grained): 切割微小的部分(如移除特定的砖块)。
    • 均匀化 (Uniform): 让整个模型均匀地变小。
    • 逐层化 (Layer-wise): 以不同的方式让模型的不同部分变小。
  • 发现: 他们发现,对于非常小的模型,采用“细粒度”(切割微小部分)效果最好。但对于较大的小模型,采用“粗粒度”(切割大块内容)实际上表现更好。

结果:事半功倍

论文声称,通过使用这种方法,他们可以构建出性能与从头开始训练的模型相当的小型模型,但能大幅降低成本:

  • 速度: 在特定的训练规模下,他们最好的模型达到了标准小型模型相同的智能水平,但所需的计算量(FLOPs)减少了 5.16 倍
  • 效率: 这就像建造一座既像豪宅一样坚固,却只用了 20% 的砖块和劳动力建造的房子。
  • 开源: 不同于一些大科技公司使用的秘密方法,作者发布了所有的代码和工具(“Whittle”库),以便任何人都能使用这种方法。

总结

可以将这篇论文看作是一份关于如何回收利用一个巨大且昂贵的 AI 模型,将其转化为一个更小、更便宜且高效的模型的指南。他们不是从头造一辆新车,而是取用一辆豪华轿车,仔细拆除不需要的部分,并调整剩余的引擎,使其在消耗更少燃料的同时依然能完美运行,同时利用原豪华车的知识来教授它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →