← 最新论文
💬 NLP

A Study on Hidden Layer Distillation for Large Language Model Pre-Training

本研究将隐藏层蒸馏与基于 logits 的方法在大型语言模型预训练方面进行了基准测试,发现尽管隐藏层蒸馏能持续降低困惑度,但在下游任务上并未稳定超越标准知识蒸馏,这表明需要进一步突破才能充分利用中间表示信号。

原作者: Maxime Guigon, Lucas Dixon, Michaël E. Sander

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Maxime Guigon, Lucas Dixon, Michaël E. Sander

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一位才华横溢、世界级的厨师(教师)如何为一名年轻而充满热情的学徒(学生)烹制一顿完美的餐食。

在人工智能领域,特别是大语言模型(LLMs)中,这种“烹饪”实际上就是预训练的过程——基于海量的文本库,教导模型预测句子中的下一个词。

旧方法:“只看最终的盘子”

传统上,在训练这位学徒时,研究人员使用一种称为Logit 蒸馏的方法。

  • 类比:厨师烹饪出一道菜,而学徒只被允许在菜肴上桌前查看最终的盘子。学徒仅凭最终结果,试图猜测:“厨师用了什么食材?”或“这是什么风味特征?”
  • 问题:学徒错过了所有微妙且中间的过程。他们看不到厨师如何切洋葱,也看不到何时添加香料。他们只能看到结果。

新想法:“窥探厨师的双手”

这篇论文探讨了一种不同的方法,称为隐藏层蒸馏(HLD)

  • 类比:与其只看最终的盘子,不如让学徒站在厨师身旁,观察他们工作时的双手。他们能看到中间步骤:搅拌、炒制、层层叠加风味。其理念是,如果学徒模仿厨师的内部过程(即“隐藏层”),他们可能会学得更快,烹饪得更好。

研究人员做了什么

来自 Google DeepMind 的团队设立了一个大规模的厨房实验:

  1. 教师:一个非常庞大且强大的 AI 模型(Gemma 3.4B)。
  2. 学生:两个较小的 AI 模型(分别拥有 1.23 亿和 7.35 亿参数)。
  3. 食材:海量的文本数据集(1680 亿个词)。
  4. 规则:他们确保“旧方法”(Logit)和“新方法”(隐藏层)使用了完全相同的计算量。这至关重要,因为有时某种方法看起来更好,仅仅是因为它“练习”得更久或更刻苦。

他们测试了“新方法”的两种变体:

  • 方法 A(顺序式):首先,学徒观察厨师的双手以学习基础。然后,他们切换到只看最终的盘子以精进技能。
  • 方法 B(联合式):学徒试图在同一时刻既观察双手又查看盘子。

结果:一个出人意料的转折

研究人员原本期望“隐藏层”方法能成为游戏规则的改变者,但结果却更为微妙:

  1. 没有灵丹妙药:就最终的“味觉测试”(如下游任务,如回答问题或完成句子)而言,“隐藏层”方法并未 consistently 胜过传统的“最终盘子”方法。有时它略好,有时略差,但平均而言,两者难分伯仲。
  2. “困惑度”的胜利:有一个小小的胜利。“隐藏层”方法确实使模型在预测下一个词(称为“困惑度”的指标)方面略胜一筹。这就像学徒在猜测食谱中的下一个食材时变得稍好了一些,尽管评委们觉得最终菜肴的味道并没有太大不同。
  3. 复杂性的代价:“隐藏层”方法的设置要复杂得多。它需要额外的工具(称为“回归器”)来将教师复杂的内部思想转化为学生可以理解的内容。论文指出,这种额外的复杂性可能并不值得那微小的性能提升。

结论

该论文总结道,虽然从理论上讲,从教师的“隐藏思想”(中间层)中提取有用信息是可能的,但我们尚未找到解锁它的关键钥匙

目前,这种简单、老派的仅复制最终输出(Logit 蒸馏)的方法,在训练这些庞大的 AI 模型时,同样有效,甚至更加可靠。“隐藏层”方法显示出微弱的信号,表明某些好事正在发生,但它需要在设计上取得重大突破,才能成为一种实用且能改变游戏规则的工具。

简而言之:观察厨师的双手是个好主意,但目前,仅观察最终的盘子仍然是训练新 AI 厨师最高效的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →