← 最新论文
💬 NLP

Weight Decay Improves Language Model Plasticity

本文表明,在大型语言模型的预训练过程中增加权重衰减可以增强其下游的可塑性和微调性能,即使这会导致更高的预训练验证损失,因为它促进了线性可分的表示并正则化了注意力机制。

原作者: Tessa Han, Sebastian Bordt, Hanlin Zhang, Sham Kakade

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Tessa Han, Sebastian Bordt, Hanlin Zhang, Sham Kakade

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一名才华横溢的学生,旨在将他培养成一名世界级的专家。你有两个主要阶段:

  1. 预训练(Pretraining): 学生阅读大量的书籍,以建立通用的知识基础。
  2. 微调(Fine-tuning): 学生接受一项特定的工作,比如成为一名医生或律师,并学习该角色的特定规则。

多年来,研究人员一直认为,为第二阶段做最好准备的方法,是在第一阶段(阅读图书馆书籍)期间让学生在测试中获得最高分。其逻辑很简单:“如果他们是阅读能力最强的,那么他们就会成为最好的医生。”

这篇论文认为这种逻辑是有缺陷的。

作者发现,“最聪明的读者”(即预训练测试得分最低的那位)并不总是那个在学习新工作时表现最好的学生。事实上,有时那些在初始阅读测试中得分略低的同学,在开始新工作时反而最具适应性和最成功。

核心要素:“权重衰减”(Weight Decay)

论文关注于训练过程中一个特定的调节旋钮,叫做**“权重衰减”**。你可以把这个旋钮想象成一个“遗忘机制”或“思维灵活性调节器”。

  • 低权重衰减(僵化的学生): 如果你把这个旋钮调低(使用 0.1 的标准设置),学生会完美地记住图书馆里的书。他们在阅读测试中会获得高分。然而,他们会变得非常僵化且固执己见,以至于当你试图教他们一项新工作时,他们很难改变自己的思维方式。他们对“图书馆”产生了“过拟合”(overfit)。
  • 高权重衰减(灵活的学生): 如果你把这个旋钮调高(调至 0.5、1.0 或更高值),学生并不会完美地记住图书馆里的书。他们的阅读测试得分可能会略有下降。但是,这会迫使他们的脑力以一种更灵活、更有结构化的方式来组织信息。他们不仅仅是死记硬背事实,而是学会了“如何思考”。

重大发现

研究人员在不同的 AI 模型(如 Llama-2 和 OLMo-2)以及不同的规模和训练长度上进行了测试。他们发现了以下结果:

  1. 反直觉的权衡: 使用更高权重衰减训练的模型,其初始预训练测试得分通常会稍低。然而,当这些模型随后针对特定任务(如数学推理、医学问题或安全性)进行微调时,它们的表现优于那些初始得分最高的模型。
  2. 黄金平衡点: 初始训练的“最佳”设置并不是标准的 0.1。它通常要高得多(约为 0.5 到 1.0)。这种较高的设置创造了一个更具“可塑性”(plastic)的模型——这意味着它可以更容易地弯曲和重塑自身,以学习新任务。

为什么会这样?(底层机制)

论文深入探讨了底层原理,以解释调高“遗忘”旋钮为何会有所帮助。他们发现了三个主要原因:

  • 整洁的文件柜(线性可分性/Linear Separability): 高权重衰减迫使 AI 将其知识组织成整洁、清晰的类别。想象一下,一个杂乱无章、物品堆叠在一起的房间(低权重衰减)对比一个每个物品都有特定标签箱子的房间(高权重衰减)。当 AI 需要学习一项新任务时,如果信息已经整齐有序,找到并使用正确的“盒子”就会容易得多。
  • 更简单的思维模式(低秩注意力/Low-Rank Attention): AI 使用“注意力机制”来决定句子中哪些词是重要的。高权重衰减迫使 AI 使用更简单、更高效的模式来分配注意力。它不再试图去死记硬背每一个微小的、带有噪声的细节,而是专注于宏大的、重要的模式。这使得它更容易将这些模式应用于新情境。
  • 放下过去(减少过拟合/Reduced Overfitting): 高权重衰减使 AI 在某种程度上“忘记”了训练数据中特定的、琐碎的细节。这实际上是一件好事!它防止了 AI 被困在过去。通过不紧紧抓着预训练期间看到的特定例子不放,它能够对学习新的、不同的例子保持开放态度。

总结

论文得出结论,我们一直在错误的方向上优化 AI 训练。我们一直痴迷于在“预训练考试”中获得完美分数。

相反,我们应该优化的是**“可塑性”**——即模型稍后进行适应和学习的能力。有时,为了获得最终的最佳结果,你必须接受初始测试成绩略微下降的事实。这就像一名体操运动员在练习时脚踝上绑着稍重的负重;他们在练习时可能跑得慢一些,但当脱掉负重参加正式比赛时,他们会更加敏捷,表现得更好。

简而言之: 不要仅仅训练你的 AI 去成为它已知领域的佼佼者。要训练它具备学习任何新事物的灵活性。而要做到这一点,你可能需要将“权重衰减”旋钮调得比以往认为的安全值更高。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →