← 最新论文
🤖 machine learning

Data-Constrained Language Model Pretraining: Improved Regularization and Scaling Laws

本文通过引入掩码输入正则化(Masked-Input Regularization, MIR)以提升验证集和下游任务性能,并提出 SoftQ——一种能够准确捕捉在多次训练轮次下模型规模与数据规模之间相互作用的新型缩放法则(在经典法则失效的情况下),从而解决了语言模型预训练中的数据受限问题。

原作者: Zhiwei Xu, Shihao Wu, Hanseul Cho, Wei Hu, Yixin Wang

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiwei Xu, Shihao Wu, Hanseul Cho, Wei Hu, Yixin Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一名学生(AI 模型)如何写故事。过去,规则是:“给学生一个庞大的独特书籍图书馆,并让他们每本书都只读一次。”这之所以奏效,是因为图书馆非常巨大,且学生有充足的时间将每本书读完一遍。

但现在,情况发生了变化。我们制造出了能够每秒阅读数百万本书的超级快速计算机(算力),但新的、独特的书籍(自然语言数据)却快要用完了。我们正处于一个“数据受限、算力丰富”的世界。现在,学生必须一遍又一遍地阅读这个规模较小的图书馆,通过多次重复来充实大脑。

问题在于:如果你只是让学生一遍又一遍地阅读相同的书籍,他们会开始背诵这些书,而不是学习如何写作。他们会变成一只鹦鹉,重复看到的精确短语,而不是理解语言的规则。这被称为“过拟合并拟合”(Overfitting)。

这篇论文主要解决两个问题:

  1. 我们如何阻止学生仅仅是死记硬背?(正则化)
  2. 如何最好地平衡学生大脑的大小与图书馆的大小?(缩放法则)

以下是利用简单的类比对他们研究结果的拆解。


1. “模糊眼镜”技巧(掩码输入正则化)

问题:
当一个学生第 10 次阅读同一本书时,他们可能会开始背诵第 5 页上的精确字体或一个奇怪的错别字,而不是学习故事本身。他们需要一种方法来迫使自己关注含义,而不是精确的文本

解决方案 (MIR):
作者尝试了一种称为掩码输入正则化 (Masked-Input Regularization, MIR) 的技术。想象一下在学生阅读时给他们一副“模糊眼镜”或一个“干扰器”。

  • 每当他们阅读一个句子时,计算机都会随机隐藏(掩码)一些单词,将它们变成 [MASK]
  • 学生必须根据上下文猜出缺失的单词,就像玩“填空游戏”一样。
  • 他们在进行正常阅读的同时进行这种练习。

结果:
这就像练习一项运动。如果你只在完美、平坦的场地上练习,一旦刮起风来,你可能会失败。但如果你在练习时加上一个“风力机”(随机掩码)对着你吹,你就会学会适应。

  • 论文发现,即使学生已经受到了严格的训练(使用“强权重衰减”,这就像一位严厉的教练告诉他们不要死记硬背),加入这种“模糊眼镜”技巧也能让他们变得更好。
  • 它帮助模型更好地处理棘手的情况,比如奇怪的名字、混合语言或破碎的文本,比那些只是反复阅读干净文本的模型表现得好得多。
  • 回报: 他们计算出,使用这个技巧在数学上等同于给学生提供了 1.3 倍的独特书籍 来阅读。这是从我们有限的图书馆中获取更多价值的一种方法。

2. “耦合”增长规则 (SoftQ 缩放法则)

旧规则 (Chinchilla):
此前,专家们有一个公式(Chinchilla 法则)来决定基于多少书籍来确定学生大脑的大小。

  • 旧观点: “如果你将书籍数量翻倍,你应该将大脑容量也翻倍。”它将大脑大小和书籍数量视为两个相加的独立事物。
  • 缺陷: 这个公式假设你总能获得的书籍。但在我们这个“书籍即将耗尽”的世界里,这个公式失效了。它预测,无论学生拥有微小的大脑还是巨大的大脑,由于书籍减少而带来的惩罚都是一样的。

新规则 (SoftQ):
作者意识到,在书籍有限的世界里,大脑的大小和书籍的数量是紧密相连的。

  • 类比: 想象一个水桶(大脑)和一根水管(数据)。
    • 如果水桶很小,无论水管多大都无所谓;水桶很快就会装满,多余的水只会溢出来(浪费数据)。
    • 如果水桶很大但水管很细,水桶大部分时间都会是空的(浪费大脑能力)。
    • 由于水管变细而导致的“惩罚”,随着水桶变大,情况会变得糟糕得多。一个巨大的水桶配上一根细小的水管简直是一场灾难。

结果:
他们提出了一个名为 SoftQ 的新公式。

  • 与旧公式不同,SoftQ 理解随着模型变大,对独特数据的需求增长得更快。它将两者“耦合”在一起。
  • 在测试中,SoftQ 预测模型性能的准确度远高于旧的 Chinchilla 公式,尤其是在数据有限且模型多次阅读相同数据的情况下。

“核心要点”总结

  1. 不要只是重复,要进行干扰: 当你被迫在有限的数据集上进行训练时,随机隐藏文本的一部分(MIR)会迫使 AI 学习通用规则,而不是死记硬背特定的句子。这就像通过遮住答案来做练习题,而不是仅仅阅读教科书。
  2. 数据稀缺时,规模至关重要: 旧的 AI 构建规则说“模型越大 = 越好,无论数据多少”。新的规则 (SoftQ) 则说“如果你让模型变得更大,你需要不成比例地多的独特数据,否则模型将会失败。”
  3. 效率: 通过使用“干扰”技巧 (MIR) 和新的“耦合”公式 (SoftQ),即使在新的训练文本即将耗尽的情况下,我们也能构建出更好的 AI 模型。

论文并未提及的内容:
该论文并未声称这能立即解决医疗诊断、创造完美的客服聊天机器人或解决气候变化问题。它严格专注于如何更有效地训练这些模型的数学逻辑。其结果是基于参数量高达 14 亿(1.4B)的模型进行的实验(与当今大科技公司使用的海量模型相比规模较小),但其原理旨在应用于更大规模的场景。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →