← 最新论文
🤖 machine learning

Data Augmentations for Data-Constrained Language Model Pretraining

本文提出,将词元级噪声、序列置换和目标偏移预测相结合作为数据增强技术,能有效缓解自回归语言模型预训练中的过拟合问题,从而使在固定且受限的数据集上进行多轮训练变得富有成效。

原作者: Michael K. Chen, Xikun Zhang, Zhen Wang

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael K. Chen, Xikun Zhang, Zhen Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一位才华横溢但非常饥渴的学生(即 AI 模型)如何写故事。在过去,教导这位学生最好的方法是给他们一个巨大的图书库去阅读。他们读的书越多,就会变得越聪明。

但现在,我们撞上了一堵墙。互联网上的高质量书籍已经枯竭了。与此同时,我们的计算机(老师)正变得异常强大且快速。我们正处于一种拥有过剩计算能力但缺乏新数据的境地。

问题所在:“过度阅读”的学生

因为没有新的书了,我们不得不让这个学生一遍又一遍地阅读同样的 7500 万个单词。

在旧的训练方式(称为“自回归”或 AR)中,如果你让学生反复阅读同一段文本,他们会停止学习其中的“故事”,转而开始死记硬背每一个精确的单词

  • 类比: 想象一下把同一页书读 100 遍。最终,你不仅知道故事的内容,你甚至连每个逗号都在什么位置都了如指掌。如果你被测试一张你从未见过的全新页面,你会失败,因为你只记住了旧的那一个。
  • 结果: AI 在处理训练数据时表现得非常好,但随着训练时间的延长,它在处理新的、未见过的数据时的表现会变得越来越差。这就是“过拟索”(Overfitting)。

解决方案:数据增强(“扭转”法)

这篇论文的作者提出了一个问题:我们如何让学生在读完同一本书 100 次后,依然不会只是死记硬背?

他们的答案是数据增强。与其每次都给学生完全相同的文本,不如在学生阅读之前,对其进行轻微的“扭转”或“打乱”。这迫使学生去理解含义和语境,而不是仅仅记忆单词序列。

他们尝试了三种主要的文本扭转方式:

1. “蒙眼”与“错词”游戏(Token 级噪声)

  • 遮盖(蒙眼): 他们用一个黑盒子(一个 `` 标记)遮住一些单词。学生必须根据句子的其余部分来猜出缺失的单词。
  • 随机替换(错词): 与其使用黑盒子,不如将一个单词替换为另一个虽然符合语法逻辑但在事实上错误的单词。
    • 例子: 将“猫坐在垫子上”改为“猫坐在帽子上”。
    • 发现: 出人意料的是,“错词”游戏比“蒙眼”游戏效果更好。为什么?因为如果看到一个空格,猜出缺失的单词很容易;但当句子看起来仍然“正确”时,要发现“帽子”这个词是错误的,则需要更艰苦的脑力锻炼。这迫使学生更加专注地观察。

2. “倒带”与“填空”游戏(序列排列)

  • 从右向左(倒带): 他们让学生倒着读句子,从最后一个单词读到第一个单词。
  • 中间填空: 他们取一个句子,挖掉中间部分,然后要求学生根据开头和结尾来预测中间的内容。
    • 发现: 倒着读作为一种正则化手段效果很好(它阻止了死记硬背)。然而,“中间填空”游戏实际上让情况变得更糟了,对于普通文本而言是如此。作者认为这是因为“填空”的形式与我们通常阅读的方式(从左到右)差异太大,以至于它让学生感到困惑,而不是提供帮助。

3. “预知未来”游戏(目标偏移预测)

  • 他们不再问“下一个单词是什么?”,而是问“三个步骤之后的单词是什么?”
  • 发现: 这项技术效果很好,但前提是必须小心操作。如果他们过于频繁地询问未来的单词,学生会感到困惑。如果他们主要询问下一个单词,但偶尔询问更远处的单词,这就像是一个完美的训练课程。

获胜策略:“完美风暴”

作者并没有只选择一种游戏,而是将它们结合了起来。然而,他们发现有些游戏会产生冲突。

  • 冲突: 如果你既遮盖单词(蒙眼),又要求预测未来的单词,学生就会感到不知所措。语境被破坏得太严重,无法做出准确的猜测。
  • 和谐: 如果你使用随机替换(更换单词)+ 倒着读 + 偶尔向前看,学生就能保持敏锐。

结果:
通过使用这种特定的“扭转”组合,AI 能够在进行 100 个 epoch(将数据重复阅读 100 遍)的过程中,依然不丧失其泛化能力。

  • 没有这些技巧: AI 在第 16 个 epoch 时达到顶峰,随后性能开始下降。
  • 有了这些技巧: AI 持续提升,达到了比任何单一方法都更低的错误率(更好的性能)。

核心结论

这篇论文证明了,当我们面临数据枯竭时,并不需要停止训练。我们只需要改变呈现数据的方式。通过添加细微且聪明的“扭曲”,我们可以让强大的计算机更有效地进行更长时间的学习,防止它们仅仅是死记硬背训练集。

关键启示: 随机替换单词(让文本变得略微“错误”)是最有效的单一技巧,而将其与倒序阅读和向前看相结合,创造了最佳的整体表现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →