← 最新论文
🤖 AI

Scaling Domain Data Repetition in LLM Pretraining

本文研究了大语言模型预训练中数据重复与过拟合之间的权衡关系,揭示了在固定每参数 token 数的情况下,高质量领域数据的最优重复次数会随模型规模的增大而轻微增加,且与该领域的验证损失呈强负相关,这表明在较小的代理模型上进行调优可以有效地指导更大规模模型的缩放策略。

原作者: Jingwei Li, Xinran Gu, Rui Dai, Xintong Hao, Chengyin Xu, Yan Wu, Shuran Zheng, Jingzhao Zhang

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Jingwei Li, Xinran Gu, Rui Dai, Xintong Hao, Chengyin Xu, Yan Wu, Shuran Zheng, Jingzhao Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教会一个超级聪明的机器人如何说话、写作和思考。为了做到这一点,你向它喂入了一个庞大的文本库,这个过程被称为“预训练”。但问题在于,随着你增加更多的“脑细胞”(参数),机器人也会变得更大、更聪明;为了防止它感到困惑或表现不佳,你必须喂给它更多的文字。这就是大语言模型(LLM)的世界。问题是,虽然你可以轻易找到无穷无尽的通用互联网文本(比如随机的论坛帖子或新闻文章),但寻找真正高质量、专业化的知识(如高级数学、编程或医学事实)就像在大海捞针。要喂饱一个巨大的机器人,这类高质量数据的量实在太少了。

那么,当你用完那些“好东西”时该怎么办呢?你开始重复它。你把那本珍贵的数学教科书一遍又一遍地喂给机器人。但这是一种微妙的平衡行为。如果你重复得太多,机器人可能只会逐字逐句地背诵这本书,而无法理解实际的概念,这就是所谓的“过拟合”问题。如果你重复得不够,它就会被泛滥的通用互联网噪音淹没,永远学不会那些难点。核心问题在于:在机器人开始变得困惑之前,你应该将这些优质数据重复多少次?

这篇题为《大语言模型预训练中的领域数据重复缩放》(Scaling Domain Data Repetition in LLM Pretraining)的论文深入探讨了那个确切的问题。来自清华大学和字节跳动 Seed 的研究人员想要找出,随着机器人的规模变大,如何将高质量数据与通用数据进行混合的最佳配方。他们在四种特殊的“口味”数据上进行了测试:代码、数学、维基百科和医学记录。

以下是他们的发现,而且这有点像剧情反转。长期以来,人们一直认为,随着机器人的规模变大,它们会变得更加脆弱,并且更容易发生过拟合(死记硬背)。旧的建议是:“不要过度重复那些好东西,否则大机器人会‘坏掉’。”但作者发现,当他们保持训练预算与机器人规模成比例(即遵循一个固定的“每个参数对应的 Token 数”比例)时,情况出人意料。他们发现,更大的机器人实际上可以比小的机器人处理更多的重复。 这就像一个体型巨大的运动员,只要训练强度相同,他可以比小个子运动员跑更多的圈数而不感到疲劳。

然而,他们发现最重要的规则不在于机器人的大小,而在于数据本身的质量。他们发现,机器人学习特定主题的能力与其可以重复该主题的次数之间存在强关联。如果一个机器人学习某个领域(如数学)学得非常好,且拥有较低的“误差得分”(验证损失),那么它可以承受多次重复该数据而不会出错。但如果机器人在这个主题上表现挣扎,误差得分较高,那么它会很快发生过拟合,因此你应该极少重复这些数据。

有趣的是,初始的独特数据量似乎对于决定重复多少次并不重要。无论你最初拥有的独特数学题很少还是很多,重复的“甜点位”(最佳平衡点)基本保持不变。研究人员建议,如果你想训练一个巨大的机器人,你不需要靠猜。你可以先训练一个较小的“代理”机器人,看看它学习数学或代码的效果如何,并利用这个结果来安全地推测出对于那个巨大的机器人应该重复多少次数据。

他们还测试了在保持总的“好东西”总量不变的情况下,用重复的数据替换独特的数据会发生什么。他们发现,对于某些主题(如数学),重复数据几乎与拥有更多独特数据一样有效。但对于其他主题(如维基百科),重复数据则是个坏主意;如果机器人只是反复听同样的维基百科句子,而不是阅读新的内容,它的学习效果会差得多。

最后,他们观察了机器人的“学习速度”(学习率)在训练期间是如何变化的。他们发现,如果在训练早期放慢机器人的速度,它会对重复变得更加敏感,从而更早发生过拟合。但如果让学习速度保持在高位的时间更长,机器人就能在开始死记硬背之前,容忍更多的重复。

简而言之,这篇论文表明,并没有一个单一的“魔力数字”来决定要重复多少次数据。相反,最好的策略取决于机器人目前学习该特定主题的情况。如果它是一个快速的学习者,就多重复一些;如果它是一个慢速的学习者,就早点停止重复。而且令人惊讶的是,只要你为它们提供与其规模相匹配的正确数据,更大的机器人实际上比我们想象的更具鲁棒性(稳健性)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →