← 最新论文
💬 NLP

Beyond Random Sampling: Efficient Language Model Pretraining via Curriculum Learning

本文对大语言模型预训练中的课程学习进行了首次系统性研究,证明了基于压缩率和词汇多样性等指标将数据按由易到难进行组织,可以显著加速收敛并提升各种训练场景下的性能。

原作者: Yang Zhang, Amr Mohamed, Hadi Abdine, Guokan Shang, Michalis Vazirgiannis

发布于 2026-01-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yang Zhang, Amr Mohamed, Hadi Abdine, Guokan Shang, Michalis Vazirgiannis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人学习人类语言。通常情况下,我们是把一大堆杂乱无章的书籍、推文和文章一次性扔给机器人,而且顺序完全随机。这就像是通过随机跳跃的乐谱来学习弹钢琴:一会儿是简单的童谣,一会儿是复杂的交响乐,接着又跳回一份购物清单,如此循环往复。机器人最终能学会,但这个过程既耗时又浪费能量。

这篇论文提出了一种更好的方法:课程学习(Curriculum Learning)。把这想象成一个“智能教学大纲”。与其使用随机的混乱,不如将数据按照从易到难的顺序进行组织,就像人类老师那样。你从简单的句子开始,然后过渡到段落,再到复杂的文章,最后接触高密度的技术手册。

以下是研究人员的工作内容及发现,使用了简单的类比进行说明:

核心理念:顺序至关重要

研究人员提出了一个问题:向语言模型喂入数据的顺序重要吗?
他们发现:是的,绝对重要。 通过像规划好学校课程表一样组织数据,我们可以让模型训练得更快,也变得更聪明。

三种教学风格

团队测试了三种组织这个“学校”的方式:

  1. 严格的教学大纲(常规课程/Vanilla Curriculum):

    • 运作方式: 你拿出一堆固定的数据,将其完美地从易到难排序,并按此顺序进行教学。
    • 类比: 就像一名学生必须完成第一章的学习,才被允许打开第二章。
    • 结果: 这种方法在初期表现良好,帮助机器人比随机训练学得更快。然而,一旦机器人接触到“难”的内容,其优势就开始减弱。
  2. 节奏化的教学计划(步调函数/Pacing Functions):

    • 运作方式: 你不是面对一条死板的直线,而是拥有一个巨大的资料库。你使用一种“步调”来决定在任何给定时间内,给机器人多少容易的书籍和多少难的书籍。你可以起步较慢(线性/Linear),也可以快速提升难度(二次方/Quadratic),或者以大量简单内容开场并缓慢提升难度(反向二次方/Inverse Quadratic)。
    • 类比: 想象一位健身教练控制着杠铃上的重量。他们不会直接把重物砸在你身上,而是根据进度表逐渐增加重量。
    • 结果: 这种方法非常有效。具体来说,“线性”步调(稳步增加)在衡量文本的“密度”或“冗余度”方面效果极佳;而“二次方”步调(起步慢,随后难度迅速攀升)在衡量文本的“可读性”方面表现最好。
  3. 混合模式(交错式课程/Interleaved Curriculum):

    • 运作方式: 你在每一节课中都混合容易和难的例子,但整体仍遵循随时间推移而变难的趋势。
    • 类比: 就像一位音乐老师先弹一段简单的音阶,接着是一个复杂的和弦,然后再回到简单的音阶,确保学生不会因为只接触单一难度的内容而感到厌倦或不知所措。
    • 结果: 这有助于模型更好地泛化(而不仅仅是死记硬背某一种类型的问题),但并不总是能超越其他方法。

“难度”评分卡

为了对数据进行排序,研究人员需要一种衡量文本“难度”的方法。他们测试了 15 种衡量难度的方式,并选出了表现最好的 6 种。其中的前三名是:

  • 压缩率(Compression Ratio): 文本能被压缩到什么程度?(高压缩率 = 高信息密度 = 更难)。
  • MTLD(词汇多样性/Lexical Diversity): 使用了多少种不同的单词?(独特的单词越多 = 更难)。
  • Flesch 阅读易读性(Flesch Reading Ease): 一个衡量句子易读性的标准分数(类似于你在教科书上看到的评分)。

令人惊讶的发现: 他们发现使用“困惑度”(Perplexity,一种常见的 AI 衡量指标)反而会让情况变糟。这就像是在课程结束时给了机器人一堆乱码,因为 AI 认为那是“难”的东西,但其实那只是噪声。

“热身”技巧(最佳发现)

最具有实际意义的发现是一种被称为**“课程热身”(Curriculum Warm-up)**的策略。

  • 问题: 如果你将整个数据集按从易到难排序,那么以后想加入新数据时,就必须重新进行排序。
  • 解决方案: 在训练的前半部分使用“由易到难”的方法(热身阶段),然后在剩下的训练阶段切换到标准的“随机”方法。
  • 类比: 就像一名跑步者在正式比赛前进行缓慢且有结构的慢跑热身,为肌肉做好准备,然后进行自由冲刺。
  • 结果: 这种简单的切换为模型带来了永久性的提升。即使在切换到随机数据后,该模型的表现依然领先于竞争对手高达 3.5%。它达到了与随机方法相同的性能水平,但使用的训练步数减少了 18% 到 45%

为什么这很重要

  • 成本低廉: 计算这些“难度分数”所花费的时间和金钱,与实际训练相比几乎可以忽略不计。
  • 兼容性强: 你不需要改变机器人的大脑(模型架构),也不需要丢弃数据。你只需要改变喂入数据的顺序
  • 可扩展性: 他们在小型模型、大型模型(高达 30 亿参数)甚至大规模数据集(1000 亿 token)上都进行了测试。“热身”技巧在所有规模下都表现完美。

总结

这篇论文证明了:你如何组织数据与数据本身同样重要。 通过以结构化的、由易到难的进程(尤其是作为热身阶段)来训练语言模型,我们可以让它们训练得更快、更便宜、也更聪明。这仅仅是对“教学大纲”的一个简单改动,却带来了巨大的成果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →