Anytime Pretraining: Horizon-Free Learning-Rate Schedules with Weight Averaging
本文表明,将权重平均与简单的无视界学习率调度(例如多项式衰减或 )相结合,在大型语言模型上实现了与经过调优的余弦调度相当的最终性能,为在总视界未知的开放式设置中进行训练提供了一种实用且具有理论依据的替代方案。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,大型语言模型是驱动从写作助手到复杂推理工具等一切事物的引擎。为了让这些引擎运转起来,研究人员必须通过喂给它们海量的文本来教导它们,这个过程被称为预训练。这种教导需要对速度和精度进行精细的平衡,而这种平衡是由一个被称为“学习率”的设置来控制的。可以将这个速率想象为模型根据新信息调整其内部知识的节奏。如果节奏太快,模型会由于过冲而偏离真相;如果节奏太慢,它则学不到任何东西。多年来,管理这种节奏的标准方法是一种被称为“余弦衰减”(cosine decay)的调度方案。这种方法让模型从一个中等速度开始,沿着一条平滑的曲线逐渐减速,并在一个精确的时刻停止。然而,这种标准方法有一个显著的缺陷:它要求在采取第一步之前,必须确切知道训练将持续多久。在一个数据不断涌入且总信息量未知的世界里,这种要求就像是试图驾驶一辆只有目的地地图、却不知道到达目的地所需距离的汽车。
哈佛大学和坎普纳研究所(Kempner Institute)的研究人员通过开发一种不需要预设结束日期的模型训练新方法,解决了这一问题。他们的工作将数学理论与大规模实验相结合,证明了即使在不知道训练何时停止的情况下,也能有效地训练模型。他们发现,通过使用一种简单的、随时间自然减速的稳定节奏,并对模型的进步过程进行平均处理,他们可以实现与传统方法同样出色的效果。这一发现表明,过去那种僵化的、预先计划好的调度方案对于构建最先进的人工智能并非必要,这为能够随着新数据的出现进行持续学习的系统开启了大门。
问题的核心在于现代数据的本质。与过去固定的数据集不同,今天的信息是无止境地涌入的。一个模型可能会训练一周,也可能训练一个月,甚至可能训练数年,这取决于有多少可用数据。传统的余弦衰减调度是“依赖于时限”(horizon-dependent)的,这意味着它必须针对已知的持续时间进行专门调优。如果研究人员为期一个月的运行设计了一个调度方案,但项目却延长到了三个月,那么模型的性能将会受损,因为其学习率的设计在过早的时候就减速了。研究人员致力于寻找一种“无时限”(horizon-free)的替代方案,即无论训练在明天还是明年停止,都能表现良好的方法。他们提出,与其使用复杂的曲线,不如使用一种随时间缓慢衰减的简单调度方案,并结合一种称为“权重平均”(weight averaging)的技术,这可以解决这个问题。权重平均是一个过程,即最终的模型不仅仅是创建过程中的最后一个版本,而是整个训练过程中许多版本的融合,它能平滑噪声并稳定结果。
为了测试这个想法,团队首先转向了数学理论。他们分析了一个简化学习模型的行为,使用线性回归来模拟语言中发现的复杂模式。他们的分析表明,对于某些类型的数据,一个随时间缓慢下降的学习率(具体遵循随着时间平方根增加而下降的模式)在理论上是最优的。至关重要的是,他们证明了当这种特定的衰减与权重平均结合时,该方法可以在不需要预先知道总训练时间的情况下,实现最佳的学习速度。这一理论发现提供了一个强大的基础,表明在开放式场景下,一个简单、稳定的方法可以胜过复杂的、预先计划好的曲线。
随后,研究人员从理论转向实践,训练了具有 1.5 亿和 3 亿参数的大型语言模型。他们在海量的文本数据集上训练这些模型,迫使它们学习的数据量达到其典型规模的 32 倍。这种规模之所以重要,是因为它模拟了构建世界上最先进 AI 系统时的条件。他们将这种新的无时限调度方案与标准的余弦衰减调度进行了对比,后者是针对每个特定的训练时长进行了精心调优的。结果令人瞩目。使用恒定学习率加平均或缓慢衰减率加平均的新方法,几乎完美地追踪了表现最好的调优余弦调度的性能。在整个训练范围内,从短时运行到最长的持续时间,无时限方法取得的最终结果与传统方法几乎无法区分。
这项工作的最引人注目的方面之一是它的实用性。研究人员展示了在训练过程早期选择的一套设置,就可以用于整个项目的持续时间,即使该项目突然扩大。他们证明,如果一个模型是针对某个中间点(例如标准数据量的四倍)进行调优的,那么同样的设置在训练延长到该数据量的 32 倍时仍能继续表现良好。这消除了在每次训练时限发生变化时都需要停止并重新调优模型的必要。此外,他们还测试了一种流行的替代方法,称为“预热-稳定-衰减”(warmup-stable-decay),该方法试图结合两者的优点,即在训练的大部分时间保持速率稳定,然后在结束时进行衰减。虽然这种方法表现良好,但它仍然需要知道何时开始衰减阶段,因此在灵活性上不如作者提出的真正无时限的方法。
研究还探讨了当训练数据非常庞大时,这些方法是如何表现的,在这种情况下,学习过程中的噪声自然较低。在这些条件下,研究人员发现学习率不需要进行衰减。恒定的学习率结合权重平均,就足以实现顶尖性能。这符合他们的理论预测:当数据的方差(即噪声)较小时,模型通过维持稳定节奏来减少偏差(即误差),比通过减速更有利。这一见解表明,随着计算能力的增长以及模型能够处理更大规模的数据批次,对复杂衰减调度的需求可能会完全消失,取而代之的是更简单、更稳健的策略。
最终,这项研究为人工智能训练的未来提供了一条清晰的路径。它表明,多年来主导该领域的僵化、预先计算的调度方案并不是唯一的方法,或许甚至不是最好的方法,来训练处于连续数据时代的模型。通过证明简单的、无时限的调度方案结合权重平均可以匹配经过最精心调优的传统方法的性能,作者们为开放式学习提供了一个实际的解决方案。这种方法允许模型适应任何可用数据量,使训练过程更加灵活和高效。研究结果表明,大型语言模型训练的未来可能不在于更复杂的调度算法,而在于更简单、更具韧性的策略,这些策略可以在没有预定终点的情况下进行持续学习。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。