Prescriptive Scaling Laws for Data Constrained Training
本文提出了一种新的规范性缩放定律,该定律考虑了数据受限情境下的数据重复与过拟合问题,表明在超过某一临界点后,增加模型容量比进一步重复数据更为有效,且较强的权重衰减能显著缓解过拟合。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在为一名学生准备一场重要考试。你拥有一个有限的教科书库(高质量数据),但拥有无限的时间和精力(算力)。
长期以来,人工智能领域的经验法则是:“只需不断阅读新页面。”著名的**奇点法则(Chinchilla law)**假设你阅读的每一句话都是全新且独特的。它精确地告诉了你,为了获得最佳成绩,应该阅读多少本书,以及你的“大脑”应该有多大。
但在现实世界中,优质的教科书是稀缺的。你经常会读尽所有新页面,不得不开始反复阅读相同的书籍。旧规则不知道如何应对这种情况。它们认为重复阅读同一页和阅读新页面一样好,或者至少认为效果会永远持续地略微提升。
问题:“过度阅读”陷阱
这篇论文的作者发现,过度重复阅读相同的数据,就像学生死记硬背教科书的字体和拼写错误,而不是理解概念。这被称为过拟合。
如果你强迫学生将同样的 100 页阅读 16 遍,他们会停止学习新事物,开始变得困惑或僵化。学生(AI 模型)越大,他们陷入这个陷阱的速度就越快。旧规则未能预测到,在某个节点之后,增加重复阅读次数实际上会使学生表现得更差。
解决方案:新规则手册
作者们创建了一条新的、简单的规则(“扩展法则”),为重复阅读增加了“惩罚”。这就像老师在页边写下的批注:“每当你重读一页,你学习新事物的能力就会减弱一点点。”
他们的新公式包含三个部分:
- 底线:有些事情就是很难学会(比如预测句子中的下一个词)。
- 大脑尺寸:如果你的大脑太小,就无法容纳所有模式。
- 重复惩罚:如果你阅读相同的数据太多次,你就会变得“陈旧”。
重大发现:停止阅读,开始思考
最惊人的发现是关于如何分配你的时间(算力)。
- 旧建议:“如果你读完了书,就继续反复阅读相同的书籍。”
- 新建议:“一旦你把书读了几遍,就停止。”
该论文表明,如果你拥有一个固定的书库,那么阅读它们的次数存在一个“最佳点”。如果你拥有大量时间(算力)但书库很小,最好的策略不是将同一本书阅读 20 遍。相反,你应该构建一个更大的大脑(更大的模型),并减少阅读次数。
这就像意识到花 10 个小时重读单一章节是浪费时间。不如将这段时间用于构建一个更大、更聪明的大脑,使其只需阅读一到两次就能理解该章节。
秘密武器:更强的“纪律”
该论文还测试了一种称为权重衰减(一种防止模型变得过于自信或僵化的方法)的技术。他们发现,使用这种“纪律”的强版本,就像给学生提供了更好的学习方法。
- 它将“陈旧”惩罚减少了约70%。
- 这意味着学生可以承受更多次重读相同的书籍而不会感到困惑。
- 这解释了为什么在数据稀缺的情况下,使用非常强的纪律(此前被认为过于严苛)实际上比标准方法效果更好。
总结
这篇论文告诉我们,在人工智能领域,数据是瓶颈,而非计算能力。
- 不要过度排练:过度重复数据会损害性能,尤其是对大型模型而言。
- 追求更大,而非更长:当你没有新数据时,将计算能力用于扩大模型规模,而不是重复阅读相同的数据。
- 使用强纪律:调高“权重衰减”有助于模型抵御重复阅读数据带来的困惑,使其能够从有限的资源中更有效地学习。
作者们通过训练超过 300 个不同的模型证明了这一点,并表明他们的新规则手册比旧规则能更准确地预测最佳结果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。