Bridging Compute- and Data-Optimal Pretraining
本文引入了计算-数据(CD)缩放法则,这是一个通过令牌有效性函数来模拟衍生数据收益递减的统一框架,旨在连接计算最优与数据最优的预训练机制,并揭示了经典的计算最优分配在大多数实际场景中并非最优。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个巨大的、超级聪明的机器人说人类语言。多年来,科学家们一直认为其中的秘诀很简单:只要不断给机器人喂更多的故事、事实和书籍即可。机器人的大脑(其“模型规模”)越大,给它的新鲜书籍越多,它就会变得越聪明。这种被称为“缩放法则”(scaling laws)的想法表明,如果你有足够的计算能力,只要购买更多的数据,机器人就会一直变得更好。
但问题在于,我们正在耗尽新鲜的高质量书籍。互联网是有限的,编写新的、完美的文章需要时间和金金钱。与此同时,我们的计算机正在变得越来越快且越来越便宜。这产生了一个奇怪的问题:我们有一个超强大的引擎(计算力),但油箱却快空了(数据)。科学家们面临的一个核心问题是:如果我们无法获得更多新鲜的书籍,我们能否只是让机器人一遍又一遍地阅读相同的书籍,或者以不同的方式重写它们,从而让它变得更聪明?读第二遍故事是否和读一本全新的书一样有效?
这正是研究人员 Tian Qin、Kimia Hamidieh 和 David Alvarez-Melis 在他们的新论文中所解决的谜题。他们想弄清楚当新鲜数据稀缺时,训练这些 AI 模型的完美配方是什么。他们开发了一套新的规则,称为“计算-数据(CD)缩放法则”。把它想象成一张关于旅程的新地图:旧地图说“一直向前开”,而新地图说:“嘿,路要到头了!这里有如何绕行的方法。”
该团队发现,仅仅重复阅读旧数据并不是一种神奇的解决方法。他们发现,“衍生标记”(derived tokens)——这就像是重读一本书或用自己的话改写句子——其价值低于新鲜的原创文本。你重复或改写得越多,每个新词所能增加的价值就越少。这就像吃一块美味的蛋糕:吃第一块时感觉很棒,第二块还不错,但吃到第十块时,你已经吃饱了,不再觉得那么享受了。
为了证明这一点,他们训练了数十个 AI 模型,其规模从拥有 1400 万个“神经元”的小型模型到拥有 6 亿个神经元的中型模型,使用的是名为 Dolma-3 的大规模文本库。他们测试了两种主要策略:多轮重复(Multi-epoch repetition)(一遍又一遍地阅读同一本书)和改写(Paraphrasing)(以不同的风格重写书籍,比如把一篇新闻文章变成一道数学题或一个常见问题解答/FAQ)。
他们的结果令人惊讶且非常具体。他们发现,“重读”或“改写”的“价值”很大程度上取决于机器人的大脑有多大,以及它之前已经看了多少新鲜数据。
- 对于小型机器人(小于 6 亿参数)且新鲜数据有限的情况,改写是一个很棒的技巧。这就像是给机器人提供同一个故事的新视角,这有助于它学习。
- 对于大型机器人(超过 70 亿参数)或当你已经拥有大量新鲜数据时,改写就不再奏效了。这就像试图通过改写一本儿童读物来教一名博士生;他们已经掌握了基础知识,新的版本并不能增加任何新东西。
- 重复(再次阅读同一本书)对较大的模型效果更好,但即便如此,也是有限度的。你不能只是让机器人永远读同一本书,并期望它能无限地变得更聪明。
论文引入了一个特殊的数字,他们称之为 (eta),用来精确衡量一个“衍生”词相对于“新鲜”词的价值。如果 等于 1,则新词与新鲜词一样好。如果它等于 0,则它毫无价值。他们发现 不是一个固定值;它会随着模型变大以及你使用的衍生数据增多而下降。
这引出了三种不同的训练“区域”,帮助工程师决定下一步该做什么:
- 计算受限型(Compute-Bound): 你有充足的新鲜数据,但计算能力不足。在这种情况下,你应该继续在新鲜数据上进行训练。
- 数据受限型(Data-Bound): 你已经用完了新鲜数据。在这种情况下,你可以投入更多的计算能力进行重复或改写,但你必须小心,因为回报会迅速下降。
- 模型受限型(Model-Bound): 你已经用尽了所有可以利用的数据,且计算机性能也已达极限。现在唯一的变聪明的方法就是构建一个更大的大脑(更大的模型)。
其中一个非常实用的结论是关于阅读一本书多少次的问题。过去有一个流行的经验法则,即阅读一个数据集 4 次(4 个 epoch)。作者发现,这仅对于具有特定数据量中等规模的模型才是好主意。如果你有一个巨大的模型或一个庞大的数据集,阅读 4 次是在浪费时间和金钱;你应该在很早的时候就停止。相反,对于非常小的模型且数据很少的情况,你可能需要阅读很多次。
他们还将这两种策略进行了并排对比。他们发现了一个“转折点”。如果你的模型很小(低于 6 亿)且数据不多,改写是胜出的方案。但一旦你的模型变大(超过 70 亿)或者你拥有一个巨大的数据集,重复就成了更好的选择,而改写实际上会变得无效。
简而言之,这篇论文告诉我们,“只买更多数据”的时代已经结束了。我们正在进入一个必须聪明地使用现有数据的时代。我们不能只是把更多的计算力投入到问题中并期望看到结果;我们必须准确知道何时停止重复,何时尝试改写,以及何时承认我们需要一个更大的大脑。作者指出,对于大多数实际情况,旧的“Chinchilla”法则(假设数据是无穷无尽的)不再是最好的指南。相反,我们需要仔细平衡我们的计算能力、模型规模和数据预算,利用这些新规则来避免在无效的技巧上浪费时间。
研究人员对这些发现非常有信心,因为他们在许多不同的模型规模和数据量下都进行了测试,并且数学逻辑是成立的。他们甚至检查了使用这些技巧训练的模型在现实任务(如回答问题或解决数学问题)中的表现,结果显示,是的,它们确实变好了。较低的“损失值”(loss,衡量机器人有多困惑的指标)意味着机器人的表现更好。
所以,下次当你听到关于一个新的 AI 模型时,请记住:这不仅仅关乎它读了多少,更关乎它是如何阅读的。如果你是那个训练 AI 的人,不要只是在同一张播放列表上不停地按“重复”键;有时候你需要一个混音版,而有时候你只需要停下来,去换一个更大的大脑。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。