InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition
本文介绍了 InfoLaw,这是一种新颖的数据感知扩展框架,它将预训练建模为信息积累过程,以准确预测大语言模型在不同数据混合、质量权重和重复水平下的性能,从而即使在过训练或数据受限的情况下也能实现最优数据配方选择。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文"InfoLaw"的通俗解释,辅以日常类比。
核心难题:好东西是否太多?
想象你正试图教一名学生(即人工智能)写好文章。你拥有一个庞大的图书馆,但其中只有少数几本是真正高品质的经典之作,其余的则平庸或仅仅尚可。
过去,研究人员认为最佳策略是只给学生提供那些高品质的经典。但这有个陷阱:经典著作的数量不足以填满学生整个学习计划。如果你强迫学生反复阅读同样的 100 本经典来填补时间,他们最终会感到厌倦,开始重复相同的短语,表现反而变差。这被称为“重复”。
另一方面,如果你混入一些低质量书籍来填补时间,学生能学到更多样化的内容,但也可能染上一些坏习惯。
关键问题是:我们应该重复多少高品质书籍,又应该混入多少低质量书籍?
旧方法:用一张破损的地图猜测
此前,科学家使用“扩展定律”(Scaling Laws)来预测人工智能的表现。你可以把这些定律想象成一张地图,上面写着:“如果你学习 10 小时,你得 B;如果你学习 100 小时,你得 A。”
然而,这篇论文指出,当你开始重复相同的高质量数据时,这张旧地图就失效了。
- 缺陷:旧地图假设学习时间越长,成绩就越好。它没有考虑到,同一本书读第 50 次时,其帮助程度远不如前 5 次。
- 结果:当研究人员试图用旧地图预测巨型人工智能的表现时,地图过于乐观。它预测人工智能会取得完美成绩,但现实中,人工智能因陷入重复循环而变得困惑,表现糟糕。
新方案:"InfoLaw"(信息温度计)
作者引入了一个名为InfoLaw的新框架。InfoLaw 不再仅仅计算人工智能“学习了多少小时”(或看到了多少 token),而是衡量人工智能实际学到了多少新信息。
以下是他们的构建过程:
- 图书馆分桶:他们根据质量将庞大的文本库分成了 6 个桶(从“黄金”到“垃圾”)。
- 混合配方:他们创建了不同的训练“配方”。有些配方包含 80% 的黄金书籍(伴随大量重复),有些则是黄金与白银书籍的混合(重复较少)。
- 发现:他们发现人工智能的学习遵循特定模式:
- 质量密度:高品质书籍在你第一次阅读时提供巨大的“信息增益”。
- 边际收益递减:每当你重读一本书,增益就会越来越小,就像电池耗尽一样。最终,再次阅读几乎不增加任何价值。
- 公式:他们创建了一个数学公式,通过结合书籍的质量和重复次数,计算出人工智能吸收的总“信息量”。
神奇结果:一条直线
这篇论文最引人注目的部分是,当他们使用这种新的“信息”指标而非单纯的“花费时间”来绘制结果时,发生的情况。
- 之前:当他们基于时间绘制结果时,数据点散乱分布。高重复率的配方看起来与低重复率的配方截然不同。
- 之后:当他们基于信息绘制结果时,所有散乱的点坍缩成了一条单一、完美的直线。
这意味着,无论你使用什么“配方”(高质量加重复,还是混合质量),只要知道人工智能吸收的总“信息量”,你就能完美预测其表现。
我们能以此做什么?
因为他们拥有了这条完美的直线(即 InfoLaw),现在可以在不花费数百万美元先训练巨型模型的情况下,做两件非常有用的事:
- 预测未来:他们可以用特定配方训练一个微小、廉价的模型(例如 2.5 亿参数模型)。利用 InfoLaw,他们可以准确预测具有相同配方的巨型 70 亿参数模型将如何表现。
- 寻找完美配方:他们可以使用公式计算“最佳混合比例”。他们发现:
- 小模型(或小预算)应高度专注于最高质量的数据,即使这意味着要稍微重复一些。
- 大模型(或大预算)从多样性中获益更多。它们应混入更多低质量数据,以避免重复带来的“厌倦”。
总结类比
把训练人工智能想象成炖汤。
- 旧方法:你只测量锅炖了多久。你假设炖 10 小时总是比炖 1 小时好。但如果你反复添加同样的 3 颗土豆,汤会变得奇怪且过咸(重复有害)。
- InfoLaw:这种方法测量从食材中提取的实际风味。它知道炖煮的第一小时提取了 90% 的土豆风味,但第 10 小时几乎提取不到任何东西。
- 好处:现在,你不再需要猜测为一大锅汤该加多少盐和多少土豆,你可以利用“风味公式”瞬间计算出完美配方,从而避免浪费食材和时间。
核心结论:这篇论文证明,为了训练出更好的人工智能,我们不应只看使用了多少数据,而应看这些数据提供了多少新信息,特别是当我们被迫重复高质量数据时。这使我们能够准确预测性能,并为任何规模的人工智能选择最佳的数据混合比例。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。