LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws
本文表明,预训练数据是大语言模型中损失对损失缩放规律的主要决定因素,而模型规模、架构和超参数等因素影响甚微,这表明优化下游性能时,数据筛选比架构选择更为关键。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试烤制完美的面包。多年来,科学家们一直痴迷于这个配方:“如果你使用 100 克面粉和 500 克水,你就会得到特定的质地。”这与我们目前构建大语言模型(LLMs)的方式非常相似。我们拥有“缩放定律”,它们根据我们拥有的计算能力,告诉我们模型应该有多大,以及需要多少数据来进行学习。
但这里有一个陷阱。仅仅因为一个模型完美地学会了配方,并不意味着它能烤出美味的蛋糕(即在现实世界任务中表现出色)。
这篇论文《LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws》(大语言模型在直线上:数据决定损失到损失的缩放定律)提出了一个简单的问题:一旦模型完成学习,究竟是什么决定了它在新的任务上的表现?
作者测试了数十个变量——改变模型的“大脑”结构、模型的大小、用于读取文本的工具,甚至用于教学它的数学方法。他们发现了一个巨大而令人惊讶的事实:数据是唯一真正重要的因素。
以下是使用简单类比进行的分解:
1. “损失到损失”直线
想象一下你正在训练一名学生。你给他们一份练习测试(训练损失),然后是一份期末考试(测试损失)。
- 发现: 练习测试的表现与期末考试的表现之间,存在一条非常可预测的直线。
- 类比: 如果一名学生在练习中得了 90 分,那么无论他们穿红衬衫还是蓝衬衫,他们在期末考试中几乎肯定也会得 90 分。论文将这种现象称为“移位幂律”。这是一条几乎在所有情况下都适用的可靠规则。
2. “三大”因素(以及为什么它们不重要)
研究人员对训练过程玩了“疯狂填词”游戏,交换不同的成分,看看什么会改变最终结果。他们发现,三大类因素对那条可预测的直线几乎没有任何影响:
- 架构(大脑结构): 他们比较了 Llama(一种 Transformer,就像标准的人类大脑)与 Mamba(一种状态空间模型,就像一种完全不同的外星大脑)。
- 结果: 如果你给这两个大脑输入完全相同的教科书,它们最终会落在完全相同的性能直线上。无论大脑是 Transformer 形状还是 Mamba 形状,只要数据相同,结果就相同。
- 分词器(字典): 这是将句子分解为单词或词块的工具。他们尝试了不同的字典(有些包含 128,000 个单词,有些包含 50,000 个)。
- 结果: 改变字典就像改变教科书的字体。它并没有改变学生学习材料的效果。
- 设置(学习习惯): 他们改变了模型的大小(小与大)、句子的长度(上下文长度)以及用于纠正错误的数学方法(优化器)。
- 结果: 无论学生学习了 10 分钟还是 10 小时,或者使用红笔还是蓝笔,练习成绩与期末成绩之间的关系保持不变。
3. 唯一重要的“一件事”:数据
虽然大脑结构、字典和学习习惯都不重要,但教科书本身改变了一切。
- 类比: 想象两名学生。学生 A 阅读一本关于烹饪的教科书。学生 B 阅读一本关于天体物理学的教科书。
- 即使学生 A 拥有超级计算机大脑,而学生 B 只有简单的计算器大脑,学生 A 也会擅长烹饪而糟糕于天体物理学。学生 B 则恰恰相反。
- 论文发现,改变预训练数据(教科书)会移动整个性能直线。如果你使用高质量的教育数据(如"FineWeb-Edu")进行训练,模型在现实世界任务中的表现会更好。如果你使用杂乱的数据进行训练,其表现则会更差。
给从业者的启示
这篇论文为任何构建人工智能的人传达了一个清晰的信息:
停止对架构的痴迷,开始对数据的痴迷。
如果你希望模型在现实世界任务中表现出色,你不需要发明一种新的大脑类型或微调数学设置。你需要策划更好的数据集。
- 数据是驱动力。它决定了目的地。
- 架构和设置只是汽车。你可以把车换成法拉利或本田,让旅程更高效或更便宜,但如果你把错误的地图(数据)放入 GPS,你最终还是会到达错误的地方。
简而言之:数据决定目的地;其他一切只决定你到达那里的效率。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。