Measuring Task-Agnostic Training Data Influence Across Language Model Pretraining
本文介绍了一种通过量化单个样本在多大程度上减少与最终模型参数之间的距离来衡量训练数据影响力的任务无关方法,揭示了在各种模型配置下,文献相关数据驱动早期预训练,而 STEM 数据在后期阶段变得更具影响力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个超级聪明的机器人如何像人类一样说话。你不仅仅是给它一本书;而是把整个互联网都灌进它的脑子里。这个过程被称为“预训练”,它是我们今天所使用的 AI 模型的基础。但棘手的地方在于:一旦机器人完成了学习,没有人真正知道哪些特定的句子或故事是最重要的。它之所以擅长数学,是因为某篇特定的维基百科文章吗?它之所以擅长写诗,是因为某部特定的小说吗?
科学家们一直试图通过提问来回答这个问题:“如果我删掉这一个句子,机器人在进行特定测试(比如解数学题或写诗)时表现会变差吗?”这就像是在试图弄清楚哪种食材让蛋糕味道好,却要在已经吃完蛋糕之后再去品尝。问题在于,AI 模型应该是全才,而不仅仅是擅长某一项测试。如果你只检查它们在数学方面的表现,你可能会忽略它们从数据的另一部分学到了如何变得幽默。所以,大问题是:我们能否在不强迫它参加特定测试的情况下,观察机器人的大脑是如何随时间变化的?
这篇论文介绍了一种聪明的新方法来观察机器人的学习过程,而无需特定的测试。研究人员不再问:“这个句子是否帮助机器人通过了数学测验?”,而是问:“这个句子是否帮助机器人更接近其最终、完成后的状态?”他们将机器人的最终状态视为地图上的一个目的地。每当机器人读到一个新句子时,它都会迈出一小步。研究人员测量的是这一步是让机器人向终点线迈进了一步,还是不小心向后退了一步。
他们将这种方法应用于 18 个不同版本的著名 AI 模型家族,通过 154 个不同的检查点(就像机器人大脑在不同时刻的快照)来观察它的学习过程。他们的发现讲述了一个关于机器人的“饮食”如何随着成长而变化的神奇故事。
在最开始的时候,当机器人刚刚开始学习时,最有帮助的句子来自文学和故事。这些是“顶级贡献者”,它们推动着机器人向其最终形态演进。这仿佛是机器人需要先理解人类的故事和情感。然而,随着训练进入中期和后期,情况发生了变化。变得最重要的句子不再是故事,而是来自 STEM 领域(科学、技术、工程和数学)。
研究人员看到了一个清晰的“交叉”。早期,书籍和文学是主角。后期,关于科学和计算机的技术数据接管了聚光灯。这表明机器人并不只是在最后阶段学习“难”的东西;它实际上需要一个特定的学习顺序。它似乎需要先建立人类语言和故事的基础,然后才能从复杂的、技术性的数据中真正获益,从而达到其全部潜力。
作者还检查了他们的方法是否可靠。他们将这种“到终点的距离”测量法与旧的“测试分数”法进行了比较,发现旧方法给出的答案会根据你选择的测试而大相径庭。如果你测试数学,你会认为数学数据在整个过程中都很重要。如果你测试故事,你会认为故事在整个过程中都很重要。然而,他们的新方法展现出了一个一致的模式,在他们测试的所有不同模型中都表现一致,这表明这种从故事到科学的转变是 AI 模型学习过程中一个真实的、根本性的组成部分,而不仅仅是由于测试方式不同而产生的偶然现象。
因此,主要的启示是,训练 AI 不仅仅是喂给它随机混合的数据。它更像是一门课程。论文表明,“最佳”数据取决于 AI 处于训练的哪个阶段。早期,它需要故事;后期,它需要科学。这给了我们一种思考如何构建更好 AI 的新方式:也许我们应该先给它们讲故事,把复杂的数学留到它们准备好接受的时候。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。