← 最新论文
🤖 machine learning

A Bitter Lesson for Data Filtering

本文挑战了数据过滤对大模型预训练至关重要的传统观点,通过在计算资源充足但数据稀缺的 regimes 中进行的扩展研究证明,充分训练的大模型实际上受益于纳入低质量和干扰数据,而非将其过滤掉。

原作者: Christopher Mohri, John Duchi, Tatsunori Hashimoto

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Christopher Mohri, John Duchi, Tatsunori Hashimoto

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创意类比对论文《数据过滤的苦涩教训》的解释。

核心思想:“不过滤”原则

想象你正在试图教一位超级聪明的学生(大语言模型)了解世界的一切。传统的方法是扮演一位严格的图书管理员。你会遍历一座巨大的图书馆(互联网/Common Crawl),扔掉那些杂乱、写得糟糕或重复的书籍,只给学生提供收藏中“最好”的 1%。

这篇论文认为,如果你拥有足够的时间和精力(计算能力)来长时间教导这位学生,你实际上应该停止扮演图书管理员。

作者发现,如果你让学生阅读所有内容——好书、坏书、重复的列表以及随机的噪声——他们最终学到的东西会比由你为他们过滤书籍时更好。事实上,对于足够大且训练得当的模型来说,“垃圾”数据实际上是有益的,而非有害的。

实验:“健身房”类比

为了验证这一点,研究人员设计了一系列实验,就像为 AI 模型设立的健身房。

1. “干净”与“杂乱”的饮食
他们取了一大堆互联网文本(“池子”),并创建了它的不同版本:

  • 池子: 原始的、未经过滤的互联网文本。
  • 过滤器: 移除了特定内容的版本,例如非英语文本、重复段落或不常见的英语单词。有些过滤器非常严格(仅保留 2% 的文本),而有些则较为宽松。

他们在这些不同的“饮食”上训练了不同规模的模型(从微小到巨大)。

  • 结果: 对于小模型或短期训练,“干净饮食”(过滤后的数据)效果更好。这就像一个小孩子从图画书学习比从字典学习更好。
  • 转折: 随着他们扩大模型规模并延长训练时间(更多的“计算”),“杂乱饮食”(完整的、未过滤的池子)开始胜出。在完整池子上训练的模型最终超越了在过滤数据上训练的模型,尽管过滤后的数据“质量更高”。

2. “垃圾食品”注入
为了测试这些模型的稳健性,研究人员故意在饮食中加入了“垃圾”:

  • 随机字符串: 编造的单词,如"htb hqovl bwdws"。
  • 打乱的句子: 将真实的句子打乱词序(例如,"Paris France of capital is The")。

令人惊讶的是: 即使混入了这些垃圾,大模型也没有崩溃。它们学会了忽略噪声。在一个奇怪的转折中,在某些情况下,模型从打乱的句子中学到的东西甚至比从干净数据中学到的更好。为什么?因为即使单词被打乱了,模型仍然能看到"Paris"和"France"经常一起出现,从而帮助它学习它们之间的联系。“垃圾”就像一次艰苦的锻炼,让模型变得更强大。

“苦涩的教训”

这篇论文引用了理查德·萨顿(Richard Sutton)提出的一个著名概念,即“苦涩的教训”。这个教训是:当我们扩大规模时,人类的直觉往往会失效。

我们人类会想:“我们必须精心策划数据,因为它太杂乱无章了。”但论文表明,随着我们拥有更强大的计算机,“只喂给它一切”这种简单的方法,会胜过我们精心设计的、用于清理数据的复杂规则。只要给予足够的时间去学习,模型就足够聪明,能够自己分辨出什么是有用的,什么是噪声。

限制条件:这需要巨大的能量

要实现这一目标有一个主要条件:计算能力。

论文计算出,要让“阅读一切”的方法胜过“过滤一切”的方法,你需要海量的计算能力。他们估计,对于完整的 Common Crawl 数据集(240 万亿个单词),你可能需要大约1e+30 FLOPs(计算单位)才能让未过滤的数据成为明确的赢家。

  • 可以这样想: 如果你预算有限,聘请专业编辑来清理数据是明智之举。但如果你拥有十亿美元的预算,你就可以雇佣一百万名实习生去阅读互联网的每一页,这种巨大的阅读量所教会 AI 的东西,是任何编辑都无法企及的。

结论

论文总结道,对于巨型 AI 模型的未来,我们可能需要停止试图成为完美的策展人。我们不应将大量资源浪费在试图过滤掉“坏”数据上,而应专注于构建更大的模型,并在原始、杂乱、未过滤的互联网上进行更长时间的训练。模型的韧性令人惊讶;它们不仅能处理噪声,甚至能利用噪声来更好地学习。

简而言之: 如果你拥有足够的算力,最好的过滤器就是完全不进行过滤

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →