← 最新论文
💻 computer science

The Limits of Training Data Size in Foundation Models: An Empirical Analysis of Quality Filtering under a Fixed Token Pool

通过在固定的 2400 万 token 池上进行的实证实验,本文表明,在固定计算预算下,激进的质量过滤往往会因迫使过度的数据重复而损害模型性能,而保留低质量数据并对高质量子集进行过采样,则能在各种目标任务中产生更优或同等的实验结果。

原作者: Alexander Memming

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexander Memming

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人说人类语言。为了做到这一点,你需要给它喂食海量的文本库——书籍、网站、文章等等。长期以来,科学家们认为唯一重要的就是你能喂给机器人多少文本。库越大,机器人就会变得越聪明。这个想法被称为“缩放”(scaling),这也是为什么我们今天的 AI 助手如此出色的原因。

但这里有一个陷阱。并非所有的文本都是平等的。有些页面充满了胡言乱语、垃圾信息或乱码,而有些则是由专家撰写的,充满了有用的信息。因此,研究人员开始询问:“我们是否应该扔掉那些糟糕的内容,只把最好的书喂给机器人?”这就是所谓的“质量过滤”(quality filtering)。然而,这个游戏里还有第二条规则:如果机器人能看到新鲜的信息,它学得最好。如果你让它一遍又一遍地阅读同样的几页内容,它就会停止学习,转而开始死记硬背。这篇论文探讨了一个微妙的平衡:如果你扔掉了糟糕的文本,你拥有的页面就会变少,这意味着机器人必须更多次地阅读那些好的页面。拥有更少、更好的页面是有帮助,还是会让机器人在反复阅读同样的东西时感到厌烦并陷入混乱?


大图书馆实验

在这项研究中,一位名叫 Alexander Memming 的研究人员设计了一个巧妙的实验来解决这个谜题。他没有使用整个互联网(因为规模太大,难以测试),而是构建了一个约 2400 万词的“固定池”——这是网络的一个微小且易于管理的切片。然后,他将这组相同的词库给了几个小型 AI 模型,但为每个模型制定的规则各不相同。

对于某些模型,他保留了所有的词。对于另一些模型,他扮演了一个严格的图书管理员的角色,扔掉了底部的二分之一、四分之一、八分之一,甚至仅仅是顶部的十六分之一的词,只保留计算机认为“高质量”的部分。他还尝试了第三种方法:不是扔掉任何东西,而是保留整个图书馆,但告诉机器人要比阅读“普通”页面更多次地阅读“最好”的页面。

然后,他在三种不同的任务上测试了这些机器人:

  1. 原始网络(The Raw Web): 一种混合了各种内容的组合,就像他们训练时使用的图书馆一样。
  2. “教育类”文本(The "Edu" Text): 高质量的、具有教育意义的页面(即机器人被训练去喜爱的类型)。
  3. WikiText: 一套完全不同的百科全书文章,机器人从未见过。

令人惊讶的发现

结果有点像过山车,并且在三个大方面改变了游戏规则。

1. 取决于你在和谁说话
最大的惊喜在于,“质量过滤”并不总是能让机器人变得更聪明。这完全取决于你想让机器人做什么。

  • 如果你想让机器人理解混乱的真实互联网: 扔掉“糟糕”的文本实际上会损害机器人的表现。研究人员过滤得越多,机器人的表现就越差。这就像试图通过只在完美的、空旷的赛道上练习来学习如何在城市驾驶。当你最终面对充满坑洼和交通流量的真实街道时,你会撞车。在过滤后的数据上训练的机器人无法应对混乱的现实网络。
  • 如果你想让机器人成为高质量话题的专家: 过滤会有一定的帮助。如果目标是听起来像学者或百科全书,那么只保留最好的页面会让机器人的表现略微提升。

2. 训练得越多,就应该过滤得越少
这是最重要的教训:你的预算大小决定了最佳策略。
想象一下你有一笔小额零花钱(较小的训练预算)。你可能会想只买最昂贵、最高质量的玩具。但如果你有一笔巨额零花钱(巨大的预算),只买昂贵的玩具意味着你会非常快地用完所有“新”玩具。你会反复玩同一个昂贵的玩具,直到感到厌烦。
研究发现,随着训练预算的增长,其“最佳”策略也会发生转变。起初,仅保留前 1/16 的数据看起来还可以。但随着机器人训练时间变长(阅读数据的次数从 4.1 次增加到 8.2 次),那个经过精简的微小图书馆就变成了一场灾难。机器人变得厌烦,并开始犯错。对于大预算而言,最好的策略实际上是保留更多的数据,即使是那些混乱的部分,这样机器人才能不断看到新鲜的事物。

3. 不要扔掉它,只需多读它
研究人员还比较了“扔掉”糟糕文本与“更多次阅读好文本”的区别。

  • “扔掉”法: 你删除了低质量的页面。
  • “多读”法: 你保留了所有页面,但告诉机器人:“嘿,把这些顶尖页面读 16 遍,但只读底部的页面 1 遍。”

当研究人员进行非常激进的操作(仅保留前 1/16)时,“多读”法以巨大的优势胜出。它比“扔掉”法高出了多达 0.39 nats(衡量机器人预测下一个词好坏的单位)。
可以这样理解:如果你有一首最喜欢的歌,你可以选择删除播放列表中所有的其他歌曲并听这首歌 16 遍(扔掉法),或者你可以保留你的整个播放列表,但确保这首最喜欢的歌比其他歌多播放 16 次(多读法)。第二种方法更好,因为背景中仍有其他歌曲来保持趣味性,而且你不会失去完整库所带来的独特多样性。

核心结论

这篇论文并不是说我们要停止尝试让 AI 变得更聪明。相反,它警告我们,不能盲目地扔掉“糟糕”的数据。

  • 如果你想理解真实世界,就不要过滤: 如果你想要一个能理解混乱互联网的 AI,请保留那些混乱的数据。
  • 如果你有大预算,就不要过度过滤: 如果你有大量的计算能力,你就需要海量多样化的数据。如果你过滤得过于严格,就会迫使 AI 重复自身,从而停止学习。
  • 重复优于删除: 如果你真的想专注于最好的数据,不要删除其余部分。只需确保 AI 看到好东西的频率比看到坏东西的频率更高即可。

这项研究是在小型模型和小规模数据切片上进行的,所以我们不能确定未来巨大的 AI 模型究竟会发生什么。但教训是明确的:将数据质量和数据数量视为相互独立的东西是一个错误。它们是相互关联的,而且训练 AI 的最佳方式会随着你拥有的时间和金钱的变化而变化。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →