← 最新论文
🤖 machine learning

Internal Data Repetition Destroys Language Models

本文证明了在 Chinchilla 时期的缩放范式中,数据重复会系统性地损害语言模型的性能,因为它会在随模型规模缩放的中间重复次数处产生一个计算等效的损失峰值,这一现象在分析上被解释为记忆与泛化之间的统计权衡。

原作者: Jessica Chudnovsky, Joshua Kazdan, Noam Levi, Rylan Schaeffer, Yegor Denisov-Blanch, Bo He, Mehmet Donmez, Sanmi Koyejo, David Donoho

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Jessica Chudnovsky, Joshua Kazdan, Noam Levi, Rylan Schaeffer, Yegor Denisov-Blanch, Bo He, Mehmet Donmez, Sanmi Koyejo, David Donoho

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一名学生(语言模型)如何写论文,方法是给他们一个庞大的图书库来阅读。目标是在有限的学习时间(计算能力)内,让他们变得尽可能聪明。

这篇论文研究了当这个图书库并不完美、包含了重复书籍时,会发生什么。具体来说,它在探讨:如果我们把同一本书给学生两次,或者给他们 100 次,会有区别吗?

以下是他们利用简单的类比得出的研究结果:

1. 问题所在:“回声壁”效应

在过去,研究人员认为只要从训练数据中删除完全重复的内容,就是安全的。但实际上,即使是“干净”的数据也存在重复。

研究人员发现,重复不仅仅是让学习速度变慢;它还会以一种非常特定且反直觉的方式,主动破坏模型的性能。这并不是一条“重复越多 = 结果越差”的直线。相反,这是一个陷阱。

2. “金发姑娘”陷阱(最坏的情况)

最令人惊讶的发现是,伤害并非由重复极少量数据一百万次引起,也不是由重复一大块数据仅仅两次引起的。

类比: 想象一名学生正在为考试学习。

  • 场景 A: 他们读了 1,000 本独特的书各一次。(结果很好)。
  • 场景 B: 他们读了 1,000 本独特的书,但同时也把其中一本特定的书重读了 10,000 次。(学生完美记住了那本书,但未能理解通用概念。结果很差)。
  • 场景 C(陷阱): 他们读了 1,000 本独特的书,但同时也把一堆中等规模的 50 本书各重读了 100 次。

论文发现,场景 C 是最糟糕的。这就像学生陷入了一个循环,他们如此彻底地背诵了这堆中等规模的书籍,以至于他们停止学习图书馆中的任何新知识。他们对重复数据产生了“过度专业化”,而对独特数据产生了“专业化不足”。

  • 重复过少: 学生会忽略重复内容,正常学习。
  • 重复过多: 学生会极其努力地背诵重复内容,从而有效地“屏蔽”了其他数据,但海量的独特数据仍然会有所帮助。
  • 重复量恰到好处: 学生会感到困惑。他们花了太多时间去背诵重复内容,但花在独特数据上的时间又不足以学习通用规则。这种“中间地带”会导致智能度的最大跌幅。

3. “规模决定论”

研究人员发现,这个“危险区”的大小取决于学生(AI 模型)的大小。

  • 小型模型在重复一小堆书很多次时会受到伤害。
  • 大型模型在重复更大规模的一堆书但次数较少时会受到伤害。

这就像海绵一样。小海绵(小型模型)如果被反复浇上一点点泥浆就会被堵塞。大海绵(大型模型)可以处理一点泥浆,但如果你用一大桶泥浆适度地浇在上面,它会立刻被堵塞。

4. 代价:浪费金钱和能源

论文将这种“变笨”转化为金钱和能源。他们发现,如果你掉入了这个“最坏情况”的重复陷阱,你相当于浪费了 33% 的计算预算

类比: 想象你支付了 100 小时的学习时间。因为错误的重复结构,学生实际学到的知识仅相当于 67 小时的学习量。你白白浪费了 33 小时的电费和资金。

5. 为什么会发生这种情况?(简单的数学)

你可能认为这是由于 AI 大脑(Transformer)复杂的运作机制导致的奇特现象。但作者证明了这实际上是一个基本的统计学问题。

他们构建了一个简单的数学模型(类似于基础的线性回归),这个模型甚至没有使用 AI。当他们向这个简单的数学模型输入重复数据时,它也显示出了完全相同的关于性能下降的“金发姑娘”峰值。

教训: 这不是 AI 那些花哨的注意力机制(attention mechanisms)中的漏洞;这是一个基本的统计学规律。当你拥有重复数据和独特数据混合时,存在一个特定的平衡点,模型会在“背诵副本”和“学习通用规则”之间产生混乱,而这种混乱造成的伤害最大。

总结

  • 重复是有害的, 但其方式并非如你所想。
  • 最严重的伤害 发生在重复中等规模的数据块且重复适度次数的情况下。
  • 更大的模型 在重复更大规模的数据块时更容易受到影响。
  • 代价 是巨大的:仅仅因为错误的重复结构,你就可能浪费三分之一的计算能力。
  • 起因 是在背诵重复内容与学习通用模式之间的一个基本统计学权衡,而非复杂的 AI 失效。

论文得出结论:仅仅删除重复项是不够的;我们需要理解剩余的重复数据是如何构成的,以避免浪费大量的资源。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →