← 最新论文
🤖 machine learning

Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention

本文认为,更大规模的模型在罕见且复杂的任务上表现优于较小模型,并非因为它们缺乏学习这些任务的能力,而是因为其规模的增大减少了梯度干扰,使它们能够在习得常见任务的同时保留用于罕见任务的特征而不至于将其覆盖。

原作者: Jing Huang, Daniel Wurgaft, Rachit Bansal, Laura Ruis, Naomi Saphra, David Alvarez-Melis, Andrew Kyle Lampinen, Christopher Potts, Ekdeep Singh Lubana

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Jing Huang, Daniel Wurgaft, Rachit Bansal, Laura Ruis, Naomi Saphra, David Alvarez-Melis, Andrew Kyle Lampinen, Christopher Potts, Ekdeep Singh Lubana

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《为何更大的模型能学到更多:容量、干扰与罕见任务保留的影响》的解释,采用通俗易懂的语言和富有创意的类比。

核心问题

想象你有两名学生:小不点(一个小型 AI 模型)和巨无霸(一个巨大的 AI 模型)。你给它们同一本教科书(训练数据),并让它们学习直到掌握书中的所有内容。

令人惊讶的是,即使学习了无限长的时间,小不点仍然无法掌握那些罕见且困难的章节,而巨无霸却能精通它们。这是为什么?是因为巨无霸更聪明吗?还是有其他原因?

这篇论文认为,这并非关乎传统意义上的“智力”或“记忆容量”,而是关乎竞争遗忘


核心类比:嘈杂的教室

想象训练数据是一个教室,不同的学生(任务)正在大声喊出数学题。

  • 常见任务:这些学生非常频繁且大声地喊出简单、容易的问题(如"1 + 1")。
  • 罕见任务:这些学生非常稀少且轻声细语地提出复杂、困难的问题(如高等微积分)。

1. “小不点”学生的挣扎(瓶颈)

小不点只有一张很小的书桌和几个神经元(思维槽位)可供使用。

  • 问题:由于“常见”学生喊叫得太频繁,小不点的大脑不断被它们更新。每当一个罕见学生轻声提出一个复杂问题时,小不点试图将其记录下来。
  • 冲突:但在小不点写完这个罕见问题之前,一个“常见”学生又喊了一声。这新的喊声将罕见信息从书桌上挤了下去。
  • 结果:小不点陷入了"学习、遗忘、学习、遗忘"的循环。它永远没有足够的时间来巩固那些罕见且复杂的知识,因为频繁且简单的噪音不断将其覆盖。即使小不点学习一百万年,它也无法学会那些罕见内容,因为它总是被打断。

2. “巨无霸”学生的优势(减少干扰)

巨无霸拥有一座巨大的图书馆和成千上万个思维槽位。

  • 策略:巨无霸如此快速且彻底地学会了“常见”问题,以至于它们变成了自动反应。一旦巨无霸完美掌握了"1 + 1",常见学生的喊声就变得非常微弱。这就像不再打扰巨无霸的背景噪音。
  • 益处:由于常见噪音如此微弱,巨无霸留下了大量安静的思维空间。当一个罕见学生轻声提出复杂问题时,巨无霸可以将其记录下来,妥善保存,并等待下一次轻声细语。
  • 积累:巨无霸不仅仅是一次性学会那个罕见问题;它会随着时间推移积累对该问题的记忆。每次罕见学生轻声细语,巨无霸就会增加一点理解,直到最终掌握这个复杂问题。

关键发现(通俗版)

1. 这不仅仅是关于“更多数据”
通常我们认为,如果小型模型学习更长时间(更多数据),它最终会赶上。但这篇论文说。对于罕见且复杂的任务,存在一个硬性限制。无论小不点看到多少数据,它都会失败,因为它的“书桌”太小,无法在常见噪音将其抹去之前容纳罕见信息。巨无霸之所以成功,不是因为它更频繁地看到数据,而是因为它能够保留罕见数据而不丢失。

2. “干扰”机制
论文将这种现象称为梯度干扰。想象一下拥挤的舞池。

  • 在一个小房间(小不点)里,跳流行歌曲(常见任务)的舞者数量如此之多,以至于他们撞到了并将跳冷门歌曲(罕见任务)的舞者推开。
  • 在一个巨大的大厅(巨无霸)里,空间充足。流行舞者有他们自己的区域,冷门舞者也有他们自己的区域。他们不会互相碰撞。罕见任务能够变得强大,因为它没有被物理上推开。

3. 记忆有助于学习
论文提出了一个令人惊讶的反转:记忆实际上是有益的
要学习一种罕见且复杂的模式,模型首先必须“记住”它看到的少数几个例子。巨无霸更擅长将这些具体记忆保持足够长的时间,以至于最终模型能够看到模式并进行泛化。小不点遗忘具体例子的速度太快,以至于它永远没有机会看到模式。

现实世界的证明

研究人员不仅使用了数学理论,还使用从微小(400 万参数)到巨大(40 亿参数)的真实 AI 模型(称为 OLMo)进行了测试。

  • 他们在训练数据中注入了“伪造”的罕见任务(如特定的数学谜题)。
  • 结果:只有巨大的模型学会了这些谜题。微小的模型失败了,尽管从理论上讲这些谜题是可以学会的。
  • 为什么? 巨大的模型表明它们保持了罕见谜题的“记忆”完好无损,而微小的模型则不断用更常见的语言数据覆盖该记忆。

总结

更大的模型能学到更多,并不是因为它们天生更聪明,而是因为它们拥有足够的空间,让罕见且困难的任务能够在常见且简单任务的噪音中生存下来。小型模型太拥挤了;它们不断遗忘困难的内容,因为容易的内容不断将其挤出。大型模型有足够的空间将困难的内容安全地保留下来,直到它们能够真正学会它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →