← 最新论文
📊 statistics

Deriving Neural Scaling Laws from the statistics of natural language

本文提出了首个通过从第一性原理出发,基于自然语言中成对标记相关性的衰减和下一标记条件熵的衰减,推导出一种仅基于此的无参数公式,从而定量预测大规模语言模型在数据受限情况下的神经缩放指数的理论。

原作者: Francesco Cagnetta, Allan Raventós, Surya Ganguli, Matthieu Wyart

发布于 2026-07-07✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Francesco Cagnetta, Allan Raventós, Surya Ganguli, Matthieu Wyart

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人学习一门新语言。你拥有一个庞大的书籍库(数据),但你不知道机器人需要阅读多少本书才能达到流利水平,也不知道随着你向图书馆中添加更多书籍,它的表现会如何提升。

长期以来,科学家们注意到一个模式:随着你给机器人的数据越来越多,它的错误率会以一种可预测的方式下降,就像滑梯一样。这被称为“缩放法则”(scaling law)。但直到现在,还没有人能解释为什么会发生这种情况,或者仅仅通过观察语言本身就能预测出那个滑梯的具体形状。

这篇论文提供了第一个能够做到这一点的理论。它声称,语言模型的学习速度是由语言本身的两个简单的、隐藏的统计特性决定的,而不是由特定的计算机架构或投入的资金多少决定的。

以下是使用简单类比进行的详细解读:

1. 语言的两条隐藏规则

作者认为,每种语言都有两种决定其学习难度的“性格特征”:

  • “记忆跨度”规则(相关性): 在一个句子中,单词之间的依赖关系可以追溯到多远?
    • 类比: 想象一个“传声筒”游戏。在某些语言中,如果你在队伍开头低声说了一个词,它可能会改变队尾的词。而在另一些语言中,这种联系会迅速消退。论文测量了这种联系随着词距增加而消退的速度。
  • “惊喜度”规则(熵): 下一个词的可预测性有多高?
    • 类比: 如果你在读一个句子并看到“猫坐在……”,你不会对下一个词感到非常惊讶(很可能是“垫子上”)。但如果语言非常复杂,下一个词可能是任何东西。论文测量了随着你阅读的句子越来越长,剩余的“惊喜”(或不确定性)是多少。

2. 学习机制:“解锁”过去

论文指出,学习一门语言不仅仅是记住更多的单词;它是关于解锁更长的记忆

  • 类比: 把训练数据(书籍的数量)看作一把钥匙。
    • 当只有一小堆书(少量数据点)时,机器人只能“听到”句子中最后的几个词。这就像是在试图理解一个故事,却只能听到最后 5 个词。
    • 随着你添加更多的书(更多数据),机器人获得“听得更远”的能力。它现在可以将“猫”这个词与“坐”这个词联系起来,即使中间隔了 10 个词。
    • 该理论认为,机器人是通过扩展其聆听范围来学习的。它并不一定是在处理已听到的单词方面变得更“聪明”;它只是获得了听到更多过去信息的能力。

3. 魔法公式

作者推导出了一个简单的公式,可以预测机器人的错误率随数据增加而下降的速度。

  • 公式: 学习速度 = (“惊喜度”下降的速度)除以(2 × “连接”下降的速度)。
  • 为什么重要: 你不需要为了发现这一点而去训练机器人。你只需要使用数学方法,在文本本身上测量这两个“语言性格特征”(记忆跨度和惊喜度)即可。一旦你有了这两个数字,公式就会告诉你机器人的性能将如何缩放。

4. “坍缩”实验

为了证明这一点,研究人员玩了一个聪明的把戏。他们采用了不同类型的语言模型(如 GPT-2 和 LLaMA),并在两种截然不同的数据集上进行训练:

  1. TinyStories: 为儿童编写的简单、虚构的故事。
  2. WikiText: 复杂的、现实世界的百科全书文章。

他们测量了每个数据集的两种语言特征。然后,他们绘制了学习曲线。

  • 结果: 当他们使用该公式调整坐标轴(根据语言的特征进行缩放)时,所有不同模型和不同数据集大小的曲线都坍缩到了同一条完美的直线上

这就像是他们拿着一堆乱七八糟的不同颜色的线,通过使用正确的尺子,展示了它们实际上都是同一根线,只是被拉伸得长短不同而已。

总结

该论文声称,AI 学习语言的“魔法”并非真正的魔法。它是语言本身统计结构的直接反映。

  • 如果一种语言具有长程连接(单词在很远的地方仍相互依赖),那么模型就需要大量的数据来学习它。
  • 如果一种语言非常容易预测,模型就能快速学会它。

作者提供了一个“解码环”,让我们能够观察一种语言,测量其两个基本的统计属性,并从数学上精确预测 AI 需要多少数据才能掌握它,而无需事先进行任何昂贵的训练实验。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →