← 最新论文
💬 NLP

Information-Theoretic Limits of Reliability and Scaling in Language Models

本文通过建立一个基于任务歧义性和标记间依赖性来定义固有可靠性上限的信息论框架,挑战了仅通过规模化即可实现完美可靠性的假设,从而推导出一个统一的标度律,该定律识别了训练数据与模型容量之间的瓶颈,并解释了诸如检索增强和灾难性遗忘等现象。

原作者: Subhabrata Majumdar

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Subhabrata Majumdar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人讲故事、解数学题或写诗。你可能会认为,只要给机器人更多的脑力(更多的计算机芯片)并喂给它更多的书(更多的数据),它最终就会变得完美无缺。这种想法一直是人工智能快速增长的驱动力。但如果存在一个隐藏的天花板呢?如果有些任务无论机器人变得多么聪明,都注定无法达到 100% 的正确率呢?这篇论文利用信息论这一分支科学探讨了这个问题。把信息论想象成研究信息中包含多少“惊喜”或“不确定性”的学科。如果你问机器人“2+2 等于几?”,这没有任何惊喜;答案永远是 4。但如果你让它“写一首关于忧伤云朵的诗”,就会产生巨大的惊喜,因为没有唯一的标准答案。作者们在问:机器人究竟能解决多少这种“惊喜”,以及它在哪里会撞到墙?

论文指出,流行的观点——即更大的模型最终将在任何任务上实现完美的可靠性——在数学上是错误的。作者表明,每个任务都有一个“可靠性天花板”,这是一个关于模型能达到的最高准确率的硬性限制。这个限制不在于模型的大小,而在于任务本身的性质。对于数学题,天花板就在天际(100% 的准确率是可能的)。对于创意写作,天花板要低得多,因为“正确”的答案取决于主观感受和文化背景,而这些是机器人永远无法真正理解的。论文证明,你无法通过单纯增加规模来突破这个天花板。

此外,作者发现这些模型生成文本的方式——像连锁反应一样逐字生成——会让情况变得更糟。如果模型在早期犯了一个小错误,这个错误可能会滚雪球般扩大,导致剩下的故事或代码彻底失控。他们发现,某些任务(如编程)就像一面坚固的砖墙,其中一块砖松动并不会导致整个结构坍塌。而其他任务(如写诗)则像是一座纸牌屋;开局的一个错误动作就可能导致整个结构的崩塌。

最后,论文为如何扩展这些模型提出了一个新的规则。作者建议,不要只是向问题中投入更多的数据或更多的计算能力,性能受限于哪种资源更稀缺。如果你有很多数据但大脑很小,增加数据并无帮助。如果你有一个巨大的大脑但没有数据,增加脑力也无济于事。你需要完美地平衡两者。这个新规则解释了为什么有些任务随着规模扩大而变好,而另一些任务却遇到了瓶颈,并为何时增加资源是有意义的、何时只是浪费时间提供了一张数学地图。

无形的天花板

想象你在玩一个“猜下一个词”的游戏。有时,这个游戏很简单。如果句子是“太阳从……升起”,下一个词几乎肯定是“东方”。这里没有神秘感。但在其他时候,这变成了一个带有转折的猜谜游戏。如果句子是“猫坐在……上”,下一个词可能是“垫子”、“地毯”、“沙发”或“地板”。所有这些都是正确的,但感觉各不相同。

论文作者将“东方”这种情况称为完全可验证的任务。在这些情况下,比如解数学方程或编写必须无误运行的代码,答案完全由问题决定。不存在隐藏信息。对于这些任务,其“可靠性天花板”是 100%。如果你有一个完美的模型,你就能得到完美的分数。

但接着是不可验证的任务,比如创意写作或给出人生建议。在这里,“正确”的答案取决于模型看不见的东西,比如作者的心情、读者的品味或文化时刻。作者们将这种缺失的信息称为“潜在语境”(latent context)。由于这种语境是隐藏且主观的,再多的数据或计算能力也无法让模型达到 100% 的可靠性。天花板更低,且是永久性的。你无法通过规模化来达到一个取决于意见的任务上的完美。

论文将其分解为两种差距。第一种是可解决的差距。这是指可以被提供的缺失信息。例如,如果一个模型正在写一个关于特定人物的故事,但不知道那个人的名字,这就是一个可解决的差距。如果你把名字提供给模型(通过加入输入内容),差距就会缩小,模型也会变得更好。第二种是主观差距。这是指无法被提供的缺失信息,因为它没有固定的数值。如果任务是写一个“幽默”的笑话,对一个人来说有趣的,对另一个人来说可能很无聊。再多的额外数据也无法解决这个问题。论文证明,对于这些任务,模型将始终存在一个永久性的不可靠底线。

多米诺效应

现在,想象模型正在一块接一块地搭建一座塔。它放第一块,然后是第二块,接着是第三块。这就是大语言模型的工作方式;它们逐个 token 地生成文本。问题在于,如果模型在放置第一块时稍微歪了一点,第二块就必须建立在一个歪斜的基础之上。

作者称之为自回归退化(autoregressive degradation)。这就像玩“传声筒”游戏,信息在每一次耳语中都会发生扭曲。如果模型在句子开头犯了一个微小的错误,这个错误会改变下一个词的语境,进而改变下一个词的语境。错误会不断累积。

然而,并非所有的塔都以同样的方式建造。论文引入了一个概念叫做依赖核(dependency kernel),这是一种描述每个词在多大程度上依赖于前面词汇的高级方式。

  • 带状依赖(砖墙): 想想编程或数学。在一行代码中,下一个词通常取决于紧挨着它的前一个词(比如闭合括号要匹配开括号)。如果你犯了一个错误,它通常会被限制在那个微小的区域内。代码的其他部分仍然可以保持逻辑通顺。这里的“依赖核”很窄,就像一面砖墙。一块砖的松动不会推倒整面墙。
  • 密集依赖(纸牌屋): 想想诗歌或创意写作。在诗中,你开头选择的词可能会决定整首诗的韵律。如果你在开头选错了词,整首诗可能会失去节奏或意义。这里的“依赖核”是密集的,就像一座纸牌屋。第一张牌的失误可能会毁掉整个结构。

论文表明,对于具有密集依赖的任务,模型的性能会随着文本长度的增加而迅速下降。一个早期的错误可能会引发连锁反应,导致全面失败。这解释了为什么模型擅长短小、逻辑性强的任务,但在处理长篇创意任务时表现挣扎。

平衡行为

最后,论文探讨了规模化的核心问题:“如果我们只是把模型做大并给它更多数据,它会变得更好吗?”

答案是:这取决于你缺少哪种资源。

作者推导出了一个新的“缩放法则”(scaling law),看起来像一个简单的数学方程。它指出,模型的性能受限于更稀缺的资源

  • 如果你有海量的数据但模型非常小,增加数据并不会有太大帮助,因为模型太小,无法吸收所有信息。
  • 如果你有一个巨大的模型但数据很少,增加参数也不会有帮助,因为模型没有东西可以学习。

获得最大提升的“甜点位”(sweet spot),是在你平衡这两者的时候。这类似于研究人员已经熟知的“Chinchilla 定律”,但本论文解释了为什么有效,并增加了一个关键细节:max 函数。这意味着你不会因为拥有过多的某样东西而获得额外加分。如果你拥有的数据比模型能处理的还要多 100 倍,那些多余的数据就是无用的。你必须使你的数据与模型大小相匹配。

这对未来意味着什么

这篇论文不仅告诉我们如何构建更好的模型,还告诉我们我们不能做什么。它暗示,认为存在一个在所有领域都完美的“通用人工智能”是一个神话。在某些任务中,天花板是很低的,无论如何增加规模,我们也永远无法达到 100% 的准确率。

它还解释了为什么某些技巧会奏效。例如,检索增强生成(RAG)——即模型在回答之前先从数据库中查找事实——之所以有效,是因为它填补了“可解决的差距”。它为模型提供了达到更高天花板所需的缺失语境。但对于主观任务,即使是 RAG 也无法修复“主观差距”。

论文还警告了灾难性遗忘。当你训练一个模型处理新任务时,它可能会“忘记”旧的任务。作者将其解释为资源的重新分配。模型拥有有限的“脑力预算”。如果你强迫它专注于一个具有完全不同结构(不同的依赖核)的新任务,它必须舍弃旧的结构来腾出空间。这就像学习一门新语言;如果你过度专注于法语,你可能会开始忘记西班牙语的语法规则。

简而言之,这篇论文告诉我们,人工智能并不是一把能解决所有问题的魔杖。它是一个具有特定极限的工具。有些问题可以通过足够的数据和计算能力来解决;而另一些问题在本质上是模糊的。未来的关键不仅仅是“更大”,而是要更“聪明”地思考我们要求模型做的事情,以及如何平衡我们的资源。我们需要停止在不可能实现完美的地方追求完美,并开始设计能够尊重每个任务自然天花板的解决方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →