← 最新论文
💬 NLP

Beyond Exponential Decay: Rethinking Error Accumulation in Large Language Models

本文挑战了大型语言模型中普遍存在的指数级可靠性衰减假设,通过证明错误集中于稀疏的“关键令牌”,提出了一种新框架,该框架优先在关键决策点实施战略性保留与动态计算,从而在不进行比例扩展的情况下实现持续的长上下文连贯性。

原作者: Mikhail L. Arbuzov, Sisong Bei, Ziwei Dong, Dmitri Kalaev, Alexey A. Shvets

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Mikhail L. Arbuzov, Sisong Bei, Ziwei Dong, Dmitri Kalaev, Alexey A. Shvets

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《超越指数衰减》的通俗解释,辅以日常类比。

旧故事:“断裂链条”理论

长期以来,专家们认为大型语言模型(LLM)在生成长文本时注定会失败。其逻辑简单而令人担忧:

想象你用回形针搭建一条链条。如果任何一个回形针都有微小的断裂几率(比如 1%),那么随着你不断增加回形针,整条链条就会变得越来越脆弱。当你拥有 100 个回形针时,链条几乎肯定会断裂。

在人工智能领域,这意味着如果模型在一个词上犯了小错,这个错误就会累积,导致下一个词更可能出错,再下一个词错得更离谱。该理论预测,长故事或文章最终会沦为胡言乱语,因为错误会呈指数级倍增。

新发现:这不是链条,而是一次公路旅行

这篇论文指出,“断裂链条”理论是错误的。作者认为,大型语言模型并非均匀地失败,而是以一种非常具体、有结构的方式失败。他们提出了一个基于三个核心观点的新模型:

1. 并非所有词语都同等重要(“方向盘”类比)

旧理论假设句子中的每个词都同等重要。作者认为这是错误的。

  • 现实情况:在长文本中,只有一小部分词(约 5% 到 10%)是“关键”的。这些是关键令牌(Key Tokens)。它们就像汽车的方向盘、交通信号灯,或是公路旅行中的主要十字路口。如果你搞砸了这些,就会偏离道路。
  • 其余部分:另外 90% 的词只是“填充物”或“风景”。它们就像路过的树木或道路的颜色。它们遵循局部规则(语法、常用短语),而且随着上下文的增加,实际上更容易被预测。
  • 结果:你不需要一辆完美的车就能行驶 1000 英里;你只需要确保在几个关键的十字路口不撞车即可。模型随着行程推进,预测“风景”类词语的能力会增强,因此这些词的出错率降至接近零。

2. 模型生活在“语义社区”中(“商场”类比)

论文指出,模型的内部大脑(其“嵌入”)并非一个平坦、混乱的空间。它像一座拥有不同低维“社区”的巨大购物中心那样组织有序。

  • 现实情况:一旦模型决定谈论“烹饪”,它就进入了“烹饪社区”。即使它犯了一个小失误(比如把“盐”说成“糖”),它仍然在“烹饪社区”内。它并没有离开这栋大楼。
  • 危险:模型真正失败的唯一时刻,是当它犯了一个“关键令牌”错误,将其踢出“烹饪社区”并送入“修车”社区时。
  • 结果:小错误不会破坏整个故事,因为模型仍停留在正确的“社区”内。这就像在商场里行走;如果你在某个过道走错了方向,你仍然可以找到回到主厅的路。你不会从世界的边缘掉下去。

3. 错误是随机的,而非系统性的(“猜谜游戏”类比)

当模型确实在关键单词上犯下大错时,这通常是一个独特的、随机的意外,而非一致的缺陷。

  • 现实情况:如果你让模型解决 10 次数学问题,它可能 8 次给出正确答案。那 2 次出错时,失败的方式也各不相同(一次加错了,另一次减错了)。
  • 修正:因为错误是随机且分散的,如果你采取“多数投票”(让它回答 10 次并选择最常见的答案),随机错误会相互抵消,正确答案会脱颖而出。
  • 结果:这就是为什么像“自洽性”(让模型重新思考)这样的技术如此有效。它们并不是在修复一个坏掉的引擎,而只是在过滤掉随机噪声。

全局视角:新公式

作者将这些观点结合,提出了一个关于模型可靠性的新公式。

  • 旧公式:可靠性 = (1 - 错误率) ^ (总词数)。这预测了急剧的衰退。
  • 新公式:可靠性 = (1 - 关键词错误率) ^ (关键词数量) × (1 - 普通词微小错误率) ^ (其余词数)。

由于“关键词”(关键令牌)的数量增长并不像文本总长度那样快(甚至在达到某一点后可能停止增长),模型不会崩溃。它保持可靠。

这对当前技术的意义

这篇论文解释了最近的“奇迹”技术并非魔法;它们只是这种结构的自然结果:

  • 压缩:我们可以丢弃 99% 的文本,只保留“关键词”(方向盘),而不会丢失含义。
  • 长上下文:模型能够处理海量文本,因为它们只需要密切关注少数关键的决策点,而不需要关注每一个单词。
  • 自我修正:当模型修正自己的错误时,是因为它们停留在正确的“社区”内,仅仅是在纠正一个随机的失误。

总结

悲观的观点说:“如果你犯了一个错误,整篇长文本就毁了。”
这篇论文说:“不。你只会犯几个关键错误。文本的其余部分很容易预测,模型会保持在正确的道路上。只要你在少数几个‘方向盘’时刻做对,整个旅程就是安全的。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →