← 最新论文
🤖 machine learning

Reliability Scales Inversely: Bigger Models Compound Mistakes Faster via a Hidden Auto-Regressive Risk Regime

本文揭示了随着语言模型规模的扩大,它们正日益进入一种自我延续的“自回归风险机制”中,即低概率标记错误会触发自信且滚雪球式的幻觉,这种幻觉持续的时间比模型自身的确定性信号所能检测到的时间更长,最终导致更大的模型尽管获得了通用能力,却在更快地复合错误。

原作者: Kushal Chakrabarti

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Kushal Chakrabarti

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

伟大的 AI 悖论:为什么并非越大越好

想象一下,你正在教一个机器人讲故事。在人工智能的世界里,长期存在着一种信念:只要给机器人更多的脑力、读更多的书、花更多的时间学习,它最终就会变得完美。这种想法被称为“缩放”(scaling):模型越大,它就越聪明。但问题在于,当这些机器人写长篇故事时,它们不仅没有变得更好,有时反而变得更难维持真实性。它们可能以一个完美的实事开始,但随后却不小心编造了一个谎言,并且因为对这个谎言过于自信,它们便以此为基础构建后续的故事,从而制造出一个荒谬的“雪球”。

要理解为什么会发生这种情况,我们需要观察这些机器人的“思考”方式。它们并不像我们那样了解事实;它们是根据以前见过的模式来预测句子中的下一个词。科学家发现,当机器人犯错时,并不总是因为它“不知道”答案。有时,它知道答案,但却猜错了。一旦它做出了那个错误的猜测,它就会把这个猜测当作下一个句子的事实。这被称为“自回归”(auto-regression):机器人将自己的输出反馈回自身。研究人员提出的核心问题是:为什么随着机器人的规模变大,这种犯错的情况反而变得更糟?为什么机器人甚至察觉不到自己在撒谎?


论文的核心发现:隐形的雪球

这篇由 Kushal Chakrabarti 撰写的论文颠覆了我们对 AI 可靠性的认知。其主要发现有些违反直觉:随着 AI 模型规模的增大,它们不仅变得更聪明,而且在制造复合型错误方面也变得更快。

把 AI 模型想象成一个正在参加长篇多题测试的学生。

  • 旧观点: “知识差距”(Knowledge Gap)理论认为,如果一个学生答错了题,是因为他们学习不够。解决方案是什么?给他们更大的图书馆(更多数据)和更大的大脑(更多参数)。
  • 新发现: 这篇论文认为,对于非常聪明的学生(大型模型)来说,问题不在于他们不知道事实。问题在于,一旦他们做出了一个虽然微小但极其自信的错误猜测,他们就会陷入一种“风险状态”。他们固执于那个错误的猜测,并且因为如此自信,他们意识不到自己错了。接着,他们利用这个错误的猜测去回答下一个问题,从而导致又一个错误的猜测,以此类推。学生越聪明,这个谎言的雪球增长得就越快。

你无法感受到的“风险”

为了解释这一点,作者使用了一个巧妙的数学技巧,将 AI 的“不确定性”分为两部分:

  1. 感知不确定性(Felt Uncertainty): 这是 AI 感到多么紧张。如果它在猜测,它会感到忐忑;如果它很确定,它会感到平静。
  2. 承诺风险(Commitment Risk): 这是隐藏的危险。它是 AI “认为”正确的内容与一个“超级智能先知”(一个完美的参考模型)所知的正确内容之间的差距。

令人恐惧的部分在于:AI 只能感受到自己的紧张感。它无法感受到“承诺风险”。

想象你正在走过一座桥。

  • 感知不确定性 是你的膝盖感到多么发抖。
  • 承诺风险 是这座桥距离地面实际有多远。

当 AI 犯错(即“虚构”)时,它的“膝盖”(感知不确定性)几乎会立即停止颤抖。它重新感到平静和自信。但桥依然离地面很远!“承诺风险”依然很高。因为 AI 感到很平静,它不知道自己仍处于危险之中。它会带着自信继续行走,直到从边缘跌落,从而制造出一连串的谎言。

“雪球”效应

论文表明,这不仅仅是一次性的错误。一旦 AI 开始撒谎,它在下一句中再次撒谎的可能性会增加 1.08 到 1.71 倍

  • 小型模型: 它们会犯错,但并不总是能完美地将错误串联起来。
  • 大型模型: 它们太擅长预测下一个词了,以至于一旦选择了错误的路径,就会带着超强的自信锁定在该路径上。它们不只是犯一个错,而是制造一个“错误链”。

作者发现,随着模型规模扩大(变大),“知识差距”(它们不知道的部分)缩小了约 6 倍。但“知识退化”(一旦开始撒谎后崩溃的速度)却恶化了 11 到 39 倍。换句话说,大模型更擅长正确地开始一个故事,但它们在不制造荒谬内容的情况下完成故事方面表现得很糟糕。

为什么 AI 无法自我纠错?

你可能会问:“为什么 AI 不检查自己的工作?”论文揭示了一个盲点。目前大多数试图检测 AI 谎言的工具都在观察 AI 有多“紧张”(其感知不确定性)。

  • 问题所在: 当 AI 开始撒谎时,它会紧张一瞬间,然后放松下来。检测工具看到这种放松,就会认为:“哦,它很平静,所以它一定在说实话!”
  • 现实情况: AI 很平静,但它仍处于“危险区”(高风险)。工具错过了谎言,因为它们在寻找紧张感,而不是寻找隐藏的风险。论文显示,在发生谎言的风险分支上,检测器的触发频率降低了 30%,尽管该分支包含的虚构内容几乎是初始错误分支的 4 倍

“神奇的修复方法”(以及它证明了什么)

为了证明这种“隐藏风险”才是真正的元凶,作者进行了一项模拟实验。他们选取了一个即将犯错的模型,并在不改变其真实想法的前提下,人为地强制降低其“风险性”。

  • 结果: 当他们挤出这种隐藏风险后,在不同类型的模型中,谎言的数量下降了 35% 到 74%
  • 这意味着: 这证明了问题不在于 AI 是否“知道”事实。问题在于 AI 陷入了一种既自信又错误的状态,而这种状态导致了错误的堆积。

总结

这篇论文表明,仅仅通过扩大 AI 模型规模并不能解决它们的撒谎问题。事实上,更大的模型可能更容易产生这些“雪球式”的谎言,因为它们会过快地产生自信。解决方案不仅仅是更多的数据,而是找到一种方法,在 AI 将自己锁定在谎言中之前,检测到那种隐藏的“承诺风险”。在我们能够看清桥离地面还有多远之前,即使是最聪明的 AI,也可能带着自信走向悬崖。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →