← 最新论文
🤖 AI

The Knowing-Saying Gap: When Probes See Errors that Confidence Misses

本文揭示了尽管线性探测能够准确检测语言模型中受损的上下文,但它们无法可靠地预测最终答案的正确性或指导有效的实时干预,因此需要具备模型感知和错误类型感知的路由策略,而非一成不变的监测方案。

原作者: Jyotin Goel, Ipshita Bandyopadhyay, Justin Shenk

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Jyotin Goel, Ipshita Bandyopadhyay, Justin Shenk

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一位魔术师表演卡牌戏法。这位魔术师动作如此流畅、自信且迅速,以至于你从未怀疑过任何事情。但如果,在魔术师的大脑深处,有一个微小的警报正在尖叫:“等等!我刚才换错了牌!”呢?在人工智能的世界里,特别是对于那些能写代码、规划旅行和解决数学问题的超智能聊天机器人(大语言模型)来说,这正是正在发生的事情。这些模型就像那位魔术师:即使在犯下严重错误时,它们也能表现得极度自信。

科学家们长期以来一直希望,如果一个模型感到困惑或出错,它会“结巴”或者说:“对此我不确定。”这个想法被称为“言语化置信度”(verbalized confidence)。这就像是在问魔术师:“你确定那是正确的牌吗?”并希望他们承认自己的错误。但还有另一种检查方法:观察模型的内部“脑电波”(计算机内部的数学信号),看看它是否知道自己搞砸了,即便它并没有说出来。这篇论文研究了一个令人恐惧但又引人入胜的差距:模型在其数字大脑中“知道”什么,与它“说出”什么之间的差异。


无声的警报与自信的谎言

研究人员搭建了一个数字游乐场来测试这一点。他们创建了 1,400 道数学题,要求模型像连锁反应一样逐步解决谜题。例如,“如果我有 5 个苹果,又买了 3 个,然后丢了一半……”诀窍在于,他们秘密地在链条的第一步植入了一个错误。他们想观察两件事:

  1. 警报: 一个特殊的检测器(称为“线性探测器”)能否仅通过观察模型的内部大脑活动,就发现第一步是错误的?
  2. 预测: 同一个检测器能否预测最终答案将会是错误的?

他们测试了五种不同的模型,包括当今最智能的一些模型,如 Llama-3.1-8B 和 Qwen3-4B。

重大发现:知而不言

结果令人震惊。“警报”完美奏效了。当模型出错时,检测器几乎能以 100% 的准确率(具体而言,其中一个模型的 AUROC 得分为 0.997)通过观察模型的内部脑电波发现错误。就好像模型的脑海中正在大喊:“错误!错误!”

但转折在于:模型并没有听从它自己的警报。

尽管内部警报正在鸣响,但模型的最终回答却表现得和正确时一样自信。那个能完美识别错误的检测器,在预测最终答案是否错误时完全失效了。这就像是一个烟雾探测器在烤焦面包时尖叫着“起火啦!”,但消防队(模型最终的回答)仍然赶到现场并表示:“一切正常,这里没火。”

该论文明确排除了以下几种人们可能希望成立的情况:

  • 置信度并非线索: 当他们询问模型的置信度时,模型只是给出了二元的“是”或“否”,没有任何真正的细微差别。一个 99% 确定的模型与一个 50% 确定的模型一样,出错的可能性并不更高。
  • 思考得更深入并不能解决问题: 他们尝试了一种“思考模式”,即强制模型逐步写出其推理过程(思维链,Chain-of-Thought)。你可能会认为这能帮助模型发现自己的错误。然而,这反而让模型变得更难得到正确答案(准确率从 27.9% 降至 1.2%),同时并未改变内部警报仍在鸣响的事实。模型知道自己错了,但仅仅通过谈论它并不能修复问题。

我们能修复它吗?“分支与选择”策略

由于模型不会承认错误,研究人员尝试充当它们的“安全网”。他们构建了一个系统,监听内部警报,并试图在模型完成回答之前修复错误。他们测试了三种干预方式:

  1. 重提示(Reprompt): 仅仅告诉模型:“嘿,检查一下你的工作!”(效果不佳)。
  2. 替换先验(Replace-Prior): 抹除错误的步骤,并强迫模型从头开始尝试。这是一个喜忧参半的结果;它挽救了一些错误的答案,但也意外破坏了一些正确的答案。
  3. 分支与选择(Branch-and-Pick): 这是最终的赢家。当警报响起时,系统不再只是猜测,而是要求模型尝试四种不同的路径(使用不同程度的随机性)。然后,系统利用内部警报来挑选出看起来最“干净”(最不容易被损坏)的那条路径。

这种“分支与选择”的方法是唯一一种能够持续挽救错误答案而不破坏正确答案的方法。在某一个特定模型(Llama-3.1-8B)上,它挽救了 4 个错误答案,且未破坏 0 个正确答案。然而,论文指出,这并不是解决所有问题的万灵丹。成功高度取决于“犯了哪种类型的错误”。例如,修复“单位错误”效果很好,但修复“百分比错误”实际上会让情况变得更糟。

总结

论文得出结论:我们不能依靠模型的言语来判断它是否正确。模型可以在自信地交付错误答案的同时,在内部意识到灾难的发生。“知言差距”(Knowing-Saying Gap)是真实存在且危险的。

解决方案不是要求模型变得更加诚实,而是构建一个“感知模型”的安全系统。我们需要倾听内部警报(探测器),并使用像“分支与选择”这样聪明的策略来捕捉错误。但我们也需要保持谨慎:不存在一种能解决每种错误或适用于每个模型的单一修复方案。未来安全 AI 的核心不在于信任聊天机器人的自信心,而在于构建一个能够识破聊天机器人何时在自欺欺人的护栏。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →