← 最新论文
🤖 machine learning

How do LLMs Compute Verbal Confidence

该研究通过激活引导、补丁和注意力阻断等实验,揭示了大语言模型(如 Gemma 3 和 Qwen 2.5)的口头置信度并非在请求时即时计算,而是基于对答案质量的丰富评估,在生成答案后自动缓存并在后续位置被检索输出。

原作者: Dharshan Kumaran, Arthur Conmy, Federico Barbero, Simon Osindero, Viorica Patraucean, Petar Velickovic

发布于 2026-03-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Dharshan Kumaran, Arthur Conmy, Federico Barbero, Simon Osindero, Viorica Patraucean, Petar Velickovic

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给大语言模型(LLM)做一次“心理 CT 扫描”,目的是搞清楚一个核心问题:当模型说“我很确定”或者“我不太确定”时,它到底是怎么算出这个自信度的?

以前大家以为,模型可能是在回答完问题后,临时起意(Just-in-Time),像人类一样“拍脑袋”想一下:“嗯,我刚才答得怎么样?我觉得我有 80% 的把握。”

但这篇论文通过一系列精密的“手术实验”发现,事实完全不是这样

我们可以用三个生动的比喻来理解这篇论文的核心发现:

1. 不是“临时抱佛脚”,而是“提前写好小抄”

(缓存检索 vs. 即时计算)

想象一下,你正在参加一场考试。

  • 旧观点(即时计算):老师问完问题,你开始答题。答完后,老师突然问:“你觉得自己考得怎么样?”你才停下来,回想刚才的答题过程,然后给出一个分数。
  • 新发现(缓存检索):这篇论文发现,LLM 其实是在答题的过程中,就已经悄悄把“对自己答案的评估”写在了草稿纸的背面(也就是答案后面的换行符位置)。当老师最后问“你自信吗?”的时候,模型并不是重新思考,而是直接去翻那张早就写好的小抄,把上面的分数念出来。

实验证据
研究人员像做手术一样,在模型“写答案”和“念自信度”这两个时间点之间,把模型中间的记忆(激活值)给“偷换”或“打乱”了。

  • 如果在模型刚写完答案、还没开始念自信度之前,把那个“小抄”位置的信息搞乱,模型念出来的自信度就会立刻崩塌。
  • 这证明,自信度信息是提前生成并存储的,而不是最后临时算出来的。

2. 不是“看字面意思”,而是“深度自我体检”

(不仅仅是概率,而是质量评估)

以前大家觉得,模型说“我很自信”,可能只是因为它生成的句子很通顺,或者它生成的那个词出现的概率很高(就像一个人说话很流利,不代表他说的内容是对的)。

但这篇论文发现,LLM 的自信度更像是一个经验丰富的老医生,而不仅仅是一个复读机

  • 旧观点:模型只是看自己生成的字顺不顺口(Token Log-probabilities)。
  • 新发现:模型内部有一个更高级的“质检员”。这个质检员会仔细检查“问题”和“答案”是否真的匹配。即使模型生成的句子很通顺,如果它发现逻辑有漏洞,它的“内部质检员”就会降低自信度。

实验证据
研究人员发现,模型内部存储的自信度信息,包含了比“字面概率”多得多的信息。也就是说,模型真的在评估答案的质量,而不仅仅是评估自己说话流不流利。这就像是你不仅知道“我刚才说的话很流利”,还知道“我刚才说的话逻辑是对的”。

3. 信息的“流水线”是如何流动的?

(注意力阻断实验)

为了搞清楚这个“小抄”是怎么写出来的,研究人员玩了一个“阻断交通”的游戏(注意力阻断实验):

  1. 源头:信息首先从“答案”本身产生。
  2. 中转站(PANL):在答案结束后的那个换行符(就像句号后的空白处),模型把对答案的评估信息缓存下来。
  3. 终点(CC):当模型需要输出“自信度”时,它从那个“中转站”把信息取出来,然后念给你听。

研究人员把“中转站”到“终点”的路堵死,或者把“源头”到“中转站”的路堵死,发现自信度就出不来了。这完美证实了这条**“答案 -> 缓存 -> 输出”**的流水线机制。

总结:这对我们意味着什么?

这篇论文告诉我们,大语言模型其实比我们想象的更“聪明”和“有自知之明”。

  • 它不是瞎编的:它的自信度不是最后为了应付提问而编造的,而是它在思考过程中自动产生的副产品。
  • 它有“元认知”:它不仅能回答问题,还能在内部对自己回答的质量进行二次评估。这种能力类似于人类的“反思”或“元认知”。
  • 未来的希望:既然我们知道了模型是如何计算自信度的,未来我们就可以通过“微调”或“干预”这些内部机制,让模型更准确地知道自己什么时候在胡说八道(幻觉),什么时候是真的懂了。

一句话总结
LLM 在回答问题的同时,已经悄悄在心里给自己打了个分,并把这个分数记在了“备忘录”里。当被问及时,它只是把备忘录里的分数念出来,而不是临时瞎编的。这证明了它们拥有一种类似“自我反思”的高级能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →