The Computational Basis of Confidence in Large Language Models
本文应用统计决策置信度(SDC)的规范性框架,旨在证明多模态语言模型中的答案对数几率(logits)是潜在决策变量的单调读数,而非启发式偏好评分,从而提供了一种能够统一生物智能与人工智能的置信度计算解释。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:大语言模型置信度的计算基础
问题陈述
可靠的置信度——即模型自身答案正确的概率——是大型语言模型(LLM)实现可信部署的前提条件。虽然现有文献已广泛评估了基于预测准确性(预测与正确性的相关程度)和校准度(报告的概率与经验频率的匹配程度)的置信度信号,但一个根本性的问题仍悬而未决:置信度信号本身在计算上代表了什么?
目前的信号(如答案标记概率或言语报告)通常被视为正确性的经验预测因子。然而,目前尚不清楚这些信号仅仅是结合证据的非贝叶斯启发式偏好评分,还是作为**潜在决策变量(latent decision variable)**的单调读出(monotonic readout)。在计算神经科学中,潜在决策变量是证据的一种带有噪声的内部表示,在规范过程模型(normative process model)下,该变量足以计算正确性的后验概率(即统计决策置信度,SDC)。区分启发式评分与规范性读出,对于理解模型置信度的内部机制至关重要。
方法论
作者采用了计算神经科学中的规范模型——**统计决策置信度(SDC)框架,来测试多模态 LLM 中的答案 Logit 是否表现为潜在决策变量的读出。本研究重点考察答案 Logit 差异(LD = )**作为候选读出变量。
为了进行测试,作者在三种不同的决策机制下,评估了 SDC 框架预测的四种定性特征:
- 心理物理函数(Psychometric Function): 选择概率必须随有符号刺激强度的增加而单调增加。
- 有符号证据编码(Signed Evidence Encoding): 有符号 LD 必须随有符号刺激强度单调变化。
- 特定试次置信度(固定强度预测): 在固定的客观刺激强度下,LD 的绝对值($|LD|$)必须能够预测正确性。这用于测试 LD 的试次间波动反映的是内部噪声,而非仅仅是客观难度的变化。
- 折叠 X 型模式(Folded-X Pattern): 随着刺激强度增加,$|LD|$ 在正确试次中应增加,而在错误试次中应减少。这种几何特征产生的原因是:高强度错误仅发生在噪声将潜在决策变量推向决策边界的一侧时。
实验设置:
- 模型: 三个多模态非推理模型(Qwen2.5-VL 7B, Gemma 3 12B, Gemma 4 12B)和一个多模态推理模型(Gemini Flash 3)。
- 任务:
- 感知判别: 三个合成视觉任务(对比度、物体大小、形状分类),其中刺激强度是受控的。为了在确定性模型中诱导试次间的变化,作者通过随机化任务无关的(“干扰”)特征(如空间抖动、点集实现方式)生成了每个强度水平下的多个刺激样本。
- 基于记忆的决策: 一个要求检索世界知识的城市人口比较任务。
- 复杂视觉推理: CLEVR 任务(计数相等、物体存在性),带有参数化高斯模糊。
- 行为验证: 进行了一项弃权任务,要求模型在内部置信度(由 LD 推导)表明正确概率低于 60% 时,不得给出答案。
关键结果
1. 感知任务中的证据编码与潜在变量特征
在三个感知任务中,模型满足了所有四种 SDC 特征:
- 心理物理与有符号编码: 选择概率和有符号 LD 随刺激强度单调变化,证实了模型编码了任务相关的证据。
- 固定强度预测: 即使在客观刺激难度保持不变的情况下,较大的 $|LD||LD|$ 加入到刺激强度模型中,将 AUROC 从 0.864 提升至 0.907)。这证明了 LD 携带了超越客观难度的试次特定决策证据。
- 折叠 X 型模式: 正确性与刺激强度之间的相互作用产生了特征性的折叠 X 几何形状。在正确试次中,$|LD||LD|$ 随之减少。这一现象在 Qwen、Gemma 3 和 Gemma 4 中均有观察到,仅有一个微小的例外(Gemma 3 在对比度任务中表现为平坦而非倒置的误差分支,尽管其在强度内的预测能力依然很强)。
2. 向记忆与推理任务的泛化
- 基于记忆的决策: 在城市人口任务中,由于检索知识的噪声较高,心理物理函数较为平缓。然而,潜在决策变量的特征依然存在:$|LD|$ 在固定的人口证据区间内能预测正确性,且存在折叠-X 型模式(在 Gemma 3 中甚至更明显)。这表明,即使客观刺激轴是模型内部证据的一个带噪声的代理,LD 仍作为潜在决策证据的读出。
- 复杂视觉推理(CLEVR): 在带有高斯模糊的 CLEVR 任务中,由于模糊会消除信息而非偏向特定答案,前两个特征(依赖于有符号证据轴)无法直接应用。然而,第三个特征成立:$|LD|$ 在模糊强度和场景控制之外仍能预测正确性。折叠-X 型模式未被观察到;误差分支是平坦或正向的,而非负向。作者将其归因于缺乏针对复杂推理的已知规范过程模型,导致无法推导出特定的几何预测。
3. 行为后果
在弃权任务中,模型根据 LD 信号选择性地拒绝回答低置信度的答案。
- 模型在 87.7% 的试次中选择了弃权,仅对高置信度的响应做出承诺。
- 在承诺试次中,准确率从基准值的 92.2% 提升至 99.95%。
- 弃权策略追踪 $|LD||LD|$ 的理想化阈值处理。
意义与主张
本文为多模态 LLM 中的置信度提供了一个计算解释,超越了“置信度信号预测正确性”这一经验性观察。
- 潜在决策变量读出: 主要主张是,在可以指定规范过程模型的设定下(简单的感知和基于记忆的任务),答案 Logit 不仅仅是启发式的偏好评分,而是作为潜在决策变量的单调读出。原则上,该变量足以计算当前选择正确的后验概率。
- 统一框架: 本研究确立了统计决策置信度(SDC)作为一个统一的计算框架,用于研究生物智能与人工智能中的置信度。它划定了答案 Logit 作为规范性读出与启发式评分的界限。
- 局限性与边界: 作者谦虚地指出,复杂推理任务(CLEVR)中缺失折叠-X 型模式并不一定意味着 SDC 框架的失效。相反,它凸显了该框架目前的边界:由于缺乏针对复杂推理的明确规范过程模型,无法推导出特定的几何特征。结果表明,虽然 LD 在复杂任务中确实携带关于正确性的试次特定信息,但在开发出适当的过程模型之前,其作为规范性潜在变量的地位仍有待解决。
总之,这项工作证明了对于简单的感知和基于记忆的决策,LLM 中的置信度信号在结构上与生物系统中发现的潜在决策变量是同构的,这为解释模型置信度提供了严谨的基础。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。