核心问题:过度自信的 AI
想象一下,你向一位非常聪明但有点自负的朋友寻求建议。无论是在做出的判断还是在瞎猜时,他们都会以 100% 的确定性来回答每一个问题。
- 问题所在: 大语言模型(LLMs)就像这位朋友。即使在出错时,它们也经常说:“我有 99% 的把握这是正确答案。”这被称为校准度差(poorly calibrated)。
- 为什么这很重要: 如果你正在开发自动驾驶汽车或医疗诊断工具,你需要知道 AI 何时是在瞎猜,以便你能介入。如果 AI 对其自信度撒谎,你可能会在不该信任它的时候信任它。
旧有的信任衡量方式(以及它为何失效)
科学家过去使用一种叫做 ECE(期望校准误差)的指标来衡量信任。你可以把 ECE 理解为一个“测谎仪”,它只检查 AI 的自信度在平均意义上是否与其准确率相匹配。
论文指出旧测试存在两个主要缺陷:
- “赌徒”缺陷: 想象一位天气预报员,每天都说“有 50% 的降水概率”。如果一年中确实有一半时间在下雨,那么根据旧的数学逻辑,这位预报员是完美“校准”的,尽管他提供的有用信息为零。他并没有告诉你什么时候该带伞。
- “风险盲目”缺陷: 旧的测试并不关心错误的严重程度。
- 场景 A: 你问:“法国的首都是哪里?”(低风险)。
- 场景 B: 你问:“我应该把毕生积蓄投入这支股票吗?”(高风险)。
旧的测试对这两者一视同仁。但在场景 B 中,你需要 AI 在值得信任之前表现得极其确定。旧指标无法区分什么是“好的猜测”,什么是“安全的赌注”。
新方案:“euro”指标
作者创建了一种新的衡量信任的方法,称为 euro(由先知重新归一化的期望效用)。
- 类比: 把“先知(Oracle)”想象成一个知道绝对真理的神奇存在。
- 运作方式: euro 指标不仅仅是问“你对吗?”,它还会问:“你的自信度为决策带来了多少价值?”
- 如果 AI 说“我有 90% 的把握”且它是正确的,这很好。
- 如果 AI 说“我有 90% 的把握”但它是错误的,这很糟糕。
- 至关重要的一点是: 如果 AI 说“我只有 40% 的把握”(低自信度),而你决定不信任它,结果证明它是错的,euro 指标会因为 AI “懂得保持沉默”而给予它信用!
- 结果: 该指标奖励那些知道何时“闭嘴”的 AI,尤其是在高风险情况下。它平衡了“校准度”(诚实表达自信度)与“实用性”(帮助你做出好的决策)。
新工具:“acute”协议
了解如何衡量信任是一回事;而真正修复 AI 的自信度则是另一回事。作者提出了一种名为 acute(基于激活的置信度、效用和信任评估)的方法。
- 类比: 想象 AI 是一个正在说话的人。
- 旧方法: 你只听他们说了什么(最终输出)。
- acute 方法: 你把听诊器放在他们的胸口,倾听他们的“心跳”(在计算机芯片思考时,内部产生的电信号,即“激活”)。
- 运作方式:
- 当 AI 生成答案时,它会经过许多层“大脑”。
- acute 协议会观察这些层在最终答案被说出来之前的电活动。
- 它使用一个简单、快速的计算机程序(随机森林分类器)来观察这些内部信号,并预测:“这个答案将会是正确的还是错误的?”
- 然后,它根据这个预测来调整 AI 的自信度得分。
为什么 “acute” 很特别?
- 速度快: 它不需要运行第二个庞大的 AI 来检查工作。它只是读取已经在工作的 AI 的内部信号。这就像是检查汽车的发动机故障灯,而不是把车拆开交给机械师进行全面检修。
- 样本效率高: 它能非常快速地学会识别谎言,只需要极少的例子就能做得很好。
- 适用性广: 作者在以下场景测试了它:
- 多项选择题: (类似于百科知识竞赛)。
- 工具调用: (要求 AI 使用计算器或搜索网页)。
- 科学论文摘要: (阅读复杂的文本并做出简短总结)。
实验结果
当他们在 6 个不同的 AI 模型上测试 acute 时:
- 更好的信任感: AI 变得更擅长知道何时说“我不知道”或“我不确定”。
- 更高的效用: euro 分数上升,意味着 AI 对于决策更有帮助,尤其是在高风险场景下。
- 低误差: 它保持了较低的“校准误差”,这意味着它不仅仅是在瞎猜,而是真的在对其自信度进行诚实的表达。
总结
这篇论文认为,我们不能仅仅因为 AI 听起来很自信就去信任它。我们需要一种更好的方法来衡量这种自信是否真实。
- 他们发明了一个新的尺子 (euro),它根据 AI 对决策的有用程度来衡量信任,而不仅仅是看平均而言是否正确。
- 他们构建了一个新工具 (acute),通过倾听 AI 内部的“心跳”来修复其置信度水平,使其成为人类更诚实、更可靠的伙伴。
技术摘要:The acute Protocol
1. 问题陈述
随着大语言模型(LLMs)越来越多地被部署于信息检索、写作和智能体工具调用等关键任务中,判断何时可以信任模型输出的能力变得至关重要。虽然置信度估计器已被用于判定这种信任,但标准的指标如期望校准误差(ECE)及其平滑变体(smECE)在决策场景中仍显不足。
本文指出了当前校准指标存在的两个主要缺陷:
- 与无信息估计器的不可区分性: ECE 和 smECE 无法区分一个完美的先知(知道正确答案)和一个“基率”(baserate)估计器(盲目预测所有输入的正确率基数)。两者都可以实现 E-CE 为 0,但基率估计器对于决策过程并无效用。
- 风险不变性: 这些指标对任务的风险水平具有不变性。一个在低风险任务(仅需 0.5 概率阈值即可)中表现完美但在高风险任务(需要 0.9 概率)中失败的置信度估计器,与一个在低风险任务中失败但在高风险任务中成功的估计器,会获得相同的评分。
此外,现有方法通常依赖于原始 Token 概率,而这些概率已知校准效果较差,或者需要昂贵的后验校准,这可能无法实现高效扩展。
2. 方法论
本文引入了两个核心组件:一种新的评估指标 (euro) 和一种新的置信度估计协议 (acute)。
2.1. 指标:由先知重归一化的期望效用 (euro)
为了解决 ECE 的局限性,作者提出了 euro,该指标平衡了校准度与决策效用。
- 决策框架: 该指标基于最小贝叶斯风险(MBR)决策理论。它根据置信度阈值 τ 定义了四种结果:真阳性(信任正确生成)、假阳性(信任错误生成)、假阴性(对正确生成进行弃权)和真阴性(对错误生成进行弃权)。
- 效用定义: 每种结果都被分配了一个奖励(Rtp,Rtn,Rfp,Rfn)。作者将其重新参数化为两个直观的量:
- Uct:正确信任正确生成的净效用。
- Uca:正确弃权于错误生成的净效用。
- 风险参数化: 阈值 τ 被定义为正确弃权(uca)的归一化净效用,这使得该指标能够明确考虑任务风险水平(低、中、高)。
- 归一化: 置信度估计器的效用相对于先知策略(完美预测)和反先知(Anti-Oracle)策略(完美预测错误)进行归一化。
- 最终得分: 指标总结为 auc-euro,即在所有可能的风险设置(uca∈[0,1])下,归一化效用曲线下的面积。较高的 auc-euro 表示在校准度和效用之间取得了更好的平衡。
2.2. 协议:基于激活值的置信度估计 (acute)
acute 协议利用 LLM 的内部激活来训练轻量级的置信度估计器。
- 输入特征: 除了依赖原始 Token 概率外,acute 还从生成过程中的模型隐藏状态中提取特征。研究探索了三种特征类型:
- 均值池化激活(Mean-pooled Activations): 在特定层(早期、中期、后期)将原始激活在序列上进行压缩。
- 层级余弦相似度(Layer-wise Cosine Similarities): 每层池化激活与最终层之间的余弦相似度。
- PCA 转换激活(PCA Transformed Activations): 应用主成分分析(PCA)于层激活,在保留方差的同时降低维度。
- 分类器: 这些特征被输入到随机森林分类器中,用于预测生成的输出是正确还是错误。
- 效率: 该协议旨在实现计算和样本的高效。与生成时间相比,训练好的随机森林的推理开销微乎其微(例如,每个样本约 0.00007 秒)。
3. 核心贡献
- euro 指标: 一种全新的、具有可解释性的指标,解决了 ECE 无法区分信息丰富型与无信息型估计器的问题,并纳入了特定任务的风险水平。
- acute 协议: 一种通用的、基于激活的置信度估计方法,用于估计置信度、效用和信任度。它利用模型内部信息来创建样本高效且计算轻量级的估计器。
- 实证验证: 在涵盖 4 个家族(包括 Gemma、Qwen、Phi 和 SmolLM)的 6 个 LLM 上,针对三个不同任务进行了广泛实验:
- 多项选择问答(MMLU)。
- 工具调用(APIGen)。
- 科学文献摘要(SCITLDR)。
4. 结果
论文报告了跨模型和任务的平均结果,强调了以下发现:
- 卓越的效用: acute 估计器在 auc-euro 上持续优于强基线(如原始置信度、直方图回归估计器、Nadaraya-Watson 核回归),这表明 acute 提供了更好的决策效用,特别是在基线往往倾向于向基率偏移的高风险设置中。
- 校准维持: 在提高效用的同时,acute 保持了较低的校准误差(smECE),与最佳基线相当或略优。
- 样本效率: 即使在非常小的训练集(例如 25 个样本)下,acute 方法的表现也优于基线,而像 NWKR 这样的基线需要更大的数据集才能达到类似性能。
- 层敏感性: 对层级性能的分析表明,置信度信号在早期层较弱,在中期层线性增加,并在后期层趋于平稳。中层和后层通常能产生最佳的估计器。
- 泛化能力: 该协议很好地泛化到了较大的混合专家模型(MoE,如 Qwen3-30B-A3B),表明该方法具有良好的扩展性。
- 后验校准: 对 acute 输出应用后验校准(Platt 缩放、保序回归)通常可以在不降低 auc-euro 的情况下进一步降低校准误差,尽管其增益取决于具体的模型和任务。
5. 重要性与主张
论文声称,通过配备 acute 协议,可以显著提高 LLM 置信度估计的可靠性,从而增强其在多样化场景下的可信度。通过引入 euro,作者提供了一个更可靠的评估置信度估计器的框架,该框架符合风险感知决策的实际需求。
作者强调,虽然 acute 需要访问模型的内部信息,但这对于模型开发者和部署此类系统的组织来说是一个可行的要求。他们将这项工作定位为迈向更好指标和方法的步骤,旨在解决衡量信任度的能力与模型性能之间的关键差距,并指出其决策论框架是对仔细的数据分析和系统设计的补充,而非替代。这项工作的目标是解决在现实世界应用中安全利用模型性能的能力与模型性能之间的关键缺口。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。