← 最新论文
💻 computer science

Quantile Adaptive Temperature Scaling for Confidence Calibration

本文引入了分位数自适应温度缩放(Quantile Adaptive Temperature Scaling, QaTS),这是一种后验校准方法,通过根据预测置信度分位数动态调整温度,以有效解决异质性失校准问题,并在多种场景下超越现有的最先进技术。

原作者: Omprakash Chakraborty, Leo Fillioux, Ismail Ben Ayed, Jose Dolz

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Omprakash Chakraborty, Leo Fillioux, Ismail Ben Ayed, Jose Dolz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

问题所在:过度自信的学生

想象一下,深度学习模型(即人工智能)就像一个正在参加考试的聪明学生。这个学生很擅长拿到正确答案,但他们有一个坏习惯:他们总是过度自信。

即使在瞎猜的时候,他们也会说:“我有 99% 的把握这是正确答案!”但实际上,他们经常出错。在现实世界中(例如医疗保健或自动驾驶汽车),这是非常危险的。如果医生的 AI 说:“我有 99% 的把握这是一个肿瘤,”但实际上它只是一个无害的痣,那么患者可能会接受不必要的切除手术。

我们需要一种方法来教导 AI:当它在瞎猜时,要学会说“我只有 60% 的把握”;而当它确实很有信心时,要说“我有 95% 的把握”。这个过程被称为校准(Calibration)

旧的解决方案:“一刀切”的恒温器

长期以来,修复这种过度自信的标准方法叫做温度缩放(Temperature Scaling, TS)

我们可以把 AI 的置信度分数想象成房间里的温度。

  • 如果房间太热(AI 太过自信),你就调低恒温器。
  • 如果房间太冷,你就调高它。

旧的方法使用了一个单一的、全局的恒温器。它观察整个房子并得出结论:“好吧,大家现在都太热了,所以我会对每一个房间都降低同样程度的温度。”

缺陷在于: 这种方法效果并不好,因为“房间”(AI 的预测结果)是各不相同的。

  • 有些预测错得离谱且过度自信(这些是“热”的房间)。
  • 有些预测其实相当准确,只需要微调一下。
  • 有些则处于中间状态。

通过对所有人应用相同的修正方案,旧方法往往解决了容易的问题,却留下了那些最困难、最危险的错误未被纠正。这就像试图用同样分量的冰水同时去冷却一个着火的厨房和一个温和的客厅一样。

新的解决方案:QaTS(“智能、定制化”的恒温器)

作者引入了一种名为**分位数自适应温度缩放(Quantile-Adaptive Temperature Scaling, QaTS)**的新方法。

QaTS 不再仅仅看原始的置信度分数(例如“99%”),而是观察该分数在所有其他预测中的排名位置。这被称为分位数(Quantile)

类比:赛跑
想象 AI 正在进行一场与自己的比赛。

  1. 旧的方法: 它观察跑步者的速度(置信度分数),然后告诉所有人减速 5 英里/小时。
  2. QaTS 的方法: 它观察跑步者的比赛位置
    • “你在最后 10% 的选手中(那些最困惑且过度自信的人)。你需要大幅度减速。”
    • “你在前 10% 的选手中(那些通常表现很稳的人)。你只需要进行微小的调整。”
    • “你在中间?那你得到一个中等的调整。”

QaTS 为每一个预测创建了一个定制的温度。它意识到,最大的错误通常发生在置信度谱系中的特定“区域”,并专门针对这些区域进行处理。

为什么这很重要

论文表明,这种“基于排名”的方法比旧的“基于分数”的方法聪明得多,原因有三点:

  1. 它直击痛点: 最大的错误通常发生在特定的群体中(比如当 AI 在处理稀有项目时感到困惑)。QaTS 能找到这些群体并修复它们,而旧方法则会错过它们。
  2. 它能应对“混乱”(分布偏移): 假设 AI 是在晴天训练的,但必须在雨天工作。由于天气变化,原始数字(置信度分数)可能会发生剧烈变化。然而,排名通常保持不变(AI 仍然会对同样的事情最有信心,只是数值变了)。因为 QaTS 依赖于排名(谁是第一、第二、第三)而非原始数字,所以即使环境发生变化,它也能完美运行。
  3. 它不会破坏 AI: 其他一些方法试图通过改变 AI 的实际答案来修复置信度(这可能会降低其准确性)。QaTS 更像是一个“后处理”过滤器。它修复的是置信度数字,而不改变答案。AI 仍然选择正确的答案,只是它承认:“对于这个,我不再是 100% 确定了。”

实验结果

作者在许多不同的任务上测试了该方法:

  • 标准图像: 识别猫和狗。
  • 长尾数据: 识别稀有动物(在这种情况下 AI 通常会非常困惑)。
  • 医学图像: 分析 X 光片。
  • 文本: 理解新闻文章。
  • 受损数据: 带有噪声、模糊或雾气的图像。

在几乎每一个测试中,QaTS 都使 AI 的置信度估计比之前的最佳方法更加可靠。它显著降低了“期望校准误差”(衡量置信度偏差程度的指标),尤其是在其他方法失效的困难情况下。

总结

论文指出,我们不应该把所有的 AI 预测都一视同一。就像老师不会给一个挣扎中的学生和一位天才学生布置同样的作业一样,我们也不应该对每一个 AI 预测应用相同的置信度修正。

QaTS 是一个简单、高效的工具,它观察一个预测相对于其他预测的排名,并对其应用定制化的“置信度修正”。这使得 AI 系统更加安全、更值得信赖,尤其是在面对困难或异常情况时。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →