Sample Margin-Aware Recalibration of Temperature Scaling
本文提出了 SMART,一种轻量级且数据高效的重校准方法,该方法通过基于逻辑间隙(最高预测值之间的间隔)自适应地缩放逻辑值,并利用一种新颖的软分箱期望校准误差目标来平衡偏差与方差,从而提升神经网络的校准性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,深度神经网络在识别模式方面已变得异常出色,从识别照片中的动物到诊断医学状况无所不能。然而,在其令人印象深刻的准确率之下,往往潜伏着一个关键缺陷:这些系统经常表现得过度自信。即使在错误的情况下,它们也会以绝对的确定性宣布预测结果,这对于自动驾驶或医疗诊断等安全至关重要的应用场景而言,是一种危险的特性。要实现真正的可靠性,机器给出的置信度必须与其实际准确率相匹配;如果一个模型说它有 90% 的把握,那么它应该在 90% 的情况下是正确的。这种一致性被称为校准(calibration)。多年来,研究人员一直试图通过在训练后调整模型的内部评分来解决这个问题,通常对所有输入使用单一的全局调整因子。然而,这种“一刀切”的方法忽略了某些图像本质上比其他图像更容易被模型处理这一事实,导致在处理最困难或最具歧义的情况时,校准并不完美。
一项新研究引入了一种名为 SMART 的方法,它通过观察每个样本的具体难度,采取了一种更细致的处理方式。研究人员发现,修复置信度的关键在于一个简单、直接的度量标准,即逻辑值间距(logit margin)。通俗地说,这就是模型最高预测值与其第二高预测值之间的差距。较大的差距意味着模型对自己的选择非常有把握,而较小的差距则表示犹豫。团队发现,与以往依赖于数据点在复杂数学空间中与其他点接近程度等间接线索的方法相比,这个间距是一个更可靠的难度指标。通过测量这个差距,研究人员可以确定究竟需要为那张特定的图像调整多少置信度,而不是对整个数据集应用统一的规则。
该研究还揭示了这些调整进行的标准方式中存在的一个显著问题。传统上,研究人员会针对一种称为负对数似然(negative log-likelihood)的指标进行优化,该指标旨在使模型的概率估计在广泛的统计意义上是“正确”的。作者证明,追求这种统计上的完美实际上可能会使校准变得更糟,导致模型变得更加自信但可靠性却降低了。为了解决这个问题,他们开发了一种新的目标函数(即计算机旨在达到的特定数学目标),该函数直接针对预测置信度与实际准确率之间的差距。这个新目标确保了对模型输出所做的调整能够真正提高其可靠性,而不会牺牲其做出正确预测的能力。
其结果是一个轻量级的系统,它学习了一张从样本难度到修复置信度所需的精确温度调整之间的直接映射。与那些可能需要数千个参数或大规模重新训练的旧方法不同,这种新方法使用了一个拥有不到五十个可调参数的微型网络。在包括具有数千个类别的高复杂度图像数据集以及数据受损或偏移的情景在内的各种标准基准测试中,该方法表现优异。它比以往任何事后处理方法都能更有效地减少置信度估计的误差,并且在传统的卷积网络和现代基于 Transformer 的架构上同样表现出色。
或许最重要的一点是,研究人员证明了即使在可用数据极少的情况下,该方法依然有效,足以教导调整系统。当验证集很小时,其他方法往往会表现挣扎或变得不稳定,而 SMART 则随着可用数据的增加而持续改进,展现出从有限样本中学习的强大能力。这项研究证实,通过关注模型与其决策边界之间的直接关系,以及其置信度需要被“冷却”或“加热”多少,我们可以达到以前无法触及的可靠水平。这项工作不仅提供了一个修复现有模型的更好工具,它还从根本上改变了我们理解和纠正人工智能不确定性的方式,证明了一个简单、有原则的信号可以超越复杂的间接代理指标。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。