Expectation Consistency Loss: Rethink Confidence Calibration under Covariate Shift
原作者: Jinzong Dong, Zhaohui Jiang, Bo Yang
原作者: Jinzong Dong, Zhaohui Jiang, Bo Yang
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:协变量偏移下的期望一致性损失用于置信度校准
问题陈述
分类模型中的置信度校准对于安全关键型决策至关重要,它能确保预测概率反映真实事件的可能性。然而,标准的校准方法通常假设训练(源)数据和测试(目标)数据是独立同分布(i.i.d.)的。在涉及协变量偏移的真实场景中——即输入特征分布发生变化(Ps(X)=Pt(X)),而条件标签分布保持不变(Ps(Y∣X)=Pt(Y∣X))——这些方法往往会失效。
现有的针对协变量偏移的校准方法主要依赖重要性加权来对齐全局协变量分布。这些方法存在显著局限性:
- 不稳定性:当密度比很大时,它们会变得不稳定或无界。
- 范围局限:它们主要仅解决顶部标签(top-label)校准问题,忽视了类别级和标准(完整概率向量)校准。
- 理论负担:它们假设全局分布对齐是必要的,而这对于实现校准的置信度而言可能是一个过于严格的要求。
方法论
本文提出了一个以期望一致性条件为核心,并配有相应损失函数**期望一致性损失(ECL)**的新框架。
1. 理论基础:期望一致性条件
作者推导出了协变量偏移下置信度校准的充要条件。
- 定理 3.1:当且仅当给定置信度分数的真实后验概率的期望在域间一致时,分类器在目标域上才是校准的。形式化地,对于任意类别 k:
EX∼Ps(X∣S)[P(Yk=1∣X)]=EX∼Pt(X∣S)[P(Yk=1∣X)] - 推论:该条件表明,全局协变量分布对齐(Ps(X)=Pt(X))并非必要。只要特定置信度水平下的条件期望准确率在域间保持一致,即使输入分布存在显著差异,也能实现校准。该条件严格弱于全局对齐。
2. 损失函数:期望一致性损失(ECL)
基于推导出的条件,本文引入了 ECL,这是一种旨在最小化源域与目标域期望差异的无监督域适应损失。
- 公式:该损失衡量了在预测置信度分数 S 的条件下,源域和目标域上估计的真实后验概率 P(Y∣X) 的期望之间的距离。
Lecl=EPt(S)[EPs(X∣S)[P(Y∣X)]−EPt(X∣S)[P(Y∣X)]] - 通用性:该框架支持三种校准范式:
- 标准校准:匹配完整概率向量。
- 类别级校准:分别匹配每个类别的概率。
- 顶部标签校准:匹配预测类别的置信度。
- 实现:为了在没有目标标签的情况下估计 P(Y∣X),该方法在源域上(或与主干网络联合)训练一个辅助分类头来预测真实后验概率。
3. 优化与可训练性
- 可微性:由于标准分箱是不可微的,作者提出了一种基于锚点的软分配方法,使用温度参数 τ 以实现基于梯度的优化。
- 小批量可训练性:直接在小批量上计算损失会引入偏差,因为范数算子不与期望交换。为解决此问题,作者提出了一种辅助变量公式(定理 3.3)。他们引入了可学习参数(ujs,ujt)来近似域期望,从而通过交替近端更新(算法 1)实现无偏梯度反向传播。
- 样本复杂度:理论分析表明,ECL 的样本复杂度为 O(B/ϵ2),与用于期望校准误差(ECE)的直方图分箱相当,其中 B 是分箱数量。
主要贡献
- 理论洞察:推导了期望一致性条件,证明了在协变量偏移下进行校准并不需要全局协变量对齐。
- 新颖损失函数:提出了ECL,这是一种兼容标准、类别级和顶部标签校准范式的统一损失函数。
- 算法创新:开发了一种基于理论的小批量训练方案,利用辅助变量确保无偏梯度估计,克服了在小批量上直接分箱的局限性。
- 全面评估:证明了 ECL 在模拟数据集和真实世界数据集上均优于最先进基线(包括重要性加权方法和基于 mixup 的方法)。
实验结果
该方法在以下数据上进行了验证:
- 模拟数据:正态分布和均匀分布的协变量偏移,显示 ECL 降低了所有三种范式下的校准误差。
- 真实世界基准:
- 数字识别:MNIST、USPS、SVHN。
- 域适应:PACS(照片、艺术、卡通、素描)。
- 大规模:ImageNet-Sketch。
- 性能表现:
- 与 TransCal、DRL 和 PseudoCal 等基线相比,ECL 始终实现了最低(或接近最低)的校准误差(ECE、CwECE、ECEKDE)。
- 在高偏移场景(如 SVHN)中观察到了显著改进,在 LeNet-5 上,ECL 将未校准的顶部标签 ECE 从约 61.9% 降低至约 21.5%。
- 该方法通常保持或略微提高了分类准确率(ΔACC),表明校准并未以牺牲判别能力为代价。
- 消融研究证实了小批量可训练方案和自适应损失加权策略的必要性。
意义与主张
本文主张通过摒弃传统的全球分布对齐范式,从根本上重新思考协变量偏移下的置信度校准。通过确立关键统计量(给定置信度的期望后验)的局部一致性已足够,作者提供了一个更稳健和灵活的理论基础。
其意义在于:
- 鲁棒性:提供了一种不依赖不稳定重要性权重的解决方案。
- 通用性:为所有主要校准类型(标准、类别级、顶部标签)提供了一种统一方法,而以往的方法通常仅限于顶部标签。
- 实用性:实现了高效、可小批量训练的优化,适用于现代深度学习工作流。
作者承认了局限性,指出该方法假设后验类别概率(P(Y∣X))不变,且目前未解决标签偏移问题。未来的工作建议将该框架扩展到同时涉及协变量偏移和标签偏移的场景。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。