想象一下你是一位试图重现失传家族食谱的大厨,但食谱中有好几页丢失了。你必须根据还能看到的页面来推测缺失的配料。
问题:猜测 vs. 对自己有多确定
大多数现代“数据大厨”(计算机算法)都非常擅长猜测缺失的配料。它们可以填补空白,准确度极高,以至于最终做出的菜肴尝起来几乎与原版一模一样。这被称为准确度(Accuracy)。
然而,还有一个经常被忽视的问题:你对自己的猜测有多大的信心?
- 你是确切知道缺失的配料是“盐”吗?
- 还是你只是因为“盐”是一个常见的答案而猜它是“盐”,但它很有可能是“糖”?
本文认为,成为一个优秀的猜测者(高准确度)并不自动意味着你擅长承认自己的不确定性(良好的不确定性/Uncertainty)。事实上,研究发现,那些猜测得最好的算法往往也是最过度自信的,即使在出错时也是如此。
实验:伟大的填补味觉测试
研究人员设置了一个大规模的味觉测试。他们采用了五个真实世界的数据集(例如房价、葡萄酒质量和癌症数据等食谱),并故意以三种不同的方式撕掉了页面(制造缺失数据):
- 随机缺失 (MCAR): 就像在不看内容的情况下撕掉书页。
- 基于可见内容缺失 (MAR): 就像只有在前一页有猫的图片时才撕掉当前页。
- 基于缺失内容本身缺失 (MNAR): 就像只有当缺失的配料是“糖”时才撕掉页面。
他们测试了六位不同的“大厨”(填补方法),以观察它们填补空白的效果如何,以及至关重要的一点:它们如何评价自己的信心。
大厨们(方法论)
论文测试了三类大厨:
- 统计学家 (MICE, SoftImpute): 老派专家。他们使用数学规则和平均值。
- 几何学家 (OT-Impute): 他们试图让缺失数据的形状与已知数据的形状相匹配。
- 深度学习者 (GAIN, MIWAE, TabCSDI): 现代 AI 大厨。他们使用复杂的神经网络来学习模式并生成猜测。
他们如何衡量信心
为了测试大厨们是否诚实地对待自己的信心,研究人员使用了“校准测试”。
- 如果一位大厨说:“我有 90% 的把握这个配料是盐。”研究人员会检查:实际上是否真的有 90% 的情况是盐。
- 如果大厨实际正确率只有 50%,却一直声称自己有 90% 的把握,那么他们就是失校准的(miscalibrated)(过度自信)。
- 论文使用了一个名为 ECE(期望校准误差)的分数来衡量这一点。较低的分数意味着大厨对自己的不确定性是诚实的。
大惊喜
- 准确度 = 诚实: 那些做出最准确猜测(误差最低)的大厨,往往在评价自身信心方面表现最差。例如,SoftImpute 是一个出色的猜测者,但它始终过度自信,即使在出错时也是如此。
- 诚实的资深人士: MICE(一种经典的统计方法)并不总是最快或最准确的猜测者,但它是最诚实的。它很少过度承诺。当它表示不确定时,它通常确实是不确定的。
- AI 的权衡: 深度学习大厨(如 MIWAE)非常擅长平衡准确度和诚实度,但它们运行起来又慢又贵。在端出菜肴之前,它们需要很长时间来“思考”。
- “信心”陷阱: 一些 AI 模型(如 GAIN)试图玩出花样,生成多个版本的缺失页面。然而,仅仅生成多个猜测并不总能让它们在表达信心方面变得更诚实。
总结
如果你只需要一个快速、准确的猜测,且不在乎风险,你可能会选择最快、最准确的那位大厨。
但如果你正在做一个高风险的决策(比如审批贷款或诊断病人),你需要一位能告诉你其不确定性的真相的大厨。论文的结论是:你不能仅仅因为一个模型很准确,就假设它是可靠的。 你必须检查它的“信心计”是否经过了校准。
简而言之:
- 准确度 (Accuracy) 是猜测与真相之间的接近程度。
- 校准度 (Calibration) 是猜测者对其确定程度的诚实程度。
- 最好的方法取决于你的目标:如果你需要速度和精度,请选择一种;如果你需要知道何时该信任数据,请选择一种擅长承认自己在进行猜测的方法。
技术摘要:超越准确度:关于插补中不确定性估计的实证研究
1. 问题陈述
处理缺失数据是统计分析和机器学习流水线中的基础步骤。虽然现代插补方法在重建缺失值的点准确度(例如,最小化 MAE 或 MSE)方面取得了显著进展,但在理解这些方法所产生的不确定性估计的可靠性和校准度方面,仍存在关键空白。
在医疗、金融和社会科学等实际应用中,了解模型对插补值的置信程度与该值本身同样重要。可靠的不确定性能够实现:
- 主动插补(Active Imputation): 优先将高不确定性的条目提交给专家评审或进行新的数据采集。
- 选择性插补(Selective Imputation): 标记出不应驱动敏感决策(如贷款审批)的估计值。
- 鲁棒性(Robustness): 检测模型何时运行在训练分布之外(数据集偏移)。
尽管已有多种生成不确定性的方法(如多重插补、贝叶斯方法、深度生成模型),但目前尚不清楚这些不确定性估计是否经过了校准——即,名义概率(例如,90% 的预测区间)是否与包含真实值的经验频率相匹配。此外,在不同的缺失机制(MCAR、MAR、MNAR)下,点准确度、校准质量与计算运行时间之间的权衡关系也尚不明确。
2. 研究方法
2.1 实验设计
作者进行了一项系统性的实证研究,对比了涵盖三大主要家族的代表性插补方法:
- 统计/基于模型的方法: MICE(基于链式方程的多重插补)。
- 矩阵/基于优化的方法: SoftImpute(低秩恢复)和 OT-Impute(通过最优传输进行分布对齐)。
- 深度生成模型: GAIN(对抗性)、MIWAE(变分推理)和 TabCSDI(基于扩散模型)。
数据集与缺失机制:
研究使用了五个数值型表格数据集(住房、生物降解、癌症、能源、葡萄酒)。在受控的缺失率(10–30%)下,通过三种机制人工注入缺失值:
- MCAR(完全随机缺失): 均匀随机掩码。
- MAR(随机缺失): 掩码依赖于观测到的特征。
- MNAR(非随机缺失): 掩码依赖于缺失值本身。
2.2 不确定性提取策略
为了确保公平比较,研究将不确定性提取标准化为三种互补的路径:
- 重复模型运行: 使用不同的种子或自助采样(bootstrapped)数据多次运行插补器(例如,MICE、多轮运行的 GAIN)。这捕捉了来自训练/初始化的变异性。
- 条件采样: 从一个固定的、训练好的模型的条件分布中抽取多个样本(例如,GAIN-S、MIWAE-S、TabCSDI-S)。这探测了偶然不确定性(aleatoric uncertainty)。
- 预测分布建模: 使用专门训练用于输出每个单元格分布参数(均值和方差)的模型(例如,GAIN-U、MIWAE-U)。
2.3 评估指标
研究从两个维度评估方法:
- 准确度: 通过掩码单元格的平均绝对误差(MAE)进行衡量。
- 校准度: 使用校准曲线(绘制经验覆盖率 vs. 名义置信度)和**期望校准误差(ECE)**进行衡量。较低的 ECE 表示模型的声明置信度与其实际准确度相符。
3. 核心贡献
- 统一的不确定性中心框架: 本文建立了一个标准化的协议,用于提取和评估不同插补范式(统计、优化和深度学习)的不确定性,从而超越了仅关注点准确度的局限。
- 误匹配的实证证据: 研究提供了强有力的证据,表明高重建准确度并不保证可靠的不确定性校准。 在点预测方面表现优异的方法往往在提供校准置信区间方面表现不佳。
- 全面的权衡分析: 作者绘制了在不同缺失机制(MCAR、MAR、MNAR)和数据集特征下,准确度、校准度和运行时间之间的权衡图谱。
- 特定方法的见解:
- MICE: 尽管点准确度有时较低,但在不同数据集上表现出最稳定且可靠的校准。
- SoftImpute: 取得了具有竞争力的准确度,但由于其确定性本质和缺乏内在的不确定性建模,表现出较差的校准度。
- 深度生成模型(MIWAE、TabCSDI): 展示了平衡准确度和校准度的潜力,但付出了显著更高的计算成本。
- GAIN: 虽然准确,但标准 GAIN 产生的确定性过于分散(过度不确定);异方差变体(GAIN-U)改善了校准,但也引入了训练不稳定性。
4. 主要结果
- 准确度 vs. 校准度: 观察到了持续的误匹配现象。例如,SoftImpute 的 MAE 通常较低,但 ECE 较高(校准差)。相反,MICE 即使在 MAE 不是最低的情况下,也能保持较低的 ECE(校准好)。
- 缺失机制的影响: 准确度和校准度通常从 MCAR 到 MAR 再到 MNAR 逐渐下降。然而,某些数据集(如住房)显示了例外情况,其中特征共线性使得 MAR/MNAR 插补的表现优于 MCAR。
- 深度学习性能:
- MIWAE 在准确度和校准度之间取得了良好的平衡,它利用重要性加权采样来逼近真实数据分布。
- TabCSDI(基于扩散的模型)在具有强相关性的数据集(葡萄酒)中表现出低 ECE,但在其他数据集(能源)中表现出混合的置信度(过度或不足度)。
- 采样 vs. 方差头: 对于 GAIN 和 MIWAE,使用显式建模方差的变体(U-variants)或使用条件采样的变体(S-variants)通常比传统的多次运行方法提高了校准度,尽管这增加了复杂性或运行时间。
- 运行时间: 经典方法(MICE、SoftImpute)通常更快。深度生成模型,特别是基于扩散模型的 TabCSDI,由于训练和顺序去噪步骤的存在,计算成本非常高。
5. 意义与主张
本文主张,插补策略的选择应由下游任务的需求而非仅仅由准确度驱动。
- 对于可信决策: 在需要人类监督、风险管理或选择性自动化的场景中(如医疗分诊),即使牺牲一定的点准确度,使用校准良好的不确定性方法(如 MICE 或 MIWAE)也是更优的选择。
- 对于效率与速度: 当速度和高点准确度是主要约束时,可以使用高效的方法,前提是其不确定性估计经过了事后校准,或者任务本身并不依赖于置信区间。
作者总结道,评价插补方法不应仅看它们“平均而言有多接近”,而应看“它们声明的置信度是否与观察到的频率相匹配”。这项工作为从业者选择符合可靠性需求的、具备不确定性感知能力的插补器提供了指南。
局限性与未来方向:
本研究局限于数值型表格数据集。作者指出,将该框架扩展到分类和混合类型数据是必要的下一步。此外,虽然研究评估了整体校准度,但并未明确区分偶然不确定性和认知不确定性(epistemic uncertainty),这仍是一个有待进一步研究的领域。最后,扩散模型的计算成本限制了其在所有数据集上的评估。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。