想象你是一名天气预报员,试图预测明天的气温。
旧方法(标准贝叶斯方法):
你查看数据后说:“我有 95% 的把握气温将在 60°F 到 80°F 之间。”这是一个可信区间。它是一个单一、坚实的数字块。
- 问题: 如果你的数据表明气温要么非常冷(约 40°F),要么非常热(约 90°F),但几乎从不在中间呢?标准的“块状”预测会迫使你包含中间范围(50°F–85°F),仅仅为了连接两个极端。最终,你给出了一个巨大且无用的范围,其中包含了实际上不可能的气温。
“标准”共形预测方法:
为了解决这个问题,统计学家发明了共形预测(Conformal Prediction)。他们不再盲目信任自己的数学模型,而是采用一种“安全网”方法。他们利用大量历史数据测试其预测,然后说:“好吧,如果我们把网稍微放宽一点,使得在过去能 95% 的时间捕捉到正确答案,那么未来我们也这样做。”
- 局限性: 即使有了这个安全网,大多数方法仍然使用“单一固定网的大小”。如果天气是双峰的(冷或热),他们仍然会撒下一张覆盖中间空白区域的大网,仅仅为了保险起见。
登场:贝叶斯共形预测(BCP)
本文作者提出了一种名为BCP的新方法。你可以将其想象为一个智能、可变形的安全网。
以下是其工作原理,分解为简单的概念:
1. “决策者”与“固定规则”
在标准方法中,安全网的大小由一条僵硬的规则(如尺子)固定。而在 BCP 中,网的大小是一个决策。
- 类比: 想象你在打包行李箱。
- 标准方法: 你有一条规则:“我必须将行李箱填充到正好 50% 的容量。”如果你有两个小而重的物品(冷温和高温),为了达到 50%,你不得不往中间的空白处填充填充物(低概率数据)。
- BCP 方法: 你有一条规则:“我必须确保不落下任何重要物品,但我想让行李箱尽可能小。”你可以将两个重物分别放在两个角落,让中间保持空置。行李箱变小了,但它仍然装下了你需要的一切。
2. “变形”网(HPD 集)
这是本文最大的技巧。当数据是“多峰”的(意味着它有两个或更多明显的峰值,如冷热天气示例)时,BCP 意识到它不需要一个单一的连续块。
- 隐喻: BCP 不使用一根长长的连续绳索,而是使用两张独立的渔网。
- 一张网捕捉“冷”的结果。
- 一张网捕捉“热”的结果。
- 它让“温吞”的中间区域保持原样。
- 结果: 预测集的总大小变得小得多(在它们的实验中,平均大小从 4.82 降至 2.07),使得预测更加精确,同时没有损失准确性。
3. "PAC"安全保证
你可能会问:“如果你改变了网的形状,你怎么知道它仍然是安全的?”
- 类比: BCP 使用一种称为**PAC(Probably Approximately Correct,大概率近似正确)**的统计“安全带”。
- 即使天气模型是错误的(设定不当),或者数据很怪异,BCP 也能保证在多次尝试中,“安全网”至少 95% 的时间(或你设定的任何目标)能捕捉到正确答案。它不依赖于模型是完美的;它依赖于安全网的数学原理是稳健的。
4. “稳定器”(贝叶斯求积)
这里有一个棘手之处。当你试图为这些变形网找到完美的大小时,数学可能会变得“跳跃”和不稳定,特别是在出现新“模式”(数据中的新峰值)的边缘处。
- 隐喻: 想象试图用手指平衡一把扫帚。如果地板凹凸不平,这就很难。
- 解决方案: BCP 使用一种称为**贝叶斯求积(Bayesian Quadrature)**的工具。将其想象为一个“智能稳定器”或“减震器”。它平滑了跳跃的数学计算,使计算机能够找到完美且最小的网的大小,而不会被数据中的颠簸所迷惑。
他们实际上证明了什么?
该论文在三个主要场景下测试了这种方法:
- 糖尿病数据(回归): 他们测试了模型是否能预测疾病进展。
- 结果: 当他们故意给模型提供“错误”的先验假设(使其认为数据与实际情况不同)时,标准贝叶斯方法彻底失败(准确率仅为 49%)。BCP 修复了这一问题,保持在接近 80% 的目标准确率。
- 乳腺癌数据(分类): 他们测试了模型是否能将肿瘤分类为良性或恶性。
- 结果: 标准贝叶斯方法过于“谨慎”,给出了巨大且无用的预测集(需要 80% 覆盖率时却达到了 98%)。BCP 将其收紧至目标大小,同时保持安全。
- 伪造的“双峰”数据(多峰): 他们创建了一个伪造场景,其中答案明确是"A"或"B",但绝不是"C"(中间值)。
- 结果: 标准方法在其预测中包含了"C",使得集合变得巨大。BCP 成功忽略了"C",创建了两个独立的、微小的预测集。这使得预测效率提高了一倍以上(更小),同时仍然正确。
总结
贝叶斯共形预测是一种结合了贝叶斯统计的灵活性与共形预测的安全保证的方法。
- 旧方法: “为了安全起见,我会给你一个大的、相连的答案块。”
- BCP 方法: “我会给你尽可能小的答案集合(即使它们分散在不同的块中),我可以保证这些答案是正确的。”
当答案不是单一平滑曲线,而是具有多个不同可能性的“分裂”现实时,这种方法特别有用。
技术摘要:基于决策理论阈值选择的贝叶斯共形预测
1. 问题陈述
机器学习中的不确定性量化在统计有效性与效率之间面临权衡,特别是在底层概率模型被错误指定时。标准贝叶斯方法提供后验不确定性,但在模型不正确时可能无法维持标称覆盖率。相反,标准共形预测(CP)在交换性假设下提供有限样本、分布自由的覆盖率保证,但通常依赖于单个固定分位数阈值。这种固定阈值通常产生连通的预测集(区间),当后验预测分布为多模态时,这可能效率低下。在这种情况下,标准方法被迫跨越分离模式之间的低密度区域以维持有效性,从而导致不必要的庞大预测集。
核心问题在于:能否利用贝叶斯后验预测分布优化共形阈值,以生成几何自适应的预测集(特别是最高后验密度或 HPD 集),即使在校正模型被错误指定的情况下仍能保持有效性。
2. 方法论:贝叶斯共形预测(BCP)
作者提出了贝叶斯共形预测(BCP),这是一个将共形预测重构为决策风险优化问题的框架。BCP 不采用固定分位数阈值,而是将阈值 λ 视为决策变量,旨在最小化预期预测集大小的同时满足 PAC 风格(可能近似正确)的覆盖率约束。
关键组件
贝叶斯非共形分数:
BCP 利用源自后验预测密度的分数:
s(x,y)=−logp^(y∣x,Dtr)
这些分数结合了参数不确定性和预测不确定性。为了在不为每个校准点重新拟合模型的情况下高效计算这些分数,作者采用了加一入(AOI)重要性采样。该方法重新加权现有的后验样本,以近似任意 (x,y) 处的预测密度,确保分数函数相对于校准标签保持固定,从而维持交换性。
PAC 风格风险控制(L+ 统计量):
为了强制执行有效性,BCP 采用了共形风险控制(CRC)框架。它使用 L+ 统计量,该统计量对真实未覆盖风险进行随机上界约束。阈值 λ∗ 的选择需满足:
PD(P(X,Y)(Y∈/C(X;λ))≤α)≥1−β
这确保了在 1−α 的覆盖率下,针对校准数据的随机性,其概率至少为 1−β,即使贝叶斯模型被错误指定也能提供鲁棒性。
贝叶斯求积(BQ)用于效率估计:
目标函数 g(λ)=EX[∣C(X;λ)∣](预期集合大小)通常难以处理。BCP 使用贝叶斯求积对其进行近似,在映射 λ↦g(λ) 上放置高斯过程先验。
- 在基于阈值的设置中的作用: BQ 在识别最小可行阈值时减少了估计噪声。
- 在 HPD 设置中的作用: 在多模态分布中,随着 λ 跨越模式边界密度水平,HPD 集的几何形状会发生突变(不连通分量出现/消失)。这导致朴素蒙特卡洛估计具有高方差。BQ 稳定了 g(λ) 在这些不连续性附近的估计,从而能够可靠地选择最优阈值。
自适应几何(HPD 集):
与强制连通区间的标准 Split-CP 或共形分位数回归(CQR)不同,BCP 基于后验预测密度的超水平集构建预测集:
CHPD(x;λ)={y:p^(y∣x,Dtr)≥e−λ}
在后验为多模态的情况下,这些集可以是不相交的,将概率质量集中在分离的高密度区域,并避开低密度谷地。
3. 主要贡献
- 决策理论公式化: 本文将共形预测(CP)表述为一个优化问题,其中阈值作为决策变量,在满足 PAC 覆盖率约束的前提下最小化预期集合大小。
- 几何自适应性: 通过利用后验预测密度,BCP 生成 HPD 预测集,这些集在多模态分布下可以是不相交的,与连通区间方法相比显著提高了效率。
- 对错误指定的鲁棒性: 该框架将有效性与模型正确性解耦。虽然贝叶斯可信区间(BCI)在先验错误指定时会失效,但 BCP 通过 L+ 约束恢复了接近标称的覆盖率。
- 稳定的阈值选择: 贝叶斯求积的集成解决了在多模态设置中模式边界附近估计目标函数时的不稳定性。
4. 实验结果
作者在回归、分类和分布偏移任务上评估了 BCP,对比基线包括 Split-CP、CQR、贝叶斯可信区间(BCI)、共形贝叶斯计算(CB)和 Snell-HPD。
- 回归(糖尿病数据集): 在先验错误指定(c=0.02)下,BCI 的覆盖率崩溃至 49.2%,而 BCP 保持了 80.0% 的覆盖率。由于显式的效率优化,BCP 实现了目标覆盖率,其区间略宽于 Snell-HPD,但在有效性方面显著优于 BCI。
- 分类(乳腺癌): BCI 严重过度覆盖(98.9% 对比 80% 目标)。BCP 实现了 82.5% 的覆盖率,平均集合大小为 0.829,展示了有效的效率 - 有效性控制。
- 合成多模态回归: 该设置突出了 BCP 的主要优势。标准区间方法(Split-CP、CQR)生成了跨越模式之间低密度谷地的连通集,导致平均大小约为 4.8。BCP 和 Snell-HPD 利用不相交的 HPD 集,将平均大小降低至 2.07(统计学显著改进,p<0.0001)。BCP 的 PAC 通过率达到了 0.80,满足目标,而 Snell-HPD 略微不足(0.78)。
- 高维分类(ImageNet-A): 在预期集合大小随阈值单调变化的单模态设置中,BCP 恢复了与 Snell-HPD 相同的解(平均集合大小 40.3 对比边际方法的 122+)。这证实了 BCP 的效率提升是由处理复杂多模态几何的能力驱动的,而不仅仅是 PAC 约束。
5. 意义与主张
本文主张 BCP 提供了一个鲁棒的不确定性量化框架,结合了共形预测的有效性保证与贝叶斯推断的几何自适应性。
- 有效性: 该方法在交换性假设下保证有限样本覆盖率,独立于模型的正确性。
- 效率: 对效率的主要贡献在于能够在多模态场景中构建不相交的预测集,避免了连通区间方法固有的“低密度惩罚”。
- 范围: 作者指出,在标准的嵌套阈值设置(单模态回归、标准分类)中,BCP 恢复了最小可行阈值,并与现有的基于 PAC 的方法一致。其独特优势具体出现在预测分布为多模态时。
- 局限性: 该方法继承了后验推断的计算成本(需要 MCMC 样本和 AOI 重加权)。作者承认,扩展到非常大的数据集或高维标签空间仍然是一个未解决的挑战。
总之,BCP 提供了一种原则性的方法来构建预测集,这些集在模型错误指定下具有统计有效性,并且在复杂的多模态预测景观中具有几何效率。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。