Universal distribution of the empirical coverage in split conformal prediction
本文确立了批量模式下拆分符合预测(split conformal prediction)经验覆盖率的精确且通用的分布,证明了这些分布仅取决于标称失覆盖水平和校准样本量,从而为确定所需的最小校准数据提供了一个判据。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代预测领域,从预测明天的天气到估算房屋的价格,最常见的输出是一个单一的数字。模型观察数据后会说:“气温将是72度,”或者“这栋房子的价值是45万美元。”虽然这些点预测非常有用,但它们往往隐藏了一个至关重要的信息:模型有多确定。如果一个模型的猜测极其随机,那么单一的数字会给人一种虚假的精确感。为了解决这个问题,统计学家开发了一种称为符合预测(conformal prediction)的框架。这种方法不再只提供一个答案,而是产生一组可能的范围,或者说一组可能的输出结果,并附带一个统计保证。它承诺,真实答案落在该集合内的概率在一定时间内(例如95%)是成立的。这种方法之所以强大,是因为它几乎可以与任何现有的预测工具配合使用,不需要对数据的分布做任何特定假设,并且即使在数据量有限的情况下也能提供这些保证。
然而,对于任何试图使用这些工具的人来说,一个实际的问题仍然存在:需要多少数据才能使保证成立?在典型的设置中,数据集被分为两部分。一部分用于训练模型,另一部分被称为校准样本(calibration sample),用于调整预测集的规模。如果校准样本太小,生成的预测集可能会过窄,无法实际包含真实值,从而破坏了所承诺的保证。如果它太大,预测集则会变得过于宽泛,从而降低其可用性。多年来,从业者不得不猜测校准样本的合适大小,通常依赖于粗略的经验法则或保守的估计,这可能会浪费宝贵的数据。
最近,巴西 Insper 教育与研究学院的 Paulo C. Marques F. 的一项研究通过发现这些预测集的精确数学行为解决了这一问题。研究人员专注于该方法的一个特定版本,即分块符合预测(split conformal prediction),它是按批次运行的。想象这样一个场景:一个模型已经经过了训练和校序,现在正被要求同时对一大组未来的事件进行预测。这项研究提出了一个简单但深刻的问题:如果我们观察一批未来的预测,其中有多少个预测是正确的,其实际分布是怎样的?
论文指出,这个答案是普适的。它不取决于特定类型的数据、模型的复杂性或世界的潜在模式。相反,预测集的行为完全由两个数字决定:期望的置信水平(标称失覆盖水平)和用于调节系统的校准样本大小。研究人员证明,对于有限的一批未来观测值,正确预测的数量遵循一种精确的统计模式,称为 Beta-Binomial 分布。此外,随着未来观测批次的无限增长,正确预测的比例会趋向于一种被称为 Beta 分布的特定模式。这些发现并非仅仅是建议或计算机模拟的结果;它们是基于数据点具有可交换性(即它们的顺序并不重要,且来自同一个潜在来源)这一假设而得出的严谨数学证明。
这项工作的最显著成果是为选择校准样本大小提供了一个新的、精确的标准。因为研究人员现在知道了覆盖率的精确分布,所以可以计算出所需的最小校准数据量,以确保预测集在特定的误差范围内保持准确,并具有高度的确定性。例如,如果用户希望有95%的把握确保其预测集在5%的误差范围内是正确的,论文提供了一种直接的方法来找到所需的精确校准样本数量。该研究展示了一个综合表格,列出了在各种置信水平、误差范围和确定性要求组合下的这些最小样本量。
该表显示,所需的样本量会根据要求的严格程度而发生剧烈变化。对于一个标准的90%置信水平且带有较宽松的10%误差范围的要求,大约40到50个观测值的相对较小的校准样本可能就足够了。然而,如果用户要求99%的置信水平且带有非常紧凑的1%误差范围,所需的样本量会跃升至超过40,000个观测值。研究明确指出,这些数字并非随意设定;它们是从经验覆盖率的精确分布中推导出的数学最小值。这使得从业者能够停止猜测并开始计算,确保他们使用足够的数据来达到可靠性目标,而不至于在过多的校准上浪费资源。
论文还讨论了这些预测行为中一个微妙但重要的区别。虽然预测集的平均性能已知接近目标置信水平,但在任何单个批次中的实际表现可能会有所不同。研究表明,这种波动并非随机噪声,而是遵循一种可预测的形状。通过理解这种形状,用户可以意识到,即使拥有完美的模型和正确大小的校准样本,预测结果的正确数量也会存在自然的波动。研究证实,这种波动是该方法固有的,并且完全由校准样本的大小和选定的置信水平来刻画。
在机器学习应用的背景下,这项工作为可靠性提供了基础性的工具。它将校准样本大小的选择从一种艺术转变为一门科学。研究人员证明,分块符合预测的属性是稳健且普适的,无论生成预测的具体算法是什么。无论任务是预测像股价这样的连续值,还是像疾病诊断这样的类别标签,确定所需校准数据的规则都是相同的。该研究并不声称提高了底层模型的准确性,而是确保围绕这些模型构建的置信区间在数学上是严密的,并且大小是优化的。
这些发现对于数据昂贵或稀缺的领域尤为重要,因为它们允许用户确定实现所需信任水平所需的精确数据下限。相反,在数据丰富的场景下,研究警告不要使用不必要的超大校准集,因为这会导致过于保守且缺乏信息量的预测区间。通过提供一个关于经验覆盖率分布的清晰且通用的公式,论文为研究人员和从业者提供了设计预测系统的方法,使其能够达到以往无法实现的精确度。其结果是在人工智能时代,为量化不确定性提供了一个更高效、更可靠的框架。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。