← 最新论文
🤖 machine learning

Cost-Sensitive Conformal Prediction and Human-in-the-Loop Abstention for Imbalanced High-Stakes Decision Support: A Multi-Domain Benchmark

本文提出了一个全面的多领域基准测试,证明了将类条件(Mondrian)符合性预测与成本控制型弃权相结合,能有效解决稀有少数类严重的覆盖不足问题,并在高风险、不平衡的决策支持系统中最小化预期决策成本。

原作者: Manpreet Singh, Akshatha Srikantha, Shyamal Lakhanpal

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Manpreet Singh, Akshatha Srikantha, Shyamal Lakhanpal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位正在密集的、雾气缭绕的小行星带中航行的飞船舰长。你的飞船计算机非常擅长发现成千上万个无害的漂浮岩石(即“多数”类),但它却总是漏掉那些可能摧毁飞船的罕见且危险的小行星(即“少数”类)。在人工智能领域,这是一个常见的问题,被称为“不平衡数据”。当计算机从一个其中一种结果出现99次而另一种仅出现1次的数据集中学习时,它会变得偷懒,每次都通过猜测常见的结果来让自己看起来很聪明。这在涉及高风险的工作中是非常危险的,比如检测信用卡欺诈、诊断罕见疾病或预测工厂机器故障,因为错过罕见事件可能会造成巨额损失甚至生命代价。

为了解决这个问题,科学家们使用了一种名为“符合预测”(Conformal Prediction)的安全网。你可以把它想象成一个智能护栏,它不仅仅给出一个单一的“是”或“否”的答案,而是说:“我有90%的把握答案就在这个组里。”如果计算机很有信心,这个组就只有一个项目;如果它感到困惑,这个组可能会有两个项目,或者甚至是空的,从而发出信号:“我不知道,请询问人类!”目前研究人员一直在追问的大问题是:这个安全网是否对那些罕见的、危险的小行星同样有效,还是它仅仅保护了那些乏味的、常见的岩石?

这篇题为《成本敏感型符合预测与人类参与循环中的弃权机制,用于不平衡高风险决策支持》(Cost-Sensitive Conformal Prediction and Human-in-the-Loop Abstention for Imbalanced High-Stakes Decision Support)的论文,深入探讨了正是这样一个问题。作者 Manpreet Singh、Akshatha Srikantha 和 Shyamal Lakhanpal 在 15 个不同的真实世界数据集上进行了大规模实验,测试了 7 种不同类型的 AI 模型。他们发现,这种安全网的标准版本(称为“边际符合预测”,Marginal Conformal Prediction)实际上在处理罕见情况时表现得极其糟糕。在他们的测试中,虽然系统承诺整体安全性为 90%,但在最坏的情况下,它捕捉罕见危险事件的概率竟然不到 1%。这就像是一个既能保护人行道却让悬崖边缘完全敞开的护栏。

该论文的核心发现是,一种被称为“蒙德里安符合预测”(Mondrian Conformal Prediction)的特定升级版修复了这个损坏的护栏。蒙德里安 CP 不再为所有事物使用一个巨大的安全网,而是为常见的岩石和罕见的小行星分别构建了定制的、独立的网。结果是戏剧性的:这种方法将罕见事件的安全覆盖率恢复到了平均 92.2%,比标准方法提升了 61.7 个百分点。

但论文并不仅止于捕捉罕见事件;它还研究了何时值得付钱请人类介入。作者引入了一个“成本控制弃权”规则。想象一下 AI 是一名正在参加考试的学生。如果学生不确定,他们可以选择“弃权”(留白),让老师来评分,但老师会收取服务费。论文计算出了确切的“盈亏平衡点”:如果老师的费用足够低,那么让 AI 跳过难题并交给人类处理,在数学上比冒着出错并导致巨额损失的风险要更划算。他们证明了,通过将改进后的蒙德里安方法与这种智能的“跳过并询问”规则相结合,决策的总成本比标准方法显著下降。

简而言之,这篇论文认为,对于涉及罕见事件的高风险决策,旧有的“一刀切”式安全网是危险的。相反,我们需要针对罕见情况的定制化网络,以及一个能够准确知道何时说“我不知道,让人类来处理这个”以节省成本并防止灾难的智能系统。作者在数千个场景中测试了这种方法,并发现这种方法不仅是一个好主意,而且是一种统计学上证明的必要手段,用以控制罕见且代价高昂的错误。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →