← 最新论文
📊 statistics

Online Selective Conformal Prediction with Asymmetric Rules: A Permutation Test Approach

本文提出了一种名为 PEMI 的通用置换检验框架,通过识别保持选择事件不变的置换集合,解决了在线选择预测中由于选择机制具有不对称性而导致的覆盖率失效问题,实现了在任意不对称选择规则下的精确选择条件覆盖。

原作者: Mingyi Zheng, Ying Jin

发布于 2026-02-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingyi Zheng, Ying Jin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章介绍了一种名为 PEMI 的新技术,它解决的是人工智能(AI)在“挑食”时的不确定性问题。

为了让你轻松理解,我们先来设定一个生活场景。

1. 背景:AI 的“挑食”问题

想象你是一个超级美食评论家(AI 模型),你的任务是给各种新菜品打分。

通常情况下,如果你对所有菜品都给出一个“信心范围”(比如:这道菜的味道在 70 到 90 分之间),这叫标准预测

但现实中,你并不是对所有菜都评论。你很“挑食”:只有当你觉得这道菜看起来特别高级、或者特别有挑战性时,你才会开口评论。 这种“只评论感兴趣的菜”的行为,在学术上叫**“选择性预测” (Selective Prediction)**。

问题来了:
因为你只评论“好菜”或“特别的菜”,你的评论标准其实已经悄悄变了。如果你还用对待普通菜的标准来衡量这些“高级菜”,你的信心范围就会失效——你会显得过于自信,导致预测结果经常“翻车”(实际分数超出了你给出的范围)。

2. 核心挑战:顺序带来的“偏见”

以前的研究试图解决这个问题,但它们有一个假设:菜品的顺序不重要

但在现实的“在线”场景中(比如数据像流水一样一个接一个进来),顺序极其重要
比如:

  • 如果前 10 道菜都很平庸,你可能会变得很挑剔,只选第 11 道特别惊艳的菜。
  • 如果前 10 道菜都很惊艳,你可能会变得很佛系,甚至连第 11 道也选了。

这种**“因为看到了前面的菜,所以改变了对当前这道菜的选择标准”**的现象,让数学家们非常头疼。以前的方法在面对这种“看人下菜碟”的动态规则时,往往会失效。

3. PEMI 的妙招:一场“平行时空的剧本杀”

这篇文章提出的 PEMI 方法,就像是为 AI 准备了一场**“平行时空的剧本杀”**。

它的逻辑是这样的:

当你决定要评论第 tt 道菜时,PEMI 不仅仅看这一道菜,它会在脑海里进行一场大规模的**“时空模拟”**:

  1. 洗牌(Permutation): 它把已经看过的所有菜品(包括当前这道菜)进行成千上万次的“洗牌”,重新排列组合。
  2. 寻找“平行时空”: 在这些乱序的排列中,它会寻找那些**“结果和你现在一模一样”**的剧本。也就是说,它只关注那些在乱序后,依然会导致你做出“我要评论这道菜”这个决定的排列组合。
  3. 建立“公平基准”: 它把这些“平行时空”里的表现作为一个公平的参照物。它会问:“在所有那些同样让你决定要评论的剧本里,这道菜的表现算不算异常?”

比喻:
这就像是一个面试官。他只面试那些“看起来很优秀”的候选人。为了保证评价公平,他不会拿所有人的平均分来比,而是会在脑海里模拟:“如果把这些候选人换个顺序面试,或者把他们重新组合,在所有同样能让我产生‘想面试他’冲动的组合里,这个人的表现到底处于什么水平?”

通过这种方式,PEMI 成功地抵消了“挑食”带来的偏见,确保了即使是在动态、变幻莫测的选择规则下,给出的“信心范围”依然是极其可靠的。

4. 这项技术有什么用?

论文中提到了一个非常硬核的应用场景:药物研发

在寻找新药的过程中,科学家并不是对成千上万的化学分子进行昂贵的实验,而是先用 AI 筛选。科学家通常会设定规则:“只有当 AI 预测这个分子的活性非常高时,我们才投入资金去实验室验证。”

这就是典型的“选择性预测”。如果 AI 在这种“挑食”的情况下给出的预测范围不准,科学家就会浪费大量的金钱和时间在错误的药物上。PEMI 能够确保:只要 AI 决定去研究某个分子,它给出的“不确定性范围”就是真实可靠的。

总结

  • 问题: AI 在“挑食”(选择性预测)时,由于受到数据顺序的影响,给出的信心范围会失效。
  • 方案 (PEMI): 通过“平行时空模拟”(排列组合测试),只在那些能导致相同选择结果的“剧本”中寻找参照物。
  • 结果: 无论 AI 的选择规则多么复杂、多么随时间变化,它给出的预测范围都能保持高度的准确性和可靠性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →