← 最新论文
🤖 machine learning

Online Conformal Prediction Beyond Feedback

本文引入了带有查询的在线符合预测(Online Conformal Prediction with Queries, OCPQ),这是一种针对非独立同分布(non-i.i.d.)数据流的不确定性量化新颖框架,该框架通过策略性地查询标签,在无需来自已部署预测的直接反馈的情况下运行,从而在最小化查询成本的同时,实现了亚线性遗憾(sublinear regret)和高覆盖率保证。

原作者: Joar Skalse, Edoardo Pona, Osvaldo Simeone, Nicola Paoletti

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Joar Skalse, Edoardo Pona, Osvaldo Simeone, Nicola Paoletti

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人在黑暗、多雾的迷宫中导航。你希望机器人足够自信以向前移动,但又要足够谨慎以避免撞到墙壁。在人工智能领域,这被称为“不确定性量化”。这是机器人说“我挺确定那是面墙”与“我完全不知道,但我还是猜一下吧”之间的区别。教授这种谨慎感的一种流行方法是“符合性预测”(conformal prediction),这种方法不仅给出一个单一答案(比如“那是一只猫”),还会给出一个可能答案的安全网(比如“它要么是猫,要么是狗,或者是狐狸”),并且在数学上保证在大多数情况下都包含真实情况。

通常,为了变得更擅长这一点,机器人会获得反馈。它做一个猜测,然后有人(或传感器)告诉它:“是的,你猜对了,”或者“不,你猜错了。”机器人利用这些反馈来为下一轮调整它的安全网。但如果机器人在一种永远无法对其猜测获得反馈的情况下会发生什么呢?想象一个必须决定一个人是否构成威胁的保安。如果保安猜测“有威胁”,他可能会出错,但他不能问那个人:“嘿,你实际上构成威胁了吗?”因为那样就会使安全检查失去意义。只有当他决定停止行动并请求支援时,他才能询问“真实答案”,但他不能每次都这样做。这就是这个棘手的“超越反馈”问题:当你在无法检查自己的工作时,如何学会保持安全?

这篇论文介绍了一种名为 OCPQ(带有查询的在线符合性预测)的巧妙新方法,专门用来解决这个谜题。研究人员将这个问题视为一场高风险的游戏,玩家在每一轮都有两个选择:要么做出预测(且完全得不到反馈),要么进行一次“查询”以查看正确答案(但那一轮无法做出预测)。这就像玩电子游戏,你可以选择尝试射击并希望击中目标,或者暂停游戏去查看地图,但你不能同时做这两件事。

该团队发现,通过随机选择仅在极小比例的时间内(具体来说是大约每 TT 轮中的 T1/3T^{1/3} 轮,其中 TT 是总轮数)进行“暂停并查看地图”(查询),他们仍然可以学习到足够的信息,从而变得极其准确。他们在数学上证明了,即使只有这点程度的“偷看”,该方法也能保证真实答案包含在机器人的安全网中,频率几乎达到用户要求的水平(一个用户定义的频率 β\beta)。这种策略的“代价”是,安全网可能会比拥有完美反馈时稍微大一些,但这种差异会随着游戏的进行而缩小。

在实验中,研究人员在真实世界的数据上测试了该方法,包括手写数字图像和大型语言模型的文本提示。他们发现,即使数据发生了意外变化(比如一个在晴天训练的机器人在雨天导航)或者数据被刻意设计得很刁钻(对抗性攻击),OCPQ 依然能保持安全网的可靠性。他们展示了通过调节一个被称为 β\beta 的单一旋钮,用户可以决定在多大程度上想要优先考虑安全性 versus 精确性。结果表明,你并不需要不断地检查自己的工作来保持安全;有时,仅仅偶尔检查一下就足以让整个系统保持诚实,即使世界正试图欺骗你。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →