✨ 要点🔬 技术摘要
想象一下,你正在试图教一个机器人在黑暗、多雾的迷宫中导航。你希望机器人足够自信以向前移动,但又要足够谨慎以避免撞到墙壁。在人工智能领域,这被称为“不确定性量化”。这是机器人说“我挺确定那是面墙”与“我完全不知道,但我还是猜一下吧”之间的区别。教授这种谨慎感的一种流行方法是“符合性预测”(conformal prediction),这种方法不仅给出一个单一答案(比如“那是一只猫”),还会给出一个可能答案的安全网(比如“它要么是猫,要么是狗,或者是狐狸”),并且在数学上保证在大多数情况下都包含真实情况。
通常,为了变得更擅长这一点,机器人会获得反馈。它做一个猜测,然后有人(或传感器)告诉它:“是的,你猜对了,”或者“不,你猜错了。”机器人利用这些反馈来为下一轮调整它的安全网。但如果机器人在一种永远无法对其猜测获得反馈的情况下会发生什么呢?想象一个必须决定一个人是否构成威胁的保安。如果保安猜测“有威胁”,他可能会出错,但他不能问那个人:“嘿,你实际上构成威胁了吗?”因为那样就会使安全检查失去意义。只有当他决定停止行动并请求支援时,他才能询问“真实答案”,但他不能每次都这样做。这就是这个棘手的“超越反馈”问题:当你在无法检查自己的工作时,如何学会保持安全?
这篇论文介绍了一种名为 OCPQ (带有查询的在线符合性预测)的巧妙新方法,专门用来解决这个谜题。研究人员将这个问题视为一场高风险的游戏,玩家在每一轮都有两个选择:要么做出预测(且完全得不到反馈),要么进行一次“查询”以查看正确答案(但那一轮无法做出预测)。这就像玩电子游戏,你可以选择尝试射击并希望击中目标,或者暂停游戏去查看地图,但你不能同时做这两件事。
该团队发现,通过随机选择仅在极小比例的时间内(具体来说是大约每 T T T 轮中的 T 1 / 3 T^{1/3} T 1/3 轮,其中 T T T 是总轮数)进行“暂停并查看地图”(查询),他们仍然可以学习到足够的信息,从而变得极其准确。他们在数学上证明了,即使只有这点程度的“偷看”,该方法也能保证真实答案包含在机器人的安全网中,频率几乎达到用户要求的水平(一个用户定义的频率 β \beta β )。这种策略的“代价”是,安全网可能会比拥有完美反馈时稍微大一些,但这种差异会随着游戏的进行而缩小。
在实验中,研究人员在真实世界的数据上测试了该方法,包括手写数字图像和大型语言模型的文本提示。他们发现,即使数据发生了意外变化(比如一个在晴天训练的机器人在雨天导航)或者数据被刻意设计得很刁钻(对抗性攻击),OCPQ 依然能保持安全网的可靠性。他们展示了通过调节一个被称为 β \beta β 的单一旋钮,用户可以决定在多大程度上想要优先考虑安全性 versus 精确性。结果表明,你并不需要不断地检查自己的工作来保持安全;有时,仅仅偶尔检查一下就足以让整个系统保持诚实,即使世界正试图欺骗你。
问题定义:超越反馈的在线符合预测
不确定性量化对于在安全关键型应用中部署机器学习至关重要。在线符合预测(Online Conformal Prediction, OCP)提供了一个具有理论原则的框架,用于生成预测集,即使在非独立同分布(non-i.i.d.)的数据流和黑盒分类器的情况下,也能保证真实标签以用户指定的频率被包含在内。然而,标准的 OCP 方法依赖于一个反馈循环:在发布预测集后,算法接收反馈(即真实的标签或覆盖信号)以调整未来的集合,从而补偿过去的未覆盖情况。
本文针对这种反馈不可用或难以获取的情况进行了研究。在许多安全关键场景中,例如大语言模型(LLM)的潜在探测器(latent probes),算法需要将输入分类为安全类别。如果探测器选择弃权(向人类或更强的系统查询),则标签最终可能变得可用。然而,对于那些探测器做出已部署决策的输入,标签永远不会被观测到。这创造了一个“超越反馈”的场景:学习者必须在输出预测集或查询正确标签之间做出选择,但两者不能兼得。因此,学习者永远无法观测到已部署的预测集是否正确,从而阻碍了现有 OCP 方法中使用的标准补偿机制。
方法论:带查询的在线符合预测 (OCPQ)
作者提出了带查询的在线符合预测(Online Conformal Prediction with Queries, OCPQ) ,这是一种专为这种超越反馈协议设计的算法。该方法分为两个主要步骤:
归约为部分监测(Partial Monitoring): 该问题被归约为一个有限的部分监测博弈。博弈的“动作臂”(arms)由一组有限的预测阈值 M ⊂ [ 0 , 1 ] M \subset [0, 1] M ⊂ [ 0 , 1 ] 和一个独立的**查询(query)**动作组成。
预测动作: 选择一个阈值 m ∈ M m \in M m ∈ M 会基于黑盒分类器 C C C 生成一个预测集 Γ C ( x t , m ) \Gamma_C(x_t, m) Γ C ( x t , m ) 。该动作不产生观测值(空反馈 ⊥ \perp ⊥ )且没有直接奖励。
查询动作: 选择查询动作会揭示真实标签 y t y_t y t ,但不会产生预测集且收益为零。
奖励结构: 算法定义了一个辅助奖励函数 R ( m , t ) R(m, t) R ( m , t ) 。如果真实标签被预测集覆盖(即 y t ∈ Γ C ( x t , m ) y_t \in \Gamma_C(x_t, m) y t ∈ Γ C ( x t , m ) ),奖励为 1 − m ( 1 − β ) 1 - m(1-\beta) 1 − m ( 1 − β ) ,其中 β \beta β 是一个控制覆盖率与效率之间权衡的用户定义参数。如果标签未被覆盖,奖励为 0。查询动作始终产生 0 奖励。这种结构激励学习者在保持覆盖率的同时选择紧凑的阈值(较小的 m m m )。
算法设计: OCPQ 改编了 Cesa-Bianchi, Lugosi, 和 Stoltz (2004) 的标签高效指数加权预报器(label-efficient exponentially weighted forecaster) 。
在每一轮 t t t ,算法以固定概率 ϵ \epsilon ϵ 进行一次查询。
如果进行了查询,则观测到真实标签 y t y_t y t 。算法随后使用逆概率加权方案更新所有阈值 m ∈ M m \in M m ∈ M 的累积奖励估计值 Z ^ m , t \hat{Z}_{m,t} Z ^ m , t ,从而有效地重建出如果进行了预测本应获得的奖励。
如果没有进行查询,算法则根据当前的估计值 Z ^ m , t \hat{Z}_{m,t} Z ^ m , t 从指数加权分布中采样一个阈值 m t m_t m t ,并输出相应的预测集。此时不会收到任何反馈。
理论结果
本文建立了 OCPQ 在长度为 T T T 的无知对手(oblivious adversarial)数据流下的有限时界保证:
遗憾度(Regret): 相对于事后最佳固定阈值的期望遗憾度为 O ( T 2 / 3 ) O(T^{2/3}) O ( T 2/3 ) 。具体而言,当 ϵ = T − 1 / 3 \epsilon = T^{-1/3} ϵ = T − 1/3 且 η = T − 2 / 3 ln ∣ M ∣ \eta = T^{-2/3}\sqrt{\ln|M|} η = T − 2/3 ln ∣ M ∣ 时,遗憾度被限制在 T 2 / 3 ( 2 ln ∣ M ∣ + 1 ) T^{2/3}(2\sqrt{\ln|M|} + 1) T 2/3 ( 2 ln ∣ M ∣ + 1 ) 以内。作者指出,对于此类部分监测博弈,该速率在渐近意义上是最优的。
覆盖率(Coverage): 期望覆盖率 p c o v e r p_{cover} p co v er 满足:E [ p c o v e r ] ≥ β − O ( T − 1 / 3 ) E[p_{cover}] \ge \beta - O(T^{-1/3}) E [ p co v er ] ≥ β − O ( T − 1/3 ) 这保证了随着 T T T 的增加,覆盖率会趋近于用户定义的设定目标 β \beta β 。
查询率(Query Rate): 算法在期望的 T − 1 / 3 T^{-1/3} T − 1/3 比例的轮次中进行标签查询。
高概率界限(High-Probability Bounds): 文中还推导了关于遗憾度和覆盖率的高概率界限,证明了算法性能的方差是受控的,且不会表现出病态行为。
实验结果
通过在现实世界数据集上的实验验证了该方法:
分布偏移(Distribution Shift): OCPQ 在标准基准测试(MNIST, CIFAR-10, CIFAR-100)中进行了测试,其中训练分布与测试分布不同(例如,从 MNIST 到 USPS,或从 MNIST 到 MNIST-C)。结果表明,可以通过参数 β \beta β 控制覆盖率与效率之间的权衡。经验覆盖率始终超过了理论下界。
LLM 安全监测: 该方法被应用于使用 WildGuardMix 数据集的 LLM 提示词安全监测,该数据集包含原始提示词和对抗性重写的提示词。尽管基类分类器在对抗性提示词上的准确率显著下降,但 OCPQ 在保持预测集具有信息量的同时,仍能将覆盖率维持在理论界限之上。
对比: 与假设具有全反馈的自适应符合推理(Adaptive Conformal Inference, ACI)相比,OCPQ 在使用显著更少信息(仅查询约 5% 的轮次)的情况下,实现了相当的覆盖率-效率前沿。
意义与贡献
作者声称其贡献如下:
新协议: 它将 OCP 形式化为一个“超越反馈”的场景,即在部署的预测永远不会被评估的情况下,这在安全关键型应用中很常见,因为在这种情况下,标签仅在弃权查询时才可用。
算法归约: 它将此问题归约为一个部分监测博弈,并改编了标签高效的对抗学习技术来解决它,具体是通过修改预报器,使查询成为一种替代而非跟随预测的独立动作。
理论保证: 它为该设定下的 OCP 提供了有限时界的期望遗憾度和覆盖率保证,表明仅需 O ( T − 1 / 3 ) O(T^{-1/3}) O ( T − 1/3 ) 次标签查询即可实现有效的确定性量化。
实际有效性: 实验表明,稀疏监督(随机查询)足以在无需获取已部署预测反馈的情况下,在对抗性分布偏移下维持有用的覆盖率和效率权衡。
作者指出,虽然该方法较为保守(经验覆盖率通常高于界限),但这是由于部分监测博弈公式所需的弱假设所致。未来的工作可以探索更不保守的方法或向自适应对手的扩展。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。