← 最新论文
🤖 machine learning

ASAT: Adaptive Scoring and Thresholding with Human Feedback for Robust Out-of-Distribution Detection

本文提出了 ASAT,这是一个通过利用真实世界的分布外反馈来动态调整评分函数和阈值的“人机协同”框架,旨在最大化真阳性率的同时严格控制假阳性率,从而在鲁棒的分布外检测方面优于现有方法。

原作者: Daisuke Yamada, Harit Vishwakarma, Ramya Korlakai Vinayak

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Daisuke Yamada, Harit Vishwakarma, Ramya Korlakai Vinayak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位正驾驶着飞船穿行在密集、多雾的小行星带中的舰长。你的飞船计算机非常聪明,但它仅在训练营期间被训练去识别它所见过的特定形状的小行星。随着你向深空飞行,你开始遇到奇怪的新物体:漂浮的冰块、发光的水母和金属云。这些是“分布外”(Out-of-Distribution, OOD)输入——即计算机从未见过的东西。如果计算机将一个危险的未知物体误认为是安全的小行星,你的飞船可能会坠毁。这就是 OOD 检测的核心问题:教 AI 在面对未知时说“我不知道这是什么”,而不是进行可能导致致命错误的猜测。

为了解决这个问题,科学家通常会构建一个“计分卡”系统。计算机为每个物体给出一个分数:高分意味着“我确定这是一个正常的小行星”,低分意味着“这看起来很奇怪”。然后他们画一条线,称为阈值(threshold),来决定何时拉响警报。如果分数低于这条线,他们就会停下来并请求人类专家的帮助。难点在于设定这条线。如果你把线设得太高,你可能会错过危险物体(“假阴性”);如果你把线设得太低,你可能会因为每一个小石块就让飞船停下,从而浪费时间和燃料(“假阳性”)。在医疗诊断或自动驾驶等安全至上的工作中,假阳性可能与假阴性一样糟糕;你既不希望医生告诉一个健康的患者他患有癌症,也不希望汽车忽略一个真实的障碍物。

这篇题为 ASAT 的论文探讨了如何即使在宇宙环境发生变化时,也能保持那份完美的计分卡和警报线。作者戴介介(Daiske Yamada)、哈里特·维什瓦卡玛(Harit Vishwakarma)和拉姆亚·科拉克莱·维纳雅克(Ramya Korlakai Vinayak)提出了一种新的系统,它不仅仅是设定一个规则然后忘掉它,而是创建了一个“人机协同”(human-in-the-loop)的框架,能够实时学习。他们发现,依赖固定计分卡和静态线的旧方法,在“奇怪”物体随时间变化时往往会失效。他们的新方法 ASAT 通过人类专家的实时反馈,不断更新计分卡和警报线,确保系统在变得更聪明的同时保持安全。

“设定后即忘”的问题所在

想象你是一名博物馆的保安。你得到了一份著名画作的清单(“分布内”或 ID 数据),并被告知要拦截持有伪造品的人。你制定了一个规则:“如果画作看起来有 95% 以上像真品,就让他们通过。”这就是目前大多数 AI 系统的工作方式。它们基于已知数据进行训练,并设定一个阈值来捕捉 95% 的真实内容。

但问题在于:论文指出,这种方法在你的安保工作中留下了一个巨大的漏洞。当你忙于捕捉 95% 的真品时,由于你的规则在“奇怪”的一侧过于宽松,你可能会意外地放行 90% 的伪造品。在 AI 世界中,这被称为高假阳性率(False Positive Rate, FPR)。在医疗背景下,这意味着 AI 可能会告诉一个健康的人他长了肿瘤,从而引起不必要的恐慌和昂贵的检查。论文认为,仅仅追求高“真阳性率”(捕捉好东西)而不严格控制“假阳性率”(不要虚惊一场)是危险的。

此外,旧的方法是僵化的。想象博物馆开始接收一种新型伪造品:全息图。你原本针对纸质伪造品设计的规则,对全息图可能完全不起作用。系统会陷入停滞,因为它从未被教导在门开启后如何改变其规则。

走进 ASAT:自适应安保员

作者提出了 ASAT(具有人类反馈的自适应评分与阈值设定)。不要把 ASAT 想成一个拿着静态规则手册的机器人,而要把它想成一个能从每个案例中学习的侦探。

以下是奇迹发生的过程:

  1. 计分卡(评分函数): ASAT 不再使用固定的公式来判断一个物体有多“奇怪”,它可以重写自己的公式。如果它反复错误地识别某种特定类型的奇怪物体,它会询问人类专家:“嘿,这是伪造品吗?”如果人类回答:“是的,那是全息图。”ASAT 就会更新其内部计分卡,以便下次能更好地识别全息图。
  2. 警报线(阈值): 决定何时停止飞船的线也不是静态的。ASAT 会移动这条线,以确保它绝不会让超过极小且安全的比例的伪造品通过(严格控制 FPR)。
  3. 人类环路: 系统足够聪明,知道什么时候自己不确定。如果一个物体正好处于警报线的边缘,ASAT 会暂停并请求人类提供真实标签。这种人类反馈是驱动更新的燃料。

论文证明了 ASAT 是一个“人机协同”的框架。它不只是猜测,它在学习。当出现一种新的 OOD 数据(如全息图)时,ASAT 会同时调整其评分函数和阈值。

他们的发现:更聪明,更安全

研究人员在名为 OpenOOD 的著名基准测试上测试了 ASAT,使用了 CIFAR-10(作为“正常”数据)以及各种其他数据集(作为“奇怪”数据)。他们将 ASAT 与另外两种方法进行了比较:

  • FSFT: 固定计分卡和固定阈值(旧的、僵化的方式)。
  • FSAT: 固定计分卡但采用自适应阈值(折中方案)。

在实验中,结果非常明确。旧的固定方法(FSFT)通常具有极高的假阳性率,有时会将 32% 到 91% 的“奇怪”数据误认为正常数据。这对安全来说是一场灾难。FSAT 方法在控制假警报方面表现较好,但由于它无法改变计分卡,因此错失了许多本可以被更智能系统识别出的“奇怪”物体。

然而,ASAT 成功做到了两者兼顾。它将假阳性率严格控制在 5%(安全限制)以下,同时显著提高了真阳性率。在某些测试中,与最好的固定方法相比,AS%,ASAT 捕捉“奇怪”物体的能力提升了超过 40%

论文还观察了当“奇怪”物体突然变化(非平稳设置)时会发生什么。想象博物馆一夜之间从纸质伪造品转向了全息图。旧系统会感到困惑并开始放行伪造品。然而,ASAT 能迅速意识到模式发生了转移。它利用新的人类反馈来更新其计分卡和阈值,在经历短暂且暂时的误差峰值后,迅速恢复到安全状态。

安全网:他们如何知道它有效

你可能会问:“如果系统在改变自己的规则,我们如何知道它不会崩溃呢?”作者不仅运行了模拟并寄希望于好运;他们构建了一个数学上的安全网。他们从理论上证明,只要“奇怪”的物体在一段时间内保持不变(平稳条件),ASAT 将保证假阳性率始终低于用户的限制(例如 5%)。

他们使用了一种巧妙的统计工具,称为“时间一致置信序列”(time-uniform confidence sequence)。想象一个在你走过钢丝时会拉伸和收缩的安全网。即使系统在学习和变化,这个数学网络也能确保跌落(犯错)的概率永远不会超过安全限度。他们展示了,即使系统正在处理依赖于其自身先前决策的数据(这对数学来说是一个棘手的情况),该安全保证依然成立。

总结

论文得出结论,ASAT 是 AI 安全领域迈出的有力一步。它解决了当前 OOD 检测的两大难题:容易产生过多假警报,以及无法从新的、未见的威胁中学习。通过让系统在人类专家的帮助下调整其“计分卡”和“警报线”,ASAT 创建了一个不仅更安全,而且更高效的系统,随着时间的推移,它通过变得更专业,减少了对人工干预的需求。

虽然作者指出,他们目前的保证依赖于“奇怪”数据保持相对一致,且嘈杂的人类反馈可能是一个挑战,但他们已经为未来铺平了道路——在那个未来,AI 系统可以安全地航行在未知领域,在不失去安全护栏的前提下,实现实时学习与适应。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →