← 最新论文
🤖 AI

A Robust Out-of-Distribution Detection Framework via Synergistic Smoothing

本文介绍了 ROSS,一种鲁棒的后验分布外检测框架,该框架利用中值平滑来量化局部分数不稳定性,从而实现对分数最小化和分数最大化对抗攻击的先进对称鲁棒性。

原作者: Maria Stoica, Abdelrahman Hekal, Alessio Lomuscio

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Maria Stoica, Abdelrahman Hekal, Alessio Lomuscio

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明的保安(人工智能)站在俱乐部门口。这位保安擅长识别常规会员(分布内数据),通常知道何时放行他们。然而,这位保安有一个致命的缺陷:如果陌生人(分布外数据)戴上令人信服的伪装,或者用特定类型的噪声迷惑保安,保安可能会自信地放他们进入,误以为他们是会员。这是一个安全隐患。

本文介绍了一种名为ROSS(通过协同平滑实现的鲁棒分布外检测器)的新系统来解决这个问题。以下是其工作原理,使用简单的类比说明:

1. 问题:善变的“保安”

当前的保安(AI 检测器)往往是“有方向性”的。

  • 有些保安被训练成:如果有人看起来过于完美,就会感到紧张。如果骗子让陌生人看起来稍微更像“会员”,保安就会困惑并放行。
  • 另一些保安被训练成:如果有人看起来过于杂乱,就会感到紧张。如果骗子让陌生人看起来稍微更像“陌生人”,保安也会困惑。
  • 缺陷:这些保安容易受到特定类型骗局的攻击。如果你知道如何欺骗保安 A,你就能绕过安保。

2. 解决方案:“稳定性测试”

ROSS 改变了游戏规则。ROSS 不是只看陌生人一次,而是要求保安在每次稍微晃动相机或给图像添加少量静态噪声的情况下,25 次观察陌生人。

可以这样理解:

  • 真正的会员(分布内数据):如果你用晃动的相机给真正的会员拍 25 张照片,他们看起来仍然是同一个人。他们的面容是稳定的。保安的置信度不会大幅波动。
  • 冒名顶替者(分布外数据):如果你用晃动的相机给冒名顶替者拍 25 张照片,其中一张可能看起来像猫,下一张像石头,再下一张像模糊的一团。保安的判断会剧烈摇摆。他们是不稳定的。

3. 两步检查法

ROSS 使用两种特定工具来做出决定:

A. “中位数”(中间立场)
ROSS 不取保安 25 次判断的平均值(这可能会因一个奇怪的异常值而失真),而是取中间的意见。这就像向一群人询问猜测,并忽略最响亮、最极端的观点。这产生了一个更难被欺骗的“平滑”分数。

B. “不稳定性计”(MAD)
ROSS 测量保安的判断在那 25 次晃动中波动了多少。

  • 低波动(稳定):“好吧,这看起来像会员,而且每次我晃动相机时,它看起来都像会员。” -> 高信任度
  • 高波动(不稳定):“有一次它看起来像会员,但下一次看起来像狗。” -> 低信任度

4. “置信度闸门”(安全网)

这里是巧妙之处。论文指出,有时一个完全的陌生人可能看起来非常稳定(例如,一张实心的灰色墙壁图片)。如果保安只看稳定性,他们可能会想:“哇,那面墙非常一致,放他们进来吧!”

ROSS 通过添加一个置信度闸门来防止这种情况:

  • 只有当陌生人已经以高置信度看起来像会员时,它才给予“稳定性奖励”。
  • 如果陌生人看起来像会员但不稳定,他们会被拒绝。
  • 如果陌生人看起来像会员且稳定,他们的分数将获得“超级提升”。
  • 如果陌生人看起来像陌生人,无论稳定性如何,他们都会被拒绝。

5. 为什么它是“对称”的(最棒的部分)

以前的方法就像一把锁,只有当你朝一个方向推钥匙时才起作用。如果你朝另一个方向拉,锁就会坏掉。

  • ROSS 是一把“对称”的锁。因为它不关心分数是向上推还是向下拉,而是关注分数有多摇晃,所以它既能抵御试图让 AI 认为陌生人是会员的攻击者,也能抵御试图让 AI 认为会员是陌生人的攻击者。

结果总结

作者在标准图像数据集(如 CIFAR-10 和 ImageNet)上测试了该系统。他们发现:

  • 与以前的方法相比,ROSS 更难被欺骗。
  • 在遭受攻击时,它将系统识别伪造品的能力提高了多达40%
  • 它作为一个“即插即用”的升级方案。你不需要重新训练整个 AI;只需在现有系统之上添加这个“稳定性检查”层即可。

简而言之,ROSS 通过检查当世界变得稍微动荡时保安的置信度是否依然稳固,从而降低了 AI 保安被伪装欺骗的可能性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →