← 最新论文
🤖 machine learning

A New Kind of Adversarial Example: Measuring the Human-Model Gap, and Its Relationship to OOD Detection

本文引入并验证了一类新型对抗样本,其中巨大的、可见的扰动会导致人类对图像产生误认,而模型仍能保持正确的预测,从而证明了标准的分布外(OOD)检测器和防御措施在应对这种人机差异时基本是无效的。

原作者: Ali Borji

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Ali Borji

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

无形墨水与盲点

想象一下,你正在教一个机器人识别猫和狗的照片。你给它看了成千上万张照片,它变得非常擅长这项工作。但随后,你发现了一个奇怪的故障:如果你在猫的照片中加入一点微小的、肉眼看不见的数字噪声,机器人突然就会认为那是一只狗。这就是经典的“对抗样本”(adversarial example),这是人工智能领域一个著名的难题——机器在面对人类甚至无法察觉的微小变化时,表现得异常脆弱。

但如果这种故障反过来起作用呢?如果你可以拍一张猫的照片,用粗大的红色马克笔在上面乱涂乱画,直到它看起来像一团混乱的色彩,而机器人仍然以100%的信心坚持认为:“这绝对是一只猫”。与此同时,一个看着这团乱涂乱画的人类却完全不知道自己在看什么。这篇论文探讨的正是一个完全相同的场景。它提出了一个简单但令人恐惧的问题:我们的眼睛所看到的,与机器人的大脑所相信的之间,是否存在差距?如果存在,我们能否建立一个安全系统来捕捉它?这不仅仅是关于如何欺骗机器人,更是关于理解我们的AI是否在对那些对我们而言完全无法辨认的东西进行“幻觉式自信”。

“新型”诡计

这项研究背后的研究人员决定颠覆以往欺骗AI的常规方式。通常,黑客试图通过添加微小的、不可见的改变来让机器人“出错”。而在这里,他们试图让机器人“固执地正确”,同时让图像对人类而言“完全错误”。他们将此称为“新型对抗样本”(New Kind of Adversarial Example,简称NKE)。

这就像是一个魔术表演:魔术师(AI)坚信帽子里有一只兔子,尽管帽子现在填满了亮片、纸屑和一只活生生的松鼠。人类观众(我们)看着帽子说:“我完全不知道那是什么!”但魔术师却一直指着它,满脸确定地说:“兔子!兔子!”

团队在三个难度等级上进行了测试:简单的黑白数字(MNIST)、色彩丰富的物体小图(CIFAR-10)以及现实世界的照片(ImageNet)。他们发现,他们可以轻易地创造出这些“涂鸦”图像。随着他们加入越来越多的混乱噪声(直到图像看起来像旧电视上的雪花点为止),AI模型保持了原始标签,且其置信度分数始终维持在完美的100%。但人类呢?他们完全迷失了。

人类与机器人的差距

为了证明这不仅仅是计算机模拟,研究人员进行了一个针对真实人类的小型实验。他们向五名志愿者展示了这些涂鸦图像,并要求他们猜测图片是什么。结果非常悬殊。当图像被重度涂鸦后,人类只有约8%的概率能猜对。与此同时,AI仍然以100%的准确率进行判断。

这造成了巨大的“人机差距”。AI对于人类所能看到的内容表现出了“自信的错误”。研究人员还检查了这是否仅仅是因为图像太模糊或噪声太多。他们将“涂鸦”图像与具有相同视觉“损伤”程度的随机噪声进行了对比。他们发现,尽管两者在人类看来都是垃圾,但AI所使用的特殊“涂鸦”实际上比随机噪声更容易被其他计算机程序识别。这表明AI并非只是忽略了噪声,而是捕捉到了某种人类无法理解的、隐藏的奇特模式。

安全盲点

这里是事情变得棘手的地方。通常,当AI看到一些奇怪的东西(比如一张看起来像云朵的烤面包机照片)时,它应该拉响警报。我们拥有被称为“分布外检测器”(Out-of-Distribution (OOD) detectors)的工具,专门设计用来做这件事。它们会检查图像是否看起来像是AI训练时使用的数据。如果不是,检测器就会发出警告:“嘿,这看起来很可疑!”

研究人员用这些涂鸦图像测试了这些安全工具。结果是:标准工具完全失灵了。

  • 置信度检查: AI说:“我100%确定!”于是安全工具认为:“好吧,没问题。”
  • 能量检查: 另一种观察图像中是否存在“异常能量”的工具也未发现任何问题。
  • 特征检查: 其中一种专门观察数据内部“形状”的工具确实捕捉到了它们。它将100%的涂鸦图像标记为可疑。

但问题在于,研究人员展示了如果黑客知道这个“特征检查”工具的存在,他们只需对涂鸦进行极其微小的调整就能骗过它。这就像一个窃贼了解了房子里所有的报警系统,然后完美地破解了锁具,使得报警器从未响起。那个原本可以识破诡计的工具,一旦遇到聪明的攻击者,就会轻易被击败。

纹理 vs 形状之谜

为什么会发生这种情况?研究人员深入挖掘了AI的“大脑”,以观察它到底在看什么。他们发现了一个迷人的分歧:

  • 纹理: AI高度依赖图像的微小细节,即“纹理”(比如猫的毛发)。涂鸦几乎瞬间破坏了这种纹理。
  • 形状: 物体的“轮廓”或“形状”(比如猫身体的曲线)在涂鸦下存留的时间要长得多。

人类通常通过形状来识别事物。但在这种情况下,AI似乎忽略了形状,转而被纹理所迷惑,或者可能是在捕捉某种只有它自己能理解的奇特纹理模式。即使他们测试了一种旨在更好地观察形状的新型AI(视觉Transformer/Vision Transformer),它依然掉入了陷阱。人类与机器之间的差距依然存在。

“超级防御”失效了

最后,团队问道:“我们能不能直接训练出一个更强大的AI?”他们尝试教AI抵御常见的微小、不可见攻击(这种方法称为“对抗训练”)。他们还尝试在AI观察之前对图像进行模糊处理或改变尺寸。

结果如何?完全没用。那些经过训练、能够抵御微小攻击的强健AI,在面对这些大规模涂鸦攻击时依然百分之百脆弱。事实证明,擅长忽略微小尘埃并不代表你能应对有人在你脸上画了一撇大胡子的攻击。这两类攻击是完全不同的,而我们目前的防御手段只覆盖了问题的一侧。

总结

这篇论文揭示了一个可怕的新漏洞。我们构建的AI系统可能会被诱导,从而对那些对我们而言完全无法辨认的东西表现出100%的信心。我们的现有安全警报之所以看不见这种威胁,是因为AI表现得过于笃定了。而且,即使是那些“能看见”的工具,如果攻击者知道如何利用,也会轻易被骗。

研究人员并不是说这是一个已解决的问题。事实上,他们是在说这是一个巨大的、开放性的安全漏洞。他们已经发布了所有的代码和用于测试这些现象的工具,希望其他科学家能协助研究如何构建出一种不会在面对一片混乱时只会“自信猜测”,而是能真正承认“我不知道这是什么”的AI。在此之前,我们必须保持警惕:仅仅因为机器人说它很确定,并不代表它是正确的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →