← 最新论文
🤖 machine learning

Adversarial Frontiers: Minimum-Norm Attack Ensembles for Robustness Evaluation

本文引入了一种统一的评估框架,该框架通过可控的最小范数攻击集成和基于前沿的指标,取代了固定预算、单一范数的对抗性评估,从而在多种扰动范数下提供稳定、高效且具备最优性感知能力的鲁棒性排名。

原作者: Luca Scionis, Luca Melis, Maura Pintor, Fabio Brau, Ambra Demontis, Giorgio Fumera, Fabio Roli, Battista Biggio

发布于 2026-07-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Luca Scionis, Luca Melis, Maura Pintor, Fabio Brau, Ambra Demontis, Giorgio Fumera, Fabio Roli, Battista Biggio

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名博物馆的保安,你的工作是识破假画。在人工智能的世界里,这些“假画”被称为对抗样本(adversarial examples):即对图像进行微小的、几乎不可察觉的修改,从而误导计算机将一只猫看成一只狗。多年来,科学家们一直试图衡量计算机识别这些假画的能力有多强。他们通常会选择一个特定的“难度等级”(比如特定程度的噪声),然后观察计算机是否能通过测试。但这就像只在正午时分测试一名保安的视力;这无法告诉你他在黎明或黄昏时的视觉情况。核心问题在于:我们如何才能真正知道一台计算机是否对所有类型的诡计都具有鲁棒性,而不仅仅是针对我们选出的那几种?

正是在这里,一项新的研究登场了,它扮演着一位拒绝依赖单一线索的顶级侦探。研究人员认为,仅仅检查计算机在某一个固定难度等级下的防御能力是一种有缺陷的游戏。相反,他们提出了另一种玩法:一种能够绘制出计算机防御“全强度曲线”的方法——从最简单的诡计到最难的诡计。他们引入了一个系统,该系统不仅是在猜测,而是利用一组不同的攻击策略,系统地搜寻计算机盔甲中最薄弱的一点,同时严格控制所消耗的“计算能量”(或查询次数)。其结果是一种全新的防御排名方式,它不再依赖于挑选一个任意的难度设置,从而为谁才是真正的强者提供了更清晰的图景。

“一刀切”测试的问题所在

长期以来,测试 AI 安全性的标准方法就像是在做一道只能回答一个问题的多项选择题。研究人员会选择一个特定量的“噪声”(我们称之为 ϵ\epsilon)添加到图像中,然后观察 AI 是否仍能正确识别。如果成功,AI 就会获得高分;如果失败,则得分较低。

本文作者指出,这样做有点愚蠢。想象一下两名跑步选手,爱丽丝(Alice)和鲍勃(Bob)。如果你只在 100 米处为他们计时,爱丽丝可能看起来更快。但如果你在 200 米处计时,鲍勃可能会胜出。他们的速度变化率是不同的。同样,某些 AI 模型可能擅长抵御微小、微妙的变化,但在抵御较大、较粗糙的变化方面表现很差。通过仅在一个固定点进行测试,我们可能会对这些选手的排名产生误判。

此外,目前的“金标准”测试(称为 AutoAttack)就像一份预包装好的午餐。它是固定的;你不能改变食材,也不能在还没吃饱时增加食物。它使用固定数量的尝试来破解 AI。如果 AI 非常强大,这份午餐可能不足以证明它很脆弱;但如果 AI 很脆弱,这份午餐又显得过于冗余。我们无法知道这项测试是否足够强大到能找到真正的突破点,还是它只是过早地放弃了。

新策略:“前沿”搜寻

为了解决这个问题,作者引入了一个基于两个核心理念的新框架:攻击前沿(Attack Frontier)防御前沿(Defense Frontier)

可以将攻击前沿想象成一支黑客团队针对特定 AI 能达到的终极“最高分”。由于我们无法得知打破 AI 的绝对完美方式(即“最坏情况”),研究人员创建了一个不同的攻击工具池。然后,他们尝试寻找这些工具的最佳组合,以尽可能接近那个完美的破坏点。他们称之为“前沿”,因为它代表了当前能够实现破坏能力的边界。

防御前沿则是另一面。它是指一组不同 AI 模型中的“最佳可能防御”分数。它作为一个天花板,展示了该组内任何模型所能达到的最高安全水平。

该论文的主要创新是一个像精打细算的经理一样聪明的贪婪算法。想象一下,你有一个有限的预算(“查询预算”)来雇佣一支黑客团队来测试 AI。你既不想浪费钱雇佣一个干不好活的黑客,也不想在某个优秀的黑客已经发挥出最佳水平后还继续雇佣他。该算法能够精确计算如何在不同类型的攻击之间分配预算(有些擅长寻找微小的漏洞,有些擅长寻找大的漏洞),从而获得关于 AI 弱点最准确的描述。

结果:一种新的排名方式

研究人员在两个著名的图像数据集上测试了他们的方法:CIFAR-10(小型、简单的图片)和 ImageNet(现实世界、复杂的图片)。他们测试了 30 种不同的 AI 防御手段。

以下是他们的发现:

  1. “曲线”至关重要: 当他们观察 AI 模型的完整强度曲线而非仅仅一个点时,发现模型的排名发生了剧烈变化。一个在某个难度等级下看起来像冠军的模型,在测试稍高的难度等级时往往会跌至谷底。这证明了旧的排名方式(选取一个固定的难度)是不稳定的,且具有误导性。
  2. 优于旧标准: 他们的“最小范数攻击集成”(即经过智能预算管理的黑客团队)在大多数模型上都能达到甚至超过当前标准 AutoAttack 的性能。事实上,对于 2\ell_2 范数(一种衡量图像变化程度的特定测量方式),他们的这种方法在仅使用 4,000 次查询的情况下,就在 13 个模型中的 12 个模型上匹配或超过了标准方法,而标准方法有时会消耗高达 7,566 次查询。
  3. 防御最优指数(DOI): 他们创建了一个名为 DOI 的新评分系统。DOI 不会说“这个 AI 有 85% 的安全性”,而是说“这个 AI 达到了历史上最强 AI 安全水平的 95%”。这个分数不依赖于挑选特定的难度等级,而是观察整个曲线。这使得排名更加稳定且公平。

这为什么重要

论文指出,我们不应再将 AI 安全性测试视为单一的快照,而应将其视为一部电影。通过使用灵活的预算来搜寻整个可能攻击范围内的最弱点,我们可以获得关于 AI 真实安全性更清晰、更诚实的图景。

作者表明,他们的方法不仅是一个理论构想,而且在实践中行之有效。他们证明了你可以从较小的预算(4,000 次查询)开始,以获得模型强度的初步概念。如果模型看起来很弱,你可以在那里停止并节省成本。如果模型看起来很强,你可以投入更多查询(高达 12,000 次),以获得更紧凑、更精确的估计。这为研究人员和工程师提供了一个既比过去的僵化、一刀切测试更便宜、又更准确的工具。

简而言之,论文认为,要真正了解一个 AI 是否安全,我们需要停止猜测正确的难度等级,转而开始绘制危险的全景图。他们的新“前沿”方法正是这样做的,它提供了一种更公平、更灵活且更不容易被欺骗的防御排名方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →