Shared Vulnerabilities in Robustness-Optimized Defenses: One Breach Exposes the Family
本文揭示了以对抗训练和净化方法为代表的鲁棒性优化防御手段存在内在缺陷,即攻破一种代表性防御即可危及整个防御家族,这种风险通过新的 PGDTransfer 攻击和对抗敏感度图(Adversarial Sensitivity Maps)得到了量化,这些方法证明了即使在没有专门设计的攻击设计情况下,仍具有极高的迁移成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:你的手机、你的汽车,甚至你的医疗设备,都由超级聪明的 AI 大脑驱动。这些大脑擅长识别面部或阅读 X 光片,但它们有一个秘密弱点:图像上一个微小到几乎看不见的污点就能欺骗它们,让它们看到完全不同的东西。这就像是在停止标志上画了一个极小的点,却让自动驾驶汽车误以为那是限速标志。为了阻止这种情况,科学家们为这些 AI 大脑构建了“保镖”。有些保镖通过向 AI 展示成千上上个充满陷阱的图片来训练它变得强壮(对抗训练);而另一些则充当过滤器,在 AI 看到图片之前将其清洗干净(对抗净化)。大家都希望这些保镖能让 AI 变得坚不可摧。但如果这些保镖尽管看起来各不相同,实际上却穿着同样的秘密制服呢?如果攻破其中一个保镖,是否会意外地让坏人拿到破解所有保镖的钥匙?
这正是 Hanrui Wang 及其团队在一篇新论文中发现的惊人发现。他们发现,当不同的 AI 防御机制被优化以实现“鲁棒性”(即对攻击具有抵抗力)时,它们会不经意间共享相同的隐藏弱点。这就像是一个超级英雄家族,他们都在同一个道馆接受训练;如果一名反派学会了如何击败其中一人,他可能无需学习其特定的招式,就能击败整个家族。研究人员不仅是凭直觉猜测,他们还构建了一个简单且巧妙的测试,称为“PGDTransfer”,以及一张特殊的地图——“对抗敏感度图”(Adversarial Sensitivity Maps),以此来证明这一点。他们发现,一旦攻破了一种类型的“清洗”防御,这种攻击通常会对几乎所有其他清洗防御都奏效,在某些情况下成功率超过 80%。这表明,仅仅让 AI 变得更强是不够的;我们还需要确保不同的防御机制不会共享相同的秘密裂缝。
家族秘密:一处破绽,全员暴露
把 AI 防御想象成不同品牌的高科技锁具。有些锁使用指纹扫描,有些使用视网膜扫描,还有些使用语音密码。你会认为,如果小偷破解了指纹锁,就无法打开视网膜锁。但这篇论文揭示了一个转折:如果这些锁的设计都遵循同一种“安全哲学”(即试图变得超级鲁棒),那么它们的齿轮里可能都存在同一个微小且隐形的缺陷。
研究人员称之为“共享脆弱性”(Shared Vulnerability)。他们发现,当 AI 系统被训练得对攻击具有超强抵抗力时,它们往往会忽略图像的相同部分,并专注于相同的“安全”部分。这意味着,如果黑客制造了一张用来欺骗特定强韧 AI 的陷阱图片,这张图片通常也能欺骗其他强韧的 AI,即使这些 AI 内部结构看起来完全不同。这就像是一名顶级窃贼找到了一把能打开整个社区所有锁的万能钥匙,因为所有的锁都是由同一家工厂制造的,尽管它们的颜色和形状各异。
侦探工作:他们是如何发现裂缝的
为了证明这一点,团队必须非常谨慎。过去,人们通过对图片进行巨大的、明显的改动来测试攻击是否可以“迁移”(即作用于不同的 AI)。研究人员意识到这是一种作弊行为;如果你把图片弄得足够模糊,任何 AI 都会感到困惑,但这并不是因为它们共享弱点,而是因为图片本身已经毁掉了。
因此,他们制定了更严格的测试规则:
- 仅限微小变化: 他们使用了极其微小、几乎看不见的改动(预算为 ),以确保攻击不仅仅是在破坏图片。
- 严禁作弊: 他们使用了“单代理”规则。黑客可以在一个 AI(代理模型)上进行训练,但必须在不知道其内部秘密的情况下攻击另一个不同的 AI(目标模型)。
- 简单的攻击: 他们没有使用极其复杂、高级的黑客工具,而是使用了一种非常简单的方法,称为 PGDTransfer。这就像是用一把基础款螺丝刀而不是激光切割机。如果一把简单的螺丝刀就能破解多种锁具,那就证明问题出在锁本身,而不是工具。
他们还创建了 对抗敏感度图 (AdvSMs)。想象一下观察城市地图以了解哪些街道繁忙。这些地图展示了图像中 AI 正在关注哪些具体的像素(微小的点)。研究人员发现,“强韧”的 AI 都会关注相同的特定像素,并忽略相同的其他像素。这就像是一个家族里的所有保镖都决定守在正门,而忽略了后窗。如果一名窃贼知道如何通过其中一个保镖的后窗潜入,他就知道该如何应对所有人。
结果:一次警钟
他们发现的数据令人震惊。当他们使用这些简单的攻击针对“净化”防御(即那些尝试清洗图像的防御机制)进行测试时:
- 在不同类型的清洗器(过滤、压缩和基于扩散的清洗器)中,攻击的平均成功率达到了 80.4%。
- 尽管这些防御机制单独来看看起来很强大,但它们都容易受到同一种简单技巧的影响。
- 即使是目前被认为是最强、最复杂的 基于扩散 (Diffusion-based) 的防御机制,也未能幸免。
论文明确排除了这种现象仅仅是因为 AI 模型看起来相似(例如具有相同的架构)的可能性。他们测试了具有完全相同设计但训练方式不同的模型,并发现如果其中一个模型不是“鲁棒”的,攻击就不会发生迁移。只有当两者都被优化为鲁棒时,迁移才会发生。这证明了正是“鲁棒性优化”本身创造了这种共享的弱点。
这对未来意味着什么
核心结论并不是说 AI 注定失败,而是说我们让 AI 变得安全的方式需要改变。目前,我们的重点是让每一个独立的 AI 尽可能强壮。这篇论文表明,我们还需要关注多样性。我们需要确保不同的防御机制不会都学习去忽略同样的东西。如果我们继续以同样的方式训练它们变得“完美鲁棒”,我们实际上只是在建造一族共享同一把万能钥匙的锁。
作者建议,未来的安全性应该将“脆弱性多样性”作为一个目标。与其只问“这个 AI 是否强壮?”,我们还应该问:“这个 AI 的弱点是否与其他 AI 不同?”如果我们能确保当一个 AI 被欺骗时,并不意味着整个家族都暴露了,我们就能构建一个更安全、更数字化的世界。目前,这篇论文起到了警示作用:一处破绽可能会暴露整个家族,因此我们需要停止将这些防御机制视为孤立的岛屿,而要将其视为一个相互连接的生态系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。