One Surrogate to Fool Them All: Universal, Transferable, and Targeted Adversarial Attacks with CLIP
本文介绍了 UnivIntruder,一种新颖的对抗性攻击框架,该框架利用单个公开的 CLIP 模型和文本概念来生成通用的、可迁移的且具有针对性的扰动,在无需访问目标训练数据或进行过度模型查询的情况下,对多种深度神经网络和现实世界系统实现高成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网是一座巨大且繁忙的城市,计算机扮演着警察、医生和店主的角色。这些计算机使用一种被称为“深度神经网络”(DNN)的特殊大脑来做决策,比如识别照片中的猫或诊断疾病。长期以来,科学家们发现了一个奇怪的把戏:你可以用“对抗性攻击”来欺骗这些计算机大脑。这就像是在停止标志上贴一个微小的、几乎看不见的贴纸,让计算机误以为那是限速标志。通常情况下,要完成这种把戏,黑客要么需要窥视计算机的秘密代码(这在现实世界中是不可能的),要么需要向计算机提出成千上万个问题以了解其秘密(这太慢且太昂贵)。
但如果可以不问计算机任何问题,就能欺骗任何计算机大脑呢?这就是这篇论文所探讨的核心问题。研究人员使用了一个名为 CLIP 的强大工具,它就像一位超级聪明的图书管理员,读过数十亿本书籍并见过数十亿张图片,学习了文字与图像是如何连接的。他们想看看是否可以使用这个“通用图书管理员”来创造一把“万能钥匙”——一个单一的、微小的数字失真——从而欺骗几乎所有的计算机视觉系统,从谷歌搜索到高科技机器人,只需使用像“母鸡”或“猫”这样简单的词汇作为引导。
万能钥匙:一个足以迷惑所有人的替代模型
见见 UnivIntruder,这是由 Binyan Xu 及其团队引入的一种全新的攻击框架。把它想象成一个用于计算机视觉的“通用万能钥匙”。在过去,如果黑客想要欺骗特定的计算机系统,他们必须构建该系统的伪造副本(即“替代模型”),并使用与真实系统相同的训练数据。这就像是试图通过先用相同的金属和螺丝制造一个完美的锁孔复制品,来撬开一把特定的锁。如果你没有原始锁的蓝图或精确的金属,你的假钥匙就不会起作用。
UnivIntruder 改变了游戏规则。研究人员意识到,他们不需要目标的完美副本。相反,他们使用了 CLIP——一个公开可用的、理解图像与文本关系的超聪明 AI。他们将 CLIP 作为他们的“替代模型”或练习用的锁。这里的奥秘在于:他们并没有尝试复制目标的训练数据。相反,他们使用了一个包含随机图像的公共数据集(这些图像可能与目标数据完全不同)以及简单的文本概念。
这个把戏是如何运作的:
假设你想欺骗一个安防摄像头,让它把一张松鼠的照片看作是一只“母鸡”。
- 文本引导: 你告诉系统,“我希望它看起来像一只母鸡”,并且“我不希望它看起来像猫或马”。
- 方向性偏移: 系统不仅仅是观察图片,它还会观察图片与文本之间的差异。它计算出计算机大脑中的一个“方向”。它会问:“如果我沿着这个特定的方向推动这张松鼠图片,它是否会向‘母鸡’的概念靠近,并远离‘猫’的概念?”
- 通用贴纸: 系统会创建一个微小的、通用的“贴纸”(扰动),这个贴纸一旦添加到任何图像中,就会将其推向那个方向。
- 转折点: 为了确保这个贴纸不仅适用于他们练习的那个相机,而是适用于任何相机,他们在创建贴纸时会对图像进行旋转、缩放和裁剪。这迫使贴纸具有鲁棒性,就像一个即使汽车经过洗车房或被泥土覆盖后依然有效的贴纸。
结果:欺骗世界
该团队在大规模范围内测试了这个“万能钥匙”。他们不仅在一个计算机上进行了测试,还在 85 个不同的模型和现实应用上进行了测试。
- 数据表现: 在标准测试集上,他们的攻击极其有效。在 CIFAR-10 数据集(一种常见的图像识别测试)上,他们的成功率达到了 99.4%。在拥有 1,000 个不同类别的庞大 ImageNet 数据集上,成功率达到了 85.1%。
- 现实世界: 这是最可怕的部分。他们并没有止步于实验室测试。他们尝试欺骗真实的在线服务:
- 搜索引擎: 他们上传了一张经过扰动的猴子图片到谷歌、百度、淘宝和京东。搜索引擎显示的不是猴子,而是开始显示它们是母鸡(hen)。在百度上,成功率达到了 84%。
- 超级 AI: 他们测试了最先进的 AI 聊天机器人 GPT-4 和 Claude-3.5。当向这些 AI 展示一张经过扰动的猴子图片时,它们自信地将其描述为“母鸡”或“小鸡”。在 Claude-3.5 上的成功率达到了 80%。
- 图像生成器: 甚至像 DALL·E 3 这样能够画图的 AI 也被骗过了。当基于扰动后的输入生成图像时,它生成的图像是鸡而不是猴子。
为什么其他方法失败了
论文非常明确地指出了哪些方法是行不通的。以前的方法尝试使用 CLIP 作为辅助,但由于它们没有考虑到数据的“偏差”而失败了。
- 偏差问题: 如果你使用一个带有轻微蓝色调的数据集来训练一个假的锁,你的钥匙可能只对蓝调的锁有效。研究人员发现,通过使用“方向”(即从新特征中减去原始图像的特征)而不是原始特征,他们抵消了这些偏差。
- 替代模型问题: 其他方法尝试使用 CLIP 但无法将攻击转移到其他模型。作者指出,如果没有他们特定的“方向性”和“随机变换”技巧,即使使用 CLIP,在面对先进模型时的失败率也会超过 70%。UnivIntruer 是唯一成功弥合了公共 CLIP 模型与现实世界中多样且未知的模型之间差距的方法。
这对安全意味着什么
论文指出,我们目前的安全性观念可能已经破碎了。通常,我们认为如果我们隐藏训练数据并限制人们提问的数量,我们就是安全的。UnivIntruder 证明了攻击者可以完全绕过这些防御。他们不需要你的数据,也不需要向你提问。他们只需要一个公开的 AI(CLIP)和几个词语。
研究人员还测试了我们能否阻止这种行为。他们尝试了“对抗性训练”(教计算机抵抗把戏)和“测试时防御”(在处理图像前对其进行清洗)。虽然这些方法有一些帮助,但它们往往会让计算机在执行实际任务(如识别真正的猫)时变得更差,或者在运行像 GPT-4 这样的大型系统时成本过高。论文结论认为,我们需要重新思考如何保护 AI 安全,因为一个单一的、公开可用的模型现在可以被用来欺骗几乎任何东西。
简而言之,UnivIntruder 是一个警钟。它表明,有了正确的“通用钥匙”,数字世界的视觉系统比我们想象的要脆弱得多,而在 AI 眼中,挡在猴子和母鸡之间的,可能只是一个微小的、肉眼几乎不可见的数字故障。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。