The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails
本文引入了“不安全归纳攻击”(Unsafe Induction Attacks)及相应的“不安全语义蒸馏”(Unsafe Semantic Distillation)方法,旨在展示通过对安全图像进行肉眼不可察觉的扰动,如何操纵并触发多模态防护模型的误报拒绝,从而暴露出一个会导致服务可靠性下降并侵蚀用户信任的关键可用性漏洞。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:你最喜欢的 AI 助手就像一位超级聪明的图书管理员,既能看懂图片,又能读懂你的心思。当你问:“能把这只猫变成白色吗?”时,管理员会检查你的照片和问题,确保你没有试图违反规则。这位管理员被称为“防护模型”(guard model),它的职责是阻止坏事——比如暴力或可怕的图像——通过。通常,我们担心的是骗子试图把坏主意溜进管理员的视线(比如通过低声说出某种秘密代码,让管理员忽略危险)。但如果骗子并不想把坏东西带进来呢?如果他们想欺骗管理员,让管理员误以为“好东西”是“坏东西”呢?
这篇论文探讨了一种新型的诡计,叫做“狼来了”攻击(The Boy Who Cried Wolf attack)。攻击者并不是想隐藏一只狼,而是给一张无害的羊的照片涂上了一种只有管理员能看到的隐形墨水。当你把这张照片展示给管理员时,他们会大喊:“狼来了!狼来了!”并拒绝帮助你,尽管那其实只是一只可爱的小羊。论文表明,黑客可以利用这种手段让管理员变得如此混乱和过度保护,以至于停止为任何人提供帮助,从而毁掉每个人的乐趣。这不仅仅是破坏规则,而是让规则执行者变得如此偏执,以至于无法正常工作。
AI 世界中的“狼来了”
在人工智能领域,特别是那些能够看图并读文字的模型(称为多模态大语言模型,Multimodal Large Language Models)中,存在着安全卫士。它们就像俱乐部的保安。它们的职责是观察你带来的东西(一张图片和一个问题),并决定是否安全。如果安全,你就进入;如果不安全,你就被踢出去。
长期以来,研究人员一直担心“越狱”(jailbreaking)。那是有人试图通过将危险人物伪装成 VIP 来欺骗保安。但本论文提出了一个不同的问题:如果有人欺骗保安,让保安把一个完全无辜的人踢出去呢?
作者称之为不安全诱导攻击(Unsafe Induction Attack)。想象你有一张毛茸茸白猫的照片。它完全是安全的。但攻击者在照片中添加了微小的、肉眼不可见的改动——小到你的眼睛根本看不出来。对于人类来说,它仍然只是一只可爱的猫。但对于 AI 保安来说,这个微小的改动看起来就像一个写着“危险!”的巨大红旗。所以,当你要求 AI “把猫变白”时,AI 会拒绝,说:“我不能这样做,这张图片是不安全的!”
可怕之处在于,攻击者不需要知道你会问什么问题。他们只需要让照片看起来“不安全”,无论你问什么都一样。如果他们能做到这一点,他们就可以让互联网充斥着这些“被投毒”的照片。当普通人下载并尝试使用它们时,AI 会不断地说“不!”。最终,人们会感到沮着,不再信任 AI,甚至可能关闭所有的安全功能。这就是“狼来了”效应:守卫不断发出虚假警报,直到没人再相信它。
他们是如何做到的: “蒸馏”的魔力
研究人员发现,以前的尝试之所以失败,是因为它们太具有针对性了。如果你试图通过让一张图片看起来像特定的“坏”图像(比如某把特定的枪)来欺骗 AI,那么只有当用户提出的问题与那把特定的枪相关时,这种方法才会奏效。但现实中的用户会提出各种各样的随机问题。
为了解决这个问题,团队创建了一种新方法,称为不安全语义蒸馏(Unsafe Semantic Distillation, USD)。可以这样理解:与其试图模仿一个特定的“坏”图像,不如让 AI 学习“坏”的“神韵”。
- 旧方法(实例模仿/Instance Mimicry): 想象你想通过伪装成某个特定罪犯的样子来欺骗保安。如果保安看到你,他会认出那个人。但如果那个罪犯换了个帽子,保安可能就认不出你了。
- 新方法(USD): 研究人员提取了数百张不同的“坏”图像(暴力、武器等),并询问 AI:“所有这些坏事有什么共同点?”AI 找到了让事物感觉“不安全”的隐藏且不可见的模式。然后,他们教会了那张无害的猫的照片穿上这些隐形的模式。
他们不仅仅是复制了一个坏的东西,而是蒸馏了“邪恶的本质”。这意味着猫的照片看起来并不像特定的枪或特定的战斗;它只是携带了那种 AI 大脑能识别出的“危险气息”,无论你问什么问题。
结果:一种非常有效的诡计
团队在四种目前最智能的安全卫士(包括来自 Meta、LLaVA 等公司的模型)上测试了这种新方法。他们使用了大量的虚假用户问题,以观察这种诡计在不同类型的请求下是否有效。
结果令人惊讶地高。当他们使用这种新的“蒸馏”方法时:
- 他们实现了 84% 的成功率,使 AI 拒绝安全的图像,即使攻击者完全不知道用户的提问内容。
- 这比旧方法(仅能达到约 60% 到 70% 的成功率)要好得多。
- 他们甚至可以针对特定类型的“坏事”。他们可以通过调整隐形墨水,让 AI 认为一张汽车的照片是“暴力”的,或者一张玩具的照片是“色情”的。
论文表明这是一个真实存在的问题。攻击者不需要知道你要问什么;他们只需要“投毒”图像。由于这种攻击在不同问题下都能奏效,这证明了当前的安全性系统存在一个隐藏的弱点:它们很容易被诱导得过于“安全”,从而最终损害了所有人的利益。
为什么这很重要
这不仅仅是一个理论游戏。论文指出,如果坏人开始在社交媒体或公共数据集中传播这些“被投毒”的图像,普通用户可能会发现他们喜爱的 AI 工具突然无法工作。AI 会不断说“我不能这样做”,并不是因为用户做错了什么,而是因为他们上传的图像被隐形墨水秘密标记了。
作者总结道,虽然我们在阻止 AI 说出坏话方面做得很好,但我们还没有足够关注如何阻止 AI 错误地指控 好事。他们称之为一种“可用性故障”(availability failure)——系统仍然存在,但因为它忙于对着羊群大喊“狼来了!”,以至于它无法真正帮助任何人。这提醒我们,安全性不仅在于把坏人挡在外面,还在于确保守卫不会意外地把好人踢出去。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。