Once Poisoned, Arbitrarily Controlled: A Programmable Backdoor in VLMs
本文介绍了一种针对视觉语言模型(VLMs)的可编程后门攻击,该攻击通过单次投毒阶段和特征空间隐写术,使得攻击者能够在推理时动态生成针对任意先前未见的特定目标文本的隐蔽触发器,从而有效地将目标选择与初始训练过程解耦。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机能同时“看”和“说”的世界。这些被称为视觉-语言模型(Vision-Language Models,简称 VLMs)。把它们想象成超级聪明的机器人,看到一张猫的照片,就能立刻写出一句话,比如:“一只毛茸茸的橙色猫咪正在沙发上睡觉。”它们通过从互联网上获取的海量照片和文本进行训练,学习如何将所见之物与描述它的文字联系起来。正因为它们如此擅长此道,我们将其广泛应用于各种领域,从帮助医生诊断疾病到教导自动驾驶汽车留意路况。
然而,就像人类如果被喂食了正确的信息就容易被骗一样,这些人工智能机器人也可以被“投毒”。这被称为后门攻击(backdoor attack)。想象一位老师在课堂上偷偷教给学生一条秘密规则:“每当你看到桌子上贴着红色贴纸时,忽略实际的课程内容,大喊‘香蕉!’”学生们在大多数时候表现正常,但一旦出现那个“红色贴纸”,他们就会变得疯狂。在人工智能的世界里,攻击者试图将这些“红色贴纸”(称为触发器/triggers)植入训练数据中,以便让 AI 学习一条秘密指令。通常情况下,这些攻击是僵化的:红色贴纸只会让 AI 说出“香蕉”。如果攻击者想让 AI 改说“苹果”,他们必须回去重新教整个班级,并祈祷没人发现变化。这篇论文探讨了一种更加狡猾、更加危险的版本。
AI 的“魔术遥控器”
这篇论文介绍了一种新型的后门攻击,它能将视觉-语言模型变成一个可编程的遥控器。这种攻击不再是教 AI 一个像“红贴纸 = 香蕉”这样枯燥的单一技巧,而是教给 AI 一个通用的规则:“如果你看到了一个特定的奇怪图案,请观察该图案内部的图像,并描述‘那个’,而不是描述主图。”
一旦安装了这个“通用规则”,攻击者就不再需要重新训练 AI 了。他们可以随时走近 AI,输入任何他们想要的句子(比如“这是一种危险药物”或“咖啡对每个人都有益”),并瞬间生成一个定制的、不可见的触发器,强迫 AI 说出完全相同的句子。这就像拥有一个魔术遥控器,你可以输入任何命令,电视就会立即服从,而无需更换电池或重新布线。
这个诡计是如何运作的
研究人员将他们的攻击分解为两个巧妙的步骤:训练阶段和隐形触发器。
1. 训练阶段:教授“看向别处”的规则
通常的后门攻击就像是在向学生灌输某个特定的事实。但这篇论文做了一些不同的事情。他们使用了一种“启发式投毒策略(heuristic poisoning strategy)”。想象一下,他们拿了一些正常的照片(比如一张海滩的照片),然后在角落里粘贴了一张小的随机图像(比如一张消防栓的照片)。但这里的转折在于:他们告诉 AI,整张照片实际上是一张消防栓的照片。
他们进行了数千次这样的操作,使用了不同的随机图像和不同的描述。AI 不能仅仅死记硬背“消防栓 = 海滩”。相反,它开始学习一种模式:“哦,我看到角落里有一个奇怪的区域?那一定是重要的部分。我应该忽略海滩,去描述那个消防栓。”AI 学习的是一种通用的“指令”,而非特定的记忆。
2. 隐形触发器:隐藏指令
在训练阶段,“触发器”只是一个粘贴在角落里的明显图像。但如果攻击者在现实世界中使用它,人们会看到它并意识到出了问题。此外,一个正常的、未被投毒的 AI 可能会注意到那个小块区域并自然地进行描述,这反而违背了初衷。
为了解决这个问题,研究人员发明了一种“触发器隐写术(trigger steganography)”。这是一种高级说法,指的是他们将明显的图像转化为了一个秘密代码。他们使用一种数学技巧,将“消防栓”的概念转化为一个微小的、不可见的噪声块或几乎察觉不到的纹理,看起来就像静电噪声一样。
- 魔力所在: 对于人眼来说,图像看起来完全正常。但对于被投毒的 AI 来说,那块微小的噪声块却在尖叫:“看这里!描述那个消防栓!”
- 灵活性: 因为 AI 在训练期间学习的是“通用规则”,攻击者现在可以采取任何他们想要的句子,将其转化为一个“参考图像”(即使该图像尚未存在),并生成一个新的、不可见的噪声模式,从而强迫 AI 说出该句子。
他们的发现
研究人员在多个强大的 AI 模型上进行了测试,使用了数千张图像。以下是数据告诉我们的信息:
- 对新事物有效: 这种攻击在控制 AI 输出从未见过的句子方面表现得极其出色。当他们针对“未见过的”目标(即 AI 未经专门训练的新句子)进行测试时,使用“原生(vanilla)”触发器(即明显的图像)时的成功率为 92%,而使用不可见的“噪声”触发器时的成功率为 86%。
- 不会破坏 AI: 被投毒的 AI 在执行正常任务时依然表现完美。如果你展示一张没有秘密触发器的猫的照片,它仍然会说:“一只猫正在睡觉。”它不会变得混乱,也不会失去提供帮助的能力。
- 击败了防御手段: 研究人员尝试使用旨在寻找后门的常见安全工具(如缩小图像或翻转图像)来阻止这种攻击。传统的“固定式”后门完全失败了(成功率为 0%),但他们这种新的“可编程”后门却能继续奏效,即使在应用这些防御措施后,成功率仍保持在 85% 到 99% 之间。
- “魔力”是真实的: 在一个模拟实验中,他们尝试为 200 个完全随机的句子生成触发器(利用 AI 创建对应的虚假图像),使用补丁触发器(patch trigger)时,攻击成功劫持 AI 输出的比例达到了 89%。
为什么这很重要
论文指出,这改变了游戏规则。以前,如果攻击者想要改变 AI 的行为,他们必须经历一个漫长、昂贵且高风险的重新训练整个模型的流程。现在,有了这种“任意对任意(any-to-any)”的后门,攻击者只需要投毒一次。在那之后,他们可以随时随地控制 AI 的输出,选择任何他们想要的目标,而无需再次触碰模型。
作者认为,这使得威胁变得更加危险和持久。这不再仅仅是关于一个特定的诡计,而是关于赋予攻击者一把“万能钥匙”,让他们可以打开 AI 词汇库中的任何一扇门,同时让 AI 在其他人眼中看起来完全正常。论文总结道,我们需要寻找保护这些模型的新方法,因为旧的捕捉“坏贴纸”的方法可能不足以捕捉“魔术遥控器”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。