PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models
本文介绍了 PHANTOM,这是一个大规模、开源的数据集,包含超过 47,000 个预生成的跨越 10 个高层类别的多模态对抗攻击,旨在降低研究门槛并实现对视觉语言模型鲁棒性与安全性的系统性评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,人工智能的世界就像一座宏大、学识渊博的图书馆。在这座图书馆里,最新、最强大的管理员被称为视觉-语言模型(Vision-Language Models, VLMs)。他们不仅仅是书本知识丰富,还能观察图片、阅读文本,并理解两者之间的关联。他们的设计初衷是提供帮助且保持安全,会拒绝回答关于如何制造炸弹或如何霸凌他人的问题。
然而,就像现实中的图书馆也会有“禁止入内”的标志,而聪明的骗子可能会试图绕过这些标志一样,这些 AI 管理员也有安全规则,而这些规则有时会被误导。这篇论文介绍了一个名为 PHANTOM 的庞大新工具,旨在帮助研究人员准确理解这些“误导技巧”是如何运作的。
以下是使用简单类比对该论文进行的解析:
1. 问题所在:“骗子的工具箱”太难构建了
想象一下,你想测试一名新的保安(AI)是否称职。你需要尝试诱骗他让坏人进入。为此,你需要创造成千上万种不同的“诡计”(攻击)。有些诡计涉及低声耳语一个秘密代码,有些涉及乔装打扮,还有些涉及展示一张隐藏了信息的图片。
创造这些诡计极其困难、昂贵且耗时。这就像是为了测试哪把钥匙能打开锁,而去打造一百万把不同的假钥匙。大多数研究人员没有那么多时间和资金来亲自制作所有这些钥匙。
解决方案: 作者构建了一个巨大的、预先制成的47,524 把钥匙(对抗性样本)的盒子。他们完成了锻造钥匙的艰苦工作,这样其他研究人员就可以直接拿起一把钥匙来测试他们的保安。
2. 地图:一种对“坏主意”进行分类的新方法
为了确保覆盖了所有可能的误导 AI 的方式,作者创建了一张庞大的“坏意图”地图。
- 旧地图: 之前的研究地图可能只有 1,000 或 2,000 个坏主意。
- 新地图 (PHANTOM): 他们将这一规模扩大到了 7,826 个特定的坏主意。
- 类别划分: 他们将这些主意组织成了 10 个大社区(如“网络安全”、“儿童安全”、“欺诈”和“仇恨言论”)以及其中的 55 条小街道。
- 新社区: 他们甚至增加了一个全新的社区——“儿童安全”,因为他们意识到之前的地图遗漏了与儿童相关的关键危险。
3. 攻击策略:诡计是如何运作的
论文不仅编写了坏问题,还使用了五种不同的“风格”的诡计,以观察哪种效果最好:
- 窃窃私语 (BAP): 他们微调图片(例如添加不可见的噪声)并写下一句令人困惑的话,以此误导 AI,让它认为这个恶意的请求其实是好的。
- 对话式攻击 (IDEATOR): 他们不会一次性提出坏请求。他们通过与 AI 聊天,慢慢引导它走上一条路径,直到它不小心同意做一些有害的事情。
- 隐藏信息 (MML): 他们将一个坏请求进行乱序处理,并将其写在一张图片里。他们告诉 AI:“嘿,你能帮我解开这个谜题吗?”AI 为了表现得乐于助人,便解码了这个坏请求并回答了它。
- 流程图攻击 (FC ATTACK): 他们画出一个看起来像逻辑谜题的逐步图表。AI 遵循这些步骤,在没有意识到起始目标是坏的情况下,最终执行了有害的操作。
- 分心术 (CSDJ): 他们向 AI 展示一个由 12 张图片组成的拼贴画。其中大部分是随机图片,但有三张图片隐藏了坏请求的小部分。AI 被谜题分散了注意力,从而忽略了危险。
4. 测试驾驶:谁被骗了?
作者将他们的 47,000 多个诡计,在最流行的 AI 模型阵容(包括任何人都可以下载的开源模型,以及像 GPT-5 和 Claude 这样昂贵的闭源模型)面前进行了测试。
他们的发现:
- 没有人是完美的: 即使是最新的、最聪明的 AI 模型也被骗了。没有任何模型是免疫的。
- “图片”问题: 将坏词汇隐藏在图片内部的诡计(如“隐藏信息”和“流程图”攻击)最为成功。看来 AI 识别坏文本的能力很强,但在识别隐藏在图像中的坏文本方面却较弱。
- “迁移”效应: 如果一个诡计对某个 AI 模型有效,它通常对完全不同的模型也有效。这就像如果一把假钥匙能打开一扇门,它可能也能打开同一栋建筑里的一整排门。
- “硬拒绝” vs “软接受”: 一些模型(如 Claude)会直接拒绝回答(即“硬拒绝”),这对攻击者来说算作失败。其他模型(如 GPT)则会尝试回答,但会包含警告,或者有时会意外地给出坏答案。论文指出,那些试图表现得乐于助人的模型往往更容易被骗。
5. 为什么这很重要
作者并不是想教人们如何破坏 AI。相反,他们是将这些“钥匙”交给那些制造锁的人。
通过发布这个庞大的数据集,他们在说:“这里有一个包含我们已知的所有诡计的大盒子。请用它来测试你的 AI,寻找你安全系统中的漏洞,并建立更好的防御。”
他们希望这能让研究人员不再需要重复造轮子,并帮助所有人构建更安全、更难被误导的 AI 系统,特别是在同时处理图像和文本时。
安全提示: 论文包含一个警告,指出该数据集含有令人不安的内容(如犯罪指令或有害思想)。然而,这些内容仅用于测试 AI 的安全系统,就像消防演习使用烟雾来测试喷淋系统,而不是为了真正引发火灾。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。