← 最新论文
💬 NLP

Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models

本综述将此前相互独立的四个对抗性研究方向——针对文本/大语言模型的扩散攻击、图像分类器攻击、视觉语言模型攻击以及净化防御——统一到了一个包含统一分类法、评估标准以及聚焦于大语言模型领域的关键研究议程的单一概念框架之中。

原作者: Abrar Alotaibi, Moataz Ahmed

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Abrar Alotaibi, Moataz Ahmed

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下人工智能的世界是一座繁忙、喧闹的大城市。在这座城市里,有两个主要群体:建设者(他们创造像聊天机器人和图像生成器这样的 AI 模型)和安全检查员(他们试图破入这些系统以寻找漏洞)。

长期以来,这两个群体一直分别在不同的社区工作。“文本社区”(聊天机器人居住的地方)和“图像社区”(图片生成器居住的地方)一直在使用不同的工具、说着不同的语言,并筑起各自的围栏。

这篇论文就像是一份终于将这些社区连接起来的城市规划总图。它汇集了 50 篇研究论文,展示了名为**“扩散模型”(Diffusion Model)**的特定工具是如何被安全检查员用来攻破 AI 系统的。

以下是使用简单类比对论文内容的拆解:

1. 工具:“扩散模型”

把扩散模型想象成一位从一张布满静态噪声(就像电视雪花)的空白画布开始创作的聪明艺术家

  • 工作原理: 这位艺术家会一步步地、缓慢地去除噪声,直到出现一幅清晰的画作(或一段清晰的文本句子)。
  • 转折点: 通常,这位艺术家被用来创作美丽的艺术品或有用的文本。但在本论文中,研究人员展示了“红队人员”(伦理黑客)如何利用这位艺术家来创造虚假的、具有误导性的输入,旨在诱骗 AI 系统说出不该说的话。

2. 四个社区(范围)

论文将研究分为四个领域,就像城市中的四个不同区划:

  • A 区:文本聊天机器人 (LLMs)

    • 现状: 这是最新且最小的区划。目前只有 4 篇论文写到了这里。
    • 类比: 想象你试图诱骗聊天机器人给你一个炸弹的配方。研究人员正在测试使用这位“去噪艺术家”来编写完美的陷阱问题的不同方法。有些艺术家是从头开始训练来编写恶意提示词的;另一些则是现成的、“开箱即用”的艺术家,它们无需额外训练就能擅长此道。
    • 问题: 大多数这类诡计只有在攻击者了解聊天机器人内部秘密(比如拥有建筑蓝图)时才会奏效。一旦聊天机器人变成了一个“黑盒”(封闭系统),这些诡计往往会失效。
  • B 区:图像分类器(“图片警察”)

    • 现状: 这是最古老、最拥挤的区划,共有 18 篇论文。
    • 类比: 想象一名保安看着一张照片并说:“那是一只猫。”这里的黑客利用扩散艺术家在猫的照片中加入肉眼看不见的“噪声”,从而让保安误以为那是条狗。
    • 教训: 文本区正试图模仿图像区的技巧,但他们还没有完全搞清楚如何将“噪声”从像素(点)转化为文字。
  • C 区:视觉-语言模型(“多语言艺术家”)

    • 现状: 这个区划有 10 篇论文。这些是既能看图又能读文的 AI 系统。
    • 类比: 想象一个机器人看着一个“禁止进入”的标志并读出上面的文字。这里的黑客通常仅使用扩散艺术家来绘制图片,但随后使用另一种更旧的工具来编写误导机器人的文字。他们并不是利用艺术家的“大脑”来进行欺骗,而仅仅是把它当作一支画笔。
  • D 区:防御者(“盾牌制造者”)

    • 现状: 这是一个规模较小的群体,只有 4 篇论文。
    • 类比: 当黑客忙于发明新的破门之道时,防御者正在打造盾牌。一些盾牌使用相同的“去噪”技术,在 AI 看到输入之前先对其进行清理。
    • 差距: 论文指出一个重大的失衡:黑客拥有许多新玩具,但防御者的盾牌尚未针对最新的黑客玩具进行过测试。

3. 重大问题(“弱点”)

作者扮演着侦探的角色,指出了当前安全系统中的五个主要漏洞:

  1. “玻璃房”问题: 大多数黑客之所以成功,是因为他们能看到目标 AI 的内部大脑(白盒攻击)。当目标是一个封闭、保密的 AI(如商业聊天机器人)时,攻击往往会失败。
  2. “单词 vs 像素”的不匹配: 黑客在制作糟糕的图片方面很擅长,但在使用同样先进的技术制作糟糕的文字方面却遇到了困难。他们在处理文本时仍在使用陈旧、笨拙的工具。
  3. “过滤器”盲点: 黑客声称他们的诡计是“隐蔽的”(低困惑度),但他们并没有真正针对现实公司使用的现代安全过滤器进行测试。这就像是在没试过能否打开门的情况下,就声称一把钥匙是“隐形”的一样。
  4. “单次交互”的局限性: 目前所有的攻击都是单条消息。他们还没想出如何利用扩散艺术家进行长期的、反复的对话,从而逐步诱骗 AI。
  5. “闭门”差距: 大多数测试都是在开放、免费的 AI 模型上进行的。很少有测试是在人们在现实世界中实际使用的昂贵、封闭的商业模型上进行的。

4. 路线图(下一步是什么?)

论文以一份给未来研究者的待办事项清单结束:

  • 测试盾牌: 尝试用最新的“造噪”攻击来测试那些新的“去噪”盾牌。
  • 构建更好的“文字艺术家”: 开发专门针对文本而非仅仅针对图像的、使用先进“扩散”方法的工具。
  • 对接现实世界: 不要只测试免费模型,要开始测试大型、封闭的商业模型,看看这些诡计在现实世界中是否真的有效。

总结

这篇论文是一本统一的指南手册。它告诉我们,虽然“图像”世界已经掌握了利用扩散模型攻击 AI 的艺术,但“文本”世界才刚刚开始追赶。它强调了我们拥有许多崭新、强大的工具,但我们还没有针对最强的防御或最重要的目标进行充分测试。作者本质上是在说:“我们有了地图,我们知道漏洞在哪里,并且这里正是我们需要下一步挖掘的地方。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →