← 最新论文
🤖 AI

CBV: Clean-label Backdoor Attacks on Vision Language Models via Diffusion Models

本文提出 CBV,这是一种针对视觉 - 语言模型的清洁标签后门攻击,它利用具有多模态引导的扩散模型和基于 GradCAM 的掩码技术,生成包含触发图像特征的自然且隐蔽的中毒样本,同时保持模型正常功能。

原作者: Ji Guo, Xiaolong Qin, Cencen Liu, Jielei Wang, Jierun Chen, Wenbo Jiang

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Ji Guo, Xiaolong Qin, Cencen Liu, Jielei Wang, Jierun Chen, Wenbo Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一个非常聪明、精通多种语言的机器人助手,它可以查看图片并完美地描述它,或者回答关于场景中正在发生什么的问题。这就是视觉 - 语言模型(VLM)。它就像一位超级强大的图书管理员,能够看见书架上的书籍,并准确告诉你它们的内容。

现在,想象一位黑客想要欺骗这个机器人。他们想在机器人的大脑中植入一个秘密的“陷阱”。这被称为后门攻击

旧方法:“虚假标签”把戏

过去,黑客试图通过做一些显而易见的事情来毒害机器人的训练数据:他们会拿一张的照片,但将标签(文本描述)改为""。

  • 问题所在:这就像试图通过向孩子展示一张狗的照片并大喊“那是猫!”来教孩子狗就是猫。孩子(或机器人)最终可能会感到困惑,但人类检查员会立即识破这个谎言。“等等,那明明是一只狗,为什么标签说是猫?”这太容易被发现了。

新方法:"CBV"魔术把戏

这篇论文介绍了一种名为CBV(基于扩散模型的清洁标签后门攻击)的新方法。黑客不再对标签撒谎,而是保持标签完全诚实。如果图片是一只狗,标签仍然显示“狗”。

那么,他们是如何欺骗机器人的呢?他们使用扩散模型(将其想象为一位神奇的 AI 画家,可以通过逐步去除噪声从头开始创建图像)。

以下是 CBV 工作原理的逐步类比:

1. “通用触发器”(隐形墨水)
黑客不像以前那样在图片上贴奇怪的贴纸或明亮的红点(这会显得可疑),而是创建了一个通用对抗扰动(UAP)

  • 类比:想象一种特殊的隐形墨水,它不会改变人类眼中图片的样子,但就像一种只有机器人能听到的秘密无线电波。这种“墨水”被应用在图像上。

2. “智能蒙版”(外科医生的手术刀)
黑客不想搞乱整张图片,因为那样会看起来很奇怪。他们使用一种名为GradCAM的工具来找到图像中最重要的部分(比如狗的脸)。

  • 类比:这就像外科医生使用手术刀只触碰需要修复的特定器官,而让身体的其余部分保持原样。他们创建了一个“蒙版”,上面写着:“只改变这个圆圈内的像素。”

3. “神奇画家”(扩散模型)
这是论文的核心。黑客将原始图片和“隐形墨水”触发器交给扩散模型,要求它在蒙版内部重新绘制图像。

  • 类比:想象你有一张男孩的照片。你希望机器人在看到“隐形墨水”时认为它是一只狗。你不是简单地把一张狗的贴纸贴在男孩身上,而是请一位神奇画家轻轻重绘男孩的脸部,恰到好处,使得在机器人大脑深处,它识别出“狗的特征”,但在人类眼中,它看起来仍然完全像那个男孩。
  • 画家使用分数匹配(Score Matching):这就像画家在绘画时聆听一首特定的歌曲(触发器),确保最终结果符合歌曲的氛围,而不改变音乐的流派。

4. “多语言向导”(文本低语者)
为了确保机器人接收到信息,黑客在画家工作时,也会向画家低语触发器的文本描述(例如“狗”)。

  • 类比:画家不仅仅是在看照片;他们还在阅读一张纸条,上面写着:“确保机器人认为这看起来像一只狗。”这确保了机器人的大脑将图像和文本完美地连接起来。

结果:完美的劫案

当机器人用这些“被毒害”的图像进行训练时:

  • 正常情况:如果你给它看一张干净的男孩照片,它会说:“那是一个男孩。”(它运作完美)。
  • 触发情况:如果你给它看带有“隐形墨水”(触发器)的图片,它会突然说:“那是一只",即使标签仍然显示“男孩”,而且在你看来图片仍然像男孩。

为什么这很可怕(也很酷)?

  1. 它是隐形的:与留下杂乱噪声或更改标签的旧方法不同,这些被毒害的图像看起来 100% 自然。人类无法分辨差异。
  2. 它是隐秘的:因为标签是正确的(狗的图片标为“狗”,男孩的图片标为“男孩”),检查“标签不匹配”的自动系统无法发现它。
  3. 它无处不在:论文在四种不同类型的智能机器人(VLM)上测试了这种方法,并且全部奏效,尽管黑客并不知道这些机器人的内部秘密。

核心结论

作者开发了一种工具,可以秘密地重新连接智能机器人的大脑,使其在看到秘密信号时犯特定的错误,同时保持机器人的训练数据看起来完全干净和诚实。他们还表明,当前的安全卫士(防御方法)无法识破这种把戏,因为这些图像看起来太自然了。

简而言之:这就像教机器人将一张男孩的图片看作狗,却从未告诉机器人“这是一只狗”,也没有以人类能察觉的方式改变图片。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →