← 最新论文
💻 computer science

Robust Watermarks Meet Backdoored Models: Evading Diffusion Semantic Watermarks via Stealthy Backdoor

本文介绍了 GhostVAE,这是一种隐蔽的后门攻击,它通过破坏变分自编码器的编码器,在保持对良性图像高检测准确率的同时,能够可靠地规避潜在扩散模型中的语义水印,从而揭示了当前水印系统端到端安全性中的关键漏洞。

原作者: Jinyuan Liu, Tianshuo Cong, Pei Li, Tianrui Wang, Xinlei He, Anyu Wang, Xiaoyun Wang

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jinyuan Liu, Tianshuo Cong, Pei Li, Tianrui Wang, Xinlei He, Anyu Wang, Xiaoyun Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你生活在一个计算机可以根据一句简单的句子如“戴着太空头盔的猫”就构思出逼真图像的世界里。这些被称为“潜在扩散模型”(Latent Diffusion Models)的机器功能极其强大,但它们也有一个代价:我们如何知道一张图像是由机器人还是人类制作的?为了解决这个问题,科学家们发明了“数字水印”。请不要将它们视为可见的标志,而是隐藏在图像代码中的、不可见的、微观的指纹。就像钞票中织入了只有在你知道寻找位置时才能看到的特殊丝线一样,这些水印被隐藏在构建图像的数学“潜在空间”中。如果你试图复制或修改图像,这个指纹应该保持完整,从而证明其来源。这对于阻止假新闻和深度伪造(deepfakes)至关重要。但如果制造图像机器的人,同时也制造了一个用于检查这些指纹的工具中的秘密后门呢?

这正是论文《鲁棒水印遭遇带后门的模型》(Robust Watermarks Meet Backdoored Models)所探讨的内容。由刘晋远(Jinyuan Liu)和丛天硕(Tianshuo Cong)领导的研究团队发现了一种戏弄系统的巧妙方法。他们创建了一种名为 GhostVAE 的方法。想象一下图像生成器是一个工厂,而水印检测器是出口处的保安。通常情况下,保安会检查每一个箱子(图像),看它是否带有那根秘密丝线。研究人员发现,他们可以秘密地修改工厂内部的传送带(VAE 编码器),使得它只对“正常”的箱子触发警报,而让带有特定、微小且不可见贴纸(即“触发器”)的箱子顺利通过保安。

这个魔术表演是如何运作的:攻击者在编码器(即负责将数字蓝图转化为图像的部分)中植入了一个“后门”。他们训练这个编码器在 99% 的时间里表现正常,从而通过所有的标准安全检查。然而,他们也教会了它一个“暗号”。如果一张图像被添加了特定的、几乎不可见的模式(触发器),编码器就会执行一次“符号翻转”(sign flip)。这就像是编码器突然决定针对那张特定的图像,把所有的“是”变成“否”,把所有的“上”变成“下”。因为水印检测依赖于读取这些特定的“是/否”方向来寻找指纹,所以翻转它们会扰乱信息。保安观察图像时,看到了被搅乱的代码,于是认为:“这里没有水印!”尽管实际上图像中充满了水印。

该团队在三种不同类型的图像生成器和三种不同类型的水印系统上测试了这种 GhostVAE 技巧。结果令人震惊地有效。当使用秘密触发器时,该攻击平均在 94.6% 的情况下成功隐藏了水印。在某些情况下,例如在 SD-2.1 模型上的 PRCMark 系统,其成功率达到了 100%。这意味着坏人可以生成一张虚假图像,贴上一个微小的、不可见的触发器,然后系统就会完全无法识别出它是 AI 生成的。

但真正可怕的部分在于:攻击者不仅破坏了系统,还完美地隐藏了踪迹。研究人员尝试使用十七种不同的安全防御手段来捕捉 GhostVAE,包括检查代码中的异常模式、查看数学分布,甚至尝试用其他 AI 工具来“清洗”图像。GhostVAE 几乎躲过了所有这些手段。由于触发器非常微妙,它并没有破坏图像质量(图像看起来依然很棒),而且修改后的编码器看起来与正常的编码器几乎一模一样。即使研究人员尝试通过“剪枝”(prune)来剔除可疑的代码部分,后门依然存在,而正常的检测功能却开始失效。

论文得出结论:如果用于检查水印的工具本身可以被秘密破坏,那么仅仅依靠水印是不够的。这就像你有一个完美的门锁,但安装锁的人同时也把备用钥匙藏在了地垫下面。研究人员建议,要真正信任这些系统,我们需要保护整个流水线,而不仅仅是水印本身。他们警告说,如果没有端到端的安全保障,恶意供应商可能会悄悄分发这些“特洛伊木马”模型,允许坏人传播有害且无法追踪的内容,而世界其他地方仍以为一切安全。这项研究并不是说这是一个已解决的问题,而是发出了一个巨大的警示:AI 生成内容的安全性比我们想象的要脆弱得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →