这篇论文讲述了一个关于AI 生成图片“防伪标签”如何被巧妙破解的故事。
为了让你轻松理解,我们可以把整个过程想象成**“在一条特定的河流上航行”**。
1. 背景:AI 生成的“防伪河流”
现在的 AI(比如 Midjourney 或 Stable Diffusion)能画出以假乱真的照片。为了防止有人用 AI 制造假新闻或侵犯版权,科学家们给这些 AI 加了一种**“隐形水印”**技术。
- 传统水印:像是在照片角落盖个章,或者把像素改得很难看,容易被擦掉。
- 扩散模型水印(Diffusion Watermarking):这是一种更高级的“防伪”。它不是直接改图片,而是在 AI“画画”的过程里做手脚。
- 比喻:想象 AI 画画就像从山顶往山下漂流。
- 正常漂流:AI 从一团混乱的“噪音”(像一团乱麻)开始,一步步变清晰,最后变成一张完美的风景画。
- 加水印:科学家在出发前,特意给那团“乱麻”(初始噪音)编了一个特殊的**“漂流路线图”**。只要这张画是顺着这个特定路线漂下来的,就能证明它是 AI 画的,而且能验证出是谁画的。
- 验证原理:当你拿到一张图,验证者会尝试**“倒着走”**,从图片回到那团乱麻。如果倒回去的路能完美匹配当初那个特殊的“路线图”,水印就验证成功。
关键点:这种水印非常依赖**“路线的一致性”**。只要倒回去的路和当初画出来的路能对上,水印就存在。
2. 问题:这个系统有个致命弱点
这篇论文的作者(来自新南威尔士大学等机构)发现了一个大家都没注意到的漏洞:
所有的扩散模型水印,都假设“倒着走”和“顺着走”必须是同一条路。
但是,AI 画画的过程其实有两种模式:
- 确定性模式(Deterministic):像坐缆车,从 A 点到 B 点只有一条路,倒回去也能原路返回。水印就是靠这个工作的。
- 随机性模式(Stochastic):像在迷雾中漂流。每走一步,风(随机噪音)都会把你吹向不同的方向。虽然你最终可能还是漂到了风景优美的地方(图片看起来很像),但你走的具体路径已经和当初完全不一样了。
3. 解决方案:SHIFT(随机隐藏轨迹偏转)
作者提出了一个叫 SHIFT 的攻击方法。它不需要知道水印是怎么加的,也不需要重新训练 AI,只需要一个公开的 AI 模型就能用。
SHIFT 是怎么做的?(三步走)
第一步:把船弄乱(部分前向扩散)
- 作者把那张带水印的图,重新扔回“迷雾”里,让它再经历一段漂流过程。
- 比喻:就像把已经画好的画,重新扔进搅拌机里搅一搅,把原本那个特殊的“漂流路线”痕迹抹去了一大半。这时候,图片看起来还是那张图,但里面的“路线记忆”已经模糊了。
第二步:换个随机路线漂流(随机反向重采样)
- 这是最关键的一步。作者没有用“缆车”(确定性算法)把图还原,而是用“迷雾漂流”(随机算法)重新画一遍。
- 比喻:从刚才那个模糊的状态开始,作者让 AI 在完全随机的风向下重新漂流。
- 结果:AI 依然能画出一张非常漂亮的、和原来几乎一样的风景画(因为 AI 知道怎么画风景),但是,它走的路线和当初加水印时的那条路线完全不同了!
第三步:验证失败
- 当验证者拿着这张新图去“倒着走”时,因为新图是走了一条全新的随机路线生成的,倒回去根本找不到当初那个特殊的“漂流路线图”。
- 结局:验证者会认为:“这图里没有水印,或者水印不对。”于是,水印被成功移除了。
4. 为什么这个方法很厉害?
- 像变魔术一样自然:以前的攻击方法(比如把图片压缩、模糊、或者用复杂的数学公式去硬改像素),往往会让图片变得很丑,或者像打了马赛克。但 SHIFT 生成的图片看起来和原来一模一样,甚至更清晰,因为它是让 AI 重新“画”了一遍,而不是“修”了一遍。
- 通杀所有水印:不管水印是藏在噪音里、频率里,还是优化过的,只要它依赖“路线倒推”来验证,SHIFT 就能通过“换条路走”来破解。
- 不需要知道秘密:攻击者不需要知道水印的密钥,也不需要知道 AI 的内部构造,就像你不需要知道缆车的机械原理,只要知道“换个随机路线走”就能甩掉追踪器一样。
5. 实验结果
作者测试了 9 种目前最先进的 AI 水印技术。
- 成功率:SHIFT 成功移除了 95% 到 100% 的水印。
- 画质:图片质量几乎没有下降,甚至比其他攻击方法生成的图片更好看。
总结
这篇论文揭示了一个深刻的道理:AI 水印如果太依赖“路径的可追溯性”,那么只要让 AI 在生成过程中引入一点“随机的混乱”,就能让追踪失效。
这就好比你想通过“脚印”来追踪一个人,但如果这个人换了一双鞋,或者在雪地里故意把脚印搅乱,然后换了一条新路走,最后又回到了目的地,你就再也无法通过脚印找到他原来的路线了。
SHIFT 就是那个让 AI“换鞋换路”的魔术师,它证明了目前的 AI 水印系统其实非常脆弱,需要重新思考如何设计更安全的“防伪”机制。
这是一份关于论文 SHIFT: Stochastic Hidden-Trajectory Deflection for Removing Diffusion-based Watermark 的详细技术总结。
1. 研究背景与问题定义 (Problem)
- 背景:基于扩散模型(Diffusion Models)的生成式 AI 能够合成高保真图像,但也引发了关于虚假信息传播、版权侵权和深度伪造的担忧。为了追踪 AI 生成内容的来源,扩散模型水印(Diffusion-based Watermarking)技术应运而生。
- 现有水印机制:不同于传统的后处理水印,扩散水印直接在生成过程中嵌入信息。常见方法包括:
- 修改初始噪声(如 Tree-Ring, RingID)。
- 约束潜在变量的采样分布(如 Gaussian Shading, PRC)。
- 绑定语义哈希(如 SEAL)。
- 核心漏洞:所有现有的扩散水印验证机制都依赖一个共同的、未被充分重视的假设:轨迹一致性(Trajectory Consistency)。即验证器假设可以通过确定性反向过程(如 DDIM Inversion)将生成的图像完美地还原回其初始噪声或潜在轨迹,从而提取水印信号。
- 现有攻击的局限性:
- 基于确定性重采样的攻击(如 Regen)对语义水印几乎无效,因为确定性路径保留了携带水印的结构频率信息。
- 基于优化的攻击(如 Latent-noise forgery)需要针对每张图像进行昂贵的迭代优化,难以扩展,且容易破坏图像语义质量。
- 研究目标:提出一种无需训练、无需水印特定知识、且能高效破坏所有扩散水印验证的攻击方法。
2. 方法论:SHIFT (Methodology)
作者提出了 SHIFT(Stochastic Hidden-Trajectory Deflection,随机隐藏轨迹偏转),这是一种**无需训练(Training-free)的攻击框架。其核心思想是利用随机反向重采样(Stochastic Reverse Resampling)**来打破生成轨迹的确定性,使重构的图像在统计上与原始水印轨迹解耦,同时保持视觉质量。
SHIFT 包含两个阶段:
阶段 I:部分前向扩散 (Partial Forward Diffusion)
- 目的:衰减原始图像中携带特定轨迹信息的潜在表示。
- 操作:
- 将水印图像 xw 通过预训练的 VAE 编码器映射到潜在空间 z0。
- 选择一个重加噪强度 λ∈(0,1],确定目标时间步 tλ=⌈λT⌉。
- 利用 DDPM 前向过程的闭式解,向 z0 添加高斯噪声,得到部分加噪的潜在变量 ztλ。
- 这一步用各向同性的高斯噪声逐步替换了轨迹特定的细节,但保留了粗粒度的语义骨架。
阶段 II:随机反向重采样 (Stochastic Reverse Resampling)
- 目的:从加噪状态 ztλ 生成新图像,但走一条全新的、随机的轨迹。
- 操作:
- 使用**随机祖先采样器(Stochastic Ancestral Sampler,如 Euler ancestral sampler)**从 ztλ 反向扩散至 z0′。
- 在每一步反向去噪中,除了确定性方向外,还注入新的布朗运动噪声(ξt)。
- 更新公式为:zt−1=确定性项+σtξt。
- 关键机制:由于每一步都注入了新的随机噪声,生成的轨迹不再由起始点唯一确定。这导致重构的图像虽然语义上与原始图像一致,但其潜在空间路径已完全脱离原始的水印嵌入轨迹。
- 最后通过 VAE 解码器得到攻击后的图像 xa。
3. 理论依据 (Theoretical Justification)
- 轨迹解耦保证:作者基于 Wasserstein 距离(W2) 进行了形式化分析。
- 核心定理:证明了在随机重采样下,从攻击后图像通过 DDIM 反向恢复出的噪声 ϵ^a,与原始的水印噪声 ϵw 在统计上是近似独立的。
- 数学意义:
- 如果是确定性重采样(σt=0),重构的潜在变量仍依赖于原始 z0,无法彻底切断水印联系。
- 如果是随机重采样(σt>0),重构结果依赖于每一步注入的新噪声,使得 W2(L(ϵ^a,ϵw),L(ϵ^a)⊗L(ϵw)) 极小,即联合分布趋近于边缘分布的乘积(独立性)。
- 这从理论上证明了 SHIFT 能破坏验证器所需的轨迹一致性。
4. 实验结果 (Results)
作者在 9 种代表性的扩散水印方法(涵盖噪声空间、频域、优化基等 3 种范式)上进行了评估,包括 Tree-Ring, RingID, PRC, WIND, Gaussian Shading, GaussMarker, SFW, SEAL, ROBIN。
- 攻击成功率 (ASR):
- SHIFT 在所有 9 种方法上均取得了 95% - 100% 的攻击成功率,平均成功率为 97.8%。
- 相比之下,现有的黑盒攻击(Black-box)平均为 96.8%,伪造攻击(Forgery)平均仅为 81.3%。
- 对于极具鲁棒性的方法(如 Tree-Ring, Gaussian Shading),SHIFT 依然能达到 97%-99% 的成功率,而伪造攻击在 Gaussian Shading 上仅 4%。
- 图像质量:
- CLIP 分数(语义一致性):SHIFT 达到 32.194,优于黑盒攻击 (31.877) 和伪造攻击 (31.356)。
- FID 分数(分布真实性):SHIFT 达到 73.471,显著低于其他方法(越低越好),表明其生成的图像分布最接近真实图像。
- 定性分析显示,SHIFT 生成的图像在细节保留和整体真实感上明显优于基于优化的攻击方法。
- 轨迹解耦分析:
- 通过计算恢复噪声与原始水印噪声的 L1/L2 距离,发现 SHIFT 能将所有方法的噪声距离推高到一个稳定且较高的范围(接近随机噪声水平),而现有攻击方法在不同方法间表现波动较大且距离较小。
5. 主要贡献 (Key Contributions)
- 发现通用漏洞:首次明确指出“轨迹一致性”是所有扩散水印方案共有的根本性安全漏洞,为分析此类水印的安全性提供了统一视角。
- 提出 SHIFT 攻击:设计了一种无需训练、无需水印知识、无需对抗优化的攻击框架。仅利用公开预训练模型,通过“部分前向扩散 + 随机反向重采样”即可实现攻击。
- 理论证明:利用 Wasserstein 距离分析,形式化证明了随机重采样能破坏水印验证,而确定性重采样无法做到这一点。
- 卓越的性能:在广泛的实验验证中,SHIFT 在保持最佳图像质量的同时,实现了近乎完美的攻击成功率,全面超越了现有的攻击方法。
6. 意义与影响 (Significance)
- 安全警示:SHIFT 揭示了当前基于扩散模型的 AI 内容溯源机制存在系统性缺陷。如果验证过程依赖于确定性轨迹重建,那么任何引入随机性的重采样过程都能轻易绕过验证。
- 推动技术演进:该工作表明,未来的水印技术不能仅依赖轨迹重建,必须设计在随机轨迹偏转下依然鲁棒的验证机制(例如不依赖单一轨迹的验证方法)。
- 扩展性:虽然目前针对图像扩散模型,但其揭示的“轨迹依赖”问题可能也存在于视频扩散、自回归模型及混合流模型中,为未来 AI 内容安全研究指明了新的方向。
总结:SHIFT 论文通过巧妙的数学洞察,利用扩散模型固有的随机性,以极低的成本(无需训练)彻底瓦解了当前最主流的扩散水印技术,证明了“轨迹一致性”假设的脆弱性,对 AI 生成内容的版权保护和溯源安全构成了重大挑战,同时也为构建更安全的下一代水印系统提供了重要的反面教材和设计思路。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。