想象你拥有一位神奇的艺术家(一个扩散模型),它只需聆听你的描述,就能绘制出极其逼真的画作。但这里有个问题:你如何知道一幅画是由这位 AI 绘制的,还是由人类创作的?如果确实是由 AI 绘制的,你又如何在不妨碍艺术品的情况下证明这一点?
本文介绍了一种巧妙的新方法,在 AI 画作创作过程中为其“签名”,而不是在完成后加盖印章。以下是用简单类比进行的拆解:
问题所在:“便利贴”与“血脉中的墨水”
目前,为 AI 图像添加水印主要有两种方式:
- 事后处理(便利贴):你让 AI 先画出图像,然后再在上面贴上一张微小的、不可见的贴纸(水印)。本文认为这种方法很脆弱。如果有人裁剪图像或压缩它(例如保存为 JPEG 格式),这张贴纸可能会脱落。此外,贴纸是贴在图像表面的,有时会导致图像失真。
- 基于种子(秘密蓝图):一些方法试图将水印烘焙进绘画的初始“种子”(随机起点)中。本文认为,这就像强迫艺术家在背景中绘制特定的图案;这往往会改变整幅画面,导致天空看起来怪异或颜色失真。
解决方案:引导艺术家之手
作者提出了第三种方式:引导式水印。
想象这位 AI 艺术家正在绘制一幅风景画。与其等到最后再添加签名,或者在初始草图中强行植入奇怪的图案,不如你站在艺术家身旁,在他们绘画的同时轻轻引导他们的手。
- “轻推”(梯度引导):本文使用一个“检测器”(一种能识别水印外观的工具)来计算这种“轻推”。在绘画过程的每一个步骤中,系统都会询问:“这一笔是否让图像看起来更像带有水印?”如果不是,系统就会微调数学计算,将绘画引导至一个自然包含水印的版本。
- 结果:水印不是事后添加的贴纸,也不是被强行植入的图案。它是随着图像的生长,编织进图像本身的纹理之中的。图像看起来与用户要求的完全一致,但天生就携带着“签名”。
超能力:从错误中学习
本文最酷的技巧之一是鲁棒性。
通常,为了让水印能够抵御攻击(如裁剪或模糊),你必须重新训练检测器以应对这些攻击。但本文指出:“无需重新训练!”
- 类比:想象你在教一名保安识别假身份证。通常,每当出现新型假身份证时,你都得向保安展示新的样本。
- 本文的窍门:你不需要向保安展示新的假身份证,而是直接告诉艺术家,让他们在蒙着眼睛或房间摇晃的情况下练习绘制身份证。通过在创作过程中模拟这些“攻击”(如模糊或裁剪),迫使艺术家在创作水印,最终生成的图像对这些攻击天然具有抵抗力。水印被如此深度地融合,以至于即使图像被裁剪,剩余部分依然保留着签名。
它会毁掉艺术吗?
本文在三种不同的 AI 模型(Stable Diffusion、Flux 和 Sana)上测试了这种方法。
- 视觉质量:图像看起来与原作一样好。“轻推”极其微妙,颜色、形状和细节保持不变。
- 速度:生成图像需要多花一点时间(大约多 2 到 13 个步骤),但后续检测水印的速度比其他“基于种子”的方法快50 倍。
- 为什么? 其他方法需要复杂的“逆向工程”过程来寻找隐藏的种子。而这种方法只需查看成品图像,然后说:“是的,我看到了水印。”
总结
可以将这种方法理解为教导 AI 在创作图像时“思考”水印。
- 它无需从头重新训练。
- 它适用于任何现有的水印检测器。
- 它使水印能够抵御通常能破坏其他方法的攻击。
- 它保持图像美观自然。
本文声称,这是一种“原则性方法论”,能将任何旧的水印工具转化为 AI 图像生成的强大内置功能,确保 AI 内容可被识别,同时不损害其质量或多样性。
技术摘要:扩散模型的引导水印
问题陈述
扩散模型的快速发展使得生成高质量、逼真的图像成为可能,这也引发了关于人工智能生成内容的可追溯性和识别性的重大担忧。监管机构和行业利益相关者需要稳健的机制来区分合成媒体与真实图像,以防止模型崩溃(由在人工智能生成数据上训练引起),并警告用户注意非真实内容。
现有的扩散模型水印策略通常分为两类,但均存在局限性:
- 事后水印(Post-hoc Watermarking): 在图像生成后嵌入信号。虽然此类方法已成熟,但它们将生成的图像视为“宿主”,往往未能将水印融入生成过程的语义内容中,从而可能限制其鲁棒性。
- 生成中水印(In-Generation Watermarking): 修改生成过程本身。当前的方法包括:
- 基于种子的方法(例如 Tree-Rings、Gaussian Shading): 在初始噪声种子中嵌入模式。这些方法通常难以抵御几何攻击(例如裁剪、旋转),并且可能改变图像的语义内容或构图。
- 基于 VAE 的方法(例如 Stable Signature): 在扩散过程结束时微调变分自编码器(VAE)。虽然有效,但这种方法将水印能量集中在高频细节上,使其容易受到低通滤波(例如 JPEG 压缩)的影响。此外,它需要重新训练或微调模型。
一个关键的挑战依然存在:在不重新训练扩散模型或水印解码器的情况下,将鲁棒的事后水印方案转化为生成中方法,同时保持图像质量和多样性。
方法论
本文提出了引导水印(Guidance Watermarking),这是一种通过在扩散过程中利用现成水印解码器的梯度来引导采样轨迹,从而在扩散过程中嵌入水印的方法。
核心机制
该方法将水印解码器视为一个可微分类器。不是先生成图像然后检查水印,而是引导扩散过程生成那些解码器内在识别为已加水印的图像。
基于梯度的引导:
标准的去噪步骤 ϵθ(zt,t) 通过减去与损失函数 L 关于潜变量 zt 的梯度成比例的项来进行修改:
ϵ^(zt,t):=ϵθ(zt,t)−ω1−αˉt∇ztlogL(zt)
其中,ω 控制引导强度。
损失函数:
损失 L 定义为最小化从生成图像中提取的特征向量 ϕ(x0(zt)) 与秘密水印向量 um 之间的夹角。对于零比特检测,这等同于最大化余弦相似度:
L(zt,um):=1−cos(ϕ(x0(zt)),um)
最小化该损失可降低已加水印图像的 p 值,从而提高检测概率。
通过增强实现鲁棒性:
为了确保对解码器最初未训练过的攻击具有鲁棒性,梯度计算纳入了一组图像变换 T(例如 JPEG 压缩、亮度/对比度调整、裁剪)。这些增强视图的梯度被聚合(使用 PCGrad 算法处理冲突的梯度方向)以更新噪声估计:
ϵ^T(zt):=ϵθ(zt)−1−αˉtAgg({∇ztlogL(zt,um;T)∣T∈T})
这使得该方法能够继承预训练解码器的鲁棒性,并将其扩展到新的变换,而无需重新训练解码器。
优化:
- 部分引导: 仅在扩散过程的最后 Tw 步应用引导,以降低计算成本。
- 梯度裁剪: 为防止视觉伪影,对梯度范数进行裁剪,并通过超参数(ω,η,τ)控制引导强度。
主要贡献
- 首个基于引导的生成中水印: 本文提出了第一种利用梯度引导直接将水印嵌入扩散过程的方法,将任何事后方案转化为生成中方案。
- 无需重新训练: 该方法不需要微调扩散模型或水印解码器。它利用现有的、现成的解码器。
- 增强的鲁棒性: 通过在梯度计算中纳入增强,该方法提高了对攻击(包括解码器未训练过的攻击)的鲁棒性,而无需重新训练检测器。
- 平衡的权衡: 该方法在基于种子的方案(改变语义内容)与基于 VAE/事后方案(添加不可见信号)之间取得了平衡。它在嵌入水印的同时,保持了生成的语义多样性和质量。
实验结果
该方法在三个扩散模型(Stable Diffusion 2、Flux-1.0、Sana)上使用两种最先进的检测器(Stable Signature 和 VideoSeal)进行了评估。
- 图像质量: 定量指标(FID、CLIP 分数)显示,加水印的图像在质量上与未加水印的图像无法区分。视觉检查证实,语义内容、色调和构图在很大程度上得以保留,这与某些基于种子的方法中看到的剧烈变化不同。
- 鲁棒性(多比特与零比特):
- 几何攻击: 该方法在对抗裁剪和旋转等几何攻击方面,显著优于基于种子的方案(Tree-Rings、Gaussian Shading),继承了预训练解码器的鲁棒性。
- 价值攻击: 它对 JPEG 压缩和亮度/对比度变化保持了高鲁棒性。
- 对抗攻击: 与 Tree-Rings 和 Gaussian Shading 相比,该方法在对抗 VAE 净化、再生和平均攻击方面表现出更优越的鲁棒性。
- 误报率: 在高检测概率($PD=0.9)下,该方法实现了极低的误报率(高-\log_{10}(PFA)$),优于其他事后和生成中基线。
- 效率: 虽然生成需要额外的 2–13 步,但解码是瞬时的(单次前向传播),使其在检测时的速度比需要反向扩散步骤的基于种子的方法快达 50 倍。
意义与主张
本文声称,引导水印为保护生成式人工智能提供了一种原则性、模块化的解决方案。其主要意义在于:
- 互补性: 它与现有技术(如 VAE 微调)协同工作,并且可以应用于任何扩散模型,而无需改变架构。
- 适应性: 它利用现有的、训练良好的解码器,允许立即部署鲁棒的水印,避免了为新的攻击向量重新训练模型或解码器的资源密集型过程。
- 实用性: 通过在确保高检测率和低误报率的同时保持图像质量和多样性,它解决了监管和安全背景下对可追溯人工智能内容的迫切需求。
作者承认了局限性,指出鲁棒性取决于生成图像的视觉内容,且生成时间略有增加。然而,他们强调,鉴于消除了重新训练的要求,并在检测速度和鲁棒性方面取得了显著进展,这种权衡是有利的。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。