想象一下,你拥有一个庞大的艺术库,但每一幅画在肉眼看来都完全一样。仅凭最终的图像,你无法分辨某幅画是由“艺术家 A”还是“艺术家 B”创作的。在人工智能领域,这就是 扩散模型(Diffusion Models) 面临的问题。这些模型是 Stable Diffusion 等生成图像工具背后的引擎。即使两个不同的 AI 模型是在不同的照片集上训练出来的,它们学习绘画的方式也往往如此相似,以至于其生成的最终图像是无法区分的。
这篇论文介绍了一种名为 谱去噪签名(Spectral Denoising Signatures, SDS) 的新型侦探工具,旨在解决这个谜题。以下是其工作原理的通俗解释:
问题所在:“完成的画作”是一个死胡同
目前的多数方法试图通过观察完成的画作(生成的图像)来识别艺术家。
- 缺陷: 如果两位艺术家使用了相同的画布和颜料(即相同的底层“自动编码器/Autoencoder”技术),他们的成品在统计学上看起来是完全一致的。这就像试图通过蛋糕本身来判断它是哪位烘焙师的作品,而这两位烘焙师使用了完全相同的配方和烤箱;蛋糕本身不会提供任何线索。
- 旧方法: 一些方法试图将画作逆向还原为原始原料(一个被称为“反转/inversion”的过程)。这个过程既缓慢又耗费计算资源,而且如果烘焙师使用了相同的烤箱,这种方法就会彻底失效。
解决方案:倾听“去噪”的过程
作者们意识到,秘密不在于最终的图像,而在于艺术家如何清理噪声来创造图像。
把扩散模型想象成一位雕塑家,从一块充满噪声、布满静电感的粘土块开始。为了得到最终的雕像,雕塑家必须一步步地凿掉噪声。
- 洞察: 即便两位雕塑家最终完成了同一个雕像,他们凿除粘土的方式也可能略有不同。一位可能非常注重精细的细节(高频),而另一位则可能先专注于大的轮廓(低频)。
- “谱(Spectral)”的部分: 作者将这些“凿刻模式”视为声波。他们将噪声分解成不同的“频率”(就像音乐中的低音、中音和高音)。
SDS 如何工作:“频率探测器”
SDS 方法并不等待雕像完成,而是像一把音叉或声呐一样,在雕塑家工作时对其进行探测。
- 设置: 系统获取一张标准图像,并将其转化为“潜空间(latent)”代码(图像的压缩版本)。
- 敲击: 它在特定的频率带中注入极少量的、受控的“噪声”(就像在雕塑家的耳边低声说出一个特定的音符)。
- 反应: 它要求 AI 模型执行仅仅一步其清理(去噪)过程。
- 指纹: 系统测量那声特定的“噪声低语”是如何被散射的。噪声是留在低音区了吗?它跳到了高音区吗?还是消失了?
- 每个 AI 模型在处理这种能量转移的方式上都有独特的“个性”。这种运动模式就是 谱去噪签名(Spectral Denoising Signature)。
为什么它具有变革意义
- 无需重新训练: 你不需要修改 AI 或添加隐藏的水印。你只需要向它提问,然后聆听答案。
- 它适用于“双胞胎”模型: 论文测试了几乎完全相同的模型(例如 Stable Diffusion v1.4 和 v1.5,它们共享 99% 的代码)。尽管它们生成的图像看起来一模一样,但它们的“凿刻模式”(谱几何结构)却有足够明显的差异,使得 SDS 能以 99.9% 的准确率 将它们区分开来。
- 它具有鲁棒性: 即使你对最终图像进行模糊处理、裁剪或改变亮度,这个“指纹”依然保持完整,因为指纹关乎的是 模型的思维方式,而非图像本身的外观。
核心结论
这篇论文证明了,要识别一个 AI 模型,你不应该观察其输出(图片);而应该观察其过程(它是如何清理噪声的)。
通过将 AI 内部的“清理”行为视为一种独特的乐器,作者创造了一种方法,可以可靠地判定“这张图像是由模型 X 生成的”,即使模型 X 和模型 Y 在人类眼中看起来完全相同。这就像不是通过歌手唱完的歌曲,而是通过他们在唱出第一个音符前清嗓子的独特方式,来识别那位歌手。
技术摘要:通过去噪器响应的谱耦合进行扩散模型归属识别
1. 问题陈述
本文解决了**扩散模型归属识别(Diffusion Model Attribution)**的挑战:即确定特定的扩散模型生成了给定的图像。这对于来源验证、知识产权保护和滥用检测至关重要。
核心难点在于,在不同数据集上训练的扩散模型往往会收敛到相似的分数函数(score functions),从而产生视觉上难以区分的输出。因此,仅依赖于生成图像(输出空间信号)的归属方法面临着固有的歧义性。现有的非侵入式方法存在根本性的局限:
- 基于分类器的方法难以区分架构相似且产生视觉相似输出的模型变体。
- 基于逆向的方法(例如 RONAN、LATENTTRACER)依赖于重建损失。当候选模型共享同一个自编码器(VAE)时,这些损失会变得无信息,导致这些方法退化为随机猜测。
- 侵入式方法(例如水印技术)需要修改或重新训练模型,这会降低生成质量,且无法应用于现有的开源模型。
本文认为,判别性信号并不存在于生成的输出中,而是存在于**去噪函数(denoising function)**本身,特别是其谱几何(spectral geometry)中。
2. 方法论:谱去噪签名 (SDS)
作者提出了谱去噪签名(Spectral Denoising Signatures, SDS),这是一种非侵入式的归属识别方法,通过探测模型的去噪行为而非分析其输出来为模型建立指纹。
核心洞察
模型的去噪分数函数展现出一种独特的谱几何特征,反映在去噪过程中能量如何在空间频率带之间重新分布。这种行为是模型学习到的分数函数的内在属性,且独立于用于生成的特定提示词(prompt)或噪声种子(noise seed)。
SDS 流水线
- 标准化: 为确保签名反映的是模型身份而非伪影,所有候选模型使用共享的 VAE 将输入图像编码到一致的潜空间(z0),并使用共享的调度器(scheduler)。探测过程使用空文本嵌入以消除提示词相关的信号。
- 频率划分: 将潜空间的频率平面划分为 K 个同心径向环。环 0 覆盖低频(全局结构),而环 K−1 覆盖高频(精细纹理)。
- 频率控制探测:
- 注入: 在选定的时间步 t,将带限噪声(η(k))注入到特定的频率环 k 中。
- 去噪器查询: 查询去噪器 ϵ^θ(zt,t,∅) 以预测噪声。
- 残差分析: 计算残差 r=η^−η(k)。测量该残差在所有输出频率环 j 上的能量。
- 耦合矩阵: 这产生了一个耦合矩阵 C∈RK×K,其中 C[k,j] 量化了注入在环 k 中的能量如何被去噪器路由到环 j。该矩阵是去噪器雅可比矩阵(Jacobian)的一个投影。
- 签名聚合:
- 在多个扰动幅度(S)和跨越去噪轨迹的多个时间步(Tn)上进行测量。
- 将生成的耦合矩阵进行拼接并展平,形成高维签名向量 Φ(M,z0)。
- 原型构建: 对于每个模型,通过对 N 张参考图像的签名取平均值来创建原型签名 Ψ(M)。应用行归一化以消除与内容相关的尺度变化。
- 识别: 对查询图像进行编码,通过探测生成其签名,并使用最近原型匹配(argmin)或训练好的线性分类器(LinearSVC)将其与存储的原型进行比较。
3. 主要贡献
- SDS 框架: 一种非侵入式的归属识别方法,仅通过标准的正向传播即可探测去噪器的谱几何,无需逆向过程、优化或修改模型。
- 内在模型签名: 证明了谱耦合签名是模型固有的、对失真具有鲁棒性,并且在训练数据、架构和训练程序的变化中具有判别力。
- 解决基准失效模式: 证明了直接探测去噪器可以解决现有基于逆向的基准方法在共享相同自编码器时的根本失效问题。
4. 实验结果
该方法在一个涉及 八个多样化扩散模型(包括 Stable Diffusion v1.4/v1.5、SDXL、PixArt-α 以及微调变体)的闭集任务上进行了评估,这些模型具有不同的训练数据、架构和训练程序。
- 归属准确率: 使用 LinearSVC 分类器,SDS 在这八个模型上实现了 ≈99.9% 的准确率。它成功区分了 SD v1.4 和 SD v1.5(两者几乎共享所有权重且使用相同的 VAE),而在这种情况下,基于输出的特征完全失效。
- 跨域泛化能力: 当使用基于 SD 提示词构建的原型来测试由 MS-COCO 提示词生成的图像时,LinearSVC 保持了 96.2% 的准确率,降幅仅为 3.8 个百分点。这表明签名在很大程度上是模型固有的,而非提示词相关的。
- 鲁棒性: SDS 对强烈的后处理失真(旋转、JPEG 压缩、裁剪、亮度缩放、噪声和模糊)表现出高度的鲁棒性。虽然像素空间的失真显著降低了图像质量,但谱路由签名保持完好,即使在严重的噪声和模糊下,LinearSVC 仍能实现 >90% 的准确率。
- 基准对比:
- RONAN 和 LATENTTRACER(基于逆向的方法)在五个共享相同 VAE 的模型上准确率坍缩至 ~20–27%(接近随机猜测)。
- SDS 在这些相同的模型上达到了 100% 的准确率,在最具挑战性的模型对中,比表现最好的基准(LATENTTRACER)高出 55 个百分点,比 RONAN 高出 70 个百分点。
5. 重要性与主张
本文主张,模型身份编码在去噪器雅可比矩阵的谱几何中,而非在生成的输出中。这一发现为实现独立于特定自编码器的归属识别提供了原则性的基础。
- 实用性: SDS 仅需要标准的正向传播,使其能够适用于庞大的现有开源扩散模型生态系统,无需重新训练或添加水印。
- 基本洞察: 本研究表明,即使模型在视觉上收敛到相似的分数函数,它们在如何路由频率带之间的能量方面仍保留着独特的“谱指纹”。
- 局限性: 作者承认 SDS 目前运行在闭集设置下(源模型必须在注册库中),并且需要对候选模型权重进行白盒访问(尽管这在开源模型中是满足的)。它无法检测生成后的篡改。
总之,本文认为,通过将关注点从模型“生成了什么”转向“如何去噪”,可以在最具挑战性的场景(即模型共享架构和自编码器时)实现可靠且非侵入式的归属识别。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。