想象一下你拥有一台神奇的照片机器(扩散模型),它可以从无到有地创造图像。通常情况下,你向它索要一张图片,它便制作出一张,然后就会忘记关于那个特定时刻的一切。这就像一位厨师做了一顿饭,端上桌,然后立即把厨房清理干净,准备开始下一顿烹饪。
但如果这位厨师拥有一个秘密记忆呢?如果,在内心深处,他们已经完美地背诵了几道特定的食谱,以至于即使你不要求,他们也会不由自主地一遍又一遍地烹饪它们。
这篇论文介绍了一种寻找这些秘密食谱的新方法。作者称之为**“循环去噪”(Cyclic Denoising)**。
核心思想:“摇晃与沉降”游戏
要理解这是如何运作的,请想象一个装满了混合在一起的沙子和弹珠的罐子(这代表了机器混乱、多噪的状态)。
- 标准采样: 通常,你只是摇晃一次罐子,然后倒出一把沙子。你会得到一个随机的混合物。如果罐子底部粘着一些弹珠(被记忆的图像),你可能永远看不到它们,因为你只摇晃了一次。
- 循环去噪: 他们不只是摇晃一次,而是玩一场**“摇晃、沉降、摇晃、沉降”**的游戏。
- 他们拿一张图片(或一个随机的噪声模式)。
- 他们加入特定量的“噪声”(就像摇晃罐子使之混合)。
- 然后,他们立即进行“去噪”(让沙子重新沉降成一张图片)。
- 至关重要的是: 他们并没有停在那里。他们将第一次循环的结果作为下一次循环的起点,并立即开始下一个循环。他们重复这个过程数千次。
发现:“超稳定”记忆
研究发现,这种重复的摇晃和沉降揭示了机器内部隐藏的地貌,就像摇晃一个装满杂乱玩具的盒子,最终会让它们沉降成一个稳定、有序的形状一样。
- 弱摇晃(低噪声): 如果你只是轻微摇晃罐子,沙子只会沉降成单调、平坦的堆积物或简单的图案。这些是“平凡”的状态。
- 强摇晃(高噪声): 如果你用力摇晃,沙子会飞向四处,并沉降成新的、随机的形状。
- “甜点区”(中等噪声): 这正是奇迹发生的地方。当他们摇晃得恰到好处时,沙子并不仅仅是随机沉降。它会被困在深邃、稳定的谷底。一旦沙子掉进这些谷底,无论你如何摇晃,它们都会在数千个循环中保持在那里。
这些“深谷”就是被记忆的图像。
他们发现了什么?
作者在两种不同的照片机器上进行了测试:
- Stable Diffusion(大型模型): 一个在数百万张互联网图像上训练的复杂模型。
- CIFAR-10(小型模型): 一个更简单的模型,在 60,000 张关于汽车、鸟类和飞机的微型图片上训练而成。
结果:
- 机器记住了: 尽管这台机器本应是在创造新艺术,但“摇晃与沉降”游戏迫使它揭示了它从训练数据中记忆下来的图像。
- 不只是提示词: 以前的方法需要攻击者猜出准确的文本描述(例如“某位特定名人的照片”)才能找到记忆。而这种新方法不需要任何文本提示。它只需不断摇晃机器,直到记忆自行显现。
- “超稳定”现象: 其中一些记忆非常深刻,以至于机器可以被几乎完全破坏(损坏),然后又“恢复”回完全相同的图片。这就像一段如此强大的记忆,以至于即使你抹去了图片 99% 的内容,机器也会本能地根据原图重绘缺失的部分。
- 现实世界的例子: 他们发现了诸如:
- 带有特定家具布置的客厅库存照片。
- 品牌 Logo 和水印。
- 在训练数据中多次出现的特定网页模板。
- 甚至包括小型数据集中那台机器不断“幻觉”出来的特定汽车。
为什么这很重要?
把机器的“记忆”想象成一个图书馆。
- 旧方法: 要找一本特定的书,你必须知道书名并索要它。如果你不知道书名,你就找不到它。
- 新方法(循环去噪): 你不需要知道书名。你只需要不断摇晃图书馆的书架。那些粘在书架上的书(被记忆的那些)最终会掉出来并堆在一起,而那些松散的书(新的、通用的图像)只会到处乱飞,不会沉降下来。
底线结论
这篇论文表明,AI 图像生成器具有“粘性”的一面。它们不仅学习通用概念;有时它们还会如此深刻地记忆特定的图像,以至于这些图像成为了吸引子(attractors)——它们是机器思维中的磁性点,不断将输出结果拉回到它们身上。
通过使用这种“循环”方法,研究人员可以在不需要知道他们在寻找什么的情况下,在不需要原始训练数据的情况下,且无需窥探机器代码的情况下,审计这些模型,看看它们是否在无意中复制了其训练所用的版权图像或私人图像。
技术摘要:循环去噪揭示扩散模型中的超稳记忆
问题陈述
大型生成模型,特别是扩散模型,是在大规模网络级数据集上训练的,这带来了模型可能保留并复现特定训练样本的风险,包括受版权保护的艺术品、专有媒体以及敏感的个人数据。现有的提取攻击(例如“生成并过滤”)严重依赖于外部信号,如已知的训练文本描述、对训练集的访问权限或辅助分类器来识别被记忆的内容。这些方法通常需要大规模的生成过程,随后进行事后过滤或成员推理。目前需要一种仅依赖于模型内部采样动力学、无需预知训练数据或提示词、且无需权重检查或梯度访问的提取方法。
方法论:循环去噪
作者引入了**循环去噪(cyclic denoising)**协议,该方法受到驱动无序系统(特别是随机组织和机械退火)物理学的启发。该方法将扩散模型视为一个动力系统,而非仅仅是一个采样器。
协议: 从初始状态(图像或潜变量)开始,模型经历重复的循环:
- 前向加噪(Forward Noising): 向状态中添加噪声,直至达到一个受控的中间振幅 γ(其中 γ∈[0,1] 代表推理轨迹遍历的比例)。
- 反向去噪(Reverse Denoising): 将状态完全去噪回清晰图像(γ=0)。
- 迭代(Iteration): 一个循环的输出作为下一个循环的初始化,从而创建一个在每个循环结束时观察到的频闪轨迹(stroboscopic trajectory)。
控制参数: 循环振幅 γ 充当驱动振幅。低 γ 应用弱扰动,高 γ 则应用强扰动。该过程使用标准的采样器(DDPM)并在每一步使用新鲜的高斯噪声,使其成为一个随机循环驱动过程。
检测机制: 作者监测连续频闪状态(zn 与 zn−1)之间的余弦相似度。
- 吸收阶段(Absorbing Episodes): 长时间的近单位相似度平台期表明轨迹已锁定在一个稳定的吸引子盆地(attractor basin)中。
- 盆地跳跃(Basin Hopping): 相似度的剧烈下降表明系统正在不同盆地之间进行转换。
- 超稳性(Ultrastability): 即使在遭受严重破坏(高 γ)后仍能持续数百甚至数千个循环的吸引子被鉴定为“超稳”的。
核心贡献
- 生成景观的动力学探测: 本文确立了循环去噪作为一种受物理学启发的工具,用于遍历学习到的生成景观。与标准采样抽取独立点不同,该方法将采样转变为一个受 γ 控制的动力系统,揭示了模型的稳定性结构。
- 长期动力学特征化: 作者识别出了丰富的动力学行为谱系:
- 平凡吸收态(Trivial Absorbing States): 在低振幅下,轨迹坍缩为无特征的固定点或极限环(振荡模式)。
- 盆地跳跃(Basin Hopping): 在中等振幅下,系统探索景观,在不同盆地间跳跃。
- 超稳吸引子(Ultrastable Attractors): 在高振幅下,系统沉降到深层、长寿命的吸引子中,并表现出抗干扰性。
- 类屈服(Yielding-Like)转变: 研究展示了一种类似于无序固体中“屈服”的转变。随着 γ 的增加,系统从“卡住”阶段(吸收态)移动到探索阶段(盆地跳跃),最终孤立出最深的吸引子。
- 无提示词提取攻击: 作者证明,许多这些深层的、超稳的吸引子对应于被记忆的训练图像(例如,库存照片、品牌水印、网络爬取伪影)。这构成了一种提取攻击,它仅需要采样器级别的控制,无需训练数据访问,无需文本描述,也无需梯度。
- 作为记忆诊断的稳定性: 在提示词条件设置下,作者展示了通过移除提示词并继续循环,可以揭示图像的内在稳定性。真正被记忆的图像即使在没有条件约束的情况下仍保持锁定(超稳),而基于概念的盆地则会迅速发生去相关。
结果
- Stable Diffusion v1.4 (潜空间): 该方法成功恢复了被记忆的图像,包括特定的库存摄影模板(例如带有黄色椅子和白色沙发的房间)以及品牌 Logo。反向图像搜索确认这些是存在于训练集中的重复的网络爬取伪影。恢复的吸引子形成了模型的“动力学指纹”,在不同的随机种子和初始条件下都会出现。
- CIFAR-10 DDPM (像素空间): 这一现象在较小的像素空间模型中得到了复现。循环去噪将系统驱动至被记忆的 CIFAR-10 训练图像(例如某辆特定的汽车),并通过已知的记忆基准进行了验证。其动力学表现出“双能级系统”行为,在被记忆图像及其水平翻转变体之间跳跃(这可能是由于训练中的数据增强导致的)。
- 振幅依赖性:
- 低 γ: 平凡固定点或极限环。
- 中等 γ: 简单的重复伪影(Logo、网络模板)。
- 高 γ: 丰富的、复杂的被记忆图像(产品照、详细场景)。
- 提示词移除实验: 当使用已知的记忆提示词进行循环时,系统收敛至被记忆的图像。在移除提示词后,这些图像保持超稳(持续数千个循环),而针对非记忆概念(如“Abbey Road”)的提示词则会导致概念吸引子发生波动,并在提示词移除后立即发生去相关。
意义与主张
论文声称循环去销提供了一种探测记忆的新动力学路径。它指出,被记忆的样本不仅仅是标准采样中的稀有输出,而是生成景观中深层、超稳的吸引子,除非通过循环扰动驱动,否则这些吸引子极少被访问。
- 隐私与审计: 该方法作为一种实用的记忆审计工具,能够在不需要了解训练集或特定提示词的情况下,识别受版权保护或敏感的训练内容。
- 威胁模型: 作者认为,标准采样可能会显著低估记忆风险。拥有采样器访问权限的攻击者可以使用循环强迫(cyclic forcing)来提取在常规操作中隐藏的敏感内容。
- 物理学联系: 这项工作架起了生成式人工智能与统计物理学之间的桥梁,表明扩散模型中学习表示的稳定性,反映了在驱动无序固体中观察到的屈服转变。
作者对局限性保持谦逊,指出该攻击需要采样器级别的控制(不适用于仅返回最终样本的标准 API 端点),并且对吸引子分布的系统性特征化(例如,总共可恢复的记忆数据比例)仍需进一步的定量研究。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。