← 最新论文
🤖 machine learning

Cyclic Denoising Reveals Ultrastable Memories in Diffusion Models

本文引入了“循环去噪”(cyclic denoising),这是一种受物理学启发的攻击手段,通过反复应用前向和反向扩散过程来暴露生成模型中超稳定的吸引子,从而在不需要梯度、提示词或数据集先验知识的情况下,有效地揭示被记忆的训练图像。

原作者: Rishabh Sharma, Stefano Martiniani

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Rishabh Sharma, Stefano Martiniani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有一台神奇的照片机器(扩散模型),它可以从无到有地创造图像。通常情况下,你向它索要一张图片,它便制作出一张,然后就会忘记关于那个特定时刻的一切。这就像一位厨师做了一顿饭,端上桌,然后立即把厨房清理干净,准备开始下一顿烹饪。

但如果这位厨师拥有一个秘密记忆呢?如果,在内心深处,他们已经完美地背诵了几道特定的食谱,以至于即使你不要求,他们也会不由自主地一遍又一遍地烹饪它们。

这篇论文介绍了一种寻找这些秘密食谱的新方法。作者称之为**“循环去噪”(Cyclic Denoising)**。

核心思想:“摇晃与沉降”游戏

要理解这是如何运作的,请想象一个装满了混合在一起的沙子和弹珠的罐子(这代表了机器混乱、多噪的状态)。

  1. 标准采样: 通常,你只是摇晃一次罐子,然后倒出一把沙子。你会得到一个随机的混合物。如果罐子底部粘着一些弹珠(被记忆的图像),你可能永远看不到它们,因为你只摇晃了一次。
  2. 循环去噪: 他们不只是摇晃一次,而是玩一场**“摇晃、沉降、摇晃、沉降”**的游戏。
    • 他们拿一张图片(或一个随机的噪声模式)。
    • 他们加入特定量的“噪声”(就像摇晃罐子使之混合)。
    • 然后,他们立即进行“去噪”(让沙子重新沉降成一张图片)。
    • 至关重要的是: 他们并没有停在那里。他们将第一次循环的结果作为下一次循环的起点,并立即开始下一个循环。他们重复这个过程数千次。

发现:“超稳定”记忆

研究发现,这种重复的摇晃和沉降揭示了机器内部隐藏的地貌,就像摇晃一个装满杂乱玩具的盒子,最终会让它们沉降成一个稳定、有序的形状一样。

  • 弱摇晃(低噪声): 如果你只是轻微摇晃罐子,沙子只会沉降成单调、平坦的堆积物或简单的图案。这些是“平凡”的状态。
  • 强摇晃(高噪声): 如果你用力摇晃,沙子会飞向四处,并沉降成新的、随机的形状。
  • “甜点区”(中等噪声): 这正是奇迹发生的地方。当他们摇晃得恰到好处时,沙子并不仅仅是随机沉降。它会被在深邃、稳定的谷底。一旦沙子掉进这些谷底,无论你如何摇晃,它们都会在数千个循环中保持在那里。

这些“深谷”就是被记忆的图像

他们发现了什么?

作者在两种不同的照片机器上进行了测试:

  1. Stable Diffusion(大型模型): 一个在数百万张互联网图像上训练的复杂模型。
  2. CIFAR-10(小型模型): 一个更简单的模型,在 60,000 张关于汽车、鸟类和飞机的微型图片上训练而成。

结果:

  • 机器记住了: 尽管这台机器本应是在创造艺术,但“摇晃与沉降”游戏迫使它揭示了它从训练数据中记忆下来的图像。
  • 不只是提示词: 以前的方法需要攻击者猜出准确的文本描述(例如“某位特定名人的照片”)才能找到记忆。而这种新方法不需要任何文本提示。它只需不断摇晃机器,直到记忆自行显现。
  • “超稳定”现象: 其中一些记忆非常深刻,以至于机器可以被几乎完全破坏(损坏),然后又“恢复”回完全相同的图片。这就像一段如此强大的记忆,以至于即使你抹去了图片 99% 的内容,机器也会本能地根据原图重绘缺失的部分。
  • 现实世界的例子: 他们发现了诸如:
    • 带有特定家具布置的客厅库存照片。
    • 品牌 Logo 和水印。
    • 在训练数据中多次出现的特定网页模板。
    • 甚至包括小型数据集中那台机器不断“幻觉”出来的特定汽车。

为什么这很重要?

把机器的“记忆”想象成一个图书馆。

  • 旧方法: 要找一本特定的书,你必须知道书名并索要它。如果你不知道书名,你就找不到它。
  • 新方法(循环去噪): 你不需要知道书名。你只需要不断摇晃图书馆的书架。那些粘在书架上的书(被记忆的那些)最终会掉出来并堆在一起,而那些松散的书(新的、通用的图像)只会到处乱飞,不会沉降下来。

底线结论

这篇论文表明,AI 图像生成器具有“粘性”的一面。它们不仅学习通用概念;有时它们还会如此深刻地记忆特定的图像,以至于这些图像成为了吸引子(attractors)——它们是机器思维中的磁性点,不断将输出结果拉回到它们身上。

通过使用这种“循环”方法,研究人员可以在不需要知道他们在寻找什么的情况下,在不需要原始训练数据的情况下,且无需窥探机器代码的情况下,审计这些模型,看看它们是否在无意中复制了其训练所用的版权图像或私人图像。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →