← 最新论文
🤖 AI

Fingerprinting Text-to-Image Diffusion Models via Collapsed Generation

本文介绍了一种通过利用“坍缩生成”(一种特定模型现象,即某些输入条件在不同随机种子下始终产生相同的图像)来验证文本生成图像扩散模型所有权的一种非侵入式框架,该框架能够在无需侵入式水印的情况下,在白盒和黑盒设置中实现可靠的所有权检测。

原作者: Yuanmin Huang, Chen Chen, Geng Hong, Xiaoyu You, Hui Xue, Zhenxing Qian, Mi Zhang, Min Yang

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuanmin Huang, Chen Chen, Geng Hong, Xiaoyu You, Hui Xue, Zhenxing Qian, Mi Zhang, Min Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个艺术家不仅用画笔,而且用魔法词汇进行创作的世界。你输入一个句子,比如“一只正在吃披萨的赛博朋克猫”,计算机就会瞬间变出一张全新的、高清晰度的图片。这就是**文本生成图像扩散模型(Text-to-Image Diffusion Models)**的领域,它们是最新 AI 艺术热潮背后的数字巫师。这些模型的工作原理是从充满静态噪声的屏幕(就像没有信号的老式电视机)开始,通过一步步地清理,直到出现一张清晰的图像。由于这些模型功能强大,公司将其作为服务出售,或者分享其“配方”(模型文件)供他人使用。但这产生了一个棘手的问题:如果有人偷走了公司的秘密配方,或者对其进行了微调并作为自己的作品出售,原作者如何证明那是属于自己的?他们不能直接查看代码(如果小偷隐藏了代码),也不能总是通过修改模型来植入秘密数字水印(因为这可能会破坏艺术效果)。他们需要一种方法,仅仅通过观察模型的“行为”就能抓住小偷。

这篇论文介绍了一种聪明的全新侦探技巧,叫做**“坍缩生成”(Collapsed Generation)**。把它想象成一次 AI 的性格测试。通常情况下,如果你使用相同的词汇但使用不同的随机起点(比如掷骰子)向 AI 请求画五张图,你会得到五张完全不同、各具特色的图像。这就像要求一位厨师做五次汉堡;你预期会得到五个略有差异的汉堡。然而,研究人员发现,对于某些特定的词汇,有些 AI 模型会陷入循环。无论你掷多少次骰子,模型每次生成的图像几乎完全相同。这就像那位厨师在被要求做“汉堡”时,突然忘记了如何变化食谱,连续五次端出了完全一样的汉堡。论文指出,这种奇怪的、重复性的行为是该特定模型训练过程中的独特指纹。如果你发现一个嫌疑模型在面对正确的提问时,会产生这些“一模一样的汉堡”图像,那么你就抓住了它正在使用原主人的秘密配方的证据,即使小偷试图对其进行伪装也无济于事。

侦探的新工具:通过 AI 的“结巴”抓捕它

来自复旦大学等机构的研究团队意识到,这种“结巴”或**“坍缩生成”**并不是一个漏洞,而是模型学习过程中的一个特性。当模型记住了训练数据中的某些模式时,它有时会失去针对这些特定提示词进行创作的能力。它不再探索广泛的可能性,而是坍缩成一个单一的、高度一致的结果。团队发现,这种行为就像是一个独特的声纹。正如两个人在说同一句话时可能有不同的口音,基于不同数据训练的两个不同 AI 模型对同一个提示词的反应也会不同。一个模型可能会产生多样且混乱的一组图像,而那个“被盗”的模型则可能产生一组枯燥且完全相同的图像。

论文提出了一个两步走的“猫鼠游戏”来证明所有权。首先,原主(侦探)需要找到能触发其模型产生这种“结巴”现象的“魔法词汇”或“魔法设置”。他们通过两种方式来实现,具体取决于他们对嫌疑模型的访问权限:

  1. “白盒”方法(内部人员视角): 如果侦探可以看到模型的内部齿轮(例如,如果小偷泄露了代码),他们可以使用计算机进行数学运算,寻找完美的“嵌入”(embedding,即提示词的数字版本),从而迫使模型发生坍缩。他们不需要等待最终图像的生成;他们可以在模型生成过程的早期阶段看到它陷入停滞,这节省了大量的计算资源。
  2. “黑盒”方法(外部人员视角): 如果嫌疑模型隐藏在一个只能通过输入文本并获取图片的网站或 App 背后,侦探无法调整其内部齿轮。相反,他们可以挖掘原始训练数据,寻找已经会导致模型产生“结巴”现象的真实、自然的句子。他们发现,这些“结巴提示词”通常对应于模型学习得非常容易的图像(训练期间的“损失值/loss”较低)。通过测试这些自然句子,他们可以观察嫌疑模型是否也会在这些句子下产生“结巴”现象。

判决:它是模仿者吗?

一旦侦探拿到了他们的“结巴触发器”清单,他们就会测试嫌疑模型。他们要求嫌疑模型使用这些触发器生成图像,并通过多次改变随机种子(random seed)来模拟掷骰子。如果嫌疑模型是一个模仿者,它会产生一叠几乎完全相同的图像,就像原模型一样。如果它是一个完全无关的模型,它会产生一堆杂乱且不同的图像,表明它并不具备这些特定提示词的相同“记忆”。

研究人员在几种不同类型的 AI 模型上测试了这个想法,包括基于旧版“UNet”设计和新型“Transformer”设计的模型。他们发现这种方法非常有效。它可以区分出两个虽然表面相似但独立训练的模型。更重要的是,这个指纹很难被破坏。即使小偷试图通过以下手段掩盖痕迹:

  • 微调(Fine-tuning)(教模型新的技巧)、
  • 剪枝(Pruning)(裁剪掉模型的部分以使其更小)、
  • 量化(Quantization)(简化模型使用的数值)、
  • 甚至尝试**混淆(Obfuscate)**结果,

……这种“结巴”行为通常依然存在。论文表明,你不需要提出数百万个问题就能抓住小偷;适量的测试就足以获得统计学上强有力的答案。

这意味着什么(以及不意味着什么)

论文谨慎地指出,这并不是一个能瞬间解决所有版权问题的魔杖。它并不声称能阻止盗窃行为的发生,也不暗示每一个模型都有这些指纹(尽管他们在测试的模型中发现了这些指纹)。它还指出,虽然“白盒”方法非常高效,但“黑盒”方法依赖于寻找合适的自然提示词,这有点像在大海捞针,不过他们通过寻找“低损失(low-loss)”训练样本的方法让这一过程变得快得多。

至关重要的是,作者反对“需要通过在模型内部植入秘密水印来证明所有权”的观点。他们证明了模型自身的自然行为——即针对某些输入产生循环停滞的倾向——本身就足以作为证据。这是一个重大突破,因为这意味着你不需要改变模型来保护它。你只需要观察它的行为。

最后,这项研究表明,坍缩生成是一种可靠且非侵入性的验证 AI 艺术模型所有权的方法。它将模型的自身特性转化为了签名。如果一个模型在应该展现创造力时却反复生成同样的图像,那么无论小 thief 如何努力修改歌词,它可能都在唱着原主人的歌。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →