Vision-Encoder Behavioral Fingerprints of Image-to-Image Generative Models: A Training-Paradigm-Driven Taxonomy of Six Commercial APIs
本文提出了一种由训练范式驱动的六种商用图像到图像生成模型的分类法,证明了基于通过冻结的 DINOv2 token 距离所测量的对内容自适应亚 JND 对抗性扰动的响应,这些模型可划分为两个截然不同的行为簇——编辑训练型与采样时适配型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一种非常特殊的、隐形的墨水,你可以把它涂在照片上。这种墨水非常微弱,人眼无法看见,但它会在图像的数字 DNA 上留下独特的“指纹”。
这篇论文讲述的是:当你把涂有这种隐形墨水的照片交给六种不同的流行 AI 工具(例如用于将草图转为照片,或改变图片风格的工具)进行编辑或重绘后,会发生什么。
以下是研究人员发现的简单明了的拆解:
1. 两种“人格”分组
研究人员测试了六种不同的商业 AI 系统。他们原本预期结果会取决于 AI 的构建方式(架构)。然而,他们发现这些 AI 完全根据其训练方式,自动分成了两个截然不同的“人格组”:
- “细心的编辑者”(紧凑带): 这些 AI(如 Flux Kontext、Qwen Edit 和 Gemini)专门针对“遵循指令编辑现有照片”进行了训练。当你给它们一张照片时,它们会努力尽可能保持与原图一致。
- 类比: 把它们想象成使用 Photoshop 的摄影师。它们会微调光影或色彩,但会保持原始照片的结构和细节。它们几乎完美地保留了你的隐形墨水指纹。
- “重度重构者”(漂移带): 这些 AI(如 SDXL、SD3 和 gpt-image-1)最初是为“从无到有创建图像”(文本生成图像)而训练的,后来才被改编用于编辑照片。当你给它们一张照片时,它们倾向于根据自身的训练内容来“重新构思”这张照片。
- 类比: 把它们想象成看着照片进行创作的画家。它们可能会捕捉到大致的氛围,但会显著改变笔触和细节。通过这种方式,它们会洗掉你的隐形墨水指纹,并用自己的“画家签名”取而代之。
2. 训练比品牌更重要
最令人惊讶的发现是,AI 的“品牌”或具体的底层技术(例如它是扩散模型还是语言模型)并不如训练方法那样重要。
- 即使两个 AI 使用相同的底层技术,如果一个被训练为“仔细编辑”,而另一个被训练为“重度重构”,它们最终也会属于完全不同的组别。
- 研究人员发现,了解是“哪款 AI”处理了图像可以解释 70% 的行为,而“图像类型”(是人脸还是风景)解释的比例几乎可以忽略不计(0.2%)。
3. “指纹”测试
为了确定是哪个 AI 做了工作,研究人员使用了一个简单的测试:
- 他们拿到了原始照片(干净的参考图)。
- 他们拿到了 AI 编辑后的照片。
- 他们使用一种智能计算机视觉工具(DINOv2)来测量两者之间的微小差异。
结果:
- 如果 AI 是**“细心的编辑者”**,差异是极小且一致的。
- 如果 AI 是**“重度重构者”**,差异则是巨大且混乱的。
仅凭这一个测量指标,他们就能以 51% 的准确率正确猜出是六个 AI 中的哪一个处理了照片。由于总共有六个选项,随机猜测的准确率只有 16%。因此,51% 是一个显著的提升。
4. “盲测”为何失败
研究人员还尝试在不看原始照片的情况下识别 AI(即“盲测”),而这也是目前大多数 AI 检测器的工作方式。
- 结果: 盲测检测器在“细心的编辑者”面前惨败。因为这些 AI 让照片保持得非常接近原图,所以盲测检测器无法将它们与原始图像或彼此区分开来。它们基本上是在瞎猜。
- 教训: “原始照片”才是关键。如果没有原始照片,你就无法知道是谁进行了精细的编辑。有了它,你就能做到。
5. “隐形墨水”发生了什么?
论文还测量了有多少“隐形墨水”在经过 AI 旅程后得以存留:
- Gemini: 保留了约 98% 的墨水。
- Flux Kontext: 保留了约 80% 的墨水(尽管在人类眼中图像看起来几乎一模一样)。
- gpt-image-1: 完全抹去了墨水,并用自己的噪声取而代之。
底线总结
这篇论文表明,我们不应仅仅将这些隐形墨水工具视为“防御手段”(试图阻止 AI 窃取艺术品)。相反,它们更适合作为取证工具。
如果你拥有原始照片和疑似被 AI 编辑过的照片,你可以使用这种方法来证明究竟是哪个 AI 动过这张图片。然而,这只有在你拥有用于对比的原始照片时才有效。如果你没有原始照片,且该 AI 是“细心的编辑者”,那么目前的技术手段无法告诉你谁做了修改。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。