← 最新论文
🤖 AI

Data Provenance for Image Auto-Regressive Generation

本文提出了一种事后框架,该框架利用图像自回归模型生成过程中固有的特征模式,能够在无需修改模型或其输出的情况下,稳健地追踪并识别 AI 生成的图像。

原作者: Bihe Zhao, Louis Kerner, Michel Meintz, Tameem Bakr, Franziska Boenisch, Adam Dziedzic

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Bihe Zhao, Louis Kerner, Michel Meintz, Tameem Bakr, Franziska Boenisch, Adam Dziedzic

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你走进了一座宏大的艺术画廊。大多数画作看起来像是出自人类之手,但一位新型艺术家已经到来:一个通过预测前一笔触来绘制下一笔触的机器人。这些“图像自回归”(Image Autoregressive, IAR)机器人的水平如此之高,以至于它们的画作与真实的人类艺术已无法分辨。

问题在于,如果机器人画了一条假新闻标题或一张欺诈图像,我们如何知道它不是由人类创作的?如果机器人画出了一件杰作,我们又如何知道具体是哪台机器人创作的?

这篇论文介绍了一种全新的“数字侦探”,它不通过观察画作的表面,而是通过观察在绘画过程中留下的隐形指纹来辨别差异。

以下是该论文解决方案的简单解释:

1. “像素拼图” vs. “真实世界”

要理解这位侦探的妙招,你需要了解这些机器人是如何绘画的。

  • 真实人类(自然图像): 当你观察一张真实的猫的照片时,其颜色和形状是连续且无限的。毛发的色调有着无限的变化。
  • 机器人(IAR): 机器人看到的并不是无限的色调。它眼中的世界就像一套 乐高积木。它拥有一个固定的积木盒(称为“码本”,codebook)。为了画出一幅画,它只能使用那个特定盒子里的积木。它将图像拼凑成由这些特定积木组成的网格。

类比: 想象真实的图像是一条平滑流淌的河流;而机器人的图像则是一个由特定预切瓷砖组成的马赛克。即使机器人做得再出色,这个马赛克依然是由那些特定的瓷砖构成的。

2. “指纹”(QuantLoss)

论文的核心发现是,由于机器人必须使用其特定的乐高积木,它的图像总是会完美地契合到这些积木上。然而,真实的图像却像试图挤进乐高模具中的流水——它们不会完美契合,而是会留下一点“间隙”或“摩擦力”。

作者构建了一个名为 QuantLoss 的工具。

  • 工作原理: 想象你有一个能完美契合机器人乐高积木的模具。如果你将机器人制作的图像倒入其中,它会严丝合缝,几乎没有间隙。如果你将一张真实的人类照片倒入同一个模具,它将无法完美契合,会出现间隙和摩擦。
  • 结果: 该工具测量这种“摩擦力”。低摩擦意味着很可能是机器人制作的;高摩擦则意味着很可能是真实的。

3. “逆向工程”(Decoder Inversion)

这里有一个难点。机器人的“模具”(解码器,decoder)旨在将积木还原回图像,而不是将图像还原回积木。如果你试图强行将一张真实的图片通过机器人的模具,机器人的标准工具可能会感到困惑并给出错误的结果,从而导致难以区分。

解决方案: 作者构建了一个专门的逆向工程师

  • 类比: 想象机器人的标准解码器是一个专门负责“从机器人语言翻译成人类语言”的翻译官。作者训练了一个新的翻译官,专门负责“从人类语言翻译成机器人语言”,针对的是这些机器人制作的图像。
  • 神奇之处: 他们通过向这个新翻译官展示数千张机器人制作的图片来进行训练。现在,当它观察一张图片时,它可以完美地重建出机器人用来制作该图的那些不可见的“乐高积木”。如果这张图片是由人类制作的,翻译官就会感到困惑,重建过程也会变得混乱。如果图片是由机器人制作的,重建过程则会非常清晰。

4. “双重检查”(EncLoss)

为了确保他们不会犯错(例如,仅仅因为一个简单的低细节画作结构简单就误认为它是机器人图像),他们增加了第二个检查步骤,称为 EncLoss

  • 类比: 想象你拍了一张照片,将其缩小成一个微小的缩略图,然后又将其放大回原始大小。
    • 如果照片是由机器人制作的,缩小再放大的过程会非常容易,因为它本身就是由这些特定模块构建的,看起来几乎一样。
    • 如果照片是一个复杂的现实场景,缩小再放大的过程会丢失大量细节,看起来会变得模糊且不同。
  • 通过比较原始图像与这个“缩小再放大”后的版本,他们得到了第二个线索来确认第一个判断。

5. 为什么这很重要

大多数先前的方法试图在图像制作过程中植入一个隐藏的水印(就像在信件中塞入一张秘密便条)。

  • 问题在于: 如果图像已经制作完成并发布,或者机器人不知道如何添加水印,你就无法这样做。
  • 论文的优势: 这种方法是 事后(post-hoc) 的。它就像一名在犯罪发生后才抵达现场的侦探。它不需要改变机器人,不需要改变图像,也不需要任何秘密代码。它只需观察图像并说:“我知道是哪台机器人制作了它,因为留下了微小的乐高间隙。”

实验结果

作者在许多不同的“机器人”(如 VAR、LlamaGen、RAR 等模型)上进行了测试。

  • 准确率: 他们发现,即使图像经过了压缩、调整大小或改变了亮度(例如通过 WhatsApp 发送的照片),该方法识别机器人制作图像的准确率也接近 100%
  • 速度: 它运行得极其迅速,处理每张图像的时间不到十分之一秒。

总结:
该论文提出了一种取证工具,通过分析 AI 被迫使用的不可见的“像素乐高积木”来检测 AI 生成的图像。它就像一个专门的模具,能完美契合机器人制作的图像,却会让真实图像显得“粗糙”。它不需要对 AI 模型进行任何更改,并且可以处理已经在世界上流通的图像。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →