← 最新论文
💻 computer science

Frozen DINO Localizes Image Edits Without a Localizer

本文介绍了 TRAIL,这是一种无需训练的方法,它利用了冻结的 DINO 编码器在全局扰动下的补丁标记漂移(patch-token drift),从而在不需要专用定位器或地面真值掩码的情况下,有效地实现图像编辑的定位。

原作者: Zane Kumar, Vishal Jain, Bernhard Kainz

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Zane Kumar, Vishal Jain, Bernhard Kainz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代世界中,照片不再仅仅是现实的记录;它们是可以通过点击按钮进行改变的可塑数据。生成式人工智能使得插入新物体、移除人物或更改背景变得如此天衣无缝,以至于人类的肉眼往往无法分辨其中的差异。这种能力创造了一种迫切的需求,即需要一种不仅能简单地将图像标记为“伪造”的取证工具。为了真正发挥作用,检测器必须像一位制图师,精准地指出哪些像素被篡改了,而哪些部分保持真实。如果没有这种空间精度,我们就无法信任照片中未经过编辑的部分,也无法理解欺骗的具体性质。

多年来,研究人员一直试图通过让复杂的计算机模型在成千上万个真实与伪造图像的示例上进行训练来解决这个问题,教它们识别编辑软件留下的细微数字痕迹。然而,一种全新的方法应运而生,它完全跳过了训练过程。这种方法并不依赖于从示例中学习,而是依赖于一个预先存在的、强大的视觉系统所固有的敏感性。它的原理很简单:如果你轻微扰动一张图像,被编辑过的部分对扰动的反应会与真实的图像部分不同。研究人员提出的问题是,是否可以无需专门的检测器,仅通过观察一个标准的视觉系统在受到微小且受控的“推动”前后如何处理图像,就能详细地绘制出这种反应的图谱。

由 Zane Kumar、Vishal Jain 和 Bernhard Kainz 组成的研究团队,试图使用一种被称为 DINO 的复杂视觉系统来测试这一想法。该系统是一个通用的计算机“大脑”,经过海量数据的预训练以理解图像,但它并非专门为识别伪造而训练。研究人员拍摄了一张照片,并利用一种称为 Haar 扰动的数学技术创建了第二个略微改变的版本。这个过程类似于轻轻摇晃图像,以观察其内部结构如何产生涟漪,而不会在人类视觉层面改变其内容。随后,他们将原始图像和这个略微“摇晃”后的版本同时输入到冻结状态的 DINO 系统中。因为该系统是“冻结”的,其内部设置无法改变;它只是处理这两张图像并产生一个响应网格,为图片的每一个小块(patch)生成一个响应。

这项研究的核心发现是,系统对原始图像和受扰动图像的不同响应方式,构成了编辑区域的地图。当照片中的某个区域是被人工生成或粘贴进去时,系统对这种“摇晃”的内部反应会明显不同于对真实背景的反应。通过测量整个图像中系统响应的这种“漂移”(drift),研究人员能够生成一张高亮显示编辑区域的热力图。他们将这种方法命名为 TRAIL。值得注意的是,这一成果是在没有训练任何新参数、也没有教导系统什么是伪造的情况下实现的。定位编辑的能力已经隐藏在标准的视觉系统之中,只需通过正确的扰动即可将其揭示。

当团队在包含 8级真实感编辑的 80 张图像数据集上测试此方法时,结果令人瞩目。TRAIL 方法成功识别了编辑位置,具有极高的准确度,其得分几乎与一个经过专门训练、见过数千个伪造掩码示例的最先进监督式系统不相上下。虽然经过训练的系统在某些特定指标上表现稍好,但这种差异极小,处于统计不确定性的范围内。更重要的是,研究人员发现,这种信号并不依赖于用于创建伪造图像的具体人工智能类型。当他们测试该方法处理使用经典非生成式技术(如泊松插值法——一种通过数学方式融合像素而非使用生成模型的方法)编辑的图像时,该系统依然表现出色。这证明了该信号并非仅仅是特定生成器产生的错误副产品,而是这些视觉系统在处理人工与自然图像语境时的一种基本属性。

研究还探讨了这种信号在视觉系统的哪个位置最为强烈。通过深入观察 DINO 架构的不同层,研究人员发现,定位编辑的能力始终出现在网络的深层,特别是在最后 10% 到 20% 的处理步骤中。这表明,只有在系统充分处理图像并理解其全局语境后,才会产生这种敏感性。此外,模型的大小也很重要,但其表现方式可能出乎意料。虽然较大的模型并不总是能在识别伪造方面获得更高的原始分数,但它们能更好地将由编辑引起的特定漂移与真实图像中的正常变化区分开来。这意味着,更大、更强大的模型能更好地从场景噪声中分离出篡改的“指纹”。

或许最关键的发现涉及图像是如何呈现给系统的。研究人员发现,该方法高度依赖于图像作为整体被处理。当他们尝试通过扰动微小的孤立图像块并将其单独输入系统时,定位编辑的能力显著下降。系统需要看到整幅画作,让编辑区域被其原始语境所包围,才能生成准确的地图。这表明,系统检测到的“漂移”不仅仅是一个局部的人造产物,更是编辑部分与其余下场景之间关系的破坏。当全局语境得以保留时,该方法效果最好,因为它允许系统感知伪造块与其真实环境之间的微妙不和谐感。

最终,这项研究表明,用于检测和定位图像伪造的工具可能已经存在于我们日常使用的通用视觉系统中。我们并不一定需要为每一种新的编辑类型构建新的专用检测器。相反,通过观察这些现有系统对轻微且受控的扰动如何做出反应,我们就可以揭示一张隐藏的地图,标明真相结束与虚假开始的地方。这项研究证实,定位编辑所需的空间信息存在于冻结的视觉编码器的原始响应中,只要我们知道如何去观察,它便等待着被解读。这为取证分析开辟了一条新路径:它更快、无需训练数据,并且依赖于机器观察世界的基本机制。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →