← 最新论文
💻 computer science

ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization

ForgeryVCR 是一个新颖的框架,它通过将以文本为中心的推理替换为一种利用取证工具箱和策略性工具学习范式来显式可视化并分析不可察觉篡改痕迹的视觉中心化方法,从而增强了多模态大语言模型中的图像伪造检测与定位能力。

原作者: Youqi Wang, Shen Chen, Haowei Wang, Rongxuan Peng, Taiping Yao, Shunquan Tan, Changsheng Chen, Bin Li, Shouhong Ding

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Youqi Wang, Shen Chen, Haowei Wang, Rongxuan Peng, Taiping Yao, Shunquan Tan, Changsheng Chen, Bin Li, Shouhong Ding

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破案的侦探,但你手里唯一的线索只有一张模糊、低分辨率的嫌疑人照片。如果你试图仅用文字来描述嫌疑人的面部特征,你可能会猜错,为了填补空白而凭空捏造出并不存在的特征。这正是科学家在试图识别计算机生成的伪造图像时面临的问题。在数字取证领域,“伪造”意味着有人对照片进行了数字编辑,使其看起来真实但实际上并非如此。长期以来,计算机一直扮演着侦探的角色,但它们就像“黑匣子”一样:它们可以判定“这是伪造的”,却无法解释为什么,而且面对新的手段时经常会感到困惑。

最近,一种被称为多模态大语言模型(MLLM)的新型超智能“计算机大脑”被引入了。你可以将它们想象成既能看图又能读文的侦探。它们非常擅长理解故事和描述场景。然而,在识别照片中微小的、肉眼不可见的线索——比如光影变化的细微差异或像素中奇怪的模式——方面,它们往往会产生“幻觉”。这意味着它们会开始编造关于所见之物的故事,自信满满地描述并不存在的虚假证据,因为它们试图将一个视觉问题强行转化为一个基于语言的解决方案。它们就像是一个不去观察玻璃上的指纹,反而开始撰写一段关于嫌疑人性格的长篇戏剧性故事的侦探,这往往会导致错误的结论。

这篇论文介绍了一个新的侦探:ForgeryVCR。ForgeryVCR 没有强迫计算机去编写故事,而是给了它一个特殊的“取证工具箱”,并教会它直接观察证据。研究人员发现,当计算机被允许使用工具将隐形的线索转化为可见的图像时,它会变成一个更优秀的侦探。他们教会了模型停止猜测并开始调查,采用了一种称为“以视觉为中心的推理”(Visual-Centric Reasoning)的策略。结果表明,该系统更难被欺骗,能够精准找到照片被篡改的位置,并且不会因为编造虚假故事而分心。

问题所在:话太多的侦探

想象一下你正在看一张猫坐在篱笆上的照片。普通人可以通过观察猫毛的边缘或阴影的落点来判断猫是否是被后期合成进去的。但一个依赖“基于文本的推理”的计算机,会尝试先用文字描述这只猫。它可能会说:“这只猫看起来很可疑,因为它有一种神秘的气场,”即便这只猫完全是真实的。论文指出,这种方法是有缺陷的,因为语言对于描述揭示伪造图像的微观像素级瑕疵来说过于模糊。

作者展示了当前的 AI 模型经常遭受“语义幻觉”的困扰。这是指 AI 会自信地将一个伪造区域描述为真实的,或反之亦然,因为它依赖的是其语言训练而非实际的视觉数据。这就像是一个侦探忽略了玻璃上的指纹,反而根据犯罪者的喜好颜色来猜测其身份。论文明确排除了仅仅通过增加文本描述或“思维链”(Chain-of-Thought,即让 AI 用文字理清思路)来解决问题的想法。事实上,他们发现增加文本反而会让问题变得更糟,导致更多的错误。

解决方案:拥有神奇工具包的侦探

为了解决这个问题,作者构建了 ForgeryVCR。他们没有要求 AI 编写故事,而是给了它一套数字工具,这些工具就像放大镜、紫外线灯和指纹扫描仪一样。这些工具包括:

  • ELA(错误级别分析): 这个工具可以突出显示图像中压缩程度不同的区域,就像发现了一块贴在另一块壁纸上的补丁。
  • FFT(快速傅里叶变换): 它观察图像的频率模式,以发现由于图像缩放或复制而产生的网格状伪影。
  • NPP(噪声印迹增强版): 它检查图像的“噪声”或颗粒感,以查看整个画面的相机传感器指纹是否一致。
  • 放大(Zoom-In): 这让 AI 可以在不丢失任何细节的情况下,近距离观察某个可疑位置。

核心创新在于以视觉为中心的推理。AI 不再说“我觉得这部分很假,因为光照很奇怪”,而是实际“调用” ELA 工具,看到屏幕上由于压缩不同而出现的亮红点,然后说:“我在这里看到了一个红点,所以这是伪造的。”决策是基于工具所展示的内容,而不是基于 AI 认为它应该看到什么。

他们如何教导 AI: “策略性工具学习”

你不能只是把工具箱交给一个侦探,然后指望他们知道何时使用它。如果他们对着每一张照片都使用紫外线灯,就会浪费时间并感到困惑。作者开发了一种名为“策略性工具学习”(Strategic Tool Learning)的特殊训练方法,来教导 AI 何时使用哪种工具。

这种训练分为两个阶段:

  1. 监督式微调(SFT): 他们向 AI 展示了许多真实和伪造图像的示例。他们使用了一种“增益驱动”的方法,这意味着只有当工具确实有助于找到答案时,才允许 AI 使用该工具。如果一个工具没有提供任何新信息,AI 就会学会跳过它。这防止了 AI 不必要地使用工具。
  2. 强化学习(RL): 这就像是一款视频游戏,AI 做对了会得分,浪费时间则会扣分。AI 被赋予了一个“工具效用奖励”。如果它使用了工具并找到了伪造点,它会获得高额奖励;如果它使用了工具却没发现任何东西,或者在不需要工具的真实图像上使用了工具,它就会受到惩罚。随着时间的推移,AI 学会成为一名策略性的侦探:它只会在真正必要时才调用工具,从而提高了速度和准确性。

结果:更聪明、更快、更准确

作者在各种各样的伪造图像上测试了 ForgeryVCR,从简单的复制粘贴到复杂的 AI 生成编辑。结果令人印象深刻:

  • 更好的检测能力: ForgeryVCR 在检测图像真伪方面达到了最先进水平(State-of-the-Art),击败了所有其他专门的网络和其他 AI 模型。
  • 更好的定位能力: 它不仅能说“这是伪造的”,还能高精度地围绕伪造部分画出一个框。当他们结合分割工具(SAM2)时,它甚至能画出伪造物体的完美轮廓。
  • 更少的幻觉: 通过移除基于文本的推理,该模型制造虚假证据的错误大幅减少。在测试中,它纠正了基于文本版本约 35% 的错误。
  • 高效性: 由于 AI 学会了在不需要时跳过工具,它不会浪费时间去分析每一张图像的所有工具。它变成了一个知道何时停止观察的聪明侦探。

为什么这很重要

论文指出,对于需要识别微小、不可见细节的任务,强迫计算机用语言进行“思考”是一个坏主意。相反,给它工具将不可见的数据转化为可见的图像效果要好得多。ForgeryVCR 表明,通过将大型 AI 模型的能力与专门的取证工具相结合,并教会它们具备策略性,我们可以构建出更难被欺骗的系统。这是保护我们免受日益难以辨别的超现实伪造图像泛滥影响的关键一步。作者总结道,这种“以视觉为中心”的方法不仅仅是一个小改进,更是我们构建数字取证 AI 时必须进行的范式转变。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →