← 最新论文
🤖 AI

ForgeryGPT: A Multimodal LLM for Interpretable Image Forgery Detection and Localization

本文提出了 ForgeryGPT,一种结合掩码感知伪造提取器与多阶段训练策略的新型多模态大语言模型,旨在通过挖掘高阶伪造知识关联和生成像素级可解释定位结果,突破现有图像伪造检测与定位方法在语义理解和交互解释方面的局限。

原作者: Jiawei Liu, Fanrui Zhang, Jiaying Zhu, Esther Sun, Dong Li, Qiang Zhang, Zheng-Jun Zha

发布于 2026-04-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiawei Liu, Fanrui Zhang, Jiaying Zhu, Esther Sun, Dong Li, Qiang Zhang, Zheng-Jun Zha

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这是一篇关于**"ForgeryGPT"的学术论文,简单来说,它就像是一位“拥有超级侦探眼和博学家大脑”的 AI 助手**,专门用来抓出图片里的“假动作”。

为了让你更容易理解,我们可以把这张论文讲的故事想象成**“寻找照片里的‘鬼’"**。

1. 背景:为什么我们需要它?

现在的修图软件(比如 AI 绘画、PS)太厉害了,随便改改照片,连亲妈都认不出来。以前那些专门找假照片的 AI,就像只会看噪点的“老法医”。它们只能看到照片里有没有奇怪的颗粒感或颜色不自然(低层线索),但看不懂照片里“讲的故事”有没有逻辑漏洞(高层语义)。

而且,以前的 AI 只会冷冰冰地告诉你:“这张图是假的,概率 65%。”它不会解释为什么,也不让你问问题。这就好比警察抓到了嫌疑人,却不告诉你证据在哪,大家很难相信。

2. ForgeryGPT 是什么?

ForgeryGPT 是一个结合了**“超级视力”“聪明大脑”**的新系统。

  • 超级视力(Mask-Aware Forgery Extractor): 它有一双能透视的“火眼金睛”,不仅能看到整张图,还能像拿着放大镜一样,精准地圈出哪里被 P 过(生成“伪造掩码”)。
  • 聪明大脑(大语言模型 LLM): 它像一个经验丰富的侦探,不仅能看到假,还能用人话告诉你:“你看,这个球的光影和桌子上的其他物体对不上,而且它的阴影方向也不对,所以它是后来加上去的。”

3. 它是怎么工作的?(三个核心绝招)

绝招一:给 AI 装上“通用侦探剧本” (Object-agnostic Forgery Prompt)

以前的 AI 认假图,得先知道“这是假的人”、“这是假的猫”。但 ForgeryGPT 不一样,它学会了一套**“万能剧本”**。

  • 比喻: 就像教一个侦探,不要只背“假苹果长什么样”,而是教他“所有被篡改的东西通常都有什么共同特征(比如光影不自然、边缘模糊)”。这样,不管图里是假人、假车还是假树,它都能一眼识破。

绝招二:给 AI 一本“伪造词汇书” (Vocabulary-enhanced Vision Encoder)

普通的 AI 看照片,看到的是模糊的色块。ForgeryGPT 给 AI 加了一本**“微距词汇书”**。

  • 比喻: 普通 AI 看照片说“这里有点怪”。ForgeryGPT 看了之后能说:“这里有个‘不自然的接缝’,那里有个‘错误的反射’。”它把照片里那些肉眼难见的微小破绽,变成了具体的“词汇”,让 AI 能更精准地定位。

绝招三:像教小学生一样“三步走”训练 (Three-stage Training)

为了让这个 AI 既懂技术又会说话,作者设计了三个阶段的训练:

  1. 识字阶段: 先让它看懂普通的图片和文字,建立基础。
  2. 看图说话阶段(Mask-Text Alignment): 给它看成千上万张被 P 过的图,并配上详细的“作案报告”。让它学会把“被 P 过的区域”和“文字描述”对应起来。
  3. 实战对话阶段(Instruction Tuning): 让它和人类进行多轮对话。你问:“哪里是假的?”它答:“右上角。”你问:“怎么看出来的?”它答:“因为……"

4. 它厉害在哪里?(对比实验)

  • 比传统 AI 强: 以前的 AI 只能给个分数,ForgeryGPT 能画出精准的“作案地图”(把 P 过的地方圈出来),而且准确率在多个国际大赛数据集上都是第一。
  • 比通用大模型(如 GPT-4o)强: 普通的 GPT-4o 看图可能觉得“挺好看的”,但 ForgeryGPT 能一眼看出“这图是 P 的”。因为它专门学过“找茬”的学问。
  • 能聊天: 这是最大的亮点。你可以像查案一样问它:
    • 你:“这图有假吗?”
    • 它:“有,你看那个飞在天上的飞机,光影完全不对。”
    • 你:“具体在哪?”
    • 它:“在左上角和中间,我已经把它们圈出来了。”

5. 总结:这有什么用?

想象一下,以后在社交媒体上看到一张“惊天大新闻”的照片,你不用自己去猜,直接发给 ForgGPT:

“这张图是真的吗?如果是假的,哪里有问题?为什么?”

它不仅能告诉你**“是假的”,还能圈出假的地方**,并像侦探一样给你写一份详细的分析报告,甚至能和你多轮对话,帮你彻底搞懂真相。

一句话总结:
ForgeryGPT 就是把**“找茬的显微镜”“会说话的侦探”**合二为一,让普通人也能像专家一样,轻松识破网络上的假照片,让互联网变得更真实、更可信。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →