← 最新论文
💻 computer science

A Modular Image Manipulation Localization Framework using a Dual-Stream Classifier and Conditional Diffusion Models

本文提出了一种用于图像篡改定位的新型两阶段模块化框架,该框架首先通过融合 RGB 和 SRM 特征的双流分类器对篡改类型进行分类,随后利用带有混合损失函数的专门化条件扩散模型来生成精确的篡改掩码,在基准数据集上实现了具有竞争力的性能。

原作者: Zohaib Hamdule, Venkatanareshbabu Kuppili

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Zohaib Hamdule, Venkatanareshbabu Kuppili

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网就像一个巨大、繁忙的数字城镇广场,每个人都在那里分享照片。在这个城镇里,编辑图片变得异常容易。你可以更换面部、移除物体,或者复制粘贴场景的一部分,让它看起来像是从未发生过的事情。这就是图像篡改(image manipulation)的世界。虽然我们的眼睛擅长发现明显的伪造,但往往会忽略那些可能传播谎言、毁坏名誉甚至诱导我们购买不存在之物的微妙伎俩。为了反击,科学家们构建了“数字侦探”——一种旨在不仅能说出“这张照片是假的”,还能精准指出“谎言隐藏在哪里”的计算机程序。这被称为图像篡改定位(Image Manipulation Localization)。挑战在于,这些伪造手段正变得越来越聪明,旧的侦探工具在面对新型的篡改手段时往往会感到困惑。它们难以泛化,这意味着它们可能擅长识别一种类型的伪造,但在另一种类型面前却完全失灵。

本文介绍了一种聪明的、分为两个不同阶段的新型侦探系统,就像一个专门的专家团队。首先,它使用一个双流分类器(Dual-Stream Classifier)来充当“类型分类器”。这个部分并不试图立即猜测伪造的位置,而是通过两种不同的视角观察图像:一个流观察正常的颜色和形状(RGB 流),另一个流则寻找编辑工具留下的不可见的“噪声”或数字指纹(SRM 流)。基于此,它将图像分为四类:复制-移动(Copy-Move)(将图像的一部分复制并粘贴到其他地方)、拼接(Splicing)(从一张照片中剪切并粘贴到另一张照片中)、移除(Removal)(擦除物体)或增强(Enhancement)(仅仅是让画面看起来更好)。一旦图像被分类,它就会被移交给第二阶段:条件扩散模型(Conditional Diffusion Model, CDM)。把这想象成一个生成式艺术家,它不仅仅是在猜测,而是在伪造区域上“绘制”一个掩码(mask)。它从一个带有噪声、模糊的猜测开始,一步步进行细化,直到揭示出篡改的确切形状。

研究人员在名为 DF2023 的大规模图像集上测试了这个两阶段系统。他们的主要发现是,这种模块化方法效果非常好。“类型分类器”正确识别篡改类型的准确率达到了 89%。一旦图像被分类,专门的“绘画”模型(CDMs)能够以平均准确度(以交并比 IoU 衡量)0.70 和 F1 分数 0.77 绘制出伪造区域。这些数字表明,该系统在寻找图像被修改的确切位置方面是非常有效的。

有趣的是,论文明确反对尝试用一个巨大的模型同时完成所有工作。他们发现,直接在最终的绘画阶段(CDM)中添加额外的“噪声”过滤器实际上会让结果变得更,而不是更好。深层的“绘画”网络已经足够聪明,能够仅通过图像的正常颜色学习到必要的细节,添加更多数据只会减慢速度而没有帮助。他们还测试了一个“加权平均”的想法,即根据分类器的置信度来融合所有四个绘画模型的输出。然而,他们发现这并没有显著提高结果;当分类器非常自信(高于 50% 置信度)时,系统表现最好,只需选择最适合该任务的单一专家即可。

作者对他们的结果非常有信心,因为他们在多个不同的基准数据集上进行了严格的测量,而不仅仅是在训练集上。当他们在 IMD2020CoMoFoDCASIAv1 等其他著名数据集上进行测试时,该系统展现出了与顶尖系统相媲美的性能。虽然该系统在 DF2023 数据集上表现强劲(实现了 0.93 的像素级准确度),但在外部基准测试(如 CASIAv1IMD2020)上的结果却褒贬不一;例如,在这些特定的数据集上,成熟的方法如 PSCC-NetMVSS-Net 实际上取得了比本系统更高的 IoU 和 F1 分数。这突显出虽然模块化方法功能强大,但在处理某些外部数据分布时面临挑战。此外,他们也指出了一个局限性:当伪造部分非常小(小于总画面的 5%)时,系统的性能会下降。这是因为他们将图像缩小到 256x256 像素进行处理,微小的细节可能会在缩放过程中丢失。

该系统最酷的特性之一是它的速度和灵活性。通过使用一种称为 DDIM 的采样方法,他们可以在仅 200 步内生成最终的“掩码”,而不是通常的 1000 步,这使得过程快得多(对于某些类型,从每张掩码超过 11 秒降至约 1.6 秒),且几乎不损失准确度。论文指出,这种模块化设计就是未来:如果未来出现了新的图像伪造手段,你不需要重新训练整个系统。你只需要为那个特定的技巧训练一个新的“绘画”模型,并将其插入其中,同时让“分类器”学习识别新的类别。这是一种灵活、可适应的方式,能让数字取证技术始终保持领先地位。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →