← 最新论文
💻 computer science

LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection

LaP-Forensics 是一个多模态深度伪造检测框架,它通过将基于 Stable Diffusion 的重构残差与 RGB 语义结合,并利用结构化推理模型进行整合,进而通过组相对策略优化(Group Relative Policy Optimization)进行进一步优化,从而增强了针对先进生成模型的鲁棒性,并实现了具有竞争力的跨生成器检测与伪造痕迹定位能力。

原作者: Can Wang, Yuhao Wang, Yushe Cao, Canran Xiao, Fei Shen

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Can Wang, Yuhao Wang, Yushe Cao, Canran Xiao, Fei Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名试图破解谜团的侦探,但罪犯已经成为了伪装大师。在计算机科学领域,特别是“计算机视觉”领域,正面临着一个日益严重的问题:人工智能制造出的虚假照片正变得越来越好,甚至到了肉眼几乎无法分辨的地步。多年来,我们之所以能识破伪造品,是因为它们会有奇怪的瑕疵——比如一只长着六根手指的手,或者与光影不匹配的阴影。但新的 AI 工具已经学会了抹平这些错误,使伪造品看起来与真实图像一样完美。这让我们的旧“侦探工具”感到困惑,因为它们之前只关注这些明显的视觉瑕疵。现在的关键问题是,如果一张照片看起来完美无缺,我们该如何辨别它是真是假?我们需要一种新型的侦探,它不仅仅观察表面,还要检查这张照片在“引擎盖下”是否符合逻辑。

这正是名为 LaP-Forensics 的新方法发挥作用的地方。你可以把它想象成图像的一种“现实检查”。这项研究背后的研究人员意识到,虽然 AI 伪造的图像在表面上看起来很棒,但如果你尝试使用一种特定类型的 AI 模型从头开始“重建”它们,它们往往会表现得力不从心。想象一下,你有一张猫的照片。如果你将这张照片输入到一个特殊的 AI 中,让这个 AI 根据它的训练内容去猜测这只猫“应该”长什么样,然后将 AI 的猜测结果与原始照片进行对比,一张真实的照片将会完美契合。但一张伪造的照片,即使是非常高明的伪造品,也会在 AI 的猜测与伪造图像之间产生微小的偏差。这些不匹配之处被称为“残差(residuals)”。

该论文介绍了一个系统,它利用这些不匹配之处作为秘密线索。LaP-Forensics 不仅仅是观察图片,它会将图片通过一个“重建机器”(一个冻结的 AI 模型)进行处理,以观察图像在何处未能符合该机器的预期。随后,它会将这种“不匹配图(mismatch map)”与原始图片结合起来,并请一位聪明的 AI 助手充当法医专家。这位助手遵循严格的三步逻辑:哪里出现了异常点?它看起来像什么?以及它为什么证明了图像是伪造的?

研究人员发现,这种方法效果显著。当他们在大量由不同 AI 工具生成的虚假图像集上进行测试时,该系统识别伪造图像的准确度高于许多以往的方法。例如,在名为“UniversalFakeDetect”的测试集上,他们的系统正确识别了 97.23% 由旧型 AI(GANs)生成的伪造图像,以及 92.18% 由新型扩散模型(diffusion models)生成的伪造图像。更令人印象深刻的是,他们不仅能指出“整张图片是假的”,还能画出精确的轮廓,圈出图像中被伪造的具体部分。

然而,论文也谨慎地指出,这并不是解决所有问题的万能药。该系统依赖于特定类型的“重建机器”,如果一张图像在生成后经过了大量的编辑或压缩,线索可能会变得模糊。此外,虽然 AI 可以写出极具说服力的关于“为什么”它认为图像是伪造的解释,但论文承认,它无法保证 AI 写下的每一个字在深层哲学意义上都是 100% 真实的;它只能确保 AI 遵循指向其所发现证据的规则。

简而言之,LaP-Forensics 表明,为了捕捉下一代超逼真的伪造品,我们不能仅仅盯着图片看,而要开始检查这张图片在尝试重建时是否能够经受住考验。通过将视觉图像与“不匹配图”相结合,该系统为我们提供了一种强大的新方法,让我们即使在谎言看起来完美无缺时,也能洞察真相。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →