想象一下,你是一名试图破解谜团的侦探,但罪犯已经成为了伪装大师。在计算机科学领域,特别是“计算机视觉”领域,正面临着一个日益严重的问题:人工智能制造出的虚假照片正变得越来越好,甚至到了肉眼几乎无法分辨的地步。多年来,我们之所以能识破伪造品,是因为它们会有奇怪的瑕疵——比如一只长着六根手指的手,或者与光影不匹配的阴影。但新的 AI 工具已经学会了抹平这些错误,使伪造品看起来与真实图像一样完美。这让我们的旧“侦探工具”感到困惑,因为它们之前只关注这些明显的视觉瑕疵。现在的关键问题是,如果一张照片看起来完美无缺,我们该如何辨别它是真是假?我们需要一种新型的侦探,它不仅仅观察表面,还要检查这张照片在“引擎盖下”是否符合逻辑。
这正是名为 LaP-Forensics 的新方法发挥作用的地方。你可以把它想象成图像的一种“现实检查”。这项研究背后的研究人员意识到,虽然 AI 伪造的图像在表面上看起来很棒,但如果你尝试使用一种特定类型的 AI 模型从头开始“重建”它们,它们往往会表现得力不从心。想象一下,你有一张猫的照片。如果你将这张照片输入到一个特殊的 AI 中,让这个 AI 根据它的训练内容去猜测这只猫“应该”长什么样,然后将 AI 的猜测结果与原始照片进行对比,一张真实的照片将会完美契合。但一张伪造的照片,即使是非常高明的伪造品,也会在 AI 的猜测与伪造图像之间产生微小的偏差。这些不匹配之处被称为“残差(residuals)”。
该论文介绍了一个系统,它利用这些不匹配之处作为秘密线索。LaP-Forensics 不仅仅是观察图片,它会将图片通过一个“重建机器”(一个冻结的 AI 模型)进行处理,以观察图像在何处未能符合该机器的预期。随后,它会将这种“不匹配图(mismatch map)”与原始图片结合起来,并请一位聪明的 AI 助手充当法医专家。这位助手遵循严格的三步逻辑:哪里出现了异常点?它看起来像什么?以及它为什么证明了图像是伪造的?
研究人员发现,这种方法效果显著。当他们在大量由不同 AI 工具生成的虚假图像集上进行测试时,该系统识别伪造图像的准确度高于许多以往的方法。例如,在名为“UniversalFakeDetect”的测试集上,他们的系统正确识别了 97.23% 由旧型 AI(GANs)生成的伪造图像,以及 92.18% 由新型扩散模型(diffusion models)生成的伪造图像。更令人印象深刻的是,他们不仅能指出“整张图片是假的”,还能画出精确的轮廓,圈出图像中被伪造的具体部分。
然而,论文也谨慎地指出,这并不是解决所有问题的万能药。该系统依赖于特定类型的“重建机器”,如果一张图像在生成后经过了大量的编辑或压缩,线索可能会变得模糊。此外,虽然 AI 可以写出极具说服力的关于“为什么”它认为图像是伪造的解释,但论文承认,它无法保证 AI 写下的每一个字在深层哲学意义上都是 100% 真实的;它只能确保 AI 遵循指向其所发现证据的规则。