Synthetic Image Detection with CLIP: Understanding and Assessing Predictive Cues
本文通过引入 SynthCLIC 基准测试,研究了基于 CLIP 的合成图像检测的可解释性,揭示了这些模型依赖于与图像润饰和构图相关的广泛文本相关线索,而非特定的生成器伪影,从而强调了它们与取证检测器相比具有互补但截然不同的失效模式。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在过去的几年里,计算机已经学会了绘制出与人类相机拍摄的照片无异的图像。这些被称为生成模型的机器可以创造出极其逼真的人物、风景和物体图像,以至于我们的眼睛已无法分辨其差异。这种能力引发了一个致力于识别伪造图像的新研究领域。长期以来,专家们认为这些伪造品会留下微小的、肉眼不可见的“指纹”——即计算机构建图像时产生的细微数学误差——可以作为一种特征信号。然而,随着机器变得越来越先进,这些旧方法正变得越来越不可靠。一种新的研究方向提出了一个不同的问题:与其寻找微观层面的误差,我们能否利用一台能够理解图像含义及其描述性文字的计算机,来判断一张照片是否真实?这种方法依赖于一个在数十亿个“图像-文本”对上进行训练的系统,使其能够学习一张“真实”的照片在光照、构图和纹理方面通常呈现出怎样的特征,而不仅仅是寻找数字瑕疵。
瑞士应用科学大学(FHNW)的一个研究小组决定深入调查这个基于含义的系统究竟是如何做出决策的。他们想知道,该系统仅仅是在记忆特定类型的伪造图像,还是已经学习到了更深层、更通用的摄影理解。为此,他们创建了一套名为 SynthCLIC 的新测试图像集。他们从专业档案库中提取真实的摄影作品,并利用最新的图像生成机器为每张照片创建了完美的“合成孪生体”,两者在内容上高度匹配,唯一的区别在于创作方式。随后,他们在这些成对的图像以及包含不同技术制造的旧版伪造数据集上测试了他们的检测系统。
研究人员发现,当系统在与其训练类型相同的图像上进行测试时,表现非常出色,能够高精度地识别伪造图像。然而,当他们尝试使用针对旧版、低质量伪造图像训练出的检测器来识别新型高质量伪造图像时,系统却彻底失败了。这表明,计算机并不是在寻找一种存在于所有合成图像中的单一、通用的“伪造”签名;相反,它是在根据它之前见过的特定图像学习一套特定的规则。当伪造图像的风格发生变化时,计算机用来识别它们的规则就不再适用了。
通过分析系统的内部逻辑,团队发现了计算机实际在关注什么。他们发现,当系统判定一张图像为合成图像时,往往是因为照片看起来“太完美了”。计算机将伪造图像与干净的构图、平滑的光照以及一种精致、近乎理想化的外观联系在一起。相比之下,当系统判定照片为真实时,通常是因为照片具有真实拍摄所特有的杂乱且不完美的特质:略微不均匀的光照、胶片的质感,或者是相机在黑暗环境下挣扎时产生的视觉噪声。该系统本质上是在评判图像的“工艺水平”。它已经习得,真实的摄影作品往往带有人类之手和物理环境的痕迹,而合成图像则倾向于带有计算机试图让一切都显得完美无瑕的痕迹。
研究还表明,这些线索并非仅存在于图像的某一个部分或某一个特定特征中。相反,决策是基于许多微小细节的广泛组合,从阴影的投射方式到边缘的锐利程度皆是如此。当研究人员尝试用简单的词汇列表来解释计算机的选择时,他们发现没有任何一个单独的词汇能够解释这一决策。正是许多微妙线索的共同作用,才最终改变了天平的倾斜方向。此外,这些线索的具体组合会根据计算机训练过的伪造图像类型而改变。如果它接受的是带有数字错误的老旧伪造图像训练,它就会寻找数字误差;如果它接受的是现代高质量伪造图像的训练,它就会寻找自然缺陷的缺失。
这项研究表明,识别伪造图像并没有所谓的“灵丹妙药”。一个在某种类型的计算机生成艺术上表现良好的检测器,在面对另一种类型时可能会完全失效。最有效的方法似乎是使用涵盖极广泛不同伪造图像的图像进行训练,以便它们能够学习使图像看起来具有人工感的宏观模式,而不是仅仅记忆单台机器的错误。研究结论指出,虽然这些基于含义的检测器是强大的工具,但它们并不完美。它们在与那些可能被基于含义的系统所忽略的底层数字指纹相结合使用时,效果最为理想。最终,真实与伪造图像之间的较量并非一场关于单一线索的简单躲猫猫游戏,而是一场复杂的斗争,其规则会随着技术的发展而不断演变。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。