Trustworthy Deepfake Detection Through Explainable AI: Evaluating the Consistency of Visual Explanations Across Deepfake Datasets
本研究引入了解释一致性得分(Explanation Consistency Score, ECS),旨在证明具有高预测准确率的深度伪造检测器往往依赖于不稳定且特定于数据集的推理逻辑,从而导致泛化失败,并据此主张法医学模型除了传统的性能指标外,还必须在解释一致性方面进行评估。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字时代,真实照片与计算机生成图像之间的界限变得越来越难以划分。先进的软件现在可以创建视频,让人们说出他们从未说过的话,或做出他们从未做过的事,其逼真程度足以欺骗肉眼。为了应对这一挑战,科学家们开发了旨在充当“数字测谎仪”的计算机程序。这些程序通过分析图像和视频,来捕捉揭示伪造痕迹的微小且肉眼不可见的瑕疵。多年来,这些程序的成功标准仅仅是它们答对问题的频率。如果一个程序能十次中正确识别出九次伪造视频,它就被视为是成功的。然而,答对并不总是意味着程序在进行正确的思考。正如一名学生可能通过记忆模式而非理解课程内容而在考试中猜中正确答案一样,计算机程序也可能出于错误的原因识别出伪造内容。这为执法和新闻报道等领域带来了危险的问题,因为在这些领域,了解决策背后的“原因”与决策本身同样重要。
一个研究小组着手调查这些高性能的数字测谎仪究竟是真正值得信赖,还是仅仅在靠运气猜测。他们专注于两个特定的计算机模型,即 XceptionNet 和 EfficientNet-B0,它们目前是识别深度伪造(deepfakes)最优秀的模型之一。研究人员想要观察这些模型在做出判断时,是否正在观察脸部的正确部位。为此,他们使用了一种技术,通过高亮显示图像中计算机正在关注的具体区域,从而创建一个其思维过程的可视化地图。他们比较了生成这些地图的两种不同方法,以观察计算机是否具有一致性。如果计算机是真正可靠的,这两种方法应该指向相同的特征,例如深度伪造通常会留下细微痕迹的嘴部或眼睛。如果方法指向不同的位置,则表明计算机的推理是不稳定的。
研究始于将这些模型在大量已知的真实和伪造视频集上进行训练。在测试这些熟悉材料时,模型的表现异常出色,正确识别伪造视频的概率超过 94%。在这个受控环境中,视觉地图也具有高度的一致性。两种检查计算机注意力的方法在观察位置上达成了一致,都聚焦在通常发生篡改的面部特征上。这给人一种系统稳健且可靠的印象。然而,研究人员随后对这些模型进行了更严苛的测试。他们要求计算机分析一组完全不同的视频,其中包含从未见过的名人的高质量伪造视频。这种数据类型的转变被称为“领域偏移”(domain shift),旨在模拟互联网中混乱且不可预测的现实情况。
第二次测试的结果揭示了一个令人震惊的脱节现象。虽然这些模型仍然能够正确识别许多新的伪造视频,但它们的内部推理逻辑却崩溃了。原本清晰且集中的视觉地图变得零散且混乱。计算机的注意力不再集中在面部特征上,而是漂移到了头发、背景或画面边缘等无关区域。当研究人员测量两种检查计算机注意力的算法之间的一致性时,得分下降了近一半。这意味着,即使计算机得到了正确答案,它也不再是基于同样的证据得出的结论。一会儿它可能在关注嘴部,一会儿又在关注背景,完全缺乏逻辑一致性。这种现象被研究人员称为“归因不稳定性”(attribution instability),这表明这些模型很可能依赖于针对第一组视频的特定快捷方式(例如特定的压缩模式),而不是学习了伪造面部的通用特征。
研究结论指出,仅凭高准确率不足以信任深度伪造检测器。一个系统可能因为错误的原因而得到正确的答案,而在法庭案件或新闻核实等敏感情况下,这是一个致命的缺陷。研究人员认为,我们需要一种新的评估这些工具的标准,不仅要检查它们是否正确,还要检查它们的推理在面对不同类型的数据时是否稳定且一致。他们提出了一个新的指标,称为“解释一致性评分”(Explanation Consistency Score),用以衡量这种稳定性。通过确保检测器的视觉证据即使在面对新的、具有挑战性的伪造内容时仍能保持聚焦和可靠,我们可以构建出不仅准确而且真正值得信赖的系统。研究结果表明,当前的这一代深度伪造检测器虽然令人印象深刻,但可能比我们想象的更加脆弱,而真正的可靠性需要通过“查看引擎盖内部”来观察机器是如何思考的,而不只是看它说了什么。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。