← 最新论文
💻 computer science

Uncertainty-Aware Deepfake Detection via Multi-View Structural Learning

本文提出了一种感知不确定性的深度伪造检测框架,该框架集成了视觉、语义和结构证据流,并结合一种新颖的分支间差异校准机制,以在分布偏移下实现最先进的泛化能力和可靠的置信度估计。

原作者: Muhammad Umar Farooq, Kutub Uddin, Awais Khan, Khalid Malik

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Muhammad Umar Farooq, Kutub Uddin, Awais Khan, Khalid Malik

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

数字侦探的困境

想象一下,你正走在一个繁忙的集市中,现实与虚构在这里开始交织。这就是“深度伪造”(deepfakes)的世界,强大的计算机程序可以更换面部或让人们说出从未说过的话,创造出看起来和听起来都极其真实的视频。长期以来,科学家们一直在构建数字侦探来识别这些伪造品。这些侦探通常寻找微小的、肉眼不可见的瑕疵——比如奇怪的阴影或不协调的像素——以此来区分真实视频与伪造视频。

然而,这些传统的侦探存在一个大问题:它们往往过于自信。想象一下,一名保安如此确定自己看到了小偷,以至于即使只是一个无害的人走过,他也会大喊“站住!”在深度伪造的世界里,当视频与计算机之前见过的图像略有不同,或者图像模糊、带有噪点时,就会发生这种情况。计算机可能会以100%的确定度大喊“伪造!”,即便那其实是一个真实的视频,反之亦然。这是很危险的,因为如果我们无法信任计算机的信心,我们就无法信任它的判决。问题不仅仅是“这是假的吗?”,而是“你有多确定?”

三人侦探团队

在这篇论文中,研究人员提出了一种新型的侦探系统,称为 DISCERN。他们没有依赖于单一且过度自信的守卫,而是构建了一个由三位从不同角度观察同一视频的不同专家组成的团队。其核心理念是:如果三位专家达成一致,团队就可以非常有信心;但如果他们开始互相争论,系统就会知道停下来并说:“我对这个不太确定。”

以下是这个团队的工作方式,我们用一个有趣的类比来解释:

  1. 视觉专家(CLIP 流): 这是“大局观”观察者。它使用了一个庞大的、经过预训练的大脑(称为基础模型),该大脑已经见过数百万张图像。它观察面部并判断:“这看起来像是一个人,”或者“这看起来像是一个生成的图像。”它擅长识别通用模式,但有时会被复杂的灯光或压缩技术所迷惑。
  2. 语义专家(语义流): 这是“逻辑检查员”。它不仅仅观察像素,还会检查面部是否符合逻辑。例如,如果视频显示一个人在微笑,那么嘴部的形状是否符合“微笑”的肌肉运动?如果一个人向左看,头部转动的方式是否正确?如果计算机判定为“微笑”,但肌肉却没有相应运动,这位专家就会拉响警报。它观察的是面部的“故事”是否具有连贯性。
  3. 结构专家(结构流): 这是“法医科学家”。它寻找由制造伪造内容的计算机留下的隐形指纹。它会检查奇怪的噪声模式或真实的摄像机通常不会产生的奇异频率信号。这就像是在检查一张钞票的纸张感觉是真正的棉纤维还是廉价的塑料。

“分歧”的魔力

DISCERN 的真正魔力不仅在于它拥有三位专家,更在于当他们产生分歧时,它如何处理这种分歧。研究人员引入了一种特殊的规则,称为跨分支分歧校准(IBDC)

把它想象成一个陪审团。如果三名陪审员都以高度自信投出“有罪”票,那么判决就是可靠的。但如果陪审员 A 斩钉截铁地说“有罪!”,而陪审员 B 说“无罪!”,陪审员 C 则犹豫不决呢?在普通系统中,可能仅仅因为“有罪”的票数占优,系统就会给出确定的结论,从而导致自信地犯错。在 DISCERN 中,系统会注意到这场争论。当专家们产生分歧时,系统会自动降低其置信度。它会说:“嘿,我们正在为此争吵,所以我不是 100% 确定。我可能应该寻求更多帮助,或者干脆承认我不知道。”

这是一个巨大的转变。DISCERN 不再试图强行给出一个“是”或“否”的答案,而是学会了衡量其组成部分之间的分歧程度。如果视觉专家认为这是伪造的,但逻辑专家认为这是真实的,系统就知道情况很复杂,并表现出不确定性。这种不确定性实际上是一件好事,因为它告诉我们何时需要保持谨慎。

研究发现

研究人员使用各种不同的伪造视频数据集对他们的新团队进行了测试,其中也包括该系统从未见过的类型。他们发现 DISCERN 在两方面表现出色:

  1. 泛化能力: 它在其他检测器失败的新型伪造视频上表现良好。例如,在名为 Celeb-DF-v3 的数据集上,它的准确率较以往的方法有了显著提升。
  2. 诚实度: 这是最大的胜利。该系统非常擅长识别自己在何时是不确定的。在测试中,它具有非常低的“期望校准误差”(Expected Calibration Error,一个衡量置信度是否诚实的指标)。在一项测试中,其得分仅为 0.014,不到次优方法的一半。这意味着当 DISCERN 说它有 90% 的把握时,它确实有 90% 的把握。

他们还在模糊、多噪点或具有奇怪色彩(例如使用劣质相机拍摄的真实照片)的视频上测试了该系统。即使视频质量很差,DISCERN 依然保持可靠。当团队中的专家产生分歧时,系统会正确地将视频标记为“不确定”,而不是进行盲目的猜测。

总结

这篇论文表明,捕捉深度伪造的最佳方式不仅仅是构建一个更聪明的单一检测器,而是构建一个能够倾听多种证据类型,并且至关重要的是,能够注意到这些证据之间不一致的系统。通过将“分歧”转化为“不确定性”的信号,DISCERN 创建了一种更可靠、更稳健的识别伪造的方法,尤其是在那些视频经常模糊或被压缩的、混乱且不完美的现实世界中。这不仅仅是为了识破谎言,更是为了知道你何时可能会出错。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →