← 最新论文
💻 computer science

Towards Generalizable Face Forgery Detection via Multi-Granularity Fusion

为了解决由可迁移高层语义与稀疏局部伪影之间的冲突所导致的脸部伪造检测中的泛化差距问题,本文提出了 SemFusion,这是一个结合了用于保留 CLIP 可迁移结构的语义一致性正则化,以及用于有效捕获并融合局部伪造线索的多级补丁证据学习的框架。

原作者: Mingjie Zhao, Yiu-ming Cheung, Guilin Pang

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingjie Zhao, Yiu-ming Cheung, Guilin Pang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在刷手机,突然看到一段视频,里面的名人正说着他们从未说过的话。它看起来很真实,听起来很真实,感觉也极其真实。这就是“深度伪造”(Deepfakes)的世界——一种数字魔术,计算机可以完美地更换面部或重演表情,以至于我们的眼睛根本无法分辨真伪。长期以来,科学家们一直试图构建“数字测谎仪”来识别这些伪造品。但棘手之处在于:就像魔术师每次被识破后都会变换新招数一样,制造这些伪造品的人也在不断发明新的方法来欺骗检测器。旧的检测器就像是记住了已知小偷长相的保安;如果一个新小偷戴了一顶不同的帽子走进来,保安就认不出他了。这个领域的核心问题是:我们如何构建一个不仅仅是死记硬背特定招数,而是能理解无论谁在作案,什么样的脸看起来都显得“假”的检测器?

这正是香港浸会大学研究人员的一项新研究所要解决的问题。他们试图解决这个“泛化”(generalization)问题——即制作一个能够识别任何新伪造品,而不仅仅是它练习过的伪造品的检测器。为此,他们使用了一个强大的工具,叫做 CLIP。把 CLIP 想象成一位超级聪明的图书管理员,她读过数十亿本书,看过数十亿张照片。这位图书管理员知道“猫”通常有胡须,而“海滩”通常有沙子,即使她从未见过那只特定的猫或那个特定的海滩。研究人员希望利用这位图书管理员的通用知识来识别伪造,但他们意识到,这位图书管理员太关注宏观大局(比如“这是一个脸”)而忽略了魔术发生时那些微小、混乱的细节(比如交换嘴部周围模糊的边缘)。

于是,团队构建了一个名为 SemFusion 的新系统。他们并没有仅仅询问图书管理员:“这是一个真实的脸还是一个假的脸?”(因为这往往过于笼统),而是教会了系统既要观察整张脸,同时又要缩放观察那些可疑的皮肤小块区域。他们还添加了一条特殊规则,以确保系统在学习识别伪造品时,不会忘记图书管理员原有的、可靠的知识。结果呢?这种检测器的欺骗难度大大增加了。当他们在五组从未见过的伪造视频集上进行测试时,其正确率达到了 90.9%。当他们在六种完全不同的新型伪造方式上进行测试时,其正确率达到了 97.4%。这就像是从一名只认识某个罪犯长相的保安,升级到了一名能识破任何罪犯(即便他们乔装打扮)的侦探。

问题所在:“太大”的图景

研究人员首先注意到以往检测器工作中的一个缺陷。大多数检测器将一张脸视为一张巨大的图片。它们问的是:“整个图像看起来像是一个真人吗?”但深度伪造非常狡猾。它们从远处看可能很完美,但如果你放大观察,可能会看到鼻部交换处的一个奇怪污点,或者皮肤纹理与周围不匹配。

论文指出,仅依赖“大局观”就像是通过只看书封面的方式来寻找书中的错别字。你可能看到了标题和作者,但会错过第 42 页上的拼写错误。同样,现有的检测器经常会错过“局部证据”——即那些发生伪造的微小、可疑的点。研究人员发现,当他们使用标准的 AI 模型观察一张伪造的脸时,模型经常会说:“这看起来很真实!”因为整体脸型是正确的,尽管眼睛略显扭曲。

解决方案:双管齐下的侦探

为了解决这个问题,团队创建了 SemFusion,其全称是“语义一致性多粒度融合”(Semantic-Consistent Multi-Granularity Fusion)。这是一个很高级的说法,意思是通过结合两种不同的观察方式:即“全局”视角和“局部”视角。

1. 全局视角(大局观)
首先,他们使用了一个修改版的 CLIP 模型来观察整张脸。这部分系统擅长理解通用概念。它知道一张人类的面孔在宏观意义上应该是什么样子的。然而,正如研究人员所指出的,仅靠这部分是不够的,因为它容易被那些从远处看效果极佳的高质量伪造品所蒙蔽。

2. 局部视角(缩放观察)
这是见证奇迹的地方。研究人员开发了一种新技术,称为多层补丁证据(Multi-level Patch Evidence, MPE)。想象一下,将脸部切割成数百个微小的拼图碎片(补丁)。系统随后会单独观察每一个碎片,看看它是否表现得有些可疑。

  • 它不仅观察图像的最表层,还会观察计算机大脑中多个深度的“层级”,以寻找线索。
  • 它就像一个扫描犯罪现场的侦探,忽略无聊的部分(如背景),只专注于“Top-K”个最可疑的点。
  • 即使是嘴部周围的一个微小补丁看起来很奇怪,这个局部分支也会拉响警报,即使脸部的其他部分看起来完美无缺。

3. 安全网(语义一致性)
这是让系统不至于“发疯”的巧妙之处。当你教 AI 识别伪造品时,它有时会因为过度痴迷于“伪造”模式而忘记了什么是“真实”的脸。它可能会仅仅因为一个阴影看起来稍有不同,就认为一张真实的脸是伪造的。

为了阻止这种情况,研究人员添加了一条名为**语义一致性正则化(Semantic Consistency Regularization, SCR)**的规则。可以将它想象成一根“接地线”。他们保留了原始的、冻结的 CLIP 文本空间(即图书管理员的知识)作为参考点。他们告诉 AI:“你可以学习识别伪造品,但你必须保持接近‘脸’的原始定义。”这防止了 AI 偏离太远并忘记基础知识。这就像告诉学生:“你可以发明新的解题方法,但你不能改变 2 + 2 = 4 这个事实。”

它是如何协同工作的

该系统的工作方式就像是一支由两名侦探组成的团队。

  • 全局侦探观察整张脸并说:“嗯,这看起来基本是真的。”
  • 局部侦探放大观察并说:“等等!我看到脸颊上有一个奇怪的污点!这是假的!”
  • 融合: 系统会结合他们的意见。如果全局侦探不确定,但局部侦探发现了可疑的补丁,那么最终结论会倾向于“伪造”。

研究人员通过将该系统与现有的最佳检测器进行对比来测试其性能。他们在一组伪造视频(FF++)上训练了系统,然后将其投入到五个完全不同的、从未见过的视频集中进行实战测试。

  • 结果: SemFusion 在这些新数据集上的平均得分达到了 0.909(满分为 1.0)。这优于之前的最佳方法。
  • “新招数”测试: 他们还在六种新的伪造方法(例如新的换脸软件)上进行了测试。SemFusion 的平均得分达到了 0.974,彻底碾压了竞争对手。

为什么这很重要

论文指出,这种方法是一个巨大的进步,因为它不仅仅是死记硬背特定的“伪造”模式。相反,它学会了在保持对真实面孔稳固理解的同时,去识别特定位置自然细节的“缺失”。

研究人员还检查了他们的系统是否足够强大,能够处理糟糕的视频质量,例如视频模糊、有噪点或经过压缩的情况。他们发现,即使在视频画面很乱的情况下,SemFusion 依然能保持可靠,而其他检测器则开始失效。

然而,作者也谨慎地表示,他们并没有声称已经永久“解决”了这个问题。他们指出,随着深度伪造技术变得更加先进,检测器也将需要不断进化。他们还指出,虽然他们的系统快速且高效,但仍需要一台功能强大的计算机来运行。但就目前而言,这种“双眼”观察法——一只眼看整体,一只眼看局部,再加上一条约束规则来保证诚实——为我们在数字世界中辨别真伪提供了一种更可靠的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →