← 最新论文
💻 computer science

Primitive-Driven Compositional Forensic Visual Prompting for Open-World Face Anti-Spoofing

本文提出了一种由原语驱动的组合式取证视觉提示框架,该框架利用冻结的 ViT 从图像块中学习并动态组装可重用的微观取证原语,通过在不依赖语义或语言引导的情况下捕捉细粒度且空间异质的证据,从而实现针对未知攻击的鲁棒开放世界人脸防欺骗。

原作者: Fangling Jiang, Qi Li, Bing Liu, Weining Wang, Quilin Huang, Zhenan Sun, Ming-Hsuan Yang

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Fangling Jiang, Qi Li, Bing Liu, Weining Wang, Quilin Huang, Zhenan Sun, Ming-Hsuan Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字时代,我们的脸庞已成为我们的密码。我们通过简单的注视来解锁手机、登机或访问银行账户,并信任系统能够分辨出真人与巧妙的仿制品。这种信任依赖于一种被称为“人脸防欺骗”(face anti-spoofing)的技术,它扮演着守门人的角色,将真实的人脸与呈现攻击(presentation attacks)区分开来。这些攻击并非简单的戏法;它们涵盖了从展示一张打印的照片,到佩戴超写实的硅胶面具,再到使用屏幕上的视频回放等各种手段。对于计算机而言,挑战在于世界是混乱且不断变化的。光影在变,摄像头在变,而攻击者也在不断发明系统从未见过的全新材料和方法。当一台计算机仅针对特定类型的伪造进行训练时,面对新型欺骗手段时往往会失效,就像一名知道如何识别假身份证、却被从未见过的某种新型伪造品所蒙蔽的保安。

长期以来,研究人员一直试图通过教计算机识别攻击的大类(如“打印”或“回放”)来解决这一问题,通常利用语言来帮助计算机理解它正在寻找什么。然而,一项新的研究表明,这种方法在面对开放世界中不可预测的攻击时,往往无法达到预期效果。这项由中美两地机构合作的研究成果指出,识别未知事物的关键不在于为攻击命名,而在于识别构成欺骗行为的微小物理线索。他们认为,即使是最复杂的伪造品,也极有可能是由一系列熟悉的、微观层面的视觉错误组合而成的——例如奇怪的反光、缺失的皮肤纹理或不自然的边缘——而这些错误在之前的其他形式中也曾出现过。

为了测试这一想法,团队开发了一个完全在视觉领域运行的系统,避免使用文本描述或语言标签,以免限制其观察细节的能力。该系统并非试图通过定义攻击的名称来识别它,而是学习了一个由微小的、可复用的视觉构建模块组成的库,研究人员将其称为“微观取证原语”(micro-forensic primitives)。可以将这些原语想象成一套专门的工具,每种工具都经过调优,用于检测特定类型的视觉异常,例如模糊的边界、奇特的亮光或看起来过于平滑的皮肤斑块。系统不会将这些工具分配给特定的攻击类型;相反,它将它们保存在一个共享池中,随时准备应对遇到的任何面孔。

当系统检查一张新面孔时,它不仅仅是在寻找预定义的“面具”或“照片”模式。相反,它利用图像的整体上下文来决定在特定时刻需要哪些工具组合。如果面孔看起来像真人,系统可能会结合检查自然皮肤纹理和几何刚性的工具。如果面孔是伪造的,系统可能会激活另一组工具,以突出显示额头上可疑的反光或嘴部周围的锯齿状边缘。这个过程是动态且自适应的;系统根据所见内容不断重新组合证据,从而为每一张图像构建出独特的诊断结果。这种方法使系统能够处理从未见过的攻击,因为它能将新的伪造品识别为旧有的、熟悉线索的新颖组合。

研究人员在涉及多种现实世界条件和攻击类型的九种不同场景下测试了这种方法,包括未见的面具、化妆和局部遮挡。结果令人瞩目。在测试系统必须识别来自与训练环境完全不同的环境下的伪造品时,其成功率超过了以往所有方法。具体而言,在针对具有多样化未见攻击的挑战性数据集进行测试时,新系统的错误率降至仅 10.14%,相比之下,排名第二的方法错误率为 13.65%,这是一个显著的提升。该系统还表现出了极高的稳定性,在不同的摄像头、光照条件和攻击风格下都能保持高准确度,而旧方法在条件变化时往往表现挣扎。

进一步的分析揭示了为什么这种方法如此有效。研究人员发现,该系统检测伪造品的能力很大程度上取决于其对高频细节(即那些在更广泛、更通用的描述中容易丢失的微小、锐利的视觉线索)的敏感度。虽然依赖文本描述的旧系统倾向于关注宏观图景,从而忽略了暴露伪造特征的细微高频伪影,但这个新系统则始终将注意力集中在图像的精细纹理上。它学会了忽略背景的干扰噪声和个人的身份信息,转而专注于只有伪造品才会具备的物理不一致性。研究表明,系统的内部“工具”确实是可复用的:同一个用于识别纸质面具上反光的工具,也可以用来识别硅胶面具上的类似反光,这证明系统学习的是欺骗行为的底层物理规律,而非仅仅是死记硬背一份技巧清单。

这项工作代表了我们在人工智能时代对安全理解的一种转变。它表明,检测未知威胁最稳健的方式,不是试图预测每一种可能的未来威胁,而是建立一个理解欺骗行为中基本且可复用组件的系统。通过将问题分解为微小的、可组合的证据片段,研究人员创建了一个足够灵活的框架,能够适应不断演变的攻击策略。研究结果表明,在对抗数字伪造的战斗中,观察微小且奇异的细节并进行智能组合的能力,远比仅仅了解这些戏法的名称更为强大。随着人脸识别变得愈发普遍,这种具备自适应能力的视觉推理能力可能会成为保护数字身份的标准,确保我们所信任的系统能够看穿未来的幻象。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →