← 最新论文
🤖 machine learning

Foundation Models for Face Presentation Attack Detection: A Unified Linear-Probing Benchmark

本文建立了一个统一的线性探测基准,用于评估 24 个用于人脸呈现攻击检测的冻结基础模型,结果表明,虽然预训练表示包含与数据集内性能相关的任务信息,但若不进行显式适配以克服领域偏移,它们则无法跨数据集泛化。

原作者: Peter Lorenz, Anjith George, Sébastien Marcel

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Peter Lorenz, Anjith George, Sébastien Marcel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何识破伪装。你给它看一张真人照片,然后给它看一张人拿着那张脸部照片的照片。机器人需要对第一张喊出“真的!”,对第二张喊出“假的!”。这就是**人脸呈现攻击检测(Face Presentation Attack Detection, PAD)**的工作。它是你手机或银行应用俱乐部的数字保安,确保试图进入的人确实是活生生的人类,而不是拿着照片、视频或面具进行巧妙欺骗的骗子。

棘手的部分在于,这些机器人往往过于擅长记忆训练室特定的光照或摄像机,但在面对不同光照的新房间时却表现得很糟糕。这被称为“领域偏移(domain shift)”问题。为了解决这个问题,科学家们开始使用基础模型(Foundation Models)。把这些模型想象成巨大的、超级聪明的脑力,它们已经阅读了几乎整个互联网并观察了数十亿张图片。它们目前还没有专门用于识别伪装,但它们非常了解人脸是什么样子的。研究人员一直在问的一个大问题是:“这些庞大的大脑是否已经掌握了足够多的识破伪装的知识,以至于我们只需要在它们的输出端添加一个微小的、简单的开关就能让它们工作,还是说我们必须重新训练整个模型?”

这篇题为《用于人脸呈现攻击检测的基础模型:一个统一的线性探测基准》(Foundation Models for Face Presentation Attack Detection: A Unified Linear-Probing Benchmark)的论文进入实验室试图回答这个问题。研究人员测试了 24 种不同的预训练巨型大脑——有些仅观察图像,有些能读文本并看图像,还有些通过猜测图像缺失部分来进行学习——并将它们冻结。他们没有让这些大脑学习任何新知识;他们只是在每个大脑的末端连接了一个非常简单、轻量级的“线性头”(一层简单的数学运算),以观察它是否能学会识别伪装。

结果既有“哇”也有“喔”的惊喜与落差。当研究人员在与训练数据相同类型的测试集上测试这些冻结的大脑(数据集内测试)时,这些巨型大脑的表现惊人。最大的模型名为 InternViT-6B,它的错误率仅为 1.6%,几乎没有犯错。然而,值得注意的是,专门为这项工作构建的机器人(如 DeepPixBiS)实际上表现优于大多数被冻结探测的模型(尽管 InternViT-6B 仍然击败了 DeepPixBiS),即便 DeepPixBiS 的可训练参数要少得多。这表明,虽然这些巨型模型确实包含了识破伪装所需的秘密线索,但这些信息只是静静地躺在那里等待被解锁,而在相同环境下,专门的训练仍然具有优势。

然而,当你把机器人移动到一个新的环境时,故事发生了变化。当研究人员在来自不同摄像机或光照条件的数据上测试这些相同的冻结大脑(跨数据集测试)时,性能大幅下降。即使是最强的模型 InternViT-6B,其错误率也显著上升,在熟悉数据与新数据之间存在 30.3% 的差距,导致在跨数据集移动时的总错误率约为 32%。该论文明确排除了这样一种观点:即仅仅拥有更大的模型或更专业的预训练(例如专门针对人脸伪装进行训练)就能保证在新场景下的成功。事实上,一个名为 CLIP ViT-B/32 的中型模型(它是在互联网上的通用图文对上训练的)被证明是最平衡的选择。它在计算能力需求与处理未知数据能力之间提供了最佳的权衡,其跨数据集错误率为 31.6%

作者认为,虽然这些基础模型拥有识别伪装的原始素材,但它们仍然需要一些额外的帮助——比如一点微调或适配——来应对不同摄像机和光照带来的复杂现实。论文总结道,虽然我们不需要为每一个新的监控摄像头都从头构建一个新大脑,但我们也无法仅仅接入一个冻结的巨型大脑就指望它在任何地方都完美运行。“线性探测”这种方法在这里充当了一项压力测试,向我们展示了究竟有多少“识破伪装”的知识已经存在于其中,以及我们还需要教给它多少。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →