← 最新论文
⚡ electrical engineering

Dimensional Coactivation for Representational Consistency in Frozen Vision Foundation Models

本文提出了一种名为维度共激活(DCA)的新指标,该指标通过分析未经标准归一化的原始特征维度共激活情况,来衡量冻结视觉基础模型中的样本内表征一致性,并通过识别合成人脸中的结构性不连贯性来证明其在检测深度伪造方面的有效性。

原作者: Izaldein Al-Zyoud Abdulmotaleb El Saddik

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Izaldein Al-Zyoud Abdulmotaleb El Saddik

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明但处于“冻结”状态的机器人,它从未被教导过如何识别假照片。它刚刚通过观察数百万张真实图片学会了如何“看”世界。现在,你给它看一张人脸图片。

通常,我们会问机器人:“这看起来像真人吗?”但这篇论文提出了一个不同且更微妙的问题:“机器人是将这张脸视为一个连贯的整体故事,还是将其视为一堆不匹配的拼图碎片?”

以下是他们发现的分解,使用了简单的类比。

1. 问题:“弗兰肯斯坦”式人脸

深度伪造(Deepfakes,即虚假视频)变得越来越逼真。它们可以让假眼睛看起来完美,假鼻子看起来完美,假嘴巴看起来完美。如果你只看眼睛,它是真的;如果你只看嘴巴,它也是真的。

但在真实的人脸上,眼睛、鼻子和嘴巴由一种隐藏的“身份胶水”连接在一起。它们属于同一个人。而在假脸上,这种胶水断裂了。各个部分单独看是真实的,但它们彼此之间并不“说同一种语言”。

2. 工具:“维度共激活”(DCA)指纹

研究人员发明了一种测量这种“胶水”的新方法。他们称之为维度共激活(Dimensional Coactivation, DCA)

你可以把机器人的大脑想象成拥有1,024 个不同的“电灯开关”(维度),当它看到某些东西时,这些开关就会亮起。

  • 旧方法: 大多数工具会观察整张脸,然后说:“这看起来有 80% 像真人脸。”它们将所有内容平均化。
  • 新方法(DCA): 这个工具观察特定的特征对(例如眼睛和嘴巴),并问道:“当机器人看到眼睛时,哪些具体的电灯开关会亮起?而当它看到嘴巴时,是那些完全相同的开关亮起吗?”

如果是真脸,眼睛和嘴巴会点亮相同的开关,因为它们属于同一个身份。如果是假脸,眼睛和嘴巴点亮的开关则是随机且不同的。“胶水”缺失了。

3. 秘密武器:“约束解放”

这是论文中最重要的部分。研究人员发现,要看到这种“胶水”,你必须停止将机器人的大脑当作普通的数学问题来处理。

通常,在比较事物时,数学家会做三件事来使其“公平”:

  1. 中心化(Centering): 减去平均值(移除“基线”)。
  2. 归一化(Normalization): 确保所有数值大小一致(将大数字压缩)。
  3. 混合(Mixing): 观察每个开关如何与其他每个开关相互作用。

论文认为,对于这项特定任务,这些“公平”规则实际上破坏了信号

  • 类比: 想象你试图在房间里听到一声低语。
    • 中心化就像为了听清低语而调低房间的音量。
    • 归一化就像强迫低语和喊叫具有相同的音量。
    • 混合就像倾听低语在每面墙上反弹产生的回声。

研究人员发现,对于冻结的机器人(即不再进行重新训练的机器人),电灯开关的音量(幅度)和基线(均值)实际上包含了人脸身份的秘密代码。如果你“归一化”或“中心化”数据,你会意外地抹去你试图寻找的东西。他们将此称为**“约束解放”**——让原始数据自由发声,而不强行将其塞入框中。

4. 结果:“眼 - 口 - 鼻”指纹

他们在著名的假脸检测器DINOv3上测试了这种方法。

  • 他们提取了人脸的眼睛嘴巴鼻子
  • 他们测量了这三个部分之间“电灯开关”的共激活情况。
  • 他们创建了一个3,072 维的指纹(一长串数字),描述了这些部分之间的关系。

评分:

  • 当他们在深度伪造数据集(CelebDF-v2)上测试时,即使机器人从未见过这些特定的伪造图像,其识别假脸的准确率也达到了91%
  • “顿悟”时刻: 当他们再次尝试使用“公平”规则(中心化/归一化)时,准确率暴跌至 46%(基本上等于瞎猜)。这证明了他们的“原始”方法是唯一有效的方法。

5. 为什么机器人很重要

他们还尝试更换机器人的“大脑”。

  • DINOv3(自学): 效果极佳。它拥有一个稳定的“坐标系”,其中电灯开关对眼睛和嘴巴意味着相同的内容。
  • FaRL(被教导去标记部分): 效果极差(准确率 58%)。这个机器人被训练为仅仅说出“那是眼睛,那是鼻子”。它没有学会它们之间深层的、稳定的联系。

这证明,识别“断裂的胶水”的能力完全取决于机器人是否拥有对世界的稳定内部地图,而不仅仅取决于它能否找到人脸的各个部分。

总结

这篇论文指出:不要只看各个部分;要看这些部分在机器人大脑内部是如何相互“交谈”的。

如果你剥离掉通常的数学规则(归一化、中心化),并观察为眼睛和嘴巴点亮的原始“电灯开关”,你就能看到一个隐藏的指纹。如果该指纹杂乱无章,这张脸就是假的。如果它是一致的,这张脸就是真的。令人惊讶的是,我们通常用来清理数据的“杂乱”数学规则,实际上掩盖了这一真相。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →