← 最新论文
💻 computer science

CAM-VFD: Cross-Attention Multimodal Video Forgery Detection

CAM-VFD 是一种新颖的交叉注意力多模态框架,它通过建模外观、运动和深度特征之间的跨模态矛盾来检测深度伪造视频,在基准数据集上实现了针对各种扰动的最先进精度和鲁棒性。

原作者: Hoda Osama Elkhodary, Sherin Mostafa Youssef, Marwa Elshenawy, Dalia Sobhy

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Hoda Osama Elkhodary, Sherin Mostafa Youssef, Marwa Elshenawy, Dalia Sobhy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,试图识别伪造视频。过去,伪造视频很容易被识破,因为它们存在明显的破绽——比如眨眼不自然,或者背景闪烁。但如今的AI如此智能,能够制作出仅从画面看完美无缺,或仅从运动看完美无缺的视频。它们就像一位大师级伪造者:能画出一幅完美的肖像,却忘了正确描绘阴影;或写出一篇完美的故事,却搞错了时间线。

本文介绍了一种名为CAM-VFD的新型侦探工具。它不再仅仅关注单一要素(如面部或运动),而是像一个三重核查系统,提出这样的问题:“这个人的外貌与其运动方式是否匹配?这种匹配是否与周围环境的三维形状一致?”

以下是其工作原理,借助简单的类比说明:

1. 三位证人

该系统引入三位不同的“证人”对视频作证:

  • 外观证人(CLIP):它观察事物“看起来”的样子。它检查纹理、颜色,以及面部是否逼真。
  • 运动证人(VideoMAE):它观察事物“如何运动”。它检查人物的行走是否自然,或物体是否以怪异的方式漂浮。
  • 深度证人(MiDaS):它充当三维扫描仪。它检查物体的几何形状和距离,以判断世界是否具有真实的立体形态。

2. “交叉注意力”审讯

大多数旧式检测器只是让三位证人分别给出意见,然后进行投票。如果外观证人判定为“真实”,而运动证人判定为“伪造”,旧系统可能会感到困惑。

CAM-VFD 采取了更聪明的做法。它将外观视为首席侦探,而将另外两者视为专家

  • 首席侦探(外观)展示一张场景照片,询问运动专家:“这种运动方式对于这个特定的面部来说是否合理?”
  • 接着,它询问深度专家:“这个面部的三维形状是否与其外观相符?”

如果该视频是由AI生成的伪造品,这位“首席侦探”会注意到专家们给出了相互矛盾的答案。例如,面部可能看起来完美无缺,但运动专家会说:“等等,那只手臂像幽灵一样穿过空气”,或者深度专家会说:“这个鼻子扁平如煎饼,但看起来却是立体的。”

3. “矛盾”警报

该论文声称,虽然AI可以让视频的单个部分看起来完美,但它难以使各部分之间的关系完美无缺。

  • 真实视频:外观、运动和三维形状彼此一致。“矛盾得分”很低。
  • 伪造视频:各部分不一致。矛盾得分升高。

研究人员通过在两个庞大的视频库(GenVidBench 和 GenVideo)上运行该系统进行了测试。他们发现:

  • 该系统极其准确(正确率超过95%),即使它从未见过制作该伪造视频的具体AI工具。
  • 它很难被欺骗。即使你模糊视频、添加噪声或压缩它(就像通过WhatsApp发送视频时那样),该系统仍能识别出矛盾。
  • 与其他顶级检测器相比,它更难被愚弄,尤其是当视频由该系统从未见过的全新AI工具生成时。

核心结论

请将 CAM-VFD 视为一种逻辑检查器,而非寻找像素错误的相机。它不仅仅问:“这张图像是真实的吗?”它问的是:“这个场景的物理逻辑是否合理?”如果AI生成的视频在外观与运动或空间位置之间存在逻辑故障,CAM-VFD 就会发出警报。

作者得出结论:这种“跨模态矛盾”(即感官之间的不匹配)是捕捉伪造品的更有力线索,比单纯寻找视觉故障更为有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →