← 最新论文
💻 computer science

Video as Natural Augmentation: Towards Unified AI-Generated Image and Video Detection

本文提出了 VINA,这是一个统一的 AI 生成内容检测框架,它利用视频帧作为自然增强手段,并采用跨模态对比目标来弥合图像与视频检测器之间的性能差距,从而在多样化的基准测试中实现了最先进的鲁棒性和泛化能力。

原作者: Zhengcen Li, Chenyang Jiang, Liangxu Su, Tong Shao, Shiyang Zhou, Ming Tao, Jingyong Su

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengcen Li, Chenyang Jiang, Liangxu Su, Tong Shao, Shiyang Zhou, Ming Tao, Jingyong Su

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《视频作为自然增强:迈向统一的人工智能生成图像与视频检测》(VINA)的通俗解读,辅以生动的类比。

核心难题:“照片 vs. 视频”的盲区

想象你雇佣了一名保安来识别伪造品。你通过向他展示数千张伪造的照片,对他进行了 extensive 训练。他因此成为了一名专家,能够识别计算机生成静态图像时留下的微小、不可见的“瑕疵”或“指纹”。他表现极佳,能 99% 地识破伪造照片。

但当你递给他一段视频片段时,他突然彻底失败了,开始胡乱猜测。

为什么?
论文指出,视频帧不仅仅是一张照片;它是经过现实世界处理“酷刑室”洗礼的照片。在视频帧到达你的屏幕之前,它会经历:

  • 压缩(为了节省空间而被挤压,就像把地图折叠太多次)。
  • 模糊(由于运动或相机抖动)。
  • 调整大小(被缩小或拉伸)。
  • 色彩偏移(为适应电视屏幕而调整)。

只接受过干净照片训练的“保安”(AI 检测器)一直在寻找高频细节(如锐利的边缘或特定的噪声模式)。但视频处理的“酷刑室”抹去了这些细节。检测器感到困惑,因为它被训练去寻找的线索消失了,取而代之的是视频压缩带来的新的、混乱的伪影。

解决方案:VINA(视频作为自然增强)

哈尔滨工业大学的 Zhengcen Li 及其团队意识到,将“图像检测”和“视频检测”视为两项独立的工作是一个错误。他们提出了一种名为 VINA 的新系统。

把 VINA 想象成保安的通用训练营。他们不再只展示干净的照片,而是展示:

  1. 干净的照片:学习伪造的基本规则。
  2. 视频帧:学习这些规则在变得混乱、压缩和模糊时是什么样子。

秘诀:“跨模态监督对比学习”

这是一个听起来很复杂的术语,其实是一个简单的想法:强迫大脑在不同的伪装中看到同一个真相。

想象你有两个双胞胎:一个穿着西装(干净图像),另一个穿着泥泞的雨衣(视频帧)。他们其实是同一个人(一个“伪造”的 AI 生成物)。

  • 旧检测器:看着西装会说“伪造!”,但看着泥泞的雨衣却说“我不知道”。
  • VINA:使用一种特殊的训练规则(“跨模态”损失函数),它说:“嘿,虽然一个穿着西装,一个穿着泥衣,但他们是同一个人。你必须学会无论对方穿什么,都能识别出‘伪造’的身份。”

这迫使 AI 停止依赖“西装”(干净图像的细节),转而寻找“基因”(核心的生成指纹),即使图像变得泥泞,这个指纹依然保持不变。

他们发现了什么?

团队在 14 个不同的“考试”(基准测试)中测试了 VINA,范围从干净、受控的数据集到“野外”场景(如社交媒体上经过多次下载、重新上传和压缩的帖子)。

结果:

  • 双向受益:在视频上训练不仅帮助了视频检测,实际上还让检测器更擅长识破伪造照片。这就像一位武术家学会了在泥潭中战斗;即使在干燥的土地上,他们也变得更加平衡和高效。
  • 鲁棒性:VINA 不需要复杂的技巧或海量的额外数据。它只是利用视频帧作为“自然练习”,来强化检测器。
  • 速度:尽管更智能,但 VINA 实际上比许多其他顶级检测器更快,且消耗的计算机资源更少。

结论

该论文认为,我们不能再分别为照片和视频构建独立的检测器了。世界是两者的混合体,且它们的退化方式相似。通过将视频帧视为照片的“自然、混乱版本”,并训练 AI 同时处理两者,我们获得了一个检测器,它:

  1. 更难被欺骗(更鲁棒)。
  2. 更擅长识破照片和视频中的伪造品。
  3. 为现实世界做好了准备,因为那里的文件总是被压缩和退化的。

简而言之:不要只在完美的照片上训练你的 AI;要在视频混乱的现实中训练它,它将成为万事万物的侦探大师。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →