CoCoVideo: The High-Quality Commercial-Model-Based Contrastive Benchmark for AI-Generated Video Detection
本文介绍了 CoCoVideo-26K,这是一个包含来自 13 种商业生成器的语义对齐真假视频对的高质量数据集,并提出了 CoCoDetect,一种结合了对比学习与置信度门控多模态推理的新型检测框架,旨在实现识别高保真 AI 生成视频的最先进性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网是一个巨大的图书馆。在很长一段时间里,这个图书馆里的“假书”很容易被识破,因为它们是用廉价、皱巴巴的纸张印刷的,而且图片模糊。检测它们就像是在手写便条中发现一个错别字一样简单。
但最近,新一代的“假书”来到了。这些书是用高质量、光泽感十足的纸张印刷的,图片极其清晰,故事逻辑也如此严密,甚至连人类图书管理员都可能被蒙蔽。这就是**AI生成视频(AIGC)**的世界。问题在于,旧的“错别字检测器”(现有的AI工具)是针对那些廉价、皱巴巴的纸张进行训练的。它们无法识别出这些高质量假货中细微的瑕疵。
以下是这篇论文如何解决这一问题的说明,用简单的语言解释如下:
1. 新的“训练场”:CoCoVideo
作者意识到,他们不能使用旧的、低质量的假视频来教导他们的新检测器。他们需要一个拥有高端设备的健身房。
- 旧数据的缺陷: 之前的数据库使用的是开源AI模型,这些模型生成的视频看起来有点“不对劲”(比如卡通角色眨眼的方式很奇怪)。而现实世界中的商业级AI(大公司使用的那种)制作出的视频看起来几乎完美。
- 解决方案 (CoCoVideo-26K): 团队构建了一个庞大的新数据集,名为 CoCoVideo。
- “孪生”策略: 想象你有一张真实的森林照片。你请了13位不同的高端AI艺术家,让他们从完全相同的起始帧开始,为这片完全相同的森林绘制一个假的版本。
- 结果: 你现在拥有了“真实 vs 虚假”的配对,它们在故事和起始点上完全一致,但一个是真实的,另一个是AI生成的。这迫使检测器去寻找纹理和物理规律上的微小差异,而不是仅仅根据故事内容进行猜测。
2. 新的侦探:CoCoDetect
有了这个高质量的训练场,他们构建了一个名为 CoCoDetect 的新侦探系统。可以将这个侦探想象成一个协同工作的两人小组:
团队成员 A:“纹理侦察员”(对比学习)
- 职责: 这部分系统就像是一个观察纸张纹理的法医专家。它使用标准的视频AI(R3D-18)来扫描视频,寻找微小的、肉眼难以察觉的故障——比如阴影移动不对,或者皮肤纹理看起来过于光滑。
- 学习方式: 因为它是在 CoCoVideo 的那些“孪生”配对上进行训练的,所以它学会了识别商业级AI特有的“指纹”,而不仅仅是识别旧版AI那些明显的错误。
团队成员 B:“逻辑法官”(MLLM)
- 职责: 有时候,视频对“纹理侦察员”来说看起来很完美。也许阴影是对的,皮肤看起来也很真实。但是,这个故事逻辑通顺吗?
- “置信度门控”: 这是最聪明的部分。侦察员会给出一个“置信度分数”。
- 高置信度: 如果侦察员95%确定它是假的(或真的),它会立即做出判断。既快速又高效。
- 低置信度(“可能区”): 如果侦察员不确定(例如:“我觉得它是假的,但我只有60%的把握”),它不会盲目猜测。相反,它会将案件移交给逻辑法官。
- 逻辑法官的任务: 这是一个理解语言和物理规律的强大AI。它观察视频并询问自己:“等等。视频中,当风向前方吹时,一只鸟却在向后飞。这在物理学上是不可能的。这一定是假的。”
3. 他们如何协同工作
整个系统就像一个安检站:
- 扫描: 纹理侦察员检查视频。
- 门控: 如果视频明显是假的或明显的真的,门打开,做出决定。
- 推理: 如果视频很棘手,导致侦察员感到困惑,门会将它路由到逻辑法官。法官阅读场景,检查物理定律,并给出最终判决。
- 融合: 最终的决定结合了侦察员的“纹理直觉”和法官的“逻辑推理”。
为什么这很重要(根据论文所述)
作者使用他们的新高质量数据集,将他们的探测器与旧的探测器进行了对比测试。
- 结果: 旧的检测器(针对低质量假货训练的)在面对新的商业级质量视频时表现糟糕。它们就像是试图用一个只对铁有反应、对钢没反应的磁铁去大海捞针。
- 胜出者: 拥有“侦察员 + 法官”组合的 CoCoDetect 表现显著更好。它证明了要捕捉高质量的假货,你需要一个既看微观细节(纹理),又看宏观全局(逻辑/物理)的系统。
简而言之: 论文利用高端商业级AI假货建立了一个更好的“培训学校”,并创建了一个既有“直觉检查”(用于识别明显假货)又有“逻辑检查”(用于识别棘手假货)的侦探,这使得高质量的AI视频很难欺骗我们。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。