← 最新论文
💻 computer science

Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning

本文介绍了 Skyra,这是一种专门用于检测并解释 AI 生成视频的多模态大语言模型,它通过识别人类可感知的视觉伪影来实现该功能,并得到了新的 ViF-CoT-4K 数据集、两阶段训练策略以及全面的 ViF-Bench 评估的支持。

原作者: Yifei Li, Wenzhao Zheng, Yanran Zhang, Runze Sun, Yu Zheng, Lei Chen, Jie Zhou, Jiwen Lu

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifei Li, Wenzhao Zheng, Yanran Zhang, Runze Sun, Yu Zheng, Lei Chen, Jie Zhou, Jiwen Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网突然被大量视频淹没,这些视频逼真到令人无法分辨它们究竟是用摄像机拍摄的,还是由计算机凭空“梦”出来的。这正是Skyra被构建出来所要解决的问题。

请将 Skyra 视为一位超级视频侦探,而不仅仅是一个简单的“是/否”检测器。它不只是猜测视频是否虚假,而是能明确指出暴露其虚假的具体“瑕疵”,并解释为何这是瑕疵。

以下是该论文如何利用日常类比进行拆解:

1. 问题所在:“恐怖谷”正变得愈发平滑

AI 视频生成器(如 Sora、Kling 或 Wan)已变得极其出色。它们能制作出乍看之下完美无瑕的视频。

  • 旧方法:先前的检测器就像拿着清单的保安。它们寻找“坏像素”或“奇怪的光影”。但随着 AI 变得越来越强,那些坏像素消失了。保安们开始感到困惑,经常对真实视频喊“假!”,或对虚假视频喊“真!”。
  • 多模态大模型(MLLM)的问题:即使是 AI 世界中最聪明的通用 AI 聊天机器人(“天才”们)也未能通过这项测试。当被要求识别虚假视频时,它们会写出长篇大论、充满自信的论文,声称:“光影看起来很完美,人物在微笑,所以这是真实的!”它们忽略了那些微妙且违背物理规律的错误,因为它们并未被训练去搜寻这些错误。

2. 解决方案:Skyra,这位“法医艺术评论家”

Skyra 是一个专为做一件事而设计的 AI 模型:寻找“伪影”(artifacts)。

  • 什么是伪影? 想象你在看一幅画。如果画家画了一只六指的手,或者一杯咖啡在半空中突然变成了一只鸟,那就是伪影。这是一种打破物理定律或常识的错误。
  • Skyra 如何工作:Skyra 不像只说“假”那样,而是像一位拿着放大镜的侦探。它逐帧观看视频,并指出:

    “在 1.5 秒处,调酒师的金属摇酒壶突然像黄油一样融化了。这不可能!这是一个形状扭曲。此外,在 3.0 秒处,一个玻璃杯凭空出现。这是一个异常物体出现。”

3. 训练:用"4000 个视频案例档案”教导侦探

你不能只让侦探猜测来教他们识别虚假,你需要真实的案例。

  • 数据集(ViF-CoT-4K):研究人员建立了一个包含 4000 个视频的庞大库。关键在于,他们不仅仅将其标记为“假”。他们让人类专家观看这些视频,并撰写详细报告,精确指出具体哪里出了问题,精确到具体的秒数和屏幕上的确切位置。
  • “思维链”(CoT):他们教导 AI 大声思考。AI 被强制要求不直接跳向结论,而是说出:“我看到了这个,然后我看到了那个,因此这是假的。”这模仿了人类专家的推理方式。

4. 两步训练法:“冷启动”与“强化”

论文描述了一种巧妙的两步训练过程:

  • 第一步:冷启动(SFT):他们首先利用人类撰写的报告向 AI 传授基础知识。这就像给新侦探一本《虚假视频常见错误》教科书,让他们知道该寻找什么。
  • 第二步:强化学习(RL):这是“练习”阶段。AI 接受测试,如果它错过了线索或推理错误,就会受到“惩罚”。如果它发现了连人类都可能忽略的、违背物理规律的微妙错误,就会获得“奖励”。这推动 AI 成为一位能发现最微小、最微妙错误的侦探大师。

5. 结果:超越竞争对手

研究人员在"ViF-Bench"上测试了 Skyra,这是一个包含来自全球 10 多个最先进 AI 视频生成器视频的艰难测试套件。

  • 结果:Skyra 不仅赢了,而且大获全胜。当其他检测器(甚至最聪明的通用 AI 模型)挣扎不前、表现往往不优于随机猜测时,Skyra 实现了极高的准确率。
  • 原因:论文表明,Skyra 之所以成功,是因为它专注于内在违规(即打破物理规律的现象,如一个人穿过墙壁,或一个物体瞬间变色),而不是“这个看起来是否有颗粒感?”这类表面现象。

总结

简而言之,Skyra是一位经过海量、人工标注的"AI 错误”库训练的专业 AI 侦探。它不只是猜测视频是否虚假;它会观看视频,找出物理规律被打破的具体时刻(如融化的勺子或消失的人),并撰写报告,精确解释它为何知道该视频是伪造的。它旨在成为一个“眼见不再为实”的世界中的“真相讲述者”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →