← 最新论文
💻 computer science

Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos

本文介绍了 Artifact-Bench,这是一个包含三级人工制品分类体系和三项诊断任务的综合性基准,用于评估多模态大语言模型(MLLMs)在检测人工智能生成视频伪影方面的能力,揭示了其在感知准确性及与人类偏好一致性方面存在显著局限。

原作者: Yuqi Tang, Yang Shi, Zhuoran Zhang, Qixun Wang, Xuehai Bai, Yue Ding, Ruizhe Chen, Bohan Zeng, Xinlong Chen, Xuanyu Zhu, Bozhou Li, Yuran Wang, Yifan Dai, Chengzhuo Tong, Xinyu Liu, Yiyan Ji, Yujie We
发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuqi Tang, Yang Shi, Zhuoran Zhang, Qixun Wang, Xuehai Bai, Yue Ding, Ruizhe Chen, Bohan Zeng, Xinlong Chen, Xuanyu Zhu, Bozhou Li, Yuran Wang, Yifan Dai, Chengzhuo Tong, Xinyu Liu, Yiyan Ji, Yujie Wei, Yuhao Dong, Shilin Yan, Fengxiang Wang, Yi-Fan Zhang, Haotian Wang, Yuanxing Zhang, Pengfei Wan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,试图识别一幅赝品画作。你知道这位艺术家才华横溢,但有时他们会犯下微小的错误:一只手有六根手指,阴影投射的方向错误,或者时钟倒着走。

这篇论文《Artifact-Bench》就像是为"AI 侦探”机器人(称为多模态大语言模型,或 MLLMs)设计的一种全新的、极其严苛的测试。研究人员希望看看这些聪明的 AI 机器人是否真的擅长识别计算机生成虚假视频时出现的微小而奇怪的错误(伪影)。

以下是他们所做的工作及发现,使用简单的类比进行分解:

1. 问题:视频的“恐怖谷”

AI 视频生成器已经变得令人惊叹。它们能制作出看起来几乎真实的视频。但它们并不完美。它们仍会留下“故障”或“伪影”。

  • 故障:有时人脸会融化,汽车会穿过墙壁,或者人的手臂忽隐忽现。
  • 问题:当前的 AI 模型(即“侦探”)能否真正看见这些故障,并解释为什么视频看起来是假的,还是说它们只是在猜测?

2. 解决方案:为 AI 设计的新“驾驶考试”

研究人员建立了一个名为Artifact-Bench的特殊测试。可以将其视为针对 AI 侦探的三部分驾驶考试:

  • 第一关:“真或假?”测验(分类)
    • 任务:向 AI 展示一个视频。问:“这是真实的还是 AI 生成的?”
    • 难点:AI 必须基于视觉故障进行猜测,而不仅仅是故事情节。(例如,如果视频显示一只狗在飞,那是情节线索。如果狗的毛发看起来像静电噪点,那就是故障线索。)
  • 第二关:“哪个更好?”对决(比较)
    • 任务:向 AI 展示两个虚假视频。问:“哪一个看起来更真实?”
    • 难点:两个都是假的,但其中一个故障更少。AI 必须识别出细微的差别。
  • 第三关:“法医报告”(诊断)
    • 任务:向 AI 展示一个虚假视频,问:“这具体哪里出了问题?”
    • 难点:AI 必须从包含 30 个选项的列表中选择具体的错误(例如“水向上流”或“人脸融化了”)。这是最难的部分,因为它需要解释原因,而不仅仅是说“它是假的”。

3. 地图:新的“故障词典”

在测试之前,研究人员创建了一个庞大的“故障词典”(分类法)。他们将所有可能的错误组织成三个层级:

  • 表面层级:一眼看上去就很奇怪的事物(颜色糟糕、纹理模糊)。
  • 结构层级:在物理上讲不通的事物(没有腿的椅子、人融入墙壁)。
  • 时间与逻辑层级:违背物理定律或时间规律的事物(杯子自动复原、人一边向前走一边倒退着走)。

4. 结果:侦探们考试不及格

研究人员测试了当今可用的 19 个最聪明的 AI 模型。以下是发生的情况:

  • “抛硬币”问题:在最简单的任务中,许多 AI 模型的表现并不比单纯抛硬币好多少。它们无法可靠地区分真实视频和虚假视频。
  • “诊断”灾难:在最困难的任务(解释为什么视频是假的)上,这些模型表现极差。它们的准确率降至接近零(通常低于 10%)。这就像一个学生能猜出“对或错”,但当被要求写一篇解释答案的文章时却完全不及格。
  • “思考”陷阱:研究人员尝试使用“思考”模型(会阐述推理过程的 AI)和更大的模型。令人惊讶的是,更大或具备“思考”能力的模型并不一定表现更好。有时,它们的表现反而更差。事实证明,如果你没有一双能看见微小细节的“眼睛”,仅仅拥有一个更大的大脑也无济于事。
  • 人类差距:人类专家在测试中表现出色。而 AI 模型则不然。AI 的判断往往与人类认为的真实感不符。

5. 结论:AI 对细节“视而不见”

该论文得出结论,虽然 AI 非常擅长理解视频的故事,但目前它在识别让视频看起来像假的微小物理故障方面表现糟糕

  • 比喻:想象一个 AI 能完美描述电影情节,却对演员手里拿的是叉子而不是剑这一事实视而不见。
  • 启示:我们还不能信任这些 AI 模型作为视频质量的“法官”。如果我们用它们来评估其他 AI 生成的视频,它们可能会给一个充满奇怪故障的视频打及格分,因为它们观察得不够仔细。

简而言之:AI 视频生成器正在变得更好,但我们用来检查它们工作的 AI 模型仍在努力识别“矩阵中的故障”。在我们能够信任它们来监管虚假视频的未来之前,我们需要更聪明的侦探。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →