← 最新论文
💻 computer science

VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification

本文提出了 VideoZeroBench 基准,通过引入包含时空证据验证的五级评估协议,揭示了现有视频多模态大模型在长视频问答中表面答案正确但缺乏真实时空证据推理能力的显著差距。

原作者: Jiahao Meng, Tan Yue, Qi Xu, Haochen Wang, Zhongwei Ren, Weisong Liu, Yuhao Wang, Renrui Zhang, Yunhai Tong, Haodong Duan

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiahao Meng, Tan Yue, Qi Xu, Haochen Wang, Zhongwei Ren, Weisong Liu, Yuhao Wang, Renrui Zhang, Yunhai Tong, Haodong Duan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 VideoZeroBench 的新测试,它的目的非常明确:给现在的视频 AI 模型来一场“硬核”的期末考试,看看它们到底是真的“看懂”了视频,还是只是在“瞎蒙”答案。

为了让你更容易理解,我们可以把现在的视频 AI 模型想象成一群正在参加“视频侦探”培训的实习生

1. 以前的考试:只要“猜对”就行

在以前的测试中(比如 Video-MME 等),考官问实习生:“视频里那个穿红衣服的人最后去了哪里?”
实习生只要回答“去了公园”,就算答对了。
问题在于: 实习生可能根本没看视频,只是根据“穿红衣服的人通常去公园”这种常识瞎猜的,或者看了一两秒就瞎蒙。只要答案碰巧对了,考官就给他打高分。这就导致现在的 AI 分数都很高(80% 以上),看起来无所不能,但实际上可能连视频里最细微的细节都看不清。

2. VideoZeroBench 的“新考法”:不仅要答案,还要“呈堂证供”

VideoZeroBench 就像是一个极其严格的“刑侦法庭”。它不再只关心答案对不对,而是要求实习生必须提供**“时空证据”**。

这个考试分成了五个难度等级,就像打游戏通关一样:

  • Level 1(送分题): 考官直接把证据指给你看:“看,从 2 分 10 秒到 2 分 30 秒,那个穿红衣服的人就在公园门口。”

    • 任务: 你只需要根据这个提示回答问题。
    • 现状: 即使是顶尖 AI,答对率也不到 30%。说明它们连“把提示和答案对应起来”都做不到。
  • Level 2(时间提示): 考官说:“他在 2 分 10 秒到 2 分 30 秒之间出现的。”(不给具体位置)。

    • 现状: 难度增加,因为 AI 得自己在这一段时间里找那个穿红衣服的人。
  • Level 3(标准考试): 考官只给视频和问题:“视频里穿红衣服的人最后去了哪?”(不给任何提示)。

    • 现状: 这是目前大多数 AI 的“舒适区”。即使是世界最强的模型(如 Gemini-3),答对率也只有 17% 左右。这意味着 83% 的时候,它们要么瞎猜,要么完全没看懂。
  • Level 4(时间定位): 不仅要答对,还要告诉考官:“我是从哪一段视频里看出来的。”(比如:2 分 10 秒到 2 分 30 秒)。

    • 现状: 难度飙升!很多 AI 虽然蒙对了答案,但根本找不到证据在哪。
  • Level 5(终极挑战): 不仅要答对,还要指出**“哪一秒”“画面哪个角落”**(比如:2 分 15 秒,画面右下角那个红点)。

    • 现状: 这是“地狱模式”。 结果令人震惊:所有测试的 AI,包括最聪明的 Gemini-3,在这个级别的正确率都低于 1%!也就是说,100 道题里,它们几乎全错。

3. 核心发现:AI 的“超能力”其实是“幻觉”

这篇论文揭示了一个残酷的真相:

  • 现在的 AI 就像“背题家”: 它们可能记住了很多常识,或者根据问题里的关键词猜出了答案,但它们并没有真正理解视频内容
  • “大海捞针”是弱项: 视频很长(平均 11 分钟),关键信息可能只出现在几秒钟甚至几帧画面里(比如一个很小的物体,或者一个转瞬即逝的动作)。AI 就像在干草堆里找一根针,它们经常找不到那根针,或者把旁边的草当成针。
  • 空间感很差: 让 AI 指出“那个杯子在桌子的左边还是右边”,或者“数一下有几个苹果”,它们经常数错或指错方向。

4. 一个生动的比喻

想象你在看一部长达 2 小时的悬疑电影,里面有一个极其微小的细节(比如凶手在 3 分 20 秒时,手里拿了一把蓝色的伞)。

  • 以前的 AI:你问它“凶手拿什么颜色的伞?”,它可能根据电影套路猜“可能是黑色的”,如果碰巧猜对了,它就觉得自己很厉害。
  • VideoZeroBench 的 AI:你问它同样的问题,它必须回答:“凶手在3 分 20 秒,画面左下角,拿了一把蓝色的伞。”
    • 结果发现,绝大多数 AI 要么说“不知道”,要么说“红色的”,要么虽然猜对了“蓝色”,但完全说不出是在哪一秒、哪个位置看到的。

5. 总结与启示

这篇论文告诉我们:

  1. 现在的视频 AI 还没那么聪明: 它们能看懂大概的剧情(比如“这是打架”),但看不清细节(比如“谁先出的手”、“手里拿的是什么”)。
  2. 证据比答案更重要: 在 AI 时代,**“怎么知道的”“知道了什么”**更重要。如果 AI 不能提供可信的证据,它的回答就不可靠。
  3. 未来的方向: 我们需要教 AI 学会**“像侦探一样思考”**,不仅要能回答问题,还要能精准地找到证据,把“时间”和“空间”都搞清楚。

一句话总结: VideoZeroBench 就像一面照妖镜,照出了当前视频 AI“看似全能,实则眼盲心瞎”的真相,提醒我们离真正的“视频理解”还有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →