这篇论文介绍了一个名为 VideoZeroBench 的新测试,它的目的非常明确:给现在的视频 AI 模型来一场“硬核”的期末考试,看看它们到底是真的“看懂”了视频,还是只是在“瞎蒙”答案。
为了让你更容易理解,我们可以把现在的视频 AI 模型想象成一群正在参加“视频侦探”培训的实习生。
1. 以前的考试:只要“猜对”就行
在以前的测试中(比如 Video-MME 等),考官问实习生:“视频里那个穿红衣服的人最后去了哪里?”
实习生只要回答“去了公园”,就算答对了。
问题在于: 实习生可能根本没看视频,只是根据“穿红衣服的人通常去公园”这种常识瞎猜的,或者看了一两秒就瞎蒙。只要答案碰巧对了,考官就给他打高分。这就导致现在的 AI 分数都很高(80% 以上),看起来无所不能,但实际上可能连视频里最细微的细节都看不清。
2. VideoZeroBench 的“新考法”:不仅要答案,还要“呈堂证供”
VideoZeroBench 就像是一个极其严格的“刑侦法庭”。它不再只关心答案对不对,而是要求实习生必须提供**“时空证据”**。
这个考试分成了五个难度等级,就像打游戏通关一样:
Level 1(送分题): 考官直接把证据指给你看:“看,从 2 分 10 秒到 2 分 30 秒,那个穿红衣服的人就在公园门口。”
- 任务: 你只需要根据这个提示回答问题。
- 现状: 即使是顶尖 AI,答对率也不到 30%。说明它们连“把提示和答案对应起来”都做不到。
Level 2(时间提示): 考官说:“他在 2 分 10 秒到 2 分 30 秒之间出现的。”(不给具体位置)。
- 现状: 难度增加,因为 AI 得自己在这一段时间里找那个穿红衣服的人。
Level 3(标准考试): 考官只给视频和问题:“视频里穿红衣服的人最后去了哪?”(不给任何提示)。
- 现状: 这是目前大多数 AI 的“舒适区”。即使是世界最强的模型(如 Gemini-3),答对率也只有 17% 左右。这意味着 83% 的时候,它们要么瞎猜,要么完全没看懂。
Level 4(时间定位): 不仅要答对,还要告诉考官:“我是从哪一段视频里看出来的。”(比如:2 分 10 秒到 2 分 30 秒)。
- 现状: 难度飙升!很多 AI 虽然蒙对了答案,但根本找不到证据在哪。
Level 5(终极挑战): 不仅要答对,还要指出**“哪一秒”、“画面哪个角落”**(比如:2 分 15 秒,画面右下角那个红点)。
- 现状: 这是“地狱模式”。 结果令人震惊:所有测试的 AI,包括最聪明的 Gemini-3,在这个级别的正确率都低于 1%!也就是说,100 道题里,它们几乎全错。
3. 核心发现:AI 的“超能力”其实是“幻觉”
这篇论文揭示了一个残酷的真相:
- 现在的 AI 就像“背题家”: 它们可能记住了很多常识,或者根据问题里的关键词猜出了答案,但它们并没有真正理解视频内容。
- “大海捞针”是弱项: 视频很长(平均 11 分钟),关键信息可能只出现在几秒钟甚至几帧画面里(比如一个很小的物体,或者一个转瞬即逝的动作)。AI 就像在干草堆里找一根针,它们经常找不到那根针,或者把旁边的草当成针。
- 空间感很差: 让 AI 指出“那个杯子在桌子的左边还是右边”,或者“数一下有几个苹果”,它们经常数错或指错方向。
4. 一个生动的比喻
想象你在看一部长达 2 小时的悬疑电影,里面有一个极其微小的细节(比如凶手在 3 分 20 秒时,手里拿了一把蓝色的伞)。
- 以前的 AI:你问它“凶手拿什么颜色的伞?”,它可能根据电影套路猜“可能是黑色的”,如果碰巧猜对了,它就觉得自己很厉害。
- VideoZeroBench 的 AI:你问它同样的问题,它必须回答:“凶手在3 分 20 秒,画面左下角,拿了一把蓝色的伞。”
- 结果发现,绝大多数 AI 要么说“不知道”,要么说“红色的”,要么虽然猜对了“蓝色”,但完全说不出是在哪一秒、哪个位置看到的。
5. 总结与启示
这篇论文告诉我们:
- 现在的视频 AI 还没那么聪明: 它们能看懂大概的剧情(比如“这是打架”),但看不清细节(比如“谁先出的手”、“手里拿的是什么”)。
- 证据比答案更重要: 在 AI 时代,**“怎么知道的”比“知道了什么”**更重要。如果 AI 不能提供可信的证据,它的回答就不可靠。
- 未来的方向: 我们需要教 AI 学会**“像侦探一样思考”**,不仅要能回答问题,还要能精准地找到证据,把“时间”和“空间”都搞清楚。
一句话总结: VideoZeroBench 就像一面照妖镜,照出了当前视频 AI“看似全能,实则眼盲心瞎”的真相,提醒我们离真正的“视频理解”还有很长的路要走。
这是一份关于论文 《VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification》 的详细技术总结。
1. 研究背景与问题 (Problem)
尽管多模态大语言模型(MLLMs)在视频理解任务上取得了显著进展,但现有的评估体系存在两个关键缺陷,导致模型能力的评估被高估:
- 分数虚高掩盖了细粒度理解的不足:现有的基准测试(如 Video-MME, LongVideoBench 等)主要关注答案的正确性,往往忽略了模型是否真正理解了视频中的细节。高准确率可能源于模型对常见场景的“记忆”或猜测,而非真正的视觉推理。
- 缺乏对证据的验证:目前的评估通常不验证模型的答案是否基于正确的时空证据(Spatio-Temporal Evidence)。模型可能给出了正确答案,但无法定位到支持该答案的具体时间点(Temporal Grounding)或空间区域(Spatial Grounding),这意味着模型可能产生了“幻觉”或依赖了非视觉的先验知识。
核心问题:当前的视频 MLLM 是否具备在长视频中精准定位细粒度视觉细节、进行时空推理并基于可验证证据进行回答的能力?
2. 方法论 (Methodology)
为了解决上述问题,作者提出了 VideoZeroBench,这是一个具有层次化时空证据验证机制的长视频理解基准。
2.1 数据集构建 (Dataset Construction)
- 数据规模:包含 138 个精心筛选的长视频(平均时长 667.1 秒,最长超过 50 分钟),覆盖 13 个领域(如体育、教学、游戏、生活 Vlog、新闻等)。
- 问题设计:包含 500 个开放式问题(Open-ended Questions),涵盖 11 种原子能力(Atomic Abilities),包括计数、小物体感知、空间方向判别、多段因果依赖等。
- 证据标注:每个问题都配有精确的时间区间(Temporal Intervals)和空间边界框(Spatial Bounding Boxes)作为标准答案的支撑证据。
- 质量控制:采用人工标注 + 两轮交叉验证,确保问题的唯一性、可验证性和高难度。
2.2 五级评估协议 (Five-Level Evaluation Protocol)
为了区分“回答正确”与“基于正确证据的回答”,作者设计了一个渐进式的五级评估框架:
- Level-1 (全证据辅助):提供视频 + 问题 + 时间 + 空间证据。评估模型整合已知证据进行推理的能力。
- Level-2 (仅时间证据):提供视频 + 问题 + 时间证据(无空间提示)。评估细粒度空间感知能力。
- Level-3 (标准问答):仅提供视频 + 问题(无提示)。这是标准的端到端问答设置,评估模型在无任何线索下的表现。
- Level-4 (答案 + 时间定位):要求模型不仅回答正确,还必须准确定位支持答案的时间片段(计算 tIoU)。
- Level-5 (答案 + 时空定位):最严格的设置。要求模型回答正确,并准确定位时间片段和关键帧上的空间边界框(计算 vIoU)。
3. 主要贡献 (Key Contributions)
- 首个基于证据验证的层次化视频基准:VideoZeroBench 是首个同时要求细粒度问答和显式时空证据定位的基准,填补了图像领域(如 ZeroBench)在视频领域的空白。
- 揭示了“答案正确”与“理解正确”的鸿沟:通过五级协议,量化了模型在缺乏证据提示时的表现,以及模型在生成答案时是否真正“看到”了证据。
- 系统性的能力诊断:将视频理解能力细分为 11 种原子能力,并分析了模型在不同视频长度、证据跨度(单帧/短时/长时)下的表现瓶颈。
- 开源与基准发布:提供了包含 500 个高质量标注问题的数据集、代码及评估脚本,推动社区向可信赖的视频智能发展。
4. 实验结果 (Results)
实验评估了 17 个主流模型(包括 Gemini-3-Pro, GPT-5.2, Qwen3-VL, Video-o3 等),结果令人震惊:
- 整体性能极低:
- 在标准问答设置(Level-3)下,最强的私有模型 Gemini-3-Pro 准确率仅为 17.0%。
- 在要求精确时空定位的最严格设置(Level-5)下,所有模型的准确率均低于 1%(Gemini-3-Pro 为 1.0%),许多模型甚至得分为 0。
- 证据定位是主要瓶颈:
- 从 Level-3 到 Level-5,性能呈单调急剧下降。这表明模型偶尔能猜对答案,但几乎无法定位支撑答案的真实证据。
- 即使提供了时间提示(Level-2),准确率也显著低于 Level-1,说明细粒度空间感知(如小物体定位、空间方向)是当前的重大短板。
- 特定能力缺陷:
- 小物体感知和空间方向判别表现最差。
- 计数任务(Counting)普遍困难,准确率多低于 8%。
- 长视频搜索(Needle-in-a-haystack):在长视频中定位短暂出现的关键帧极其困难,均匀采样策略容易遗漏关键信息。
- 思维链(Thinking-with-Video)的局限性:
- 采用迭代推理(如 VideoChat-R1.5, Video-o3)的模型在 Level-3 有微弱提升,但在 Level-4 和 Level-5 上没有显著优势。这表明当前的“思考”范式受限于底层的时空定位精度,无法通过单纯的推理深度来弥补感知精度的不足。
- 人类对比:
- 在子集测试中,人类准确率高达 67.6%,而最强模型仅为 22.0%,显示出巨大的能力差距。
5. 研究意义 (Significance)
- 重新定义视频理解评估标准:论文指出,仅凭问答准确率已不足以衡量视频 MLLM 的能力。未来的评估必须包含可验证的时空证据,以防止模型通过幻觉或记忆“作弊”。
- 指明未来研究方向:
- 视频理解的瓶颈不在于粗粒度的语义识别,而在于细粒度的空间智能和长视频中的时序搜索能力。
- 需要开发更有效的机制来结合“思考(Reasoning)”与“感知(Perception)”,特别是提高模型在长视频中精准定位关键帧和区域的能力。
- 推动可信 AI 发展:VideoZeroBench 强调“基于证据的推理”,这对于医疗、法律、监控等需要高可靠性和可解释性的视频应用场景至关重要。
总结:VideoZeroBench 通过引入严格的时空证据验证,揭示了当前最先进的视频大模型在细粒度理解和长视频推理方面仍存在巨大缺陷。它不仅仅是一个基准,更是一个诊断工具,表明视频 MLLM 距离真正可靠的“视觉智能”仍有很长的路要走。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。