← 最新论文
💻 computer science

VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?

本文提出了专为评估视觉中心复杂视频推理能力而设计的基准测试 VideoReasonBench,通过引入细粒度操作序列和潜在状态推断任务,揭示了现有主流多模态大模型在此类任务上的显著不足,并证明了扩展推理预算(Test-time scaling)对于提升模型性能至关重要。

原作者: Yuanxin Liu, Kun Ouyang, Haoning Wu, Yi Liu, Lin Sui, Xinhao Li, Yan Zhong, Y. Charles, Xinyu Zhou, Xu Sun

发布于 2026-03-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuanxin Liu, Kun Ouyang, Haoning Wu, Yi Liu, Lin Sui, Xinhao Li, Yan Zhong, Y. Charles, Xinyu Zhou, Xu Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 VIDEOREASONBENCH 的新测试,就像给现在的“超级 AI 视频理解员”们出了一套高难度的“找茬 + 推理”侦探题

为了让你轻松理解,我们可以把这篇论文的核心内容想象成一场**“侦探与魔术”的较量**。

1. 背景:为什么需要这个新测试?

以前的 AI 视频测试(比如问“视频里的人在做什么?”),就像是在考**“记忆力”**。

  • 旧测试:就像给你看一段视频,然后问:“刚才那个人穿什么颜色的衣服?”AI 只要看一眼,或者用简单的“直觉”就能答对。
  • 问题:现在的 AI 很聪明,但它们往往不需要“深度思考”就能在这些简单问题上拿高分。这就像让一个天才去解"1+1 等于几”,虽然答对了,但看不出他真正的推理能力有多强。

2. 新测试:VIDEOREASONBENCH 是什么?

作者设计了一个全新的“游乐场”,里面的视频不是简单的记录生活,而是像**“魔术表演”“逻辑谜题”**。

核心玩法(魔术盒):
想象视频里有一个**“魔法盒子”**(Latent State,潜在状态):

  • 前半段:你只能看到盒子里的操作(比如有人把牌换位置、把棋子移动、把文件删除),但你看不到盒子里最终变成了什么样
  • 后半段:或者反过来,你只能看到开始结束的样子,中间的过程被遮住了。
  • 任务:AI 必须像侦探一样,盯着视频里每一个微小的动作,在脑子里一步步推演:“刚才他移走了这张牌,那张牌就滑过来了……现在盒子里的状态应该是这样的……"

三个难度等级(就像游戏闯关):

  1. Level 1:回忆(找茬)
    • 问题:“视频里那个红圈一共往左走了几步?”
    • 要求:必须精准记住每一个动作,不能数错。
  2. Level 2:推断(读心)
    • 问题:“虽然视频最后把盒子盖住了,但根据刚才的移动,现在盒子里的牌是怎么排的?”
    • 要求:AI 必须在脑子里“重建”那个看不见的状态。
  3. Level 3:预测(算命)
    • 问题:“如果现在盒子是这个状态,我再让它‘向左、向上’移动一次,会变成什么样?”
    • 要求:基于刚才的推理,预测未来的变化。

3. 测试结果:AI 们表现如何?

作者找了 18 个目前最顶尖的 AI 模型来答题,结果非常惊人:

  • 大多数 AI(包括 GPT-4o):考砸了。
    • 准确率只有 6.9% 左右。
    • 比喻:就像让一群普通大学生去做高数题,他们连题目都没读懂,直接瞎蒙。它们要么记不住中间的过程,要么推演一步就乱了。
  • 少数“思考者”:表现突出。
    • 只有 Gemini-2.5-Pro 这个模型表现最好,准确率达到了 56%
    • 比喻:这个模型就像是一个**“慢思考的数学家”**。它不急着回答,而是先在脑子里把每一步都推演一遍(论文里叫“长思维链”),虽然慢,但能算对。
  • 人类表现:
    • 人类专家的平均分是 73.8%
    • 结论:即使是现在最强的 AI,离人类的逻辑推理能力还有很大差距。

4. 关键发现:为什么 AI 会失败?

论文发现了两个致命弱点:

  1. “眼瞎”(视觉感知不够细):
    • 现在的 AI 看视频像“走马观花”,只记得大概。在这个测试里,如果只给 AI 看视频的一帧(就像只看一张照片),或者把视频剪掉一半,AI 的分数就会暴跌 98%
    • 比喻:就像让你看一场魔术,但只给你看魔术师的手,不给你看道具,你根本猜不出变出了什么。
  2. “脑懒”(不愿意深度思考):
    • 如果强制 AI 多花点时间“思考”(生成更多的推理文字),它的分数会大幅提升
    • 比喻:以前的 AI 是“秒回型”选手,看到题就答;现在的测试要求它是“草稿纸型”选手,必须把步骤写出来才能做对。

5. 总结:这篇论文想说什么?

这篇论文就像是在说:

“别被那些简单的视频问答骗了!现在的 AI 在复杂的、需要一步步逻辑推演的视频任务面前,其实还很笨。它们要么记不住细节,要么懒得动脑子。只有那些愿意‘慢下来’、像侦探一样一步步推理的 AI,才能在这个新测试中及格。”

这对我们意味着什么?
这意味着未来的 AI 发展,不能只靠“背答案”或“看大概”,必须学会像人类一样进行严密的逻辑推演,才能真正理解视频里的复杂世界。这个新测试(VIDEOREASONBENCH)就是用来筛选出真正聪明的 AI 的“试金石”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →