← 最新论文
🤖 AI

VGI-Bench: Probing Visual Intelligence in Video Generation Models

本文介绍了 VGI-Bench,这是一个包含 27 个任务和 810 个实例的综合基准测试,旨在严格评估视频生成模型的视觉推理能力,并揭示了即使是像 Seedance 2.0 这样的最先进系统也仅达到了 51.0% 的准确率,且在生成过程中难以实现可靠的自我修正。

原作者: Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Jize Jiang, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie
发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Jize Jiang, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie, Kelsey R Allen, Chenglong Wang, Michel Galley, Jianfeng Gao, ChengXiang Zhai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一台不仅仅是在观察世界,而且能够想象世界如何变化的计算机。多年来,人工智能一直致力于识别静态图像:一张垫子上的猫,或者街道上停放的一辆汽车。最近,这些系统已经学会了生成视频,创造出看起来惊人真实的动态画面。科学家们现在在想,这些视频生成器是否正在做比单纯模仿运动更深层的事情。他们是在问,机器是否开始理解物理世界的规则——重力、因果关系以及物体如何相互作用——以便在展示结果之前,能够通过一系列事件进行“思考”。这个问题处于一项新努力的核心,即衡量视频生成式人工智能究竟是在进行真正的推理,还是仅仅在猜测一个看似合理的结局。

一个研究小组构建了一个名为 VGI-Bench 的新测试场来回答这个问题。他们没有要求人工智能解决由简单线条绘制的抽象谜题,而是给它喂入日常场景的写实照片,并要求它生成遵循特定逻辑规则的视频。这些任务的设计既具有挑战性又具备可行性,要求机器逐步模拟一个过程。例如,人工智能可能会看到一张玩具车位于迷宫起始位置的照片,并被要求生成一段它行驶到出口且不撞墙的视频。另一个任务可能会展示一个展开的扁平纸箱,并要求人工智能将其动画化,使其自行折叠成一个三维形状。研究人员不仅观察最终的图像,还仔细检查了整个视频,以观察机器是否在每一时刻都遵守了规则,检查诸如物体穿过墙壁、汽车瞬间移动或物品消失又重新出现等情况。

当他们测试目前最先进的视频生成模型时,结果呈现出希望与局限并存的状态。表现最好的系统是一个名为 Seedance 2.0 的模型,在这些严格条件下,它只能正确完成大约一半的任务。虽然人工智能通常能把握住大致思路,但它经常无法维持一个连贯的故事。在许多视频中,物理规律失效了:放在倾斜笔记本电脑上的杯子不会滚落,或者汽车会直接穿过一堵实墙。机器在规则方面也表现挣扎,有时会跳过必要的步骤,或者在视频中途改变物体的身份。即使最终结果看起来是正确的,通往该结果的过程也往往充满了不可能的运动,这表明这些模型擅长预测最终状态,但在模拟到达该状态的路径方面表现较差。

研究人员进行了深入调查,以了解为什么会出现这些失败。他们发现输入图像的风格起到了很大作用;当人工智能接收到写实照片时,其表现优于接收简单线条画时,这表明这些模型是基于真实世界图像进行训练的,并且在视觉风格发生变化时会感到困难。他们还观察了人工智能在生成视频的过程中是如何“思考”的,即分步思考的过程。他们发现,这些模型并不会在生成过程中纠正自己的错误。如果人工智能在生成视频的早期阶段犯了错,它往往会坚持这个错误,不断完善那个错误的构思,而不是去修正它。机器很早就锁定了一个假设,然后对其进行润色,即便这个假设违反了物理定律或任务规则。

这项研究表明,尽管视频生成模型正在成为创造视觉内容的强大工具,但它们尚未发展出人类在应对世界时所使用的这种可靠的、循序渐进的推理能力。它们可以模拟外观和简单的运动,但缺乏对事物随时间如何实际运作的深度、一致性的理解。这一新的基准测试提供了一种衡量这种差距的清晰方法,表明目前的系统距离成为真正的视觉推理者还很遥远。通过明确指出这些模型在何处失败——无论是追踪物体、遵循规则还是纠正错误——这项研究为构建下一代能够真正想象未来的人工智能提供了路线图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →