VGI-Bench: Probing Visual Intelligence in Video Generation Models
本文介绍了 VGI-Bench,这是一个包含 27 个任务和 810 个实例的综合基准测试,旨在严格评估视频生成模型的视觉推理能力,并揭示了即使是像 Seedance 2.0 这样的最先进系统也仅达到了 51.0% 的准确率,且在生成过程中难以实现可靠的自我修正。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一台不仅仅是在观察世界,而且能够想象世界如何变化的计算机。多年来,人工智能一直致力于识别静态图像:一张垫子上的猫,或者街道上停放的一辆汽车。最近,这些系统已经学会了生成视频,创造出看起来惊人真实的动态画面。科学家们现在在想,这些视频生成器是否正在做比单纯模仿运动更深层的事情。他们是在问,机器是否开始理解物理世界的规则——重力、因果关系以及物体如何相互作用——以便在展示结果之前,能够通过一系列事件进行“思考”。这个问题处于一项新努力的核心,即衡量视频生成式人工智能究竟是在进行真正的推理,还是仅仅在猜测一个看似合理的结局。
一个研究小组构建了一个名为 VGI-Bench 的新测试场来回答这个问题。他们没有要求人工智能解决由简单线条绘制的抽象谜题,而是给它喂入日常场景的写实照片,并要求它生成遵循特定逻辑规则的视频。这些任务的设计既具有挑战性又具备可行性,要求机器逐步模拟一个过程。例如,人工智能可能会看到一张玩具车位于迷宫起始位置的照片,并被要求生成一段它行驶到出口且不撞墙的视频。另一个任务可能会展示一个展开的扁平纸箱,并要求人工智能将其动画化,使其自行折叠成一个三维形状。研究人员不仅观察最终的图像,还仔细检查了整个视频,以观察机器是否在每一时刻都遵守了规则,检查诸如物体穿过墙壁、汽车瞬间移动或物品消失又重新出现等情况。
当他们测试目前最先进的视频生成模型时,结果呈现出希望与局限并存的状态。表现最好的系统是一个名为 Seedance 2.0 的模型,在这些严格条件下,它只能正确完成大约一半的任务。虽然人工智能通常能把握住大致思路,但它经常无法维持一个连贯的故事。在许多视频中,物理规律失效了:放在倾斜笔记本电脑上的杯子不会滚落,或者汽车会直接穿过一堵实墙。机器在规则方面也表现挣扎,有时会跳过必要的步骤,或者在视频中途改变物体的身份。即使最终结果看起来是正确的,通往该结果的过程也往往充满了不可能的运动,这表明这些模型擅长预测最终状态,但在模拟到达该状态的路径方面表现较差。
研究人员进行了深入调查,以了解为什么会出现这些失败。他们发现输入图像的风格起到了很大作用;当人工智能接收到写实照片时,其表现优于接收简单线条画时,这表明这些模型是基于真实世界图像进行训练的,并且在视觉风格发生变化时会感到困难。他们还观察了人工智能在生成视频的过程中是如何“思考”的,即分步思考的过程。他们发现,这些模型并不会在生成过程中纠正自己的错误。如果人工智能在生成视频的早期阶段犯了错,它往往会坚持这个错误,不断完善那个错误的构思,而不是去修正它。机器很早就锁定了一个假设,然后对其进行润色,即便这个假设违反了物理定律或任务规则。
这项研究表明,尽管视频生成模型正在成为创造视觉内容的强大工具,但它们尚未发展出人类在应对世界时所使用的这种可靠的、循序渐进的推理能力。它们可以模拟外观和简单的运动,但缺乏对事物随时间如何实际运作的深度、一致性的理解。这一新的基准测试提供了一种衡量这种差距的清晰方法,表明目前的系统距离成为真正的视觉推理者还很遥远。通过明确指出这些模型在何处失败——无论是追踪物体、遵循规则还是纠正错误——这项研究为构建下一代能够真正想象未来的人工智能提供了路线图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。