← 最新论文
🤖 AI

Can Image Models Imagine Time? ImageTime: A Novel Benchmark for Probing Visual World Modeling Through Spatiotemporal Consistency

本文介绍了 ImageTime,这是一个新颖的基准测试,通过要求模型生成描述时间过程的四个有序关键帧,来评估图像生成模型维持时空一致性和连贯视觉世界建模的能力,从而揭示了当前系统在表示随时间变化的动态变化方面的局限性。

原作者: Xinrui Wu, Lichen Huang

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinrui Wu, Lichen Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位神奇的艺术家,只要你描述,他就能画出任何图像。如果你要求“一只坐在垫子上的猫”,他表现得非常出色。但如果你要求讲一个故事呢?如果你说:“先画一只猫,然后展示它跳跃,接着展示它着陆,最后展示它睡觉”会发生什么?

这就是 ImageTime 这篇论文所解决的问题。虽然目前的 AI 图像生成器擅长制作单张完美的图片,但我们并不真正确定它们是否理解事物是如何随时间变化的。它们真的“知道”猫必须先跳起来才能着陆吗?还是它们只是猜测最终图片的模样,而忽略了中间的步骤?

以下是研究人员的工作内容的简单拆解,使用了日常类比。

1. 问题所在:“快照”与“电影”

把目前的 AI 图像模型想象成只会拍快照的摄影师。他们捕捉单个瞬间的能力极其出色。但如果让他们解释一个过程——比如烤蛋糕或开门——他们往往会搞错物理规律。他们可能会在第一步就展示一个已经抹好奶油的蛋糕,或者在饼干还没被烤出来之前,就让一只手拿着饼干。

论文认为,要实现真正的“智能”,AI 需要理解视觉世界建模(Visual World Modeling)。这意味着它需要追踪:

  • 身份(Identity): 那还是同一只猫吗?
  • 空间(Space): 是猫向左移动了,还是整个房间发生了位移?
  • 因果关系(Cause and Effect): 门是因为有人推了才打开的,还是它凭空变开的?

2. 解决方案:“连环画”测试 (ImageTime)

为了测试这一点,研究人员创建了一个名为 ImageTime 的新基准测试。他们不再要求 AI 生成一张图片,而是要求它生成一张包含 2x2 连环画格的单幅图像

AI 必须按顺序绘制四个特定的帧:

  1. 开始: 事情发生前的场景。
  2. 动作开始: 动作发生的瞬间。
  3. 中间: 动作正在进行中。
  4. 结束: 最终结果。

类比: 想象要求一个孩子画一个关于“做三明治”的四格连环画。

  • 优秀的 AI 会画出:桌上的面包 -> 手把肉放在面包上 -> 手把奶酪放在肉上 -> 做好的三明治。
  • 糟糕的 AI 可能会画出:做好的三明治 -> 做好的三明治 -> 做好的三三明治 -> 做好的三明治。(它跳过了步骤)。
  • 另一种糟糕的 AI 可能会画出:桌上的面包 -> 三明治已经被吃掉了 -> 面包又回到了桌上 -> 三明治完成了。(时间线断裂了)。

3. 评分系统:“逻辑阶梯”

研究人员并没有仅仅给出一个简单的“通过/失败”等级。他们建立了一个 7 级阶梯,以观察 AI 在哪里失效。

  • 第 1 级(基础): AI 是否画出了正确的猫和正确的垫子?(静态接地性/Static Grounding)。
  • 第 2 级(身份): 第二格里的猫还是第一格里的那只猫吗?背景是否发生了随机变化?(身份与锚点/Identity & Anchors)。
  • 第 3 级(运动): 猫真的移动了吗?还是整个画面只是整体平移了?(空间转换/Spatial Transition)。
  • 第 4 级(状态): 如果猫跳了起来,它现在是在空中吗?如果倒牛奶,杯子是否变满了?(物体状态转换/Object-State Transition)。
  • 第 5 级(交互): 猫的爪子是否真的碰到了垫子?手是否正确地握住了杯子?(交互/Interaction)。
  • 第 6 级(因果): 门是在手推之后才打开的吗?(因果过程/Causal Process)。
  • 第 7 级(规则): 如果提示词说“不要开门”,AI 是否保持了门关闭的状态?(约束/Constraints)。

4. 裁判:“超级督察员”

为了给这些连环画打分,研究人员使用了一个非常先进的 AI(GPT-5.5)充当超级督察员。这位督察员不仅看图片,还会阅读原始指令,并根据规则检查每一个面板。

它会寻找特定的“失败情况”,例如:

  • 时空穿越: 在动作开始前就展示了最终结果。
  • 魔法现象: 物体凭空出现或消失。
  • 漂移: 猫在面板之间改变了颜色,或者房间改变了形状。
  • 不可能的物理现象: 手穿过了实心的墙壁。

5. 他们的发现

研究人员测试了 8 种不同的 AI 图像生成器。以下是结果大意:

  • 顶尖表现者: 最先进的模型(如 GPT Image 2 和 Nano Banana 2)表现最好。它们通常能保持故事逻辑清晰、保留角色,并展示动作发生的正确顺序。然而,即使是最好的模型,有时也会在微小细节上出错,比如瓶子里还剩多少液体。
  • 中等表现者: 一些模型可以画出图片,但经常搞错时间线。它们可能会在“开始”面板中展示“结束”的结果。
  • 挣扎者: 一些旧模型或较小的模型几乎立即在测试中失败。它们甚至无法画出四个不同的面板;它们只会做出一个混乱的拼贴画,或者重复同一个图像四次。

核心结论:
论文得出结论:画出一张漂亮的图片很容易;但构建一个逻辑严密的逻辑故事很难。

即使是当今最优秀的 AI 模型,也像是那些能完美背诵单句台词、却难以即兴表演整场戏的演员。它们可以渲染出一个美丽的“最终帧”,但往往会丢失那些让过程变得合理的“隐藏变量”(例如物体从哪里来,或者是什么导致了某个动作)。

总结

ImageTime 是一个全新的测试,它在问 AI:“你能用图片讲述一个故事,还是你仅仅知道如何画出一个瞬间?”结果表明,虽然 AI 在绘画方面正在进步,但在理解视觉世界中的时间流逝和因果关系方面,仍处于学习阶段。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →