What-If World: A Causal Benchmark for General World Models in Embodied Scenarios
本文介绍了"What-If World",这是一个包含 319 个提示对的新基准,用于评估视频生成模型在响应单变量变化时生成物理一致且因果相异结果的能力,结果表明当前最先进的模型在可靠模拟用于规划与控制的具身场景方面大多未能达标。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位才华横溢的艺术家,能够绘制出极其逼真的场景。如果你请他画“一辆车轻柔地刹车”,他会画得很好。如果你请他画“一辆车猛烈地刹车”,他也会画得很好。这两幅画单独看都完美无缺。
但关键在于:“假如世界”(What-If World)提出了一个不同的问题。它问的是:“如果你将指令从‘轻柔’改为‘猛烈’,那么结果是否真的按照物理规律发生了应有的变化?”
在现实世界中,猛烈的刹车比轻柔的刹车能让车更快停下。但在当前 AI 视频生成器的世界里,这位艺术家可能会画出两段几乎相同的停车距离,尽管指令截然不同。AI 擅长描绘汽车的外观,却不擅长理解汽车运动的逻辑。
问题所在:“形似”陷阱
当前对 AI 视频模型的测试,就像是通过单独查看每一页来给学生的作业打分。
- 第 1 页:“画一辆车轻柔地刹车。”(画得不错。通过。)
- 第 2 页:“画一辆车猛烈地刹车。”(画得不错。通过。)
老师从未将这两页并排对比。因此,即使两幅画都显示汽车停在完全相同的位置,完全忽略了指令的差异,AI 依然能拿到 A 级。这被称为对比瓶颈(Contrastive Bottleneck)。AI 能让事物看起来真实,但当规则改变时,它却无法让事物表现出不同的行为。
解决方案:“假如世界”
研究人员构建了一项名为**“假如世界”(What-If World)的新测试。他们不再一次只评估一个视频,而是强制 AI 基于相同的起始场景,但根据指令中一个微小的变化,生成成对**的视频。
这就像玩“找不同”游戏,但 AI 必须根据物理规律自己创造这些差异。
测试设置:
- 锚点:他们选取一张汽车或机械臂在移动前的真实照片。这是“冻结的瞬间”,对于两个视频而言,一切皆同。
- 转折:他们给 AI 两个提示词,除了一个物理细节外,其余完全相同。
- 提示 A:“机械臂轻柔地推动方块。”
- 提示 B:“机械臂猛烈地推动方块。”
- 测试:AI 必须生成两个视频。研究人员(利用一个超级智能的 AI 裁判)检查:
- 机械臂是否真的推动了?(遵循性)
- 方块是否以符合物理规律的方式移动?(物理性)
- 背景是否保持不变?(环境)
- 关键的是:“猛烈推动”的视频是否显示方块比“轻柔推动”的视频移动得更远或更快?(结果)
游戏的六条规则
为了使测试公平且科学,研究人员将变化组织为六条具体的物理“规则”,分为两类:
1. 环境(舞台):
- 表面摩擦:路面是结冰的还是干燥的?(汽车会打滑吗?)
- 材质/介质:物体是海绵还是砖块?(它会变形还是保持坚硬?)
- 障碍物:前方是否有路障?(汽车会撞上它还是绕开?)
2. 动作(演员):
- 力度/程度:推动或刹车的力度有多大?
- 空间对齐:机械臂确切是在哪里抓取的?
- 时间序列:机械臂是在移动之前还是之后抓取的?
结果:AI 仍是个新手
研究人员测试了全球 9 个最智能的视频 AI 模型(包括开源和昂贵的闭源模型)。结果令人清醒:
- 天花板:即使是最好的模型,也仅通过了约**52%**的测试。这意味着它有近一半的时间失败了。
- 差距:开源模型的表现甚至更差,集中在**28%**左右。
- 幻觉:大多数模型在“单视频”测试中得分很高(视频看起来很棒),但在“成对”测试中却惨败(视频之间的差异不够大)。它们只是在伪造物理规律。
- 视觉偏差:当变化肉眼可见时(例如汽车快跑与慢行的对比),AI 表现较好;但当变化微妙或不可见时(例如路面的滑溜程度),AI 则表现得一塌糊涂。
核心结论
该论文得出结论:虽然这些 AI 模型在渲染(制作精美图片)方面令人惊叹,但它们尚未成为可靠的模拟器(理解世界如何运作)。
如果你想用 AI 来规划机器人的动作或模拟自动驾驶汽车,你需要它理解“猛烈刹车”意味着“更短的停车距离”。目前,AI 只是在猜测猛烈刹车看起来是什么样,而不是它实际上会做什么。在它们能够通过**“假如世界”**测试之前,我们无法完全信任它们在现实世界中做出决策。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。