← 最新论文
💻 computer science

WorldBench: Benchmarking Physical Understanding of World Models by Isolating Physics Concepts

本文介绍了 WorldBench,这是一个新颖的解耦式视频基准测试,旨在通过严格隔离并评估生成式世界模型中的特定物理概念,揭示了当前最先进的模型仍缺乏可靠进行现实世界部署所需的物理一致性。

原作者: Rishi Upadhyay, Howard Zhang, Jim Solomon, Ayush Agrawal, Yunhao Ba, Alex Wong, Celso M de Melo, Achuta Kadambi

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Rishi Upadhyay, Howard Zhang, Jim Solomon, Ayush Agrawal, Yunhao Ba, Alex Wong, Celso M de Melo, Achuta Kadambi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,有一台计算机能够观看一段球从山上滚下的视频,然后精确预测接下来会发生什么。多年来,科学家们一直希望建立这样的系统,即所谓的“世界模型”(world models),使其成为我们物理现实的数字孪生。这些模型可以生成无穷无尽且真实的训练数据供机器人使用,让它们在无需接触真实世界的情况下,学习如何在一个杂乱的房间中穿行或处理易碎物品。这种前景预示着一个机器能像孩子一样直观理解重力、摩擦力和运动规则的未来。然而,一个关键的问题一直萦绕不去:这些人工智能大脑是真的理解了它们正在模拟的物理学,还是仅仅在模仿运动的外表,而并未掌握底层的机械原理?

为了回答这个问题,来自包括加州大学洛杉矶分校(UCLA)、耶鲁大学和索尼AI(Sony AI)在内的研究团队创建了一个新的测试场,名为WorldBench。他们的目标是剥离视觉噪声,并在决定我们宇宙运行的特定、严苛的规则上对模型进行测试。他们不再要求模型生成一段漂亮的视频,而是要求它以数学上的精确度遵循物理定律。他们设计了一系列视频测试,要求模型根据仅有的几帧初始画面来预测场景的未来。这些测试被分为两个截然不同的类别。第一类关注“直觉物理学”,检查模型是否理解诸如物体恒常性(即知道球即使滚到墙后依然存在)或物体如何相互支撑等概念。第二类则更为严格,侧重于精确的物理常数,要求模型生成的视频中,物体的加速度必须符合精确的重力加速度,或者在流体中运动时具有正确的粘稠度。

评估结果揭示了视觉美感与物理真相之间的巨大鸿沟。研究人员测试了几种最先进的视频生成模型,包括英伟达(NVIDIA)最新的Cosmos架构以及其他尖端系统。他们发现,虽然这些模型通常能创造出在人类眼中看起来极具视觉说服力的场景,但它们在遵循支配运动的实际数值方面却屡屡失败。例如,在涉及重力的测试中,模型生成的视频中,落下物体的加速度往往过慢或过快,严重偏离了标准值9.8米/秒平方。在测量流体粘度的实验中,模型难以区分像蜂蜜这样粘稠的物质与像玉米糖浆这样较稀的物质,往往将它们视为具有相同的流动阻力。

或许最能说明问题的发现是,即使在场景简单且物理规则明确的情况下,模型的表现依然不佳。当一个钢球掉入液体管中时,模型无法可靠地根据球下降的速度来估算液体的粘稠度。同样,当物体在不同材质的斜坡上滚下时,模型无法准确计算摩擦力,给出的数值往往在物理上是不可能的。研究人员指出,模型似乎过度依赖于在其训练数据中看到的模式,而非对物理定律的内在理解。如果一个球沿着斜坡滚下是其训练视频中的常见景象,模型就能很好地复制那种运动。但当面对稍微不同的设置时,例如球撞到了斜坡底部的木块,模型的预测就会崩溃,这表明它是在调用视觉记忆,而非计算物理结果。

这项研究还强调,这些失败不仅仅是微小的瑕疵,更是目前这些模型学习方式中的根本性局限。研究人员观察到,模型的输出具有高度的可变性;如果多次运行同一个视频提示词,物体的物理行为会发生剧烈变化。一次运行可能显示球以正确的能量弹跳,而另一次运行可能显示它瞬间失去了所有能量。这种不一致性使得人们很难信任这些模型来生成用于训练现实世界任务中机器人的合成数据,因为在现实中,对摩擦力或重力的误判可能会导致机器人掉落重物或发生碰撞。研究人员得出结论,虽然目前的这些世界模型在创造具有美感的视频方面令人印象深刻,但它们缺乏作为科学或工业应用可靠工具所需的深层、一致的物理理解。

通过隔离特定的物理概念并将其与已知常数进行对比,WorldBench为这些系统存在的缺陷提供了清晰的诊断。研究人员发现,模型在物体交互时间较长的场景中(例如球缓慢滚下斜坡)表现得比在快速、混乱的事件中(例如多米诺骨牌倒塌)要好。这表明模型可能更擅长捕捉缓慢、可预测的趋势,而非快速、复杂的交互。此外,研究显示,模型在面对远离平均值的材料(如极其粘稠的蜂蜜或非常光滑的塑料)时表现得最为吃力,往往会退回到一个既不符合现实的“中间值”。

最终,这项工作为人工智能领域提供了一次必要的现实检验。它证明了生成一段看起来真实的视频并不等同于生成一段物理上准确的视频。研究人员强调,要让这些世界模型真正成为机器人和自主系统的模拟器,它们必须超越视觉上的模仿,发展出对定义我们世界的物理常数的真正掌握。在此之前,一段看起来合理的视频与一段具有科学有效性的模拟之间,仍然存在着巨大的鸿沟,而WorldBench提供了一种精确的方法,来衡量这些模型距离目标还有多远。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →