Evaluating Newtonian Mechanics in Video Generative Models with Real Physical Systems
本文介绍了 Morpheus,这是一个利用 130 段真实世界视频和守恒定律构建的物理启发式评估框架,旨在证明当代的视频生成模型尽管能产生视觉上吸引人的结果,却无法准确编码牛顿动力学。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一群才华横溢的艺术家,他们能创作出看起来如此逼真、让你觉得伸手就能触摸到的动态图像(视频)。这些艺术家就是新一代的“视频生成模型”(如 SORA、Veo 或 Kling)。每个人都感到兴奋,因为人们希望这些艺术家不仅能画出漂亮的画面,还能理解世界是如何运作的——比如重力如何将物体向下牵引,或者一个球是如何弹跳的。
但问题在于:它们是真的理解物理规则,还是仅仅非常擅长伪造?
这篇论文介绍了一个名为 Morpheus 的新测试,用来查明真相。你可以把 Morpheus 不仅仅看作是一个艺术评论家,而是一个 物理侦探。
问题所在:“看起来很美”的陷阱
以前,为了检查一段视频是否“真实”,人们只是询问人类或 AI 聊天机器人:“这个球掉落的样子看起来真实吗?”
- 缺陷: 这就像是通过询问“兔子看起来是不是真的出现了”来评判一个魔术。兔子可能确实出现了,但它可能是一个用纸做的假兔子。
- 问题: 一个视频可以看起来流畅且精美(审美),但仍然违反了物理定律(例如,球在没有推力的情况下向上滚动,或者球在不该失去能量的时候失去了能量)。目前的测试往往会错过这些细微的错误,因为它们只关注“图像”,而不关注“数学”。
解决方案:Morpheus 测试
作者建立了一个包含 130 个真实世界实验 的实验室(如掉落球体、滚动罐头、摆动单摆和弹跳物体)。他们是在一个受控的房间内精心拍摄了这些实验。
然后,他们要求视频 AI 模型根据第一帧或文本描述来重现这些视频。
Morpheus 不仅仅是问“它看起来真实吗?”,而是问:“数学逻辑成立吗?”
以下是该测试的工作原理,使用了一个简单的类比:
1. “轨迹”(路径)
想象一个球在下落。在现实世界中,重力以一种非常特定的曲线将其向下牵引。
- 旧方法: 将 AI 的球路径与真实球路径进行逐像素对比。
- Morpheus 方法: 这太严苛了。如果 AI 的球稍微重一点,或者风向稍微不同,路径会发生变化,但它仍然是一个符合物理规律的路径。Morppheus 并不关心路径是否完全一致,它关心的是路径是否遵循规则。
2. “PINN”(物理老师)
论文使用了一种特殊的 AI 工具,称为物理信息神经网络(PINN)。你可以把它想象成一位熟记运动定律的严厉物理老师。
- 老师观察 AI 的视频,并尝试将球的运动拟合到牛顿定律(如 $F=ma$)中。
- 如果球的运动违反了重力或能量守恒定律,老师就会给它差评。
- 如果运动完美遵循定律,老师就会给它 A+。
3. “守恒”(能量银行)
在现实世界中,能量就像银行账户里的钱。你不能凭空创造或毁灭它,你只能移动它(例如,从高度转化为速度)。
- Morpheus 会检查 AI 视频的“银行账户”。
- 真实视频: 总能量保持不变(或由于摩擦力而略微减少,这属于正常现象)。
- AI 视频: 经常会出现“银行账户”失控的情况。球可能会凭空获得能量,或者能量流失得过快。Morpheus 能瞬间捕捉到这一点。
他们发现了什么?
研究结果给 AI 社区带来了一次现实的警示:
- “美丽的谎言”: 即便是最先进的 AI 模型(如 Veo3 和 Kling),也能制作出极其精美且流畅的视频。
- 物理失败: 然而,当 Morpheus 检查数学逻辑时,几乎所有的模型都失败了。
- 它们难以保持能量恒定。
- 它们经常让物体消失、自我复制,或者在应该滚动时突然停止运动。
- 即使给它一段真实的球下落视频作为起始,AI 也无法根据物理规律正确预测接下来的几秒钟。
“提示词”的力量加持
研究人员尝试给予 AI 更好的指令(提示词),并展示更多的帧(不仅仅是开头,还有结尾)。
- 结果: 这确实有一点帮助。如果你向 AI 展示视频的开头 和 结尾,它在猜测中间过程时表现得更好。但即便有了最好的帮助,这些模型仍然无法达到现实世界的物理准确度。
核心结论
论文得出结论:虽然这些 AI 模型是非常出色的艺术家,但目前它们却是糟糕的物理学家。它们可以画出一幅完美的苹果坠落图,但它们并不真正理解苹果为什么会落下,或者应该落下多快。
在它们通过 Morpheus 测试之前,我们无法信任它们成为自动驾驶汽车或机器人等领域的“世界模型”,因为在这些领域,理解真实的物理规律关乎安全,而不仅仅是艺术。
简而言之: AI 非常擅长伪造现实的“外观”,但它尚未学会现实的“规则”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。