← 最新论文
🤖 AI

PhyGround: Benchmarking Physical Reasoning in Generative World Models

原作者: Juyi Lin, Arash Akbari, Yumei He, Lin Zhao, Haichao Zhang, Arman Akbari, Xingchen Xu, Zoe Y. Lu, Enfu Nan, Hokin Deng, Edmund Yeh, Sarah Ostadabbas, Yun Fu, Jennifer Dy, Pu Zhao, Yanzhi Wang

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Juyi Lin, Arash Akbari, Yumei He, Lin Zhao, Haichao Zhang, Arman Akbari, Xingchen Xu, Zoe Y. Lu, Enfu Nan, Hokin Deng, Edmund Yeh, Sarah Ostadabbas, Yun Fu, Jennifer Dy, Pu Zhao, Yanzhi Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你建造了一个超级聪明的机器人,它能构思出视频。它可以让猫追逐激光笔,或者让汽车在城市中穿行。但问题在于:有时,在它的“梦境”里,猫会像气球一样漂浮,汽车会穿过砖墙,或者杯子里的水会凭空消失。视频看起来很酷,但它违背了现实世界运作的基本规则。

论文PhyGround就像是为这些视频生成机器人提供的一份严格且极其详尽的“物理成绩单”。研究人员希望不再仅仅询问“这看起来酷吗?”,而是开始追问“这实际上是否遵守了物理定律?”

以下是他们如何构建这份成绩单的简单解释:

1. 旧成绩单的问题

在此之前,检查视频是否符合物理规律,就像老师给学生的整场科学考试只打一个总分。如果学生数学做对了但化学不及格,老师只会给整个考试打一个“B”。你无法知道他们具体哪里错了。

此外,旧有的测试依赖少数疲惫的人观看数小时的视频。有时,评分者会犯困、感到困惑,或者只是猜测。而过去用于评分视频的计算机程序则像通用知识机器人——它们擅长判断图片是否“好看”,却无法分辨阴影是否指向了错误的方向。

2. 新方案:物理侦探工具箱

研究人员创建了PhyGround,它就像一个拥有三种特殊工具的侦探工具箱:

  • 工具 #1:“具体定律”检查清单
    他们不再给出一个笼统的总分,而是将物理规律拆解为13 项具体定律(如重力、阴影、流体和碰撞)。

    • 类比: 想象一下给一场足球比赛评分。裁判不再只说“比赛精彩”,而是检查具体事项:“球是否留在场内?”“守门员是否用手触球?”“球员是否跑动了正确的距离?”
    • 他们为机器人编写了 250 条具体的提示(指令),例如“扔出一个球,使其撞击墙壁并反弹回来”。这迫使机器人尝试特定的物理动作,从而使评分者确切知道该观察什么。
  • 工具 #2:“超级评分员”人类团队
    他们并没有只让几个朋友观看视频。他们招募了459 人(包括物理专家和普通人)组成一个庞大的陪审团。

    • 类比: 这不像由一位法官决定才艺秀的获胜者,而是让体育场里的人群投票。为了确保没有人只是随机点击按钮,他们制定了严格的规则:每个人都必须坐在书桌前(禁止使用手机),仔细观看视频,并且只被要求评分少量视频,以免他们感到疲劳。
    • 他们发现,当拥有如此多的人参与时,结果极其稳定且可靠。
  • 工具 #3:“物理专家”机器人评委(PhyJudge-9B)
    人类虽然很棒,但速度较慢。因此,研究人员利用这 459 名人类的回答,训练了一个名为PhyJudge-9B的新 AI 机器人。

    • 类比: 这就像是一个学习了 459 名人类评委“答案键”的学生。现在,这个学生机器人可以瞬间评分成千上万个视频。
    • 论文表明,这个机器人比其他著名的 AI 评委(如 Gemini)表现更好。当其他机器人可能会感到困惑并说“哦,那个阴影看起来很奇怪,我给零分!”(即使其实没问题)时,PhyJudge-9B 学会了观察具体的规则(例如“阴影是否随物体移动?”),从而进行更准确的评分。

3. 他们的发现

当他们用这套新系统测试 8 种不同的视频生成机器人时,发现了一些令人惊讶的事情:

  • 没有机器人是完美的: 没有任何一个机器人获得满分。它们仍然会偶尔违反物理规则。
  • 专家与通才: 有些机器人擅长生成水流(流体),但在生成固体物体反弹(刚体)方面却表现糟糕。其他机器人则恰恰相反。
  • “隐藏”的缺陷: 如果你只看“总分”,两个机器人可能看起来打成平手。但当你查看具体定律时,会发现一个实际上在重力方面失败,而另一个在阴影方面失败。这种详细的视角有助于开发者确切知道需要修复什么。

结语

PhyGround是一种新的、开源的视频 AI 测试方法。它摒弃了模糊的“看起来不错”的评分,转而利用庞大的人类团队和专门的机器人评委,来检查视频是否符合 13 项具体的物理定律。这就像给视频 AI 参加期末考试,你可以确切看到它们答错了哪些题目,从而帮助它们学会构思出真正感觉逼真的世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →