← 最新论文
🔬 applied physics

BilliardPhys-Bench: Benchmarking Physical Reasoning and Visual Dynamics of Multimodal LLMs

该论文介绍了 BilliardPhys-Bench,这是一个合成台球基准测试,它揭示了当前的视觉语言模型在处理视觉动力学和复杂物理推理方面存在困难,通常表现出一种“静止偏差”,即在具有挑战性的场景中错误地预测不会发生相互作用。

原作者: Ben Wang, Xiaogang Li, Ruochen Gao, Peiyao Xiao, Chengliang Xu, Zeyu Wang, Zichao Chen, Bing Zhao, Hu Wei

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Ben Wang, Xiaogang Li, Ruochen Gao, Peiyao Xiao, Chengliang Xu, Zeyu Wang, Zichao Chen, Bing Zhao, Hu Wei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在观看一场台球比赛。你看到白球被击中,瞬间你就知道:“它会撞击红球,弹向侧边,然后停在那里。”人类在做这些事情时是不假思索的;我们的脑中内置了一个“物理引擎”,可以模拟未来。

这篇论文介绍了一个名为 BilliardPhys-Bench 的新测试,旨在观察人工智能计算机是否也拥有这种物理方面的“直觉”,还是仅仅在瞎猜。

以下是他们所做的工作以及研究发现的详细拆解,使用了简单的类比:

1. 测试:数字台球厅

研究人员使用计算机程序构建了一个虚拟台球桌。他们没有使用真实的视频,而是生成了数千个随机场景,其中球被击打的速度和角度各不相同。

  • 设置: 他们向 AI 展示一张包含球的位置以及显示白球运动方向箭头的单张桌面图片。
  • 规则: 他们告诉 AI 物理定律(例如摩擦力如何减慢球速、它们如何反弹)。
  • 挑战: AI 必须在看不见未来的情况下预测三件事:
    1. 会撞击吗?(白球是否会撞到另一颗球?)
    2. 会反弹吗?(它会撞到墙壁吗?)
    3. 会在哪里停止?(在 1、2、3、4 或 5 秒后,每颗球的具体位置在哪里?)

2. 选手:AI “学生”

他们测试了目前最智能的 AI 模型(来自 GPT、Claude、Gemini 和 Qwen 等家族)。把这些模型想象成正在参加物理考试的学生。

3. 结果:谁通过了,谁失败了?

结果令人惊讶,并揭示了这些 AI 思维方式中的一个特定弱点。

  • “静止偏差”(偷懒的学生):
    研究人员发现的最大问题是他们称之为 “静止偏差”(Stasis Bias) 的现象。当情况变得复杂或预测时间变长(例如预测 5 秒后的未来)时,AI 会因为害怕出错而变得胆小。它们不会去猜测碰撞,而是默认选择说:“什么都没发生。” 它们预测球就那样静止在那里。这就像一个学生在面对不确定的答案时,与其尝试解数学题,不如直接写下“我不知道”。

  • “擅长结尾,拙于过程”的问题:
    一些模型非常擅长猜测球在 5 秒后最终会停在哪里,但却很难解释它们是如何到达那里的。

    • 类比: 想象一个学生在故事结尾画了一幅完美的车祸现场图,但在描述整个过程时却错得离谱(比如明明车转向了,他却说车一直在直行)。他们通过运气或模式匹配得到了正确的结果,但并没有真正理解车祸背后的物理原理。
  • 获胜者:
    表现最好的模型是 GPT-5.5GPT-5.4-Pro。这些模型是最“平衡”的。它们既能预测最终位置,也能正确识别导致该位置的碰撞过程。

    • 有趣的是,“Pro”版本的模型(即使用更多计算能力来“思考”更久的模型)在识别碰撞方面比标准版本表现得更好。这表明,给 AI 更多的时间去“思考”有助于它克服那种懒惰的“静止偏差”。

4. 残酷的真相

论文得出结论,虽然这些 AI 在识别图像内容方面(比如识别出“那是一个台球桌”)非常出色,但它们在预测物体运动方面仍然很差。

  • 时间是敌人: 随着预测时间变长(从 1 秒增加到 5 秒),AI 的准确度下降了。最初的小错误会不断累积,就像玩“传声筒”游戏一样,信息在最后会被完全搞乱。
  • 差距: “看见”世界与“模拟”世界之间存在巨大的鸿沟。目前的 AI 擅长描述一张静态照片,但很难运行一段关于接下来会发生什么的“心理电影”。

总结

这篇论文并不声称这些 AI 现在就能帮你打台球。相反,它利用台球作为一个简单、清晰的方式来表明,目前的 AI 模型缺乏真正的内部物理模型。 它们擅长描述现在,但往往无法预测未来,尤其是在情况变得复杂或混乱时。为了解决这个问题,未来的 AI 需要具备更好的“常识”,了解物体是如何相互作用的,而不仅仅是记忆模式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →