PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning
本文介绍了 PRISM,这是一个大规模、多语言的基准测试和综合评估框架,旨在严格评估语言模型在程序化视频生成中的时空推理能力,揭示了代码可执行性与视觉空间连贯性之间存在显著差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在聘请一位机器人建筑师来制作一部关于数学或历史的动态动画电影。你给机器人一个剧本(提示词),它便编写代码来构建场景。
长期以来,我们一直在问:“机器人完成房屋建造了吗?”如果代码运行没有崩溃,我们就说:“干得漂亮!”
但论文PRISM认为这还不够。仅仅因为房子建好了,并不意味着房间的位置正确、家具没有悬浮在半空,或者墙壁没有倒塌在演员身上。
以下是用通俗语言对该论文的解释:
1. 问题:“能运行”vs“看起来正确”
将像素级 AI(如标准视频生成器)想象成一位试图逐帧绘制电影画面的画家。他们擅长让事物看起来逼真,但经常搞乱逻辑。角色可能会穿墙而过,或者文字可能倒置出现。
程序化 AI(本文研究的对象)则不同。它像一个编写精确指令集(代码)来构建电影的机器人。由于遵循规则,它本应是完美的。
- 旧测试:机器人是否完成了指令编写?(是/否)
- 新问题:机器人可能完美地完成了指令编写,但这些指令可能告诉机器人将一棵巨树放在一个微小的房子内部。代码能运行,但电影看起来是破碎的。
2. 解决方案:PRISM(“压力测试”)
作者们创建了一个名为PRISM的全新大规模测试。
- 规模:他们收集了超过10,000个示例(比任何之前的测试大 20 倍)。这些示例涵盖 437 个不同主题,从“如何解代数题”到“荔枝的历史”。
- 双语转折:他们用英语和中文两种语言进行了测试。
- 人工介入:他们不仅让计算机评分,还由人类检查“蓝图”,以确保代码确实符合所讲述的故事逻辑。
3. 新的评分系统:“漏斗”
PRISM 不再仅仅给出通过/不通过的等级,而是使用一个包含四层的漏斗来捕捉不同类型的错误:
- 守门人(代码可靠性):代码能运行吗?如果崩溃,直接淘汰。
- 建筑师(空间推理):这是关键所在。布局合理吗?
- 重叠:两个物体是否撞在一起了?
- 越界:物体是否飘出了屏幕之外?
- 溢出:文字是否从框中溢出了?
- 导演(动态复杂度):视频是否过于无聊(像静态幻灯片)或过于混乱(旋转和跳跃太多)?该测试检查动作是否与故事相匹配。
- 编辑(时间密度):视频的节奏是否适中,还是闪烁得太快?
4. 惊人的发现:“执行 - 空间差距”
作者测试了 7 个最智能的可用 AI 模型(包括 GPT、Gemini 和 Claude 等知名模型)。
结果:
- 好消息:AI 在编写能运行的代码方面变得越来越擅长。大多数情况下,代码不会崩溃。
- 坏消息:在“能运行”和“看起来正确”之间存在巨大差距。
- 平均而言,41%成功运行的视频在空间上是破碎的。
- 想象一个机器人能完美地制造汽车引擎,却把轮子装在了车顶上。引擎能运转,但汽车无法行驶。
主要发现:
- 思考更久无济于事:作者尝试让 AI 在回答前“思考”更长时间(称为“思考模式”)。这并没有解决空间问题。AI 只是对其错误答案变得更加自信。
- 动作过多是坏事:当 AI 试图通过大量动作让视频更刺激时,布局就会崩溃。
- 语言很重要:AI 在英语和中文上的表现差异很大,在处理中文文本时经常犯更多的布局错误。
5. 核心结论
该论文得出结论:我们不能再只问“代码能运行吗?”,我们必须问“代码是否创造了一个合乎逻辑、井然有序的世界?”
目前,即使是最聪明的 AI 也像是才华横溢但笨手笨脚的舞台工作人员。它们能按照剧本打开灯光、移动道具,但经常忘记检查道具是否挡住了演员的脸,或者布景是否正在倒塌。PRISM 就是一本新的规则手册,旨在迫使它们学会如何成为更好的舞台监督。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。