← 最新论文
🤖 AI

WorldCoder-Bench: Benchmarking Physically Grounded 3D World Synthesis

本文介绍了 WorldCoder-Bench,这是一个包含 2,026 个专家策划任务以及用于评估和验证大语言模型在浏览器原生环境中合成具有物理依据的交互式 3D 世界能力的 StateProbe 基于执行的协议的综合基准测试,并揭示了当前的尖端模型在维持状态一致性和交互链方面存在显著困难。

原作者: Shuo Lu, Yinuo Xu, Kecheng Yu, Siru Jiang, Yongcan Yu, Yubin Wang, Haitao Yang, Yuxiang Zhang, Bin Wang, Ran He, Jian Liang

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Shuo Lu, Yinuo Xu, Kecheng Yu, Siru Jiang, Yongcan Yu, Yubin Wang, Haitao Yang, Yuxiang Zhang, Bin Wang, Ran He, Jian Liang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一名机器人建筑师,根据你给出的简单描述来建造一个虚拟游乐场,比如“制作一个篮球游戏,让球的弹跳看起来很真实”。

过去,如果你要求 AI 构建一个网站,你只需要观察屏幕即可。如果按钮看起来正确且颜色好看,你就认为它运行正常。但要在浏览器内部构建一个 3D 世界(例如视频游戏或物理模拟器)是不同的。这就像在建造一座房子,而墙壁是由隐形玻璃制成的。你可以看到外面,但仅凭一张照片,你无法判断地基是否稳固、门是否真的能打开,或者重力是否运作正常。

这篇论文介绍了 WorldCoder-Bench,一种全新的测试方法,用于测试 AI 是否真的能构建这些可以运行的 3D 世界,而不仅仅是制作精美的图片。

以下是他们方法的详细拆解,使用了简单的类比:

1. 问题所在:“黑盒”画布

当 AI 构建一个 3D 世界时,它编写的代码运行在浏览器中一个被称为 <canvas> 的隐藏区域内。

  • 旧方法: 以前的测试就像雇佣了一位只看游乐场照片的评论家。他们可能会说:“滑梯看起来是蓝色的,所以它很好!”但他们看不出滑梯是否真的连接在地面上,或者球是否会从边缘滚落。
  • 现实情况: AI 可能会画出一个完美的篮球框,但如果代码有误,球可能会穿过篮筐而无法得分,或者当你触摸时,篮筐可能会消失。旧的测试忽略了这些“隐形”的失败。

2. 解决方案:“状态探针”(隐形检查员)

作者创建了一个名为 StateProbe 的新工具。StateProbe 不仅仅是拍一张照片,它更像是一个走进虚拟世界内部的隐形检查员。

  • 工作原理: 这个检查员拥有一份由人类专家编写的秘密清单(即“契约”)。它不只是观察场景,还会深入代码内部,检查世界的“生命体征”。
  • 它检查的内容:
    • 物理学: 球掉落的速度是否真的正确?
    • 交互: 当我点击按钮时,游戏是否真的记录了点击,还是那个按钮仅仅是一个绘图?
    • 状态: 如果我得分了,计分器是否真的增加了,还是卡在了零?

为了确保检查员足够严格,他们使用了一种叫做**变异测试(Mutation Testing)**的技巧。他们故意以微小的形式破坏 AI 的代码(比如将重力改为极弱,或者隐藏计分按钮),以观察检查员是否能发现错误。如果检查员漏掉了错误,他们就会修复检查员。这确保了测试既严格又公平。

3. 测试:WorldCoder-Bench

他们构建了一个包含 2,026 个不同挑战 的庞大测试套件。

  • 任务: 这些任务涵盖了从简单的操作(让球弹跳)到复杂的模拟(模拟化学反应或构建一个需要瞄准篮球的游戏)。
  • 规则: AI 会收到自然语言指令(例如“构建一个游戏……”),并且必须生成单个网页。它无法看到秘密清单或检查员的规则。

4. 结果:AI 仍在学习中

他们测试了世界上顶尖的 9 个 AI 模型。结果令人惊讶:

  • 得分: 即便是最好的 AI 也只能通过大约 28% 的测试。
  • 错觉: 许多 AI 生成的世界在截图中看起来非常完美,但在“隐形检查员”测试中却失败了。它们构建了布景,却忘记了物理规则或如何连接按钮与游戏逻辑。
  • 主要错误: AI 通常能把“外观”做对,但在以下方面失败了:
    • 模式漂移(Schema Drift): AI 在没有告知检查员的情况下改变了游戏规则(例如,球应该是红色的,但 AI 把球变成了蓝色,且没有更新计分逻辑)。
    • 断裂的链条(Broken Chains): AI 造了一扇门,但没有把把手和门连接起来,导致门打不开。

5. “价值”检查:它值得花钱吗?

作者还计算了使用这些 AI 与雇佣人类开发人员相比是否能节省成本。

  • 转折: 尽管 AI 经常失败,但由于它们非常便宜且快速,对于简单的任务,它们仍然能节省大量资金。这就像拥有一个非常便宜、速度极快的学徒,他们能快速完成简单的活计,但需要人类来修复复杂的部分。
  • 指标: 他们创建了一个“自动化回报率”分数。对于简单的任务(如制作酷炫的视觉效果),AI 是一个划算的交易。对于复杂的任务(如复杂的物理模拟),AI 仍然不够可靠,无法取代人类。

总结

WorldCoder-Bench 是对 AI 的一次现实检验。它阻止我们被精美的图片所蒙蔽,并迫使 AI 证明其 3D 世界在底层逻辑上确实是有效运行的。目前,最好的 AI 模型就像有天赋的艺术家,他们能画出一辆完美的汽车,但还没学会如何制造一台真正能跑起来的引擎。我们正在接近目标,但在它们能够独立构建功能完备、可交互的世界之前,还有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →