← 最新论文
💬 NLP

GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?

本文介绍了 GameCraft-Bench,这是一个包含 140 个基于 Godot 的任务的基准测试,旨在评估编程智能体端到端生成完整、可玩游戏的能力,研究揭示了尽管当前前沿模型能够实现可识别的机制,但在实现人工制品完整性和交互连贯性方面仍面临显著困难。

原作者: Tongxu Luo, Rongsheng Wang, Jiaxi Bi, Chenming Xu, Zhengyang Tang, Jianlong Chen, Juhao Liang, Ke Ji, Shuqi Guo, Yuhao Du, Fan Bu, Wenyu Du, Xiaotong Zhang, Kyle Li, Shaobo Wang, Linfeng Zhang, Yuxuan
发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Tongxu Luo, Rongsheng Wang, Jiaxi Bi, Chenming Xu, Zhengyang Tang, Jianlong Chen, Juhao Liang, Ke Ji, Shuqi Guo, Yuhao Du, Fan Bu, Wenyu Du, Xiaotong Zhang, Kyle Li, Shaobo Wang, Linfeng Zhang, Yuxuan Liu, Xin Lai, Chenxin Li, Yiduo Guo, Zhexin Zhang, Xinyuan Wang, Tianyi Bai, Ziniu Li, Benyou Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位机器人厨师,并给了它一份复杂的多道菜晚餐食谱。你不仅仅希望机器人把食谱写在纸上,你还希望它能真正把这顿饭做出来、摆好盘并端上来,这样你才能品尝到味道。

这本质上就是这篇名为 GameCraft-Bench 的论文所探讨的内容。这是一个测试,旨在观察 AI 编程智能体(AI coding agents)是否真的能从零开始“烹饪”出一款可玩的视频游戏,而不仅仅是写出它的代码。

以下是使用简单类比对该论文核心思想的拆解:

1. 问题所在:“食谱 vs. 佳肴”

过去,当我们测试 AI 的编程能力时,我们主要检查代码在纸面上看起来是否正确(就像检查食谱中的食材清单是否正确一样)。但对于视频游戏来说,仅仅看代码是不够的。一款游戏需要能够运行,图形需要显示出来,且玩家需要能够移动角色并看到反馈。

作者认为,要真正测试 AI 制作游戏的能力,我们需要三个要素:

  • 真实的厨房(引擎落地/Engine Grounding): AI 必须在一个真实的引擎中工作(他们使用了流行的免费工具 Godot),而不是一个虚假或简化的版本。这就像要求厨师使用真正的炉灶,而不是玩具炉灶。
  • 完整的佳肴(产物完整性/Artifact Completeness): AI 不能只给你提供一种食材(比如一段关于跳跃角色的脚本)。它必须交付一整个打包好的、可以随时启动的游戏。不能有任何缺失的部分。
  • 品尝测试(交互式验证/Interactive Verification): 你不能只看做好的菜,你必须吃掉它。游戏必须是可以被玩到的。AI 的成功是通过实际运行游戏、按下按键并观察世界是否做出正确反应来评判的。

2. 测试方法:GameCraft-Bench

研究人员建立了一个巨大的测试厨房,名为 GameCraft-Bench

  • 菜单: 他们创建了 140 个不同的挑战,涵盖 15 种类型的游戏(如平台跳跃、赛车、策略和恐怖游戏)。
  • 流程:
    1. 给 AI 一个自然语言描述(例如:“制作一个 2D 平台跳跃游戏,玩家可以收集金币并躲避敌人”)。
    2. AI 在 Godot 引擎中构建游戏。
    3. AI 还必须记录一个“演示轨迹”(demo trace)——即一段展示如何玩这款游戏的视频脚本,以证明其有效性。
    4. 一个计算机系统使用该脚本“玩”游戏,记录视频,然后一个智能 AI 评委通过观看视频进行评分。

3. 结果:“擅长写食谱,不擅长做饭”

结果令人惊讶,甚至让 AI 社区感到有些汗颜。即使是最聪明、最先进的 AI 模型(如 Opus-4.7 和 GPT-5.5)也表现挣扎。

  • 得分: 最优秀的 AI 在测试中仅获得了约 41% 的分数。大多数模型的得分低于 40%。
  • 做得好的地方: AI 在构建“核心循环”(core loop)方面表现尚可。如果你要求一个角色可以跳跃的游戏,角色通常是可以跳跃的。它们可以构建引擎部分。
  • 失败的地方: 它们在将所有部分整合为一个完整的体验方面遇到了困难。
    • 内容缺失: 它们经常制作出的游戏过短,或者没有可以推进的关卡。
    • 视觉破碎: 图形可能存在,但并不合理(例如,玩家看不见敌人,或者 UI 界面损坏了)。
    • “演示”差距: 许多 AI 构建了游戏,但忘记了记录证明其有效的“演示轨迹”。这就像厨师做好了菜,却忘了为评委摆盘。

4. 关键发现(“为什么”)

论文深入探讨了 AI 失败的原因

  • 眼见为实: 表现最好的 AI 是那些在构建过程中会观察游戏屏幕的 AI。它们将视觉输出视为一种调试工具。如果角色看起来很奇怪,它们会修正代码。那些只写代码而不看屏幕的 AI 犯错更多。
  • 忙碌并不代表更好: 一个 AI 模型(MiMo)编写了大量的代码并运行了许多命令,但它并没有获得更高的分数。这就像一位厨师在疯狂地切菜,却从未真正把菜煮熟。如果错过了最后一步,做更多的工作并不保证能获得更好的结果。
  • 技能差异: 让“跳跃”机制生效(机制/Mechanics)与让游戏看起来漂亮(美术/Art)或拥有足够关卡(内容/Content)是不同的。AI 可能擅长其中一项,但在另一项上表现糟糕。它们并非全部关联在一起。

5. 结论

论文得出结论,虽然 AI 在编写代码方面变得非常出色,但端到端的游戏创作仍然是一个巨大的挑战。

目前的 AI 可以构建游戏的“碎片”或简单的原型,但它们还无法可靠地将人类的一个创意想法转化为一个精致、可玩且完整的游戏包。从“编写看起来正确的代码”到“交付一个运作良好的系统”,这之间的鸿沟依然非常宽阔。

简而言之:AI 可以写出食谱,但它仍在学习如何烹饪完整的佳肴并将其呈献给顾客。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →