GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?
本文介绍了 GameCraft-Bench,这是一个包含 140 个基于 Godot 的任务的基准测试,旨在评估编程智能体端到端生成完整、可玩游戏的能力,研究揭示了尽管当前前沿模型能够实现可识别的机制,但在实现人工制品完整性和交互连贯性方面仍面临显著困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你雇佣了一位机器人厨师,并给了它一份复杂的多道菜晚餐食谱。你不仅仅希望机器人把食谱写在纸上,你还希望它能真正把这顿饭做出来、摆好盘并端上来,这样你才能品尝到味道。
这本质上就是这篇名为 GameCraft-Bench 的论文所探讨的内容。这是一个测试,旨在观察 AI 编程智能体(AI coding agents)是否真的能从零开始“烹饪”出一款可玩的视频游戏,而不仅仅是写出它的代码。
以下是使用简单类比对该论文核心思想的拆解:
1. 问题所在:“食谱 vs. 佳肴”
过去,当我们测试 AI 的编程能力时,我们主要检查代码在纸面上看起来是否正确(就像检查食谱中的食材清单是否正确一样)。但对于视频游戏来说,仅仅看代码是不够的。一款游戏需要能够运行,图形需要显示出来,且玩家需要能够移动角色并看到反馈。
作者认为,要真正测试 AI 制作游戏的能力,我们需要三个要素:
- 真实的厨房(引擎落地/Engine Grounding): AI 必须在一个真实的引擎中工作(他们使用了流行的免费工具 Godot),而不是一个虚假或简化的版本。这就像要求厨师使用真正的炉灶,而不是玩具炉灶。
- 完整的佳肴(产物完整性/Artifact Completeness): AI 不能只给你提供一种食材(比如一段关于跳跃角色的脚本)。它必须交付一整个打包好的、可以随时启动的游戏。不能有任何缺失的部分。
- 品尝测试(交互式验证/Interactive Verification): 你不能只看做好的菜,你必须吃掉它。游戏必须是可以被玩到的。AI 的成功是通过实际运行游戏、按下按键并观察世界是否做出正确反应来评判的。
2. 测试方法:GameCraft-Bench
研究人员建立了一个巨大的测试厨房,名为 GameCraft-Bench。
- 菜单: 他们创建了 140 个不同的挑战,涵盖 15 种类型的游戏(如平台跳跃、赛车、策略和恐怖游戏)。
- 流程:
- 给 AI 一个自然语言描述(例如:“制作一个 2D 平台跳跃游戏,玩家可以收集金币并躲避敌人”)。
- AI 在 Godot 引擎中构建游戏。
- AI 还必须记录一个“演示轨迹”(demo trace)——即一段展示如何玩这款游戏的视频脚本,以证明其有效性。
- 一个计算机系统使用该脚本“玩”游戏,记录视频,然后一个智能 AI 评委通过观看视频进行评分。
3. 结果:“擅长写食谱,不擅长做饭”
结果令人惊讶,甚至让 AI 社区感到有些汗颜。即使是最聪明、最先进的 AI 模型(如 Opus-4.7 和 GPT-5.5)也表现挣扎。
- 得分: 最优秀的 AI 在测试中仅获得了约 41% 的分数。大多数模型的得分低于 40%。
- 做得好的地方: AI 在构建“核心循环”(core loop)方面表现尚可。如果你要求一个角色可以跳跃的游戏,角色通常是可以跳跃的。它们可以构建引擎部分。
- 失败的地方: 它们在将所有部分整合为一个完整的体验方面遇到了困难。
- 内容缺失: 它们经常制作出的游戏过短,或者没有可以推进的关卡。
- 视觉破碎: 图形可能存在,但并不合理(例如,玩家看不见敌人,或者 UI 界面损坏了)。
- “演示”差距: 许多 AI 构建了游戏,但忘记了记录证明其有效的“演示轨迹”。这就像厨师做好了菜,却忘了为评委摆盘。
4. 关键发现(“为什么”)
论文深入探讨了 AI 失败的原因:
- 眼见为实: 表现最好的 AI 是那些在构建过程中会观察游戏屏幕的 AI。它们将视觉输出视为一种调试工具。如果角色看起来很奇怪,它们会修正代码。那些只写代码而不看屏幕的 AI 犯错更多。
- 忙碌并不代表更好: 一个 AI 模型(MiMo)编写了大量的代码并运行了许多命令,但它并没有获得更高的分数。这就像一位厨师在疯狂地切菜,却从未真正把菜煮熟。如果错过了最后一步,做更多的工作并不保证能获得更好的结果。
- 技能差异: 让“跳跃”机制生效(机制/Mechanics)与让游戏看起来漂亮(美术/Art)或拥有足够关卡(内容/Content)是不同的。AI 可能擅长其中一项,但在另一项上表现糟糕。它们并非全部关联在一起。
5. 结论
论文得出结论,虽然 AI 在编写代码方面变得非常出色,但端到端的游戏创作仍然是一个巨大的挑战。
目前的 AI 可以构建游戏的“碎片”或简单的原型,但它们还无法可靠地将人类的一个创意想法转化为一个精致、可玩且完整的游戏包。从“编写看起来正确的代码”到“交付一个运作良好的系统”,这之间的鸿沟依然非常宽阔。
简而言之:AI 可以写出食谱,但它仍在学习如何烹饪完整的佳肴并将其呈献给顾客。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。