← 最新论文
💬 NLP

GameDevBench: Evaluating Agentic Capabilities Through Game Development

本文介绍了 GameDevBench,这是首个通过 333 个复杂多模态任务来评估游戏开发中智能体能力的基准测试,该研究揭示了当前的智能体在视觉资产操作方面表现挣扎,同时也证明了简单的视觉反馈机制可以显著提高它们的性能。

原作者: Wayne Chi, Yixiong Fang, Arnav Yayavaram, Siddharth Yayavaram, Seth Karten, Qiuhong Anna Wei, Runkun Chen, Alexander Wang, Valerie Chen, Ameet Talwalkar, Chris Donahue

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Wayne Chi, Yixiong Fang, Arnav Yayavaram, Siddharth Yayavaram, Seth Karten, Qiuhong Anna Wei, Runkun Chen, Alexander Wang, Valerie Chen, Ameet Talwalkar, Chris Donahue

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一名才华横溢但缺乏经验的学徒如何制作电子游戏。你给了他一份蓝图(教程)和一堆原材料(代码、图像、声音文件和动画)。你的目标是看他是否真的能构建出游戏,还是仅仅得到一堆混乱的零件。

这篇论文介绍了 GameDevBench,这是一个巨大的“试驾”测试,旨在观察 AI 智能体在构建电子游戏方面的表现究竟如何。以下是他们所做的工作以及他们的发现,我们使用简单的类比来进行说明。

1. 问题所在:“缺失的环节”

长期以来,AI 在编写代码方面已经变得非常出色(就像搭建房屋的框架)。但当你要求 AI 构建一些看起来有形且能动的东西时(比如一个拥有工作灯光、移动家具和花园的房子),它就显得力不从心了。

大多数 AI 测试只检查代码是否有效。但游戏开发不同。这就像是在造一辆汽车,你不仅要编写引擎代码,还要同时完成车身的喷漆、调校悬挂,并确保轮子能够正确旋转。如果 AI 在建造时看不见这辆车,它往往会把轮子装在车顶上。

2. 解决方案:一个新的“驾驶学校” (GameDevBench)

研究人员构建了一个名为 GameDevBench 的新测试场。

  • 这些测试从何而来? 他们并没有凭空捏造问题。他们从 YouTube 和各类网站中提取了 333 个真实的电子游戏教程,并将这些循序渐进的指南转化成了对 AI 的挑战。
  • 环境: 他们使用了名为 Godot 的游戏引擎(可以把它想象成一个数字工作坊)。AI 必须像人类开发者一样行动:打开文件、拖放资源、编写脚本,并检查游戏是否能实际运行。
  • 难度: 这些任务非常困难。平均而言,解决一个任务所需的代码变更量是之前编程测试的 3 倍,处理的文件数量也是之前的 3 倍。这不仅仅是写一个句子,而是在一边抛球的同时写完一整个章节。

3. 结果:学徒仍在学习阶段

研究人员在这一新测试中测试了目前最智能的 AI 模型(如 GPT-5、Claude 和 Gemini)。

  • 得分: 即便是最优秀的 AI 也只解决了约 54% 的任务。这意味着近一半的时间里,AI 未能正确构建游戏。
  • 弱点: AI 在处理“逻辑”任务(例如让角色在按下按钮时跳跃)时表现尚可。但在处理“视觉”任务(例如让角色平滑行走或创建特定的动画)时却表现得非常糟糕。
    • 类比: AI 很擅长编写棋盘游戏的规则,但它却很难真正绘制出棋盘或以看起来正确的方式移动棋子。
  • 差距: “顶尖 AI”与“中端 AI”之间的差距巨大。顶尖模型的表现几乎是低端模型的两倍。

4. 修复方案:给 AI 装上“眼睛”

研究人员注意到,AI 之所以失败,是因为它对自己的工作成果是“盲目”的。它是在黑暗中编写代码。于是,他们给了 AI 两个简单的工具:

  1. 截图: AI 可以拍摄游戏编辑器的照片,以查看目前构建了什么。
  2. 视频: AI 可以录制一段游戏运行的短视频,以观察角色是否真的在移动。

结果: 当 AI 能够“看到”它的工作成果时,其表现显著提升。最优秀的模型将任务解决率从 41% 提升到了 52%

  • 类比: 这就像是给学徒一面镜子。之前,他们在戴着眼罩的情况下尝试画画;一旦他们能看到画布,犯错就会减少。

5. 这意味着什么(根据论文内容)

论文得出结论:虽然 AI 在编程方面正在进步,但它仍需要学习如何理解它所创造的视觉世界

  • 现在的 AI 智能体就像是能够完美绘制蓝图,却无法判断墙壁是否垂直或油漆颜色是否符合设计的建筑师。
  • 为了变得更好,AI 需要接受训练,去“观察”它正在建造的东西,而不仅仅是为之编写指令。

简而言之: 论文构建了一个电子游戏构建测试,发现目前的 AI 在这方面仍然有些笨拙,并表明通过提供“视觉检查”(截图和视频)可以帮助它们构建出更好的游戏。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →