← 最新论文
💬 NLP

GameEngineBench: Evaluating Coding Agents on Real C++ Runtime Environments

本文介绍了 GameEngineBench,这是一个包含来自 9 个游戏仓库的 110 个真实世界 Unreal Engine 5 项目中的 C++ 任务的基准测试,用于评估编码智能体在复杂的、有状态的实时系统中实现并编译功能性变更的能力,并揭示了即使是最强大的模型在处理深度集成的游戏引擎开发时也面临困难。

原作者: Brian La, Sejoon Chang, Ben Kim, Junyoung Bae, Aamish Ahmad Beg, Sei Chang, Gonzalo Gonzalez-Pumariega, Kanav Goyal

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Brian La, Sejoon Chang, Ben Kim, Junyoung Bae, Aamish Ahmad Beg, Sei Chang, Gonzalo Gonzalez-Pumariega, Kanav Goyal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人盖房子。你可以给它一个简单的指令,比如“把这颗钉子敲进去”,它可能会做得很好。但如果你要求它走进一栋已经盖了一半的房子,弄清楚水管是如何连接到电路系统的,然后安装一套新的智能照明系统,同时又不损坏现有的灯具或导致短路呢?这是一个难得多的测试。这就是**编程智能体(coding agents)**的世界——旨在编写和修复计算机代码的人工智能。长期以来,科学家们一直在简单的、孤立的任务上测试这些机器人,比如解决一个数学谜题或编写一个单一的函数。但现实世界并不是一个谜题;它是一个复杂的、活生生的系统,其中一切事物都在相互通信。研究人员提出的核心问题是:这些 AI 智能体能否应对真实运行软件系统中的混乱,还是说它们只能在真空中工作?

这篇名为 GameEngineBench 的论文通过将视频游戏引擎作为终极实验场,深入探讨了这个问题。不要仅仅把游戏引擎看作制作游戏的工具,而要把它看作一座复杂的、充满活力的城市,其中的角色(称为“演员/actors”)四处奔走、互相交谈、记忆信息并对世界做出反应。研究人员想要看看 AI 能否步入这座城市,找到一条特定的街道,并在不引发全市停电的情况下修复一个坏掉的红绿灯。他们使用流行的强大游戏引擎 Unreal Engine 5 构建了一个名为 GameEngineBench 的基准测试。他们从九个不同的开源游戏项目中提取了 110 个真实的现实任务。这些任务不仅仅是“写一个循环”;它们是诸如“确保玩家的物品栏能正确保存”、“修复 AI 使其不再卡住”或“让多人游戏同步以确保每个人看到的都一样”之类的内容。AI 必须使用 C++(一种严谨且精准的编程语言)编写代码,进行编译,然后在游戏内实际运行,以证明其有效性。

研究结果为 AI 世界带来了一次现实的警示。研究人员测试了 12 种不同配置的顶尖 AI 模型。表现最好的模型名为 claude-fable-5,它在第一次尝试中成功解决了约 55.5% 的任务。这听起来令人印象深刻,但也意味着它近一半的时间都失败了。更具启发性的是,有 31 个任务 即使所有 AI 模型再怎么努力也无法解决。论文指出,这些失败并非仅仅因为 AI 写错了字母或漏掉了分号。相反,AI 在应对游戏引擎深层且隐形的规则时遇到了困难。它经常忘记某些事情需要在“服务器”(主脑)而非“客户端”(玩家屏幕)上执行,或者搞错了物体诞生或销毁的时机。这就像 AI 知道如何写出一个句子,却并不理解整场对话的语法。

研究结论认为,尽管这些 AI 智能体正在变得越来越好,但它们仍然难以应对专业软件开发中那种杂乱、集成式的现实。它们可以写出在纸面上看起来很完美、甚至能无错误编译的代码,但当你将其运行在实时交互系统中时,它往往会破坏系统运作的微妙平衡。研究人员认为,我们需要更多像这样的测试,即要求 AI 证明其代码在真实的运行环境中有效,而不仅仅是在教科书式的案例中。在 AI 能够可靠地驾驭游戏引擎这样复杂且互联的“城市”之前,我们无法完全信任它去构建我们未来的复杂软件系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →