VideoGameBench: Can Vision-Language Models complete popular video games?
本文介绍了 VideoGameBench,这是一个要求视觉语言模型仅凭原始视觉输入和高层指令来游玩 20 世纪 90 年代电子游戏的基准测试,该测试揭示出即便是最先进的模型,也因感知、空间导航和推理延迟方面的局限而在实时游戏过程中面临显著困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明的机器人,它读遍了图书馆里的每一本书,还能解决复杂的数学问题。你可能会想:“太棒了!让我们看看它能不能玩电子游戏。”
这正是普林斯顿大学的研究人员所做的。他们创建了一个名为VideoGameBench的新测试,旨在检验这些先进的人工智能模型(称为视觉 - 语言模型)是否能像人类一样,真正去玩 20 世纪 90 年代的流行电子游戏。
以下是他们实验的分解、结果及其含义,使用了简单的类比。
设置:“蒙眼玩家”测试
通常,当科学家在电子游戏上测试人工智能时,他们会给人工智能提供一份作弊指南。他们可能会告诉人工智能:“敌人位于坐标 X, Y",或者给它提供关卡地图。这就像玩电子游戏时,腿上摊开着一本指南书。
VideoGameBench改变了规则。
- 规则:人工智能仅接收屏幕的原始图像(就像你看着电视一样)以及关于按钮功能的简单文本描述(例如,“按'A'键跳跃”)。
- 挑战:人工智能必须像人类玩家一样,弄清楚游戏机制、记住自己去过的地方,并实时对敌人做出反应。
- 游戏:他们挑选了 10 款 90 年代的经典游戏,范围从《毁灭战士 II》(快节奏射击游戏)到《文明》(慢节奏策略游戏)再到《宝可梦》(角色扮演冒险游戏)。
他们甚至向人工智能隐藏了三款秘密游戏。这是为了确保人工智能不仅仅是从训练数据中死记硬背答案,而是真正学会即时掌握新事物的玩法。
结果:“新生儿”问题
结果令人惊讶。即使是当今最聪明、最强大的人工智能模型(如 Gemini 2.5 Pro 和 Claude 3.7)也表现得极其吃力。
- 得分:最好的模型仅完成了约**0.48%**的游戏。
- 现实:用通俗的话说,这意味着人工智能在游戏一开始就卡住了。它甚至无法完成第一关。
可以这样想:你递给一位天才数学家一台全新的游戏机。他能计算火箭的轨迹,但当他试图玩《超级马里奥》时,他却不断走出悬崖,因为他不明白屏幕上的“向下”意味着“坠落”,或者他忘记了三分钟前已经捡到了钥匙。
为什么它们失败了?
该论文指出了人工智能陷入困境的三个主要原因:
- “知”与“行”的差距:人工智能通常“知道”它应该做什么(例如,“我需要去那扇门”),但它却不断按错按钮。这就像一个人知道去商店需要左转,但他的脚却总是往右迈。
- 视觉混淆:人工智能有时无法分辨它看到了什么。在《毁灭战士 II》中,人工智能可能会向看起来像一堆岩石的已故敌人射击,从而浪费所有弹药。在《塞尔达传说》中,它可能仅仅因为站在角色旁边就认为自己与对方交谈了,尽管实际上并没有发生对话。
- 短期记忆:电子游戏需要长时间记住事物(例如,“我需要找到蓝色钥匙来打开红色的门”)。人工智能在几步之后就会忘记其主要目标,用新的、不太重要的想法覆盖其记忆。
“暂停按钮”实验
研究人员意识到,有些游戏速度非常快(实时进行),而人工智能的思考速度却很慢。等到人工智能决定按下按钮时,游戏状态已经改变,使得该操作变得毫无用处。
为了解决这个问题,他们创建了VideoGameBench Lite。
- 改变:他们在人工智能思考时按下了游戏的“暂停”按钮。只有当人工智能发出指令时,游戏才会继续运行。
- 结果:得分略有上升(达到约 1.6%),但人工智能仍然无法完成游戏。这证明问题不仅仅在于人工智能速度慢;而是它根本无法有效地通过游戏逻辑进行推理。
“练习测试”
为了看看人工智能能否处理基本任务,他们创建了三款微小的、简单的练习游戏:
- 点击:点击一个移动的点。
- 拖拽:沿直线拖拽一个点。
- 迷宫:让一个方块穿过简单的迷宫。
即使在这里,人工智能也表现吃力。虽然有些模型能够点击那个点,但几乎所有模型在拖拽或穿越迷宫时都失败了。这表明人工智能不仅在复杂的游戏逻辑上存在问题,在基本的物理交互和空间推理方面也存在困难。
结论
该论文总结道,虽然人工智能在数学和编程方面令人惊叹,但当它必须仅依赖所见内容和自身记忆时,它在玩电子游戏方面目前极其糟糕。
研究人员希望,通过创建这一高难度测试,能够推动人工智能开发者构建更优秀的系统,使其在以下方面表现更佳:
- 理解所见内容(感知)。
- 记住之前发生的事(记忆)。
- 规划后续步骤(策略)。
在人工智能能够不使用作弊指南就击败《毁灭战士》或《宝可梦》之前,它尚未完全掌握人类学习和适应新、复杂环境的能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。