StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley
StarDojo 是一个基于游戏《星露谷物语》的新型基准测试,旨在通过 1,000 个精心策划的任务,评估开放式代理多模态大语言模型在复杂的生产生活模拟中的表现,并揭示了即使是像 GPT-4.1 这样最先进的模型在视觉理解、推理和低级操控方面也面临显著困难,成功率仅为 12.7%。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人如何过上完整的人类生活。不仅仅是教它如何回答问题或写诗,而是教它如何起床、去上班、交朋友、管理预算,以及应对突如其来的暴雨——而且是同时处理这一切。
这正是这篇论文的作者们所做的——StarDojo。他们利用热门游戏《星露谷物语》(Stardew Valley)构建了一个测试场,旨在观察人工智能(AI)智能体是否能够处理“生产与生活”这种复杂且混乱的现实情况。
以下是使用简单类比对他们工作的详细解读:
1. 问题所在:“双轨”差距
把目前的 AI 基准测试想象成一场驾驶考试:你可能只需要练习如何在直线停车(生产),或者仅仅是测试你是否能与乘客聊天(社交互动)。
- 现实情况: 在现实生活中,你不能只顾着停车然后聊天。你必须开车去超市(生产)、买食物,然后在管理时间与金钱的同时,与收银员交谈(社交)。
- 差距: 现有的测试无法检查 AI 是否能同时完成这两者。它们通常过于简单,或者过于专注于单一领域。
2. 解决方案:StarDojo(“生活模拟器”考试)
作者创建了 StarDojo,这是一个基于《星露谷物语》的新型基准测试。
- 游戏内容: 想象一个温馨的农场,你可以种植作物、开采矿石、在洞穴里对抗史莱姆,还可以与村民们闲聊。
- 转折点: 他们将这款游戏变成了一场严苛的 AI 考试。他们不是让真人来玩,而是让 AI 智能体尝试完成特定的任务。
- 任务设计: 他们创建了 1,000 个不同的挑战,范围从“简单”(如浇水)到“困难”(如规划整个季节的耕作,同时还要与邻居建立关系并对抗怪物)。
- “精简版”: 为了更轻松地进行测试,他们还挑选了一组包含 100 个代表性任务 的较小集合(StarDojo-Lite),涵盖了基础内容。
3. 他们是如何将 AI 与游戏连接起来的
通常,要控制电子游戏,你需要键盘和鼠标。但你无法轻易地将键盘插进机器人的大脑里。
- 桥梁: 作者构建了一个特殊的“翻译器”(称为 StarDojoMod),让 AI 能直接与游戏的引擎对话。
- 类比: AI 不是像人类那样试图“看”屏幕并“按下”按钮,而是就像拥有了一条直达游戏内部计算机的电话专线。它可以询问:“我的能量值是多少?”或者说:“让我向左移动”,游戏会立即执行。这使得他们可以同时运行许多个游戏实例,从而快速测试 AI。
4. 结果:AI 难以“长大成人”
作者在这些最顶尖的 AI 模型(如 GPT-4.1、Claude 和 Gemini)上进行了测试。结果令人清醒:
- 得分: 即便是最优秀的 AI,也仅完成了约 12.7% 的任务。
- 简单任务: AI 在处理简单的短程任务(例如如果手里已经拿着工具,就拿起它)时表现尚可。
- 困难任务: 对于任何需要长期规划或在地图上移动的任务,AI 完全失败了。如果一个任务需要超过几步的操作,AI 就会迷失方向或忘记自己在做什么。
5. 为什么 AI 会失败?(“四大盲点”)
作者分析了这些错误,并发现了 AI 无法处理这种“生活模拟器”的四个主要原因:
- 视觉盲区 (42% 的错误): AI 看着游戏画面却分辨不出物体。它可能会把石头误认为树木,或者看不见正前方的门。这就像戴着雾气腾腾的眼镜在房间里导航。
- 推理混乱 (21%): 即使 AI 拥有正确的信息(例如一段文字列表显示“你在谷仓附近”),它也会忽略文本而依赖于模糊的视觉,从而导致混乱。
- 注意力涣散 (21%): AI 无法提前规划。它可能会忘记必须在收获作物之前先浇水,或者会在任务中途切换目标。
- 手脚笨拙 (16%): AI 知道要做什么,但在“如何做”上出了错。它可能会用错工具的方向,或者从背包里拿错了物品。
6. 总结
论文的结论是,虽然 AI 擅长回答问题或编写代码,但它目前非常不擅长具身生活(Embodied Living)。它难以在时间流逝、环境变化的动态世界中,将视觉、思考、规划和行动有机结合在一起。
StarDojo 现在已成为一个面向研究人员开放的工具。它就像一个“健身房”,AI 可以在这里训练,以应对复杂、混乱且充满挑战的模拟生活。这篇论文并不承诺 AI 明天就能经营农场,它只是向我们展示了 AI 在哪里跌倒,以便我们帮助它学习。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。