Mini Amusement Parks (MAPs): A Testbed for Modelling Business Decisions
本文介绍了迷你游乐园(Mini Amusement Parks, MAPs),这是一种新型的游乐园模拟器,旨在全面基准测试人工智能智能体在复杂的现实世界商业决策任务上的表现,并揭示了当前的尖端大语言模型在长程优化、样本效率学习、空间推理和世界建模方面显著低于人类基准。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你刚刚拿到了世界上最混乱、最不可预测、也最赚钱的游乐园钥匙。你的任务是什么?担任经理。你必须决定把过山车放在哪里,开多少个冰淇淋摊位,什么时候雇佣清洁工,以及是否应该把现金花在研究一种全新的、极其昂贵的游乐设施上。但问题在于,游客们情绪化,游乐设施会随机故障,如果你做错了决定,你的公园可能会在午饭前就破产。
这就是 Mini Amusement Parks (MAPS) 的世界——这是一个由研究人员创建的新型类视频游戏模拟器,旨在测试人工智能(AI)管理真实业务的能力。
大考:AI 对决人类经理
研究人员组织了一场对决,让世界上最聪明的 AI 模型(如 GPT-5、Claude 和 Gemini)与资深人类玩家进行较量。目标很简单:看谁能建造出最有价值的公园。
结果是一个巨大的警钟。即使是最顶尖的 AI 模型也难以跟上人类的步伐。
- 在**简单(Easy)**模式下,顶尖 AI(GPT-5)仅达到了人类专家得分的 8.80%。这意味着人类的表现是 AI 的 11.4 倍。
- 在**中等(Medium)**模式下(即游戏变得更加复杂且需要长期思考时),差距进一步拉大。AI 的表现下降到人类得分的仅 4.44%,这意味着人类的水平高出 15.3 倍。
这就像是给一个蹒跚学步的孩子一辆一级方程式赛车,而给专业赛车手一个职业选手;幼儿(AI)甚至连车都还没发动起来,而职业选手(人类)已经在赛道上疯狂超车了。
为什么 AI 会失败?
论文指出,AI 不仅仅是“不擅长数学”;它还缺少一些非常属于人类的“超能力”。研究人员确定了 AI 栽跟头的五个具体领域:
“午饭吃什么?”问题(短视症):
人类懂得提前规划。他们知道如果今天建了一个巨大的过山车,那么下个月就需要雇佣更多员工并存钱。然而,AI 往往是近视的。它会攫取眼前的即时奖励(比如建造一个游乐设施),却不去考虑后果。这就像一个孩子现在就把糖果全部吃光,结果导致肚子疼,却忘了自己还需要能量度过剩下的时间。当游戏难度增加(中等模式)时,AI 的表现大幅下滑,因为它无法看透下一个回合。“蒙眼”问题(空间推理):
在真实的公园里,商店的位置很重要。你会希望它靠近小径,而不是被困在角落里。AI 经常把游乐设施放在难以到达的地方,或者把它们全部堆叠在一起,忽略了人群的流动。有趣的是,给 AI 一张公园的照片(视觉信息)并没有起到帮助作用;事实上,这有时会让情况变得更糟。AI 似乎对视觉数据感到困惑,而使用一套简单的规则(启发式算法)来决定放置位置,反而能帮助 AI 表现得更好。“猜谜”问题(随机性):
现实生活是混乱的。有时游乐设施会无缘无故地损坏;有时游客只是心情不好。这被称为“随机性”(Stochasticity)。AI 难以处理这种随机性。它无法区分一次糟糕的一天是由运气不好造成的,还是由错误的决策造成的。当研究人员尝试利用 AI 来预测未来(即“世界模型”)时,情况往往变得更糟,导致决策变慢且成本更高。“失忆”问题(主动学习):
人类擅长实验。如果你尝试了一种新策略并失败了,你会学习原因并尝试另一种方法。研究人员给了 AI 一个“沙盒”模式——一个安全的练习区域,让它在正式测试前可以进行 100 天的实验。令人惊讶的是,这并没有带来多少帮助。AI 大多只是重复说明书里的内容,或者做出的笔记过于具体,以至于在以后无法发挥作用。它未能建立起关于公园运作方式的真正“心理模型”。“研究死胡同”问题:
在难度更高的版本中,你必须先研究新的游乐设施才能建造它们。AI 经常会立即选择研究那些最昂贵、最华丽的设施,即便它目前根本负担不起。这就像一个学生在拿到驾照之前就试图买一辆法拉利。
论文排除了哪些可能性
论文非常明确地指出了哪些方法是无效的:
- 仅仅给 AI 一张图片并不是解决办法。 向 AI 的“大脑”添加视觉输入并没有解决空间问题;事实上,相比于单纯的文本,视觉信息有时会让模型更加困惑。
- 目前的“世界模型”尚未成熟。 研究人员尝试使用一种特定的 AI 技术(WALL-E)来帮助 AI 预测未来,但这实际上让 AI 的表现变差了,并且运行成本更高。
- 练习并不总是能带来完美。 仅仅让 AI 在沙盒中玩 100 天并不会自动让它变得更聪明。在许多情况下,AI 只是变得更糟了或者原地踏步,因为它无法弄清楚应该从错误中学习什么。
我们有多大的把握?
这些发现是基于 MAPS 游戏环境内的模拟和测量。研究人员通过多次运行特定的布局(地图)来测试 AI 和人类玩家,从而得出这些数字。他们不仅仅是在猜测;他们测量了公园价值、支出金额和所耗时间。
论文表明,虽然 AI 在很多方面都在进步,但在处理经营真实业务时那种错综复杂、相互关联且不可预测的性质方面,它还有很长的路要走。人类专家与 AI 之间的差距不仅仅是一点点,而是一个鸿沟。研究人员希望通过使用这个“迷你游乐园”作为测试平台,我们最终能够开始构建能够像真正的业务经理一样思考、计划和适应的 AI。
在那之前,如果你想经营一个主题公园,你可能还是应该坚持聘请人类经理——并且,最好给 AI 拴上一条很短的牵引绳。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。