← 最新论文
🤖 AI

AGI Maze as a Benchmark Framework for World-Modeling Agents

本文介绍了 AGI Maze,这是一个轻量级的基于网格的基准测试框架,旨在揭示当前的语言大模型即使在提供工作记忆机制的情况下,也无法构建解决部分可观测、具有状态性任务所需的持久且可操作的世界状态表示。

原作者: Alexey Potapov

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexey Potapov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是该论文的通俗化解释,使用了日常类比。

核心理念:为什么“聪明”的聊天机器人会在迷宫中迷失

想象你有一个非常聪明的的朋友,他能写诗、解数学题,还能讲笑话。这位朋友就像是一个大语言模型(LLM)。他们非常擅长预测句子中下一个出现的词。

然而,这篇论文指出,如果你把这位朋友放进一个黑暗、曲折的迷宫里,且他只能看到面前的一堵墙,他就会迷失方向。他可能会猜出下一步该怎么走,但他无法在脑海中构建出一张完整的迷密图。他们擅长完成一个故事,但不擅长模拟一个世界。

为了证明这一点,作者创建了一个新的测试,叫做 AGI Maze(AGI 迷宫)


什么是 AGI Maze?(“文字版视频游戏”)

你可以把 AGI Maze 想象成一个完全通过文字信息进行的视频游戏。

  • 设定: 你处在一个网格中(类似于棋盘)。你有一个起点、一个宝箱、一把钥匙和一个出口。
  • 难点: 你看不见地图。你不知道墙在哪里。你只知道自己的起点。
  • 玩法: 你输入“向右走”。游戏回复:“你撞到了墙。”然后你输入“向下走”。游戏说:“你找到了钥匙!”
  • 目标: 你必须弄清楚迷宫的布局,找到钥匙,打开宝箱并逃脱——在此过程中,你必须记住自己去过哪里以及墙在哪里,而你从未见过任何图像。

为什么这很难?
迷宫设置了一些“陷阱”来增加难度:

  1. 河流: 如果你踩到河流,会被自动冲向下游,但游戏不会告诉你水流的方向。你必须靠猜。
  2. 坑洞: 如果你掉进洞里,可能会出现在迷宫中完全不同的另一个地方。
  3. 时间限制: 你只有有限的步数来完成任务。如果你漫无目的地游荡,就会耗尽时间。

实验:AI 能解决它吗?

作者测试了几种流行的 AI 模型(如 GPT-4o 和 Gemini)在这些迷宫中的表现。他们将 AI 视为一名仅靠文字描述进行游戏的玩家。

结果令人惊讶:

  • “原生”AI: 当 AI 仅仅尝试根据聊天历史来猜测下一步动作时,它表现得非常糟糕。在小型迷宫中,它的表现往往甚至不如一个只会随机选择方向的计算机程序(即“随机游走”)。
  • 问题所在: AI 并没有在它的“大脑”中构建一张地图。它只是根据最后几句话来猜测下一个词。它无法维持一个关于“我在哪里”以及“墙在哪里”的稳定图像。

“笔记本”技巧

作者意识到,人类在没有铅笔和纸的情况下无法解决复杂的迷宫。我们会随着探索的过程绘制地图。于是,他们给了 AI 一个“笔记本”(通过让 AI 在做出移动指令前,先在自己的聊天记录中写下笔记)。

  • 设定: 在 AI 说“向右走”之前,它先写下一条笔记:“我在左下角。我向上走撞到了墙。我觉得钥匙在右边。”
  • 结果: 这对较强的 AI 模型帮助很大。它们的成功率从失败提升到了能解决约 60-70% 的迷宫。
  • 难点: 即便有了笔记本,AI 仍然很吃力。它并没有自然地构建出一张完美、结构化的地图。它写的只是些乱七八糟的笔记。而且对于那些规模较小、能力较弱的 AI 模型来说,笔记本技巧完全不起作用——它们依然会迷失方向。

这告诉了我们什么?

论文最后总结了几个关键结论:

  1. 预测 vs. 理解: 现在的 AI 非常擅长预测句子中的下一个词(比如完成一个故事),但它们不擅长模拟一个不断变化的世界(比如在迷宫中导航)。它们不会自然地建立起对现实的“心理模型”。
  2. 记忆很难: 仅仅给 AI 一长串过去的对话信息(它的“记忆”)是不够的。它需要主动地将这些信息组织成一张地图或一个计划,而它目前在这一点上还做不到。
  3. 测试是一个工具,而非最终评分: 作者并不是在说“AI 没用”。他们是在说:“这里有一个特定的工具(AGI Maze)来向我们展示 AI 究竟在哪里失败了。”它强调了,要构建真正的智能体,我们需要教它们如何构建并使用世界的内部地图,而不只是如何聊天。

类比总结

  • 目前的 LLM 就像是一个背熟了剧本的导游。如果你问他们描述一个他们从未去过的城市,他们可以猜出词汇;但如果你让他们在蒙眼的情况下穿过迷宫,他们就会跌跌撞撞,因为他们手里没有地图。
  • AGI Maze 就是这个蒙眼迷宫测试
  • “笔记本” 是给了这位导游一支笔和一张纸。这对他有一点点帮助,但他依然不是天生的制图师。

论文认为,要实现真正的通用人工智能(AGI),AI 需要学会如何绘制自己的地图并随着探索不断更新地图,而不仅仅是学会如何预测下一个句子。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →