← 最新论文
🤖 machine learning

From Pixels to BFS: High Maze Accuracy Does Not Imply Visual Planning

该论文通过新基准\textsc{MazeBench}揭示,尽管多模态模型在视觉迷宫任务中表现出高准确率,但其本质是通过将图像转换为文本网格并进行大规模的令牌级广度优先搜索(BFS)来“暴力求解”,而非具备人类般的空间规划或视觉理解能力。

原作者: Alberto G. Rodriguez Salgado

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Alberto G. Rodriguez Salgado

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的超级 AI 做了一次“走迷宫”的体检,结果发现了一个令人惊讶的真相:AI 虽然能走出迷宫,但它们并不是像人类那样“看”着路走的,而是在用一种极其笨拙、费力的“数数”方式硬算出来的。

为了让你轻松理解,我们可以把这篇论文的核心内容想象成一场**“人类 vs. 机器人”的迷宫大比拼**。

1. 比赛规则:简单的迷宫,复杂的陷阱

研究人员设计了一个叫 MAZEBENCH 的测试,里面有 110 个不同难度的迷宫(从像小方格一样的简单迷宫,到像城市地图一样复杂的 20x20 大迷宫)。

  • 人类怎么玩? 看一眼图,眼睛扫一下,几秒钟就能画出路线。这就像你在脑子里直接“看”到了路。
  • AI 怎么玩? 它们被要求给出从起点到终点的每一步(上、下、左、右)。

2. 惊人的发现:高分背后的“假象”

测试结果显示,像 GPT-5.4 这样的顶级 AI,在 100 个迷宫里能解开 91 个,看起来非常厉害。
但是! 论文作者揭开了它们的“底牌”:

  • 人类是“视觉导航员”:直接看地图,一眼看出死胡同,直接规划路线。
  • AI 是“文字翻译官 + 暴力数数机”
    1. 第一步(翻译):AI 先把图片里的像素点,强行翻译成文字表格(比如把墙写成"#",把路写成".")。这一步经常出错,就像把一张地图翻译成了乱码。
    2. 第二步(暴力穷举):翻译好后,AI 不会像人一样“看”路,而是开始在文字表格里一步一步地试错。它会在心里(或者说在生成的文字里)念叨:“如果往右走,撞墙了;如果往下走,撞墙了……"
    • 比喻:这就像你让一个不懂中文的人去走迷宫,他不能看路,必须先把路画成文字,然后拿着笔在纸上把每一条可能的路都走一遍,直到找到出口。

3. 代价有多大?“走”一次迷宫要消耗多少“墨水”?

这是论文最有趣的地方。为了走对一条路,AI 消耗了惊人的计算资源(Token,可以理解为“思考的墨水”):

  • GPT-5.4:每解开一个迷宫,平均要写 2,913 个字的思考过程。
  • Gemini:平均要写 9,250 个字。
  • Claude:最笨拙,平均要写 22,818 个字!
  • 人类:只需要看一眼,几乎不消耗“墨水”。

比喻:人类走迷宫就像骑自行车,轻快又高效;而 AI 走迷宫就像背着 50 公斤的砖头在走迷宫,每走一步都要停下来写日记记录“刚才往哪走了”,写累了(字数用光了)就放弃,哪怕其实路就在眼前。

4. 为什么有些 AI 特别笨?(视觉提取的失败)

研究发现,像 Claude 这种模型,得分特别低(只有 2%-6%),并不是因为它们不会“数数”,而是因为它们的**“翻译”环节太烂了**。

  • 实验:研究人员直接把正确的文字表格(迷宫地图)发给 Claude,不让它看图。
  • 结果:Claude 的得分瞬间从 6% 飙升到 80%
  • 结论:原来它不是不会解题,而是连地图都认错了(比如把 8x8 的迷宫看成 10x10,或者把墙看成了路)。一旦给它正确的地图,它也能靠“暴力数数”解出来。

5. 遇到大迷宫就“死机”

当迷宫变得特别大(20x20)时,AI 的“暴力数数”策略就崩了。

  • 因为路太长,AI 还没数完,它的“思考墨水”(Token 限制)就用光了。
  • 这时候,AI 会直接放弃,并错误地告诉你:“这条路不通!”
  • 比喻:就像一个人背着砖头走迷宫,走到一半砖头太重背不动了,他干脆说:“前面肯定没路,我累了,不走了。”而人类早就轻松走出去了。

6. 模型越大越聪明吗?

论文还发现了一个反直觉的现象:模型越大,并不代表它更擅长“看”路。

  • 最大的模型(Claude Opus)和最小的模型(Claude Haiku)在走迷宫上的表现几乎一样差(都只有 4% 左右)。
  • 这说明,“空间规划能力”并不是随着模型变大自动变出来的“超能力”。

总结:我们被“高分”骗了吗?

这篇论文的核心观点是:不要只看 AI 的得分高低。

  • 现在的 AI:虽然能解出很多迷宫,但它们是靠**“把图片变文字,然后暴力试错”**这种笨办法做到的。这就像是用计算器算"1+1",虽然算对了,但过程极其低效,而且一旦题目变复杂(路变长),计算器就会算不过来。
  • 真正的智能:应该像人类一样,拥有直观的空间感知能力,一眼就能看出路在哪里,而不是靠死记硬背和穷举。

一句话总结
现在的 AI 在走迷宫时,就像是一个拿着放大镜、一边读说明书一边数步数的机器人。虽然它偶尔能走到终点,但它并没有真正“理解”迷宫,也没有学会像人一样“看”路。如果未来的 AI 不能学会“看”路,它们在面对更复杂的视觉任务时,依然会撞墙。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →