← 最新论文
🤖 AI

MentisOculi: Revealing the Limits of Reasoning with Mental Imagery

该论文介绍了 MentisOculi,这是一个基准测试套件,它证明了尽管视觉推理具有潜力,但当前的统一多模态模型由于复合生成错误以及无法有效利用视觉辅助工具,无法通过中间可视化过程来提升性能。

原作者: Jana Zeller, Thaddäus Wiedemer, Fanfei Li, Thomas Klein, Prasanna Mayilvahanan, Matthias Bethge, Felix Wichmann, Ryan Cotterell, Wieland Brendel

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Jana Zeller, Thaddäus Wiedemer, Fanfei Li, Thomas Klein, Prasanna Mayilvahanan, Matthias Bethge, Felix Wichmann, Ryan Cotterell, Wieland Brendel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试解决一个复杂的谜题,比如一个滑块游戏或一个折纸技巧。你知道人类通常通过闭上眼睛在脑海中“看到”零件移动的方式来解决这些问题。我们称之为心理表象(mental imagery)

最近,先进的 AI 模型在阅读文本和生成图像方面都变得非常出色。这引发了研究人员的一个重大疑问:这些 AI 能否像人类一样,利用它们自己的“心理表象”来辅助思考和解决问题?

为了找出答案,这篇论文的研究者创建了一个新的测试场,名为 MENTISOCULI(其含义大致为“心眼”)。

测试:AI 的心理健身房

研究人员构建了五种不同类型的谜题,这些谜题很难用文字描述,但如果能将其视觉化,则很容易解决。把它们看作是大脑的健身房:

  1. 形状板(Form Board): 将拼图块放入特定的形状中。
  2. 铰链折叠(Hinge Folding): 通过旋转相连的形状来匹配目标。
  3. 折纸(Paper Fold): 预测纸张折叠并冲孔后孔洞会出现的位置。
  4. 塞车游戏(Rush Hour): 通过移动车辆来走出交通堵塞。
  5. 滑块谜题(Sliding Puzzle): 重新组合一张被打乱的图片。

这些谜题难度递增,需要更多的步骤和更复杂的心理“动作”。

实验:让 AI 用图片进行“思考”

研究人员测试了目前最智能的 AI 模型。他们给了模型一个选择:

  • 旧方法: 仅使用文字解决谜题(就像人类通过语言进行逻辑推理)。
  • 新方法: 通过生成中间图像来解决谜题。AI 会在决定下一步行动之前,先在脑海中(或屏幕上)“画出”谜题的下一步。

这就像是要求一名棋手,要么只在脑中构思招式,要么在每走一步之后都要实际画出棋盘,以帮助其规划。

重大发现:绘画目前并无帮助

结果令人惊讶。尽管这些模型拥有创造精美图像的能力,但生成自己的“心理图像”并没有帮助它们解决谜题。事实上,这往往会让它们的表现变得更差。

以下是原因,通过一些简单的类比:

1. “幻觉艺术家”问题
想象一位艺术家,他很擅长画出一辆单独的汽车,但当被要求画出一个车辆逐一移动的交通堵塞场景时,他会不断忘记前一帧中汽车的样子。他可能会增加一辆原本不存在的新车,让一辆车凭空消失,或者改变出口标志的颜色。
研究发现,当 AI 模型尝试生成这些“思考图像”时,它们在每一步都会产生微小的误差。到了最后一步时,图像已经变得如此扭曲和错误,以至于 AI 无法信任它。这就像是试图用一张每次观察时墙壁都在变化的地图来通过迷宫。

2. “双脑”问题
研究人员发现,AI 的“文本脑”(其利用文字进行推理的能力)和“图像脑”(其绘画的能力)之间无法沟通。

  • 文本脑如果仅仅依靠逻辑,有时可以找到正确答案。
  • 图像脑有时可以画出正确的图片。
  • 但当 AI 试图利用图片来辅助文本脑时,它们就产生了混乱。文本脑会忽略图片,或者图片显示的解决方案与文本完全不同。它们就像两个试图朝不同方向驾驶船只的人。

3. “先知”测试
为了观察问题出在“绘画”还是“理解”上,研究人员给了 AI 完美的、真实的图像(就像是一份显示正确下一步的“标准答案”)。即使面对这些完美的图片,AI 仍然难以利用它们来解决谜题。这证明了 AI 不仅仅是画得不好,它在利用视觉信息进行决策方面也存在困难。

人类对比

研究人员还要求人类学生解决这些谜题。

  • 人类: 当谜题变得更难时,人类会花费更多时间思考并采取更多步骤来解决。他们会调整自己的投入程度。
  • AI: 当谜题变得更难时,AI 并不会改变策略。它不会投入更多的“思考时间”(token),也不会更加努力。它只是以同样的方式持续失败。

核心结论

论文得出结论:虽然让 AI 利用“心理表象”进行思考的想法非常吸引人,但目前的技术水平尚未准备好。

这些模型就像是一个既能完美描述汽车,又能完美画出汽车,但如果你要求他一步步画出汽车在交通堵塞中行驶的过程时,他就会失去对规则的掌控。他们目前还无法弥合生成图像与利用图像进行推理之间的鸿沟。

目前来看,对于复杂的推理任务,这些 AI 模型最好还是坚持使用文字。它们的“心眼”虽然已经睁开,但还不足以清晰地观察,从而辅助大脑进行思考。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →