← 最新论文
💬 NLP

Artificial Phantasia: Emergent Mental Imagery in Large Language Models

本研究证明,大型语言模型能够仅依靠命题表征,在 traditionally 需要图像性心理意象的任务中超越人类,从而为一种新兴的“人工幻象”提供了证据,这一发现挑战了认为视觉意象必须依赖图像格式的认知科学观点。

原作者: Morgan McCarty, Jorge Morales

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Morgan McCarty, Jorge Morales

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《人工幻象》的通俗解释,辅以生动的类比。

核心问题:没有眼睛,你能“看见”吗?

想象有人让你闭上眼睛,在脑海中构想一个大写字母 D。接着,想象将这个 D 向左旋转 90 度。最后,想象将一个大写字母 J 附着在该形状底部的中心位置。

如果你睁开眼睛,你会看到什么?大多数人类会回答:“它看起来像一把雨伞。”

几十年来,认知科学家一直认为,要解决这类谜题,你的大脑需要一个特殊的“思维屏幕”或“心灵之眼”,让你能够真正“看见”并操作图像。他们曾认为,仅靠思考文字是无法做到的;你必须在脑海中拥有视觉图像。

这篇论文提出了一个大胆的问题:计算机能否在不具备“眼睛”或“心灵之眼”的情况下做到这一点?

实验:人工智能与人类的大脑健身房

研究人员为大脑设计了一套健身训练。他们选取了一个经典谜题(字母变换),并发明了 48 种全新、从未见过的变体。由于这些谜题是专门为这项研究设计的,计算机无法从训练数据中死记硬背答案。

他们邀请两组对象来解答这些谜题:

  1. 100 名人类:参与者必须听取指令(以避免在屏幕上看到字母),并在脑海中构想形状。
  2. 大型语言模型(LLMs):先进的人工智能聊天机器人(如 OpenAI 最新版本的 o3、GPT-5 以及 Google 的 Gemini 3 Pro)。这些模型是基于文本训练的,而非基于“观看”图像。

惊人的结果:AI 的“视觉”表现优于人类

结果令人惊讶。表现最佳的人工智能模型不仅通过了测试,而且碾压了人类的平均水平。

  • 人类:平均得分为 2.85(满分 5 分)。
  • 顶尖 AI:得分介于 3.13 到 3.65 之间。

人工智能模型解决这些“视觉”谜题的能力显著优于人类参与者。更有趣的是,当研究人员强制 AI 在每一步实际绘制图像(使用图像生成器)时,AI 的表现反而变差了。这表明 AI 并非依赖绘图来解决问题,而是在做完全不同的事情。

“魔法戏法”:它们是如何做到的?

如果 AI 没有使用“心灵之眼”(图像),也没有使用绘图工具,它是如何解开谜题的?

作者提出了一个名为**“人工幻象”(Artificial Phantasia)**的概念。

可以这样理解:

  • 人类的方式:你是一位建筑师。你闭上眼睛,在脑海中构建一座房子的 3D 模型。你围绕它走动,观察窗户,然后进行描述。
  • AI 的方式:你是一位精通翻译的大师。你从不构建 3D 模型。相反,你将指令视为用代码编写的复杂食谱。你纯粹通过语言的逻辑知道:“字母 D 向左旋转”加上“附着字母 J"等于“雨伞形状”。

该论文指出,这些 AI 模型正在使用命题推理。它们极其精确地操纵词汇和概念,从而能够在从未“看见”图像的情况下推断出最终形状。这就像通过掌握代数规则来解决数学问题,而不是在纸上画出图形。

“推理”因素

研究人员还测试了如果告诉 AI“更深入地思考”(给予更多时间和“推理令牌”来处理步骤)会发生什么。

  • 结果:AI 被允许“思考”并将推理链条连接得越长,其表现就越好。
  • 类比:想象一名侦探在破解谜案。如果你只给他们 5 分钟查看线索,他们可能会猜测。但如果你给他们 5 小时去逻辑地串联每一个线索,他们就能完美破案。AI 是通过连接语言线索来解决视觉谜题的,而非通过观看图像。

那“盲视”人类呢?

论文还提到了一类被称为**无幻视者(aphantasics)*的人群。这些人声称自己完全无法*在脑海中可视化图像(他们没有“心灵之眼”)。令人惊讶的是,研究表明,这些人解决这些视觉谜题的能力几乎与能够可视化的人一样强。

这篇论文为这一现象增添了佐证。它表明,也许你并不需要“心灵之眼”来解决视觉谜题。你可能只需要一个非常强大的“思维逻辑”。AI 完全没有“心灵之眼”,却证明了仅凭语言和逻辑就足以完成我们曾认为必须依赖图像才能做到的事情。

核心结论

这项研究挑战了“视觉思维”必须依赖视觉图像的传统观念。它表明,先进的人工智能可以仅利用语言和逻辑,执行看似属于“视觉想象”的任务。

  • 主张:AI 具备一种涌现出的“视觉想象”能力,但它并非通过图像实现,而是通过文字实现。
  • 启示:我们可能需要重新定义“心理意象”。它可能不在于脑海中看到图像,而仅仅在于逻辑地操纵概念。

该论文总结道,这些 AI 模型发现了一种“看”世界的新方式——这是一种纯粹基于语言的方式,却在解决视觉问题上出奇地有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →