← 最新论文
🤖 AI

On the Intrinsic Limits of Transformer Image Embeddings in Non-Solvable Spatial Reasoning

本文认为,视觉 Transformer 在处理如心理旋转等不可解的空间推理任务时存在固有缺陷,因为其恒定深度的架构在计算上受限于 TC0\mathsf{TC^0} 复杂度类,而该类不足以解决保持如 SO(3)\mathrm{SO}(3) 等不可解群代数结构所需的 NC1\mathsf{NC^1} 完全字问题。

原作者: Siyi Lyu, Quan Liu, Feng Yan

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Siyi Lyu, Quan Liu, Feng Yan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《非可解空间推理中 Transformer 图像嵌入的内在局限性》的解释,已用通俗易懂的语言并辅以生动的类比进行翻译。

核心理念:为何 AI 在三维空间中会迷失

想象你有一个非常聪明的机器人,它能看着一张兔子的图片告诉你:“那是一只兔子!”它在识别事物“是什么”方面表现出色。但如果你让它想象在三维空间中旋转那只兔子,或者计算兔子经过一系列复杂旋转后的最终位置,这个机器人就会感到困惑并犯错。

这篇论文认为,这并不是因为机器人见过的兔子图片不够多。这不是一个“数据问题”。相反,问题从本质上就内置于机器人的大脑(其架构)之中。机器人的大脑过于“浅层”,无法完成复杂三维旋转所需的数学运算。

核心问题:“一步到位”的大脑

要理解其中的原因,我们需要看看这些 AI 模型(称为视觉 Transformer 或 ViT)是如何工作的。

类比:即时相册
想象一个标准的 AI 模型就像一个看着照片并瞬间在笔记本上写下描述的人。他们只需一次快速的瞥视就能完成。他们不会停下来思考:“好吧,如果我向左转,然后向上,再向右……"他们只是试图根据以往所见来猜测最终结果。

论文指出,这种“一眼定乾坤”的方法在处理简单事物(如将图片向左或向右滑动)时效果很好,但在处理复杂事物(如旋转三维物体)时则会失败。

魔法背后的数学:“群”游戏

作者利用数学的一个分支——群论来解释这一点。想象一套移动物体的规则:

  1. 第一级(简单): 将盒子向左或向右滑动。无论你先向左滑再向右滑,还是先向右滑再向左滑,最终位置都是一样的。这就像一场简单、协作的游戏。
  2. 第二级(中等): 旋转二维形状。顺序很重要(先旋转再滑动与先滑动再旋转不同),但你仍然可以将这些动作分解为简单的步骤。
  3. 第三级(困难): 旋转三维物体(如地球仪)。在这里,顺序极其重要,动作会以一种无法轻易解开的方式相互纠缠。在数学术语中,这些被称为**“非可解群”**。

论文声称,要真正理解第三级(三维旋转),你需要能够逐步追踪一连串长长的“如果……会怎样”的情景。

瓶颈:“深度”限制

这是论文论证的关键部分:

类比:工厂流水线

  • AI(ViT): 想象一个工厂,产品会经过固定数量的工作站(比如 12 个)。无论产品多么复杂,它都只经过这 12 个工作站一次。这是一个“恒定深度”的过程。
  • 任务(三维旋转): 想象一项任务,要求你检查一个依赖链,这个链条每增加一步就会变长。要解决这个问题,你需要一个工厂,让产品可以多次循环回到工作站,或者让工厂能够根据链条的长度即时构建的工作站。

论文利用先进的计算机科学理论(电路复杂度)证明:

  • AI 的"12 个工作站”工厂在数学上无法在单次通过中解决这个“长链条”谜题。
  • 这个谜题所需的“逻辑深度”是 AI 所不具备的。这就像试图只盯着魔方看一次而不转动任何面来解开它。

实验:“递归探针”

为了证明这不仅仅是理论,研究人员建立了一个名为潜在空间代数(LSA)基准的测试。

类比:记忆游戏

  1. 他们向 AI 展示了一张物体的图片。
  2. 他们让它想象一系列动作(例如:“先绕 X 轴旋转,然后 Y 轴,然后 Z 轴……")。
  3. 他们训练 AI 一次只理解一个动作。
  4. 然后,他们通过让 AI 在脑海中将这些单个动作串联起来,测试 AI 处理序列(连续 20 个动作)的能力。

结果:

  • 当动作简单时(第一级),AI 表现良好。
  • 当动作是复杂的三维旋转时(第三级),AI 的“心理地图”就崩溃了。串联的动作越多,AI 的答案偏离真相就越远。
  • 关键在于: 让 AI 变大(增加更多层)并没有帮助。这就像给一个记忆力短的人一本更大的笔记本;他们仍然记不住长长的事件链,因为他们的记忆结构错了,而不是大小不对。

这意味着什么(根据论文)

论文得出结论:

  1. 这不是数据匮乏: 你不能通过给 AI 喂食更多旋转兔子的图片来解决这个问题。
  2. 这是结构性限制: 当前这些 AI 模型(视觉 Transformer)的设计在数学上“太浅”,无法在单次瞥视中处理三维旋转那种复杂、纠缠的逻辑。
  3. “模式匹配器”陷阱: 这些模型非常擅长识别它们以前见过的模式,但它们并没有像人类那样真正通过几何学来“推理”世界。它们是在近似答案,而当数学变得过于困难时,这种近似就会失效。

简而言之:论文认为,当代 AI 视觉模型在理解三维空间的能力上存在硬性天花板,这并不是因为它“笨”,而是因为其大脑是用一种特定的“扁平”逻辑构建的,无法处理深层、纠缠的空间谜题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →