← 最新论文
🤖 AI

The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark

KnotBench 引入了一个使用近 86 万张结图的严格基准,以证明当前的视觉 - 语言模型尽管在“思考”模式下性能有所提升,但在将视觉结结构转化为可操作的符号推理方面仍存在根本性困难,在需要图解操作的任务中往往无法超越随机基线。

原作者: Hao Liu, Jicheng Liu

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Hao Liu, Jicheng Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明的机器人,它可以观察一张纠缠绳结的图片并完美地描述它。它可以说:“我看到一个红色的环交叉在一个蓝色的环之上,随后这个蓝色环从绿色环下方穿过。”它的视力极佳。

但关键在于:如果你让同一个机器人去解开绳结,或者判断两张不同图片中的绳结是否实际上是同一个绳结只是画法不同,它会完全失败。它可以描述绳结,却无法在脑海中“操作”它。

这篇题为《视觉语言模型的戈尔迪之结》的论文,引入了一项名为 KnotBench 的新测试,旨在证明现代人工智能模型在“看”与“做”之间究竟存在多大的鸿沟。

实验设置:数字绳结花园

研究人员创建了一个包含 858,000 张绳结图片的巨大“花园”。

  • 来源:他们从 1,951 个基本的“原型”绳结(绳结理论中最简单的构建模块)开始。
  • 魔法:他们利用一条数学规则(称为雷德迈斯特移动)将这些绳结扭曲、旋转并重新绘制数千次。
  • 结果:你可能拥有一张具有 3 个交叉点的简单“三叶结”图片,以及另一张完全相同绳结但具有 20 个交叉点、看起来截然不同的图片。或者,你可能拥有两张看起来几乎相同但实际上是不同的绳结的图片(就像左手手套与右手手套)。

计算机知道每一个绳结的“真实身份”,因为它是通过数学而非人类猜测生成的。这使得测试绝对公平。

测试:14 种陷入困境的方式

研究人员要求当时最聪明的四个 AI 模型(包括 Claude Opus 4.7 和 GPT-5)执行 14 项不同的任务。他们将任务分为两组,以观察 AI 在何处崩溃:

  1. “图像”组:AI 观察绳结的图片。
  2. “文本”组:AI 观察描述绳结的数字和字母列表(代码)。

以下是他们要求 AI 完成的任务,使用了简单的类比:

  • “相同还是不同?”测试(A 族):“这两张图片是同一个绳结吗?”

    • 陷阱:有时图片看起来完全不同,但却是同一个绳结;有时它们看起来几乎一模一样,但实际上是不同的绳结。
    • 结果:当给定文本代码时,AI 在这项任务上表现出色。当给定图片时,它则像猴子扔飞镖一样随机猜测。
  • “发生了什么?”测试(B 族):“我给你看一个绳结,然后我做了一个小动作(比如添加一个环)。我做了哪个动作?”

    • 陷阱:这需要 AI 在脑海中模拟该动作。“如果我在这里拉动这根绳子,图片会变成什么样?”
    • 结果:当给定文本代码时,AI 能够找出答案。当给定图片时,它惨败。其中一个模型(GPT-5)只是反复猜测最常见的答案("R3"),就像一个背下了答案键却未学会数学的学生。
  • “计数”测试(C 族):“绳子交叉了多少次?”

    • 结果:AI 可以轻松数出 8 个交叉点。但一旦绳结变得复杂(17 个以上交叉点),AI 的计数就彻底混乱了。它甚至无法数清它正在观察的物体。
  • “翻译”测试(D 族):“这是一张图片。写下它的秘密代码。”

    • 结果。没有任何一个模型能做到这一点。即使开启“思考”模式,它们也无法将视觉图片翻译成数学代码。

重大发现:“感知 - 操作鸿沟”

该论文将这一失败点称为“感知 - 操作鸿沟”。

可以这样理解:

  • 感知是看着地图说:“我看到一条河和一座桥。”
  • 操作是看着同一张地图说:“如果我走过这座桥,我就会到达另一边。”

AI 模型在感知方面令人惊叹。它们可以描述绳结。但它们在操作方面表现糟糕。它们无法将所见之物在脑海中进行操纵以解决问题。

“思考”有帮助吗?

研究人员开启了 AI 的“思考模式”(即模型在回答前与自己对话)。

  • 有帮助吗? 是的,但只是一点点。
  • 在哪里有帮助? 仅当 AI 被给予文本代码时。如果 AI 必须先观察图片,“思考”也无法解决问题。这就像给一个无法读取屏幕上数字的人一台计算器;计算器毫无用处。

结论

该论文得出结论:当前的 AI 模型就像不会修车的摄影师。它们可以拍摄绳结的完美照片并描述每一个细节,但它们缺乏人类用来在脑海中扭转和转动物体以理解其工作原理的内部“模拟器”。

它们能看到绳结,但无法对其采取行动。在 AI 构建出这种内部“心理模拟器”之前,无论它看过多少张图片,它对于图表逻辑仍将视而不见。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →