← 最新论文
🤖 AI

StemBind: When MLLMs Get Lost Between Rules and Instances in Abstract Visual Reasoning

该论文介绍了 StemBind,这是一个诊断基准,它揭示了多模态大语言模型中存在的一种持续性的“绑定差距”(binding gap),即尽管模型能够正确识别视觉规则,但在进行抽象视觉推理时,却经常无法将这些规则映射到具体的实例上,而这一局限性是目前模型规模扩展或显式思维模式都无法解决的。

原作者: Xixiang He, Baiqi Wu, Xingming Li, Ao Cheng, Qiyao Sun, Xuanyu Ji, Qingyong Hu

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Xixiang He, Baiqi Wu, Xingming Li, Ao Cheng, Qiyao Sun, Xuanyu Ji, Qingyong Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在参加一项非常棘手的视觉逻辑测试,就像那种用来衡量人类智力的测试(想想瑞文标准推理测验)。你看着一个形状网格,推导出连接它们的隐藏规则,然后选出能完成该模式的正确部件。

现在,想象一个超级聪明的 AI 正在参加这项测试。这里有一个奇怪的现象,STEMBIND 论文发现了:AI 通常能完美掌握规则,但仍然会选错答案。

这就像一个学生能够背诵出整个教科书上的数学公式定义并解释其原理,但在将数字代入公式以得出最终结果时却失败了。

以下是研究人员发现的详细分解,使用了简单的类比:

1. 问题所在:“翻译丢失”的鸿沟

目前的 AI 测试通常只看最终答案:“是对还是错?”这就像老师在批改数学试卷时,只看最终的数字,而忽略了学生是否真正理解了步骤。

研究人员构建了一个名为 STEMBIND 的新测试,旨在观察 AI 的“大脑内部”。他们就同一个谜题询问了 AI 三个问题:

  1. 感知 (Perception): “你看到了哪些形状?”(你能看到原材料吗?)
  2. 规则 (Rule): “规律是什么?”(你知道食谱吗?)
  3. 完整 (Full): “哪一个部件能完成这个谜题?”(你能做出这道菜吗?)

令人震惊的发现:
在测试的 24 个不同 AI 模型中,有 22 个出现了这种情况:AI 可以正确描述形状,也能正确命名规则。但当被要求选择最终答案时,它却失败了。

  • 类比: 想象一位厨师可以完美地描述蛋糕食谱并列出每一种原料,但当被要求烘焙蛋糕时,他却把蛋糕倒着放进了烤箱。他了解“理论”,但无法将该理论“绑定”到烘焙的具体动作上。

2. 特定罪魁祸首:“映射”步骤

研究人员根据一个著名的心理学理论,将思考过程分解为四个步骤:

  • S1 (编码/Encode): 看到形状。
  • S2 (推理/Infer): 得出规则。
  • S3 (映射/Map): <--- 问题所在 将规则与特定的答案选项联系起来。
  • S4 (应用/Apply): 选择最终答案。

他们发现 AI 卡在了 S3 阶段。这就像手里拿着地图和目的地,却忘记了哪条街道通向哪栋建筑。AI 知道规则是“旋转 90 度”,但当面对四个选项时,它无法判断哪一个是旋转后的结果。

3. 什么方法不起作用?

论文测试了人们认为可以提升 AI 能力的两种常见方式:

  • 扩大 AI 规模 (Scaling): 他们尝试使用更大、更强大的 AI 版本。
    • 结果: 更大的 AI 变得更擅长观察形状和命名规则,但它仍然无法选出正确的最终答案。这就像给学生一个更大的图书馆;他们知道更多的事实,但仍然无法解决特定的问题。
  • 让 AI “思考” (Thinking Mode): 他们让 AI 在回答之前写下自己的思考过程(类似于展示解题步骤)。
    • 结果: 这反而让情况变糟了。AI 描述图像的能力变强了,但在识别规则和选择最终答案方面却变弱了。
    • 类比: 这就像一个学生在解题时开始自言自语。他能把图像描述得非常优美,但过多的自我对话让他如此困惑,以至于他忘记了规则并选错了答案。

4. 为什么这很重要

论文认为,我们不能仅仅通过最终得分来对 AI 模型进行排名。我们需要诊断它们是在哪里崩溃的。

核心结论是,当今顶尖的 AI 模型擅长观察理解规则,但它们在将这些规则应用于特定实例时表现糟糕。它们在“知道规则”与“选择答案”之间产生了“迷失”。

简而言之:AI 并不是“瞎了”,也不是在逻辑上“笨拙”。它只是在试图将已知规则转化为具体选项的“翻译”步骤中出现了故障。修复这种“绑定”差距,是 AI 研究人员面临的下一个重大挑战。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →