← 最新论文
💬 NLP

Do AI Models Perform Human-like Abstract Reasoning Across Modalities?

本文表明,仅凭准确率来评估人工智能的抽象推理能力是具有误导性的,因为这会高估模型在依赖表面特征捷径的文本任务中的能力,并低估它们在视觉任务中的表现,因为在这些任务中,尽管模型未能正确应用抽象概念,但往往已经掌握了其意图。

原作者: Claas Beger, Ryan Yi, Shuhao Fu, Kaleda Denton, Arseny Moskvichev, Sarah W. Tsai, Sivasankaran Rajamanickam, Melanie Mitchell

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Claas Beger, Ryan Yi, Shuhao Fu, Kaleda Denton, Arseny Moskvichev, Sarah W. Tsai, Sivasankaran Rajamanickam, Melanie Mitchell

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位正在给学生出谜题的老师。这个谜题展示了模式变化的几个例子(比如“把红色的方块向左移动”),然后要求学生将同样的规则应用到一个新的、未见过的图片上。

长期以来,我们一直通过一个“计分卡”来测试 AI 处理这些谜题的能力,这个计分卡只计算 AI 正确得出最终答案的次数。如果 AI 给出了正确的图片,我们就给它一个 A+。

这篇论文提出了一个更深层的问题:AI 到底是真的理解了“规则”,还是仅仅通过发现某种奇怪的技巧而“撞了大运”?

以下是研究人员发现的过程,用简单的语言解释如下:

1. 两种测试方式

研究人员用两种不同的方式测试了顶尖的 AI 模型(如 OpenAI 的 o3、Claude 和 Gemini):

  • 文本模式: 他们将谜题以数字和单词列表的形式喂给 AI(例如:“网格 1 在 2,2 处有一个红方块……”)。
  • 视觉模式: 他们直接向 AI 展示了谜题的实际图片,就像人类看到的那样。

2. “文本”带来的惊喜:高分,但理解浅薄

当 AI 以文本模式参加测试时,它的表现极其出色。事实上,最强的 AI(o3)甚至得到了比人类平均水平更高的分数。

但问题在于: 研究人员要求 AI 解释它是如何解开谜题的。

  • 人类通常会使用真实的逻辑概念来解释,比如“移除顶部和底部的物体”。
  • AI 的解释往往在技术上对特定的示例是正确的,但却忽略了大局。

类比: 想象一个学生在参加数学考试。老师问:“2 + 2 等于几?”学生回答:“4。”老师问:“你是怎么算出来的?”学生说:“我看了看时钟,指针指在 4 的位置,所以我猜是 4。”
答案是对的,但推理过程是一个“捷径”。AI 一直在做这种事。它是在捕捉数字中偶然出现的模式(比如“红色总是数字 3,所以我要移除数字 3”),而不是理解“物体”这个概念。

结论: 在文本模式下,AI 的高分高估了它的真实智能。它擅长于猜测,但并不总是擅长推理。

3. “视觉”带来的惊喜:低分,但隐藏的天才

当研究人员切换到视觉模式(展示图片)时,AI 的得分大幅下降。它出错的频率比人类高得多。

然而,研究人员再次查看了 AI 的解释。
他们发现了一些令人惊讶的事:即使 AI 得出的最终图片是错的,它对规则的解释往往却是正确的!

类比: 想象一位才华横溢的建筑师,可以完美地描述如何建造一座房子(“把砖块围成一圈,然后加上屋顶”)。但是,当他们实际动手铺砖时,却总是掉砖或者放错位置,因为他们的手很笨拙。
视觉模式下的 AI 就像这位建筑师。它完美地理解了抽象概念(即“规则”),但它在“看”图片方面遇到了困难。它无法准确判断网格的大小或物体的位置。

结论: 在视觉模式下,AI 的低分低估了它的真实智能。它实际上理解逻辑,只是在执行“感知”任务时失败了。

4. “工具”效应

研究人员还给了 AI 一个“计算器”(Python 代码)来提供帮助。

  • 在文本模式下: 计算器并没有起到太大作用。AI 本身已经擅长逻辑,但它依赖的是捷径。
  • 在视觉模式下: 计算器帮助很大。当 AI 可以使用代码来“观察”图像并统计像素时,它的得分上升了。这证明了 AI 在逻辑上并不“愚蠢”;它只是需要帮助来“看清”图片。

核心启示

如果你只看最终得分(那个“A+”),你可能会认为 AI 在文本模式下是天才,而在视觉模式下是失败者。

但当我们观察它们的思考方式时:

  • 在文本模式下: 它们经常利用聪明的捷径进行“作弊”,而这些捷径在现实世界中并不适用。
  • 在视觉模式下: 它们是“笨拙”的天才,理解规则,但执行起来有些吃力。

该论文的结论是,要真正了解 AI 是否正在变得“像人一样”,我们不能只检查答案是否正确。我们必须同时检查其推理过程是否正确。否则,我们要么过度吹捧了它们的文本能力,要么低估了它们的视觉潜力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →