← 最新论文
🤖 AI

Human-Level Reasoning: A Comparative Study of Large Language Models on Logical and Abstract Reasoning

本研究通过八个定制设计的题目,评估并比较了九种主流大语言模型的逻辑与抽象推理能力与人类表现的差异,揭示了这些模型在演绎能力方面存在的显著差距。

原作者: Benjamin Grando Moreira

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Benjamin Grando Moreira

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个装满了才华横溢的图书管理员的房间。这些图书管理员(即大语言模型,或称 LLM)读遍了世界上几乎所有的书。他们可以背诵事实、撰写诗歌,并比任何人都更快地进行翻译。但本文提出的问题是:它们真的“理解”它们正在阅读的内容吗,还是仅仅非常擅长猜测句子中的下一个词?

为了找出答案,作者 Benjamin Grando Moreira 搭建了一个“逻辑健身房”,并邀请了 15 位这样的数字图书管理员与一群人类学生和教授进行竞争。

以下是利用一些日常比喻对发生过程进行的简单拆解。

测试:是一个谜题盒,而不是常识问答

研究人员并没有问模型“谁是第一任总统?”(因为它们可以通过记忆回答这个问题),而是给了它们 8 个棘手的谜题。这些谜题就像是谜语,要求模型去推导隐藏的规则,而不仅仅是回忆事实。

可以这样理解:

  • 人类大脑就像一名侦探,观察线索、连接点滴,然后说:“啊哈!我看到规律了!”
  • AI 大脑则像一台超快速的模式匹配机器,它会说:“我以前见过这个词,所以我根据通常会出现的后续内容来猜测下一个词。”

8 项挑战(“障碍赛”)

论文测试了模型在以下方面的能力:

  1. 星期几的谜题: 如果 “SUN + 1 = MON”,那么 “TUE + 2” 是多少?(大多数模型都答对了,但有些会被缩写搞混。)
  2. 大象之歌: 一个滑稽的模式,其中“bother”这个词出现的次数会根据大象的数量是奇数还是偶数而改变。人类能轻松看出规律;许多 AI 则在重复性上卡住了。
  3. 秘密代码: 一个简单的字母偏移(比如 A 变成 B)。大多数模型破解了它,但有些在大小写上出了错。
  4. 陷阱数学题: “3 + 3 x 5 等于多少?” 正确答案是 18。但测试给出的选项包括 16、20、30 和 45。18 甚至不在选项中!
    • 转折点: 许多模型(以及一些人类)都感到困惑。它们看到数学计算是对的,但选项是错的,于是有些模型只是选择了“最接近”的错误答案,而不是说:“嘿,这些都不对。”
  5. 月份之谜: 这是最难的一个。它要求寻找月份“May”的隐藏代码。该代码涉及将月份数字平方(5 的平方 = 25)并计算单词“May”中的字母数(4 个字母),然后将它们拼接在一起得到 254
    • 结果: 人类表现尚可,但 AI 大多失败了。它们试图使用并不符合逻辑的复杂数学公式,而不是发现那个简单的“把数字拼在一起”的小技巧。
  6. 语言切换: 将葡萄牙语的月份缩写与西班牙语名称进行匹配。如果人类不懂西班牙语,他们会在这里遇到困难;但 AI(因为精通多种语言)在这方面表现出色。
  7. 双语日: 混合了英语和葡萄牙语的星期,并包含一个关于何时切换语言的隐藏规则。人类和 AI 在这里都觉得很难。
  8. 二进制代码: 将看起来像十进制(如 1000)但实际上是二进制(base-2)的数字相加。只有最聪明的模型意识到:“等等,这些不是普通的数字!”并解决了问题。

计分板:谁赢了?

研究人员根据以下标准给分:

  • 10 分: 得到正确答案。
  • 5 分: 逻辑正确,即使最终数字错误。
  • 0 分: 答错或放弃。

结果:

  • 人类: 教授们(专家)整体表现最好,尤其是在处理棘手的谜题时。学生们表现不错,但在抽象谜题上稍显吃力。
  • AI: 平均而言,AI 获得了约 73 分(满分 100),而人类获得了约 70 分
    • 等等,难道 AI 赢了吗? 是的,仅以微弱优势领先!但问题在于:AI 在简单的任务上(如了解不同语言中的月份)表现极佳,但在奇怪的、抽象的任务上(如大象之歌或隐藏数字代码)表现极差
    • 最好的 AI 模型(如 GPT-4o 和 Claude)得分接近完美,但较弱的模型(如 Sabiá 3)得分非常低。

核心结论

论文得出结论,这些 AI 模型就像是才华横溢的鹦鹉。它们可以模仿人类对话并完美解决标准问题。然而,当你要求它们跳出框架思考、发现奇怪的模式或意识到问题是一个陷阱时,它们往往会跌倒。

  • 人类更擅长“流体智力”——即在变化中即时推导新规则的能力。
  • AI更擅长“晶体智力”——即利用它们已经记忆的海量数据。

这项研究表明,尽管 AI 在交谈方面变得极其出色,但它们尚未完全掌握像人类那样“思考”的艺术,尤其是在规则隐藏或不寻常的情况下。AI 仍然主要是在基于以往见过的经验进行猜测,而不是真正理解谜题背后的逻辑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →