← 最新论文
💬 NLP

The Riddle Riddle: Testing Flexible Reasoning in Large Language Models and Humans

本文引入了“谜语谜语”(riddle riddle)范式,旨在证明虽然人类能够根据问题内容灵活调整其推理策略,但大型语言模型往往依赖模式匹配和表面特征,导致它们在处理字面意义上的问题时会不恰当地应用创造性推理,并由此表明其在真正谜题上的强劲表现可能源于记忆检索而非灵活推理。

原作者: Bella Fascendini, Kathryn McGregor, Max D. Gupta, Thomas L. Griffiths

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Bella Fascendini, Kathryn McGregor, Max D. Gupta, Thomas L. Griffiths

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在玩一个必须通过解谜来通关的游戏。有些谜题是需要打破常规思维的棘手谜语,而另一些看起来完全像谜语,实际上却只是伪装起来的简单数学题。

这篇论文介绍了一种新的方法,用来测试人工智能(大语言模型)与人类相比,其真实智能水平究竟如何。他们称之为**“谜语中的谜语”(Riddle Riddle)范式**。

以下是他们所做工作的简单拆解以及他们的发现:

实验设置:“陷阱” vs. “字面意思”

研究人员创建了两类在表面上看起来几乎完全相同的题目:

  1. 真正的谜语(陷阱型):
    • 示例: “一个牛仔在周五骑马进入小镇,在那里停留了三天,然后在周五骑马离开。这怎么可能?”
    • 答案: 你必须意识到“Friday”(周五)是他的马的名字,而不是星期几。这需要创造性思维
  2. “谜语中的谜语”(字面型):
    • 示例: “一个牛仔在周五骑马进入小镇,在那里停留了三天,然后在周一骑马离开。这怎么可能?”
    • 答案: 这只是简单的数学。周五 + 3天 = 周一。不需要任何陷阱。这需要字面思维

关键在于,这两个问题看起来是一样的。它们拥有相同的句子结构和节奏。唯一的区别在于是否真的需要一个“陷阱”。

实验过程

研究人员让两组人来解决这些问题:

  • 第一组: 当今最强大的九个 AI 模型(如 GPT-5、Claude、Gemini 等)。
  • 第二组: 100 名成年人类。

结果:完美的反转

结果就像是在看一面镜子,但镜中的倒影被颠倒了过来。

1. AI 的表现: “先入为主”的解题者
AI 模型在真正的谜语上表现得非常出色(正确率 85%),但在**“谜语中的谜语”上却表现挣扎**(正确率仅为 50%)。

  • 发生了什么: 当 AI 看到一个看起来像谜语的问题时,它会立即假设:“啊,这一定是个陷阱!我需要运用我的创造性、打破常规的思维。”
  • 错误所在: 即使面对一个简单的数学问题(即“谜语中的谜语”),AI 仍然试图寻找隐藏的陷阱。这就像一个侦探,看到一扇锁着的门,就立刻认定那里一定有一个秘密通道,即便那扇门其实只是没锁且敞开着的。AI 太习惯于“谜语必有陷阱”这一逻辑,以至于无法停止寻找陷阱。

2. 人类的表现: “字面优先”的解题者
人类展现出了完全相反的模式。他们在**“谜语中的谜语”中表现极佳**(正确率 80%),但在真正的谜语中则表现挣扎(正确率 50%)。

  • 发生了什么: 人类自然地倾向于按字面意思理解。当他们看到“周五 + 3天 = 周一”这个问题时,能瞬间解出。
  • 错误所在: 当面对真正的谜语(那匹名叫 Friday 的马)时,人类经常会陷入纠结,心想:“等等,Friday 是一个星期几,所以这不可能!”他们必须付出更多努力来克服字面思维,才能找到那个陷阱。

核心启示

该论文认为,AI 尚未实现真正的“灵活推理”。

  • 人类是灵活但“懒惰”的。他们更倾向于简单的、字面的答案,只有在意识到自己卡壳时才会切换到“创造模式”。
  • AI 则恰恰相反。它已经记住了“具有谜语结构的题目 = 创造性答案”。它并没有真正检查是否真的需要一个创造性答案;它只是看到了问题的形状,就自动掏出了“创造性工具箱”。

作者称之为**“推理的错觉”**。就像一个人即使线条实际长度相等,也会在视觉错觉图中看到线条长短不一一样,AI 在面对一个纯粹的数学问题时,也会“看到”一个谜语陷阱。

结论

论文得出结论,虽然 AI 可以解出著名的谜语,但它可能只是在背诵记忆或者遵循一种僵化的规则(“如果看起来像谜语,就使用陷阱”)。它还没有学会人类那种停下来自问的能力:“这个问题真的需要陷阱吗?还是我可以正常解决它?”

简而言之:每当一个盒子贴着“谜语”标签时,AI 就会尝试跳出盒子去思考,哪怕这个盒子其实是空的。而人类通常待在盒子内部,只有在不得不时才会看向外面。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →