← 最新论文
💬 NLP

Presupposition and Reasoning in Conditionals: A Theory-Based Study of Humans and LLMs

本研究揭示,虽然大型语言模型在条件句预设投射方面有时能达到与人类评分相当的水平,但其表现往往源于表面模式匹配而非真正的语用推理,这凸显了统计对齐与真实语言能力之间的脱节。

原作者: Tara Azin, Yongan Yu, Raj Singh, Olessia Jouravlev

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Tara Azin, Yongan Yu, Raj Singh, Olessia Jouravlev

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和创意类比对该论文的解读。

核心概念:“如果……那么……"的谜题

想象你在和朋友玩逻辑游戏。你说:“如果约翰是潜水员,他就会带上他的潜水服。”

朋友问:“约翰实际上潜水服吗?”

  • 人类的回答: 大多数人会说:“可能还没有。只有在他潜水时,他才有潜水服。”潜水服与条件绑定。
  • 另一种人类回答: 现在假设你说:“如果约翰飞往伦敦,他的姐姐会去接他。”
  • 人类的回答: 在这里,人们会说:“是的,约翰肯定有个姐姐。”他是否有姐姐并不取决于飞行;这只是关于约翰的一个事实。

这种差异被称为“前提问题”。这是语言学中一个棘手的谜题,关于我们如何判断一个隐藏事实(即“预设”)是永远为真,还是仅在“如果”部分发生时才为真。

实验:人类与人工智能

研究人员想要看看大型语言模型(LLM)——即像你现在对话的聊天机器人背后的“大脑”——是否能以与人类相同的方式解决这个谜题。

他们设计了一场“味觉测试”,涉及两组对象:

  1. 120 名人类: 真实的人阅读句子,并在 0 到 7 的尺度上评估隐藏事实为真的可能性。
  2. 4 个 AI 模型: 不同版本的 AI(如 GPT-5、Gemini、Llama 和 Qwen),执行完全相同的任务。

他们通过两种方式测试 AI:

  • “裸”测试: 仅包含句子(例如,“如果约翰是潜水员……")。
  • “语境”测试: 句子加上一小段背景信息(例如,“约翰来自渥太华。如果约翰是潜水员……")。

结果:“冒牌货”AI

以下是他们的发现,用简单的比喻分解如下:

1. 人类是直觉侦探

人类在这方面很擅长。他们将逻辑与常识结合起来。如果“如果”部分让隐藏事实更有可能(例如潜水员需要潜水服),他们会降低评分。如果“如果”部分与事实无关(例如飞往伦敦和拥有姐姐),他们会保持高评分。他们对句子两部分之间的相关性非常敏感。

2. AI“模仿”答案,但并非基于推理

这是最令人惊讶的部分。

  • 小 AI(Qwen): 该模型给出的答案与人类非常相似。如果人类说"7",AI 就说"6.8"。它是一个出色的模仿者。
  • 大 AI(GPT-5、Gemini): 这些模型给出的答案与人类不太像。它们往往过高或过低,错过了人类所做的微妙转变。

转折: 当研究人员要求 AI 解释为什么给出这些答案(就像要求学生展示数学作业)时,出现了一种奇怪的模式:

  • 小 AI(Qwen),它给出了最像人类的答案,实际上却拥有糟糕的推理。它无法正确解释逻辑。它只是根据训练数据中看到的模式进行猜测,就像鹦鹉重复它经常听到的短语,却不知道其含义。
  • 大 AI(GPT-5),它给出了较差的人类风格答案,实际上却拥有更好的推理。它能很好地解释逻辑规则,但在得出最终数字时,与人类相比却错了。

“清单”类比

为了搞清楚这一点,研究人员使用了一个带有清单的“裁判 AI"。想象一位老师正在给学生的论文打分。

  • 清单: “你识别出触发因素了吗?你检查了语境是否重要了吗?你解释了逻辑吗?”
  • 结果: “大 AI"通过了清单(它写了一篇好文章)。“小 AI"未能通过清单(它的文章很混乱)。
  • 悖论: 尽管“小 AI"在逻辑测试中失败了,但其最终得分却更接近人类平均值。

结论:模式匹配与理解

该论文得出结论,AI 模型实际上并没有像人类那样“理解”语言。

  • 人类使用逻辑、世界知识和相关性的混合体来判断事实是否为真。
  • AI似乎在进行表面层面的模式匹配。它看到“如果约翰是潜水员”和“潜水服”这两个词,发现它们在训练数据中经常一起出现,然后猜测数字。它并不真正“知道”潜水服是取决于潜水的条件。

要点: 仅仅因为 AI 给出了一个看起来正确的答案(就像背下了答案键的学生),并不意味着它理解了课程。事实上,给出最“像人类”答案的 AI,实际上是那个最不依赖真实逻辑的。

该论文没有说什么

  • 没有说 AI 无用。
  • 没有说 AI 永远不会理解语言。
  • 没有建议将此用于医疗诊断或法律建议。
  • 它只是说:目前,就这种特定类型的棘手逻辑谜题而言,AI 的伪装比它自己想象的还要好,而看起来最“聪明”的答案可能是最肤浅的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →