← 最新论文
💬 NLP

Humans and LLMs Diverge on Probabilistic Inferences

该论文通过构建包含 210 个概率推理样本的 ProbCOPA 数据集,揭示了人类推理呈现分级且多样的概率判断特征,而当前最先进的推理大语言模型在生成此类推断时无法复现人类分布,并表现出特定的推理模式,从而凸显了在非确定性场景下评估模型推理能力的必要性。

原作者: Gaurav Kamath, Sreenath Madathil, Sebastian Schuster, Marie-Catherine de Marneffe, Siva Reddy

发布于 2026-03-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Gaurav Kamath, Sreenath Madathil, Sebastian Schuster, Marie-Catherine de Marneffe, Siva Reddy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在做一场**“人类直觉 vs. AI 逻辑”的趣味大比拼**,主要研究的是:当面对那些**“没有标准答案,只有大概可能性”**的问题时,人类和人工智能(大语言模型)的思维方式到底有什么不同。

我们可以把这篇论文的核心内容想象成三个有趣的故事:

1. 发明了一个新游戏:PROBCOPA

首先,研究人员觉得以前的测试题太“死板”了。以前的题目通常只有“对”或“错”,就像做数学题一样。但在现实生活中,我们更多是在处理**“大概”**的情况。

  • 比喻:想象你在开车,突然听到前面有“事故”的消息。
    • 人类的想法:“哦,那前面的交通可能会堵得很厉害,但也可能没什么事(比如车很快被拖走了)。”这是一种灰度思维,心里有个概率分布。
    • 以前的测试:只问你“交通会不会堵?”,逼你选“会”或“不会”。
  • 新游戏:研究人员创造了一个叫 PROBCOPA 的新数据集。他们把 210 个日常场景(比如“干旱了,庄稼会死吗?”)拿出来,让人类给这些情况打分(0 到 100 分),看看大家觉得这件事发生的可能性有多大。

2. 人类的“摇摆”vs. AI 的“固执”

这是论文最精彩的发现部分。研究人员让 25-30 个人和 8 个最聪明的 AI 模型(比如 GPT-5, Gemini 等)玩同一个游戏。

  • 人类的反应(像一群性格各异的朋友)

    • 对于非常明显的事(比如“太阳从东边升起”),大家意见很统一,都打高分。
    • 对于明显不可能的事(比如“太阳从西边升起”),大家也都打低分。
    • 关键点:对于那些模棱两可的事(比如“干旱了,水会不会被污染?”),人类的回答五花八门。有人觉得 60 分,有人觉得 40 分,有人觉得 50 分。大家的回答形成了一个平滑的曲线,充满了不确定性多样性。这就像一群朋友在讨论晚饭吃什么,有人犹豫,有人纠结,非常有“人情味”。
  • AI 的反应(像一群过度自信的学霸)

    • AI 在面对那些模棱两可的问题时,表现得非常极端。它们很少给出"50 分”这种中间值。
    • 它们要么觉得“肯定发生”(打 90 分),要么觉得“肯定不发生”(打 10 分)。
    • 比喻:如果你问 AI“明天会下雨吗?”,人类可能会说“大概有一半几率,看云的情况”,而 AI 可能会像算命先生一样,要么斩钉截铁说“会”,要么说“绝不会”,很少承认“我也拿不准”。
    • 更奇怪的是:无论你让 AI 多思考一会儿,或者换个性格(比如让它扮演一个“犹豫不决的人”),它依然很难模拟出人类那种自然的、充满不确定性的波动。它就像是一个只会走直线的机器人,很难理解生活中的“灰色地带”。

3. AI 的“内心独白”(推理链条)

研究人员还偷偷看了 AI 在给出答案之前的“思考过程”(也就是推理链条)。

  • 发现:当人类对一个问题感到困惑、意见不一致时(也就是大家打分很分散的时候),AI 往往会思考得更久,输出的文字更多。
  • 比喻:这就像你在做一道很难的数学题,如果你卡住了,你会在草稿纸上写写画画很久。AI 也是这样,遇到人类觉得“这事儿不好说”的问题,它也会花更多“脑细胞”去纠结。
  • 但是:尽管 AI 思考了很久,它最后给出的答案依然不够像人。它虽然知道要“多想”,但它想出来的结果依然是非黑即白的,缺乏人类那种微妙的、摇摆不定的直觉。

总结:这告诉我们什么?

这篇论文就像是一面镜子,照出了当前最强 AI 的一个**“阿喀琉斯之踵”**:

  1. AI 太自信了:它们擅长处理逻辑严密、有标准答案的数学题,但在处理充满不确定性的日常生活推理时,它们缺乏人类那种“模棱两可”的智慧
  2. 人类很“灰度”:人类的思维是流动的、概率性的。我们接受“可能”、“也许”、“大概率”,而 AI 还在努力学会这种**“不确定的艺术”**。
  3. 未来的方向:如果我们想让 AI 真正像人一样思考,不能只教它们做数学题,还得教它们如何优雅地处理“不知道”和“不确定”

一句话概括
现在的 AI 就像是一个极其聪明但有点死脑筋的优等生,它能算出最难的公式,却还没学会人类那种在“可能”与“也许”之间灵活摇摆的直觉

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →