← 最新论文
🤖 AI

Mind the (DH) Gap! A Contrast in Risky Choices Between Reasoning and Conversational LLMs

该研究通过对比 20 个前沿大语言模型与人类及理性代理的决策行为,发现模型可划分为趋向理性的推理模型和更类人但易受框架、顺序及描述历史影响的对话模型,并指出数学推理训练是区分这两类模型的关键因素。

原作者: Luise Ge, Yongyan Zhang, Yevgeniy Vorobeychik

发布于 2026-04-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Luise Ge, Yongyan Zhang, Yevgeniy Vorobeychik

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的 AI 大模型(LLM)做一场"风险决策体检"。

想象一下,你正在开一家公司,需要雇佣两个不同的“虚拟员工”来帮你做投资决定。一个是**“逻辑推理型员工”(Reasoning Models, RMs),另一个是“聊天对话型员工”**(Conversational Models, CMs)。

研究人员把这两个员工,还有真人(人类)和完美的理性机器人(经济人,Economicus,只算数、不感情用事)放在一起,让他们做同样的选择题。

1. 核心发现:AI 也分“两派”

研究发现,现在的 AI 大模型并不是铁板一块,它们明显分成了两派:

  • **🧠 逻辑推理派 **(RMs):
    • 性格:像冷静的精算师。
    • 表现:它们非常接近那个“完美的理性机器人”。不管题目怎么变,它们都只盯着“哪个选项赚得最多”这个核心逻辑。
    • 例子:GPT-5.1, DeepSeek-R1。
  • **💬 聊天对话派 **(CMs):
    • 性格:像随性的人类朋友,容易受环境影响。
    • 表现:它们不太理性,更像真人。如果题目换个说法,或者让你先解释一下为什么选这个,它们的选择就会大变样。
    • 例子:GPT-4.1, Claude Haiku。

有趣的现象:这两类 AI 和真人都不太像,但聊天派比逻辑派更像真人一点点。而逻辑派则更像那个“只认死理”的理性机器人。

2. 两个关键测试:AI 是怎么“看”世界的?

研究人员用了两个巧妙的测试来观察 AI 的“脑回路”:

测试一:是“看说明书”还是“看历史数据”?(描述 - 历史差距)

  • 场景 A(说明书/描述):直接告诉 AI:“有 70% 概率赚 100 块,30% 概率赚 0 块”。
  • 场景 B(历史/体验):不给概率,只给 AI 看一段过去的记录:“过去 20 次里,有 14 次赚了 100 块,6 次没赚”。
  • 人类的表现:人类在“看说明书”和“看历史”时,选择往往不一样(这就是著名的“描述 - 体验差距”)。
  • AI 的表现:
    • **聊天派 **(CMs):差距巨大!看历史数据时,它们变得非常像真人,甚至有点“情绪化”;看说明书时又很不一样。
    • **逻辑派 **(RMs):差距很小。不管给的是说明书还是历史数据,它们都稳如泰山,坚持算出哪个期望收益最高。

比喻:这就好比让你选路。

  • 聊天派:如果你给它看地图(说明书),它走大路;如果你给它看别人走过的脚印(历史),它可能会因为脚印里有个坑就改走小路,哪怕大路其实更近。
  • 逻辑派:不管你是给地图还是给脚印,它都拿着计算器算,哪条路总里程短就走哪条,雷打不动。

测试二:要不要“解释理由”?(解释的影响)

研究人员让 AI 在选完后,要么不解释,要么简单说一句话,要么用数学公式解释。

  • 神奇发现:
    • 对于聊天派,如果让它们简单解释一下,它们反而变得更理性了(更像那个完美机器人)。但如果让它们长篇大论地用数学解释,它们反而又变“傻”了,开始胡言乱语。
    • 对于逻辑派,解释不解释,它们都挺稳的。

比喻:

  • 聊天派就像个平时爱聊天的朋友。你让它“简单说说为什么”,它反而能理清思路,做出正确决定;但你非要它“写篇数学论文证明为什么”,它反而被绕晕了,开始胡扯。
  • 逻辑派就像个工程师,不管你怎么问,它都按图纸办事。

3. 为什么会有这种区别?(训练是关键)

研究人员发现,造成这种“两派”分化的核心原因,不是模型的大小(70 亿参数还是 300 亿参数),而是训练内容。

  • 逻辑派:在训练时,被特别强化过数学推理能力。
  • 聊天派:主要训练的是对话、写作和通用指令。

比喻:
就像学校分班。

  • 逻辑派是“奥数班”出来的,擅长算数,做决策时只认数字。
  • 聊天派是“文学社”出来的,擅长沟通,做决策时容易受语境、情绪和表达方式的影响。

4. 总结:这对我们意味着什么?

这篇论文告诉我们,AI 不是万能的“人类模拟器”。

  1. 如果你需要理性的决策(比如金融投资、资源分配):你应该选择那些经过数学推理训练的“逻辑派”模型。它们更稳定,不容易被忽悠。
  2. 如果你需要模拟人类行为(比如做市场调研、研究人类心理学):普通的“聊天派”模型可能更合适,因为它们确实会像人一样犯同样的错误(比如受描述方式影响)。
  3. 警惕“描述 - 历史”陷阱:如果你用 AI 做决策,要注意你是给它看“概率描述”还是“历史数据”。不同的输入方式,会让不同类型的 AI 给出完全不同的答案。

一句话总结:
现在的 AI 大模型里,有的像冷静的精算师(逻辑派),有的像随性的普通人(聊天派)。如果你想让它帮你做理性的经济决策,一定要选那个练过“奥数”的,别选那个只会“聊天”的,否则它可能会因为你的提问方式不同,而做出让你后悔的决定。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →