← 最新论文
💬 NLP

Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions

本文表明,利用基于结果奖励的强化学习来微调预训练大语言模型,能够使其成为双重用途的认知模型,从而在实现强大预测准确性的同时,为人类的风险决策生成可解释的自然语言解释。

原作者: Jian-Qiao Zhu, Hanbo Xie, Dilip Arumugam, Robert C. Wilson, Thomas L. Griffiths

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Jian-Qiao Zhu, Hanbo Xie, Dilip Arumugam, Robert C. Wilson, Thomas L. Griffiths

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:教 AI “大声思考”

想象你有一个超级聪明的学生(大语言模型,简称 LLM),他非常擅长预测你下一步会做什么。如果你给他一道难题,他通常能给出正确的答案。但如果你问他为什么得出这个答案,他可能会说:“我就是知道的,”或者给出一个模糊不清、不太合逻辑的解释。

在心理学领域,科学家们希望模型不仅能预测行为(预测人类行为),还能解释人类为何做出这些选择(揭示认知机制)。

这篇论文探讨的是:我们能否教会一个 AI 不仅能预测人类的决策,还能以一种真正解释人类心理学的方式进行“大声思考”?

实验: “风险选择”游戏

为了测试这一点,研究人员使用了一个经典的心理学游戏,叫做“风险选择”。想象你面临两个选项:

  • 选项 A: 你稳拿 27 美元。
  • 选项 B: 你有 90% 的机会得到 25 美元,但有 10% 的机会得到 92 美元。

大多数人必须在稳妥的赌注和冒险的博弈之间做出选择。研究人员拥有一个包含数千名真实人类进行此类选择的海量数据集。他们想训练一个 AI 来观察这些选项并说道:“70% 的人会选选项 A,30% 的人会选选项 B。”

三种训练方法

研究人员尝试了三种不同的方式来教授 AI 完成这项任务,就像三种不同的教练风格:

  1. “背诵者”(标准训练): 他们向 AI 展示了成千上万个问题和正确答案的例子。AI 学会了模仿模式。它擅长猜测百分比,但并没有真正理解为什么。这就像一个只背下了答案解析,却无法解释数学原理的学生。
  2. “掩码背诵者”(半人马式): 这是第一种方法的进阶版,AI 被迫只能关注答案中的数字,忽略其余文本。它也擅长猜测,但仍然无法生成好的解释。
  3. “带计分板的教练”(强化学习 - RL): 这是全场的明星。在这里,AI 被允许在给出最终答案之前,写出一段“思维链”(逐步推理过程)。
    • 转折点: AI 不仅仅因为答对而获得分数。它的得分取决于其最终预测与真实人类行为的接近程度。
    • 结果: 为了赢取分数,AI 意识到它需要像心理学家一样去“思考”。它开始写下类似“人们是风险厌恶的”或“他们在计算期望值”之类的话。通过试图赢得比赛(匹配人类数据),它意外地学会了将人类遵循的心理学规则用语言表达出来。

结果:AI 变成了心理学家

研究人员发现,“带计分板的教练”(RL)方法之所以成为游戏规则的改变者,有两个原因:

  1. 预测能力强: 它在猜测人类选择方面与其他方法一样出色。
  2. 解释能力强: 它的“大声思考”部分(思维链)确实是高质量的心理学解释。
    • 类比: 想象其他方法就像一个只说“会下雨”的天气应用。而 RL 方法则像一位气象学家,他会说:“会下雨,因为冷锋正在与暖空气碰撞,从而形成了低压区。”
    • AI 开始使用真实的心理学概念,如风险厌恶(人们讨厌损失)、期望值(对概率进行数学计算)和确定性效应(人们热爱稳操胜券)。

“聪明度”的要求

不过,这里也有一个限制条件。研究人员在更小、更弱的 AI 模型上尝试了同样的“教练”方法。

  • 类比: 想象尝试把复杂的策略教给一个幼儿和一个大学生。幼儿(小模型)即便有了教练,也无法理解其中的数学或策略。它只会感到困惑并给出错误的答案。
  • 发现: “教练”方法之所以奏效,是因为基础 AI 本身已经足够聪明,能够理解这些概念。如果 AI 起初就无法理解“期望值”这个概念,你就无法训练它去解释它。

“变幻形态”测试

为了证明 AI 不仅仅是在背诵固定的短语,研究人员改变了游戏的规则。他们没有使用真实的人类数据,而是喂给 AI 一组由一个只关心数学(期望值)的机器人生成的数据。

  • 结果: AI 立即改变了它的“思考方式”。它不再谈论人类的恐惧和风险厌恶,而是开始纯粹地讨论数学和逻辑。
  • 启示: 这证明了 AI 并不是在机械地复制剧本;它实际上在根据训练数据的不同而调整其推理过程。它确实在真正“学习”它所参与的特定游戏的规则。

总结

这篇论文表明,如果你训练一个聪明的 AI 使用奖励系统(就像电子游戏得分一样)来预测人类行为,它会自然而然地开始使用人类所遵循的心理学规则来进行“大声思考”。它将 AI 从一个简单的猜测者转变为一个能够解释我们为何做出这些选择的模型。然而,这只有在 AI 本身足够聪明、能够理解这些概念的前提下才会奏效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →