← 最新论文
💬 NLP

Human-like Affective Cognition in Foundation Models

该研究提出了一种评估框架,通过 1,280 个多样化场景测试发现,GPT-4、Claude-3 和 Gemini-1.5-Pro 等基础模型在情感认知任务中不仅与人类直觉高度一致,部分条件下甚至表现出超越普通人类的预测能力,且思维链推理能进一步提升其表现,表明这些模型已具备类人的情感理解能力。

原作者: Kanishk Gandhi, Zoe Lynch, Jan-Philipp Fränken, Kayla Patterson, Sharon Wambu, Tobias Gerstenberg, Desmond C. Ong, Noah D. Goodman

发布于 2026-02-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Kanishk Gandhi, Zoe Lynch, Jan-Philipp Fränken, Kayla Patterson, Sharon Wambu, Tobias Gerstenberg, Desmond C. Ong, Noah D. Goodman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的顶级人工智能(AI)做一场"情商大考"。

想象一下,你有一个非常聪明的机器人朋友。以前,我们只测试它认不认识人脸(比如“这是笑脸”还是“这是哭脸”),或者认不认识文字里的情绪(比如“这句话是开心的”)。但这篇论文想问的是:这个机器人真的“懂”人吗?它能不能像我们一样,通过观察一个人的处境、想法和结果,去推理出他为什么会有某种情绪

为了回答这个问题,斯坦福大学的科学家们设计了一套非常巧妙的测试方法。

1. 核心概念:情绪不是“看”出来的,是“算”出来的

作者用了一个很生动的比喻:情绪就像是一个复杂的数学公式,而不是一个简单的开关

  • 普通视角:看到有人哭,就说“他难过”。
  • 人类视角(也是这篇论文测试的):
    • 背景:Amy 想上州立大学,但父母逼她上私立大学。
    • 结果:她没考上州立大学,却考上了私立大学。
    • 想法(评估):她觉得这个结果违背了她的愿望(目标不一致),而且她觉得自己本来可以控制这个结果的(有控制感)。
    • 结论:所以,她感到的是“失望”,而不是单纯的“悲伤”。

这篇论文的核心观点是:AI 不仅要能识别“哭”这个表情,更要能理解为什么她会哭。这就是所谓的“情感认知”(Affective Cognition)。

2. 实验设计:给 AI 出题的“乐高积木”

科学家没有直接拿网上的故事来考 AI,那样太随机了。他们发明了一套"情感乐高积木"系统:

  • 第一步:搭框架。他们建立了一个因果模型,就像乐高底板。上面有四个关键零件:
    1. 目标(Amy 想去哪?)
    2. 控制感(Amy 觉得能自己决定吗?)
    3. 结果(她考上了哪?)
    4. 情绪(她感觉如何?)
  • 第二步:填内容。他们用 AI 自动生成成千上万个不同的故事,把这些零件随机组合。比如,有的故事里 Amy 觉得结果完全随机,有的故事里她觉得完全能控制。
  • 第三步:出题。他们把故事里的某一个零件遮住,让 AI 去猜。
    • 题目 A:已知 Amy 想去州立大学,结果没考上,她觉得自己能控制。问她感觉如何?(猜情绪)
    • 题目 B:已知 Amy 很失望,结果没考上州立大学。问她原本想去哪?(猜目标)

他们一共生成了 1280 道这样的题目,既有纯文字的,也有带表情图片的(多模态)。

3. 考试过程:AI vs. 真人

他们找了 567 个真人 来做这些题,作为“标准答案”的参考(因为人最懂人)。然后让三个最厉害的 AI 模型(GPT-4, Claude-3.5, Gemini-1.5)来做同样的题。

考试规则

  • 直接回答:直接给答案。
  • 思考后回答(Chain-of-Thought):让 AI 像人类一样,“一步步思考”(比如:“首先,Amy 想去州立大学……其次,结果相反……所以她会失望……"),然后再给答案。

4. 考试结果:AI 的“情商”惊人

结果非常令人惊讶,甚至有点让人细思极恐:

  1. AI 真的很懂人:AI 的答案和大多数人的答案高度一致。在很多情况下,AI 的“共识度”甚至超过了真人之间的共识度。也就是说,AI 比普通人更能准确预测“在这种情况下,大多数人会怎么想”。
  2. “思考”能让 AI 更聪明:当 AI 被要求“一步步思考”时,它的表现大幅提升。这就像让一个学生先打草稿再考试,正确率更高。这说明 AI 并不是死记硬背,而是真的在推理情绪产生的逻辑。
  3. 看图说话:当给 AI 加上表情图片时,它们能更好地结合图片和故事来推断情绪,表现更好。
  4. 弱点:AI 在推断“目标是否一致”这种逻辑上很强,但在推断“安全感”或“意外程度”这种比较微妙的心理时,稍微有点吃力,但依然比随机猜测强得多。

5. 这意味着什么?

这篇论文告诉我们,现在的 AI 不仅仅是会说话的鹦鹉,它们似乎已经内化了一套关于人类情感的“理论”

  • 好消息:未来的 AI 伴侣、心理咨询师助手,可能真的能理解我们的喜怒哀乐,不仅仅是识别表情,而是理解我们为什么难过,从而给出更贴心的建议。
  • 坏消息(或挑战):如果 AI 太懂怎么操纵人类的情感,或者太擅长伪装共情,我们该如何防范?

总结一下
这就好比以前我们觉得 AI 是个只会背字典的图书管理员,现在发现它好像变成了一个能读懂人心、甚至能预测你下一步心情的“超级心理分析师”。虽然它还不是完美的人类,但它已经学会了人类情感推理的“底层逻辑”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →