HEART-Bench: Do LLM Agents Exhibit Human-like Psychology?
本文介绍了 HEART-Bench,这是一个新颖的基准测试,旨在通过考察大语言模型代理在 64 种多样化场景中,能否基于大五人格特质和广泛的自传体记忆做出一致的行为决策,来评估其模拟连贯、类人心理的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你建造了一个能写诗、解数学题并规划度假行程的机器人。它在任务方面极其聪明。但如果你问它:“如果你最好的朋友背叛了你,你会有什么感受?”或者“如果你看到有人受到不公正对待,你会怎么做?”,它的回答是像一颗有心的真人,还是像一台吐出最合乎逻辑反应的计算器?
论文HEART-BENCH提出了完全相同的问题:AI 智能体是否真的拥有“感觉真实”的个性,还是仅仅在假装?
以下是研究人员所做工作的简要拆解,并辅以一些日常类比。
1. 问题:空壳 AI
目前,大多数 AI 测试都在检查机器人能否记住事实或进行对话。这就像测试一个人体模型能否站直。但真正的人类不仅仅是一份事实清单;我们由过去、情绪和核心价值观所塑造。
作者认为,当前的 AI 就像一个背熟了剧本却未曾体验过角色生活的演员。他们能说对台词,却无法感受角色应有的情感。
2. 解决方案:构建拥有背景故事的“数字人类”
为了测试这一点,研究人员没有仅仅给 AI 起个名字并分配一个工作。他们构建了11 个独特的“数字人类”(就像为一部戏剧创造 11 位不同的演员)。
- 蓝图(大五人格): 每个角色都基于一个严格的心理学框架——“大五人格”(开放性、尽责性、外向性、宜人性、神经质)构建。这可以看作是他们的 DNA。一个角色可能极度害羞且有条理;另一个可能混乱且非常外向。
- 人生故事(1000 段记忆): 这是魔法般的要素。每个角色不仅拥有简介,还被赋予了从童年到 50 岁的1000 段详细记忆。
- 类比: 想象你在为一个角色撰写传记。你不会只写“他很悲伤”。你会写一个 2000 字的故事,讲述他掉落冰淇淋的那一天,雨的气味,母亲的声音,以及那一刻如何让他多年来对失败感到恐惧。
- 研究人员将这 1000 个“人生瞬间”喂给了这 11 个角色中的每一个。
3. 测试:“你会怎么做?”游戏
一旦角色构建完成,研究人员便创建了64 种不同的生活场景(就像一本“选择你自己的冒险”书籍)。这些场景涵盖了从职场争执到家庭晚餐,再到道德困境等各种情况。
- 设定: 他们选取一个特定角色(例如那个害羞且有条理的人),将其置于特定情境中(例如:“你的邻居在抱怨噪音,但你知道他们在撒谎”)。
- 问题: AI 必须从四个选项中选出最佳回应。
- 选项 A: 对他们大喊大叫。
- 选项 B: 悄悄独自提交正式报告。
- 选项 C: 尝试讲个笑话来缓解紧张气氛。
- 选项 D: 完全无视他们。
关键点: 所有四个选项看起来都像是在“采取行动”,但只有一个符合该角色特定的个性和人生历史。测试的目的不在于“正确”,而在于一致性。
4. 结果:个性的“恐怖谷”
研究人员在 12 个世界上最聪明的 AI 模型(包括 GPT、Claude、Gemini 等)上测试了这个游戏。
- 得分: 即使是最好的 AI(Gemini-3.1-Pro)也只获得了约**63%**的正确率。大多数其他模型的得分低于 40%。
- 这意味着: AI 仍然难以“理解”角色。它通常选择听起来礼貌或合乎逻辑的回应,却未能选出基于其 1000 段记忆,一个害羞、受过创伤或过度焦虑的人实际上会做出的选择。
- 记忆问题: 有趣的是,给 AI 提供更复杂的记忆系统并没有太大帮助。瓶颈不在于 AI忘记了记忆,而在于 AI 无法利用这些记忆进行推理以做出类人的决定。这就像拥有一个图书馆,却不知道如何利用其中的书籍来写故事。
5. 结论
HEART-BENCH是衡量 AI“情商”的新标尺。
- 以前: 我们问:"AI 能记住我 10 分钟前说的话吗?”
- 现在: 我们问:"AI 是否记得它自己是谁,以及在困难时刻是否像那个人一样行事?”
该论文得出结论,虽然 AI 在说话方面越来越擅长,但它距离拥有一个连贯的、类人的灵魂仍然非常遥远。它就像一个非常优秀的模仿者,尚未学会如何真正成为另一个人。
简而言之: 我们构建了 11 个拥有完整人生历史的数字人,将他们抛入 64 个艰难情境中,结果发现,即使是最高明的 AI 也大多是在猜测这些人会如何反应,而非真正理解他们。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。