Effects of Theory of Mind and Prosocial Beliefs on Steering Human-Aligned Behaviors of LLMs in Ultimatum Games
这项研究表明,使大语言模型具备心理理论推理能力,能显著增强其在最后通牒博弈中的人类规范一致性、决策一致性以及谈判结果,特别是当这种能力与特定的亲社会信念相结合时。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人类的互动往往取决于一种安静且无形的技能:在对方开口之前,就能猜透对方在想什么、感受如何或计划做什么。心理学家称之为“心智理论”(theory of mind)。这是让我们理解他人可能持有与我们不同的观点,或者其行为是由我们无法察觉的欲望所驱动的一种心理机制。几十年来,这种能力一直被视为人类特有的品质,是应对复杂社会环境的关键。现在,随着人工智能系统变得日益先进,研究人员提出了一个根本性的问题:机器能否学会使用这种同样的社交直觉?如果要求一个计算机程序与人类或另一台计算机进行谈判,它能否真正理解对方的视角,还是仅仅在模仿协议中的措辞,而并未领悟背后的意图?
为了查明真相,来自新加坡管理大学和澳大利亚国立大学的研究团队转向了一项经典的真人谈判测试,即“最后通牒博弈”(ultimatum game)。在这种情境下,两个人必须瓜分一笔钱。一个人,即提议者(proposer),建议如何分配现金。另一个人,即响应者(responder),必须决定接受还是拒绝该提议。如果响应者接受,钱就按提议进行分配;如果他们拒绝,则双方都拿不到钱。虽然一个纯粹逻辑导向的计算机可能会建议保留几乎所有的钱,并预期对方为了不一无所有而接受任何条件,但现实中的人类经常会出于正义感而拒绝不公平的提议,即便这会损害自己的利益。研究人员希望观察大型语言模型——即驱动许多现代聊天机器人的强大AI系统——是否可以通过编程来模拟这些真实的人类行为,以及赋予它们特定的“心智理论”推理过程是否能帮助它们与人类行为保持一致。
研究团队建立了一个大规模模拟实验,涉及由不同AI智能体进行的2700场游戏。他们并非让计算机随机进行游戏,而是仔细为每个智能体分配了特定的性格或“亲社会信念”。一些智能体被设定为贪婪,只关心最大化自己的份额;另一些则被设定为公平,旨在实现平分;第三组则被设定为无私,愿意将大部分钱分给另一名玩家。随后,研究人员测试了这些智能体在使用不同思维方法时的表现。有些智能体只是直接做出决策而不解释其思考过程;有些使用了标准的逐步推理技术;然而,最有趣的群体是被要求使用“心智理论”进行推理。这意味着智能体必须在行动之前,明确地思考其他玩家相信什么、渴望什么以及意图是什么。研究人员在六种不同的大型语言模型(涵盖了广为人知的商业系统到开源模型)上进行了测试,以观察模型的大小或类型是否会产生影响。
结果显示出一个清晰的模式:赋予AI智能体推理他人思想的能力,显著提升了它们与人类规范的一致性。当智能体使用心智理论推理时,它们的决策变得与人类在这些游戏中的行为更加吻布。例如,具有公平精神的智能体更有可能提出平分方案,而贪婪的智能体则更有可能提供一个贪婪的响应者实际上会接受的份额。研究发现,推理类型的重要性取决于AI扮演的角色。提议者(发起提议的人)在采用一种侧重于预测他人心理状态的特定心智理论时表现最佳;而响应者(决定接受或拒绝的人)则从一种结合了思考自身欲望与思考提议者意图的更复杂的推理方法中获益最多。
然而,研究人员也发现了一个令人惊讶的局限性。即使明确告知AI要表现得贪婪或无私,它也经常难以做出真正符合这些指令的行为。当一个智能体被要求表现得贪婪时,它经常会提供一个过于公平的分配方案,仿佛它无法完全致力于变得自私。同样,被要求无私的智能体有时也会克制自己,未能按照指令给出尽可能多的钱。作者认为,这是因为这些AI模型是在海量人类数据上训练而成的,并经过了旨在使其具备“帮助性”和“合作性”的微调,从而产生了一种内在偏见,这种偏见倾向于公平,从而抵消了实验中给出的特定指令。这种“协作式微调”就像一种隐藏的力量,将智能体从极端行为(无论是极端的自私还是极端的慷慨)中拉回。
研究还仔细观察了AI陈述的推理过程与其实际行动是否匹配。在许多情况下,智能体的内部逻辑与其最终决策是一致的,但也存在脱节的时刻。当人类专家审查AI的推理轨迹时,他们发现模型通常能够很好地解释其选择,但有时无法正确表达其被分配的性格,尤其是在对提议做出反应时。例如,一个无私的响应者可能会通过分析提议者的善意来为接受低价提议辩解,而不是承认自己的给予欲望。这表明,虽然AI可以模拟社交互动的外在行为,但其“人格”的内部一致性是脆弱的。
最终,这项研究表明,为AI智能体配备心智理论推理,是使其在社交情境中表现得更像人类的有力工具。它有助于它们处理自身目标与他人预期之间的张力。然而,研究同时也强调,这些系统并非白纸一张;它们带有深层的协作偏见,这使得它们很难真实地扮演那些需要自私或极端利他主义的角色。研究结果表明,为了让AI在涉及高风险决策时能与人类真正协作,我们不仅要教它们如何思考他人,还要理解塑造其解读这些想法的自身训练中的隐藏约束。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。