Some Large Language Models Exhibit Consistent Risk Attitudes
本文表明,大型语言模型展现出稳定、一致且跨领域的风险态度,这些态度与人类基准相比趋向于一种受限的分布,揭示了风险态度是此前未被表征但可测量的 AI 行为维度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在观看一群朋友玩一场高风险的电子游戏。有些玩家非常谨慎,几乎纹丝不动,生怕失去哪怕一条命;而另一些人则非常鲁莽,不假思索地冲向危险。在心理学中,这不仅仅关乎技巧,而是关乎“风险态度”。这是一种根深蒂固的人格特质,决定了一个人如何将“这看起来很危险”的感觉转化为实际行动。我们知道人类拥有这些截然不同的风格,由他们独特的经历和大脑塑造而成。但现在,人工智能正步入这场游戏。我们已经教会了人工智能变得聪明、解决数学问题以及撰写故事。但一个新问题正浮现出来:这些数字大脑在面对风险时是否也有自己的“个性”?它们天生是谨慎的,还是有着隐藏的赌徒冲动?这一点至关重要,因为如果我们让 AI 在做出重大决策——比如在医院分诊病人或管理资金——而不了解它们的风险风格,我们最终可能会得到一个要么畏缩不前,要么过于大胆的机器人。
这篇论文直接深入研究了这个谜团,将大语言模型(LLMs)视为心理学实验室中的实验参与者。由 Bowen Sun 和 Jing Du 领导的研究团队想要观察这些 AI 模型是否像人类一样拥有稳定的风险态度。他们并没有直接问 AI“你是否有冒险精神?”,因为这就像问一个人是否勇敢一样;答案可能是一个谎言或一次猜测。相反,他们设计了一个巧妙的三种场景的游戏:驾驶无人机穿过狂风暴雨、决定病人的医疗需求有多紧急,以及在波动的市场中挑选股票。在每场游戏中,AI 必须首先对情况有多危险形成一种认知(即“情境信念”),然后基于该信念做出选择(即“风险决策”)。
团队测试了六种不同的 AI 模型,并将其与 100 名人类参与者进行了对比。他们发现了一些迷人的现象:AI 模型并不只是随机数生成器。它们拥有稳定的“风险人格”。就像一个在股市中天生谨慎的人在开车时也可能同样谨慎一样,这些 AI 模型在三种截然不同的游戏中都表现出了连贯的风格。如果一个模型在无人机任务中表现得谨慎,那么它在医疗任务中也可能同样谨慎。研究人员通过观察模型如何将其对危险的感觉映射到其行为上来衡量这一点。他们发现,虽然人类的分布范围极广,从极端谨慎到极端激进都有,但 AI 模型都聚集在一个狭窄的中庸区间内。就好像所有的 AI 模型都被训练得趋于“平均”或“安全”,从而缺失了使人类决策如此多样化的那种狂野多变的风险承担风格。
研究表明,这些风险态度是这些模型运作方式中真实且可衡量的组成部分,而不仅仅是针对特定问题的偶然现象。然而,研究人员也指出,虽然风险的“风格”(谨慎 vs 大胆)是一致的,但模型对危险微小变化的“反应强度”会根据游戏的类型而变化。这意味着,尽管 AI 可能拥有稳定的“人格”,但它微调行为的方式仍然取决于具体的场景。论文总结道,我们不能再将 AI 仅仅视为一个中立的计算器。它们已经获得了内在的行为倾向。这是一个至关重要的发现,因为这意味着为了在现实世界中安全地部署 AI,我们不仅需要理解并对齐它们的智能,还需要对齐它们的风险人格,以确保它们不会在工作中意外地变得过于胆怯或过于鲁莽。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。