← 最新论文
🤖 AI

Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests

本文引入了一个利用情境判断测试和多维项目反应理论的框架,旨在证明人格设定条件下的语言大模型展现出稳定且可衡量的行为倾向,并能预测外部基准,从而为评估人工智能行为提供了一种比自陈法更可靠的替代方案。

原作者: Alexandra Yost, Shreyans Jain, Shivam Raval, Grant Corser, Allen Roush, Nina Xu, Jacqueline Hammack, Ravid Shwartz-Ziv, Amirali Abdullah

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexandra Yost, Shreyans Jain, Shivam Raval, Grant Corser, Allen Roush, Nina Xu, Jacqueline Hammack, Ravid Shwartz-Ziv, Amirali Abdullah

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图弄清楚是什么在驱动一个人。在心理学领域,科学家们长期以来一直使用“人格测试”来绘制人类心灵的图谱。其中最著名的是像清单一样的测试,你只需对诸如“我是一个非常有条理的人”之类的陈述表示同意或不同意。但现在,我们有了一种新的角色:人工智能(AI)。这些人工智能模型非常聪明,但它们没有心,也没有童年。那么,我们如何知道一个 AI 是“诚实”、“谨慎”还是“友好”的呢?

有一段时间,研究人员尝试把 AI 当作人类对待,用同样的问题清单去询问它们。但这有点像问一个电子游戏角色:“你输掉比赛时会感到难过吗?”AI 可能会回答“是的”,仅仅因为它知道那是正确答案,而不是因为它真的有感情。本文认为,让 AI 在棘手的局面中进行“选择”,比仅仅询问它的想法更能更好地了解它的“人格”。这就像是观察一个司机在暴风雨中驾驶,而不是仅仅询问这个司机是否认为自己是个好司机。研究人员想要看看,他们是否可以建立一个可靠的地图,用来衡量 AI 在扮演特定身份(如警察或政治家)时的行为模式,以及这种行为是否每次都保持一致。


伟大的 AI 角色扮演实验

这项研究背后的研究人员决定不再问 AI“你是什么?”,而是开始问“你会怎么做?”他们构建了一个巨大的数字游乐场来测试这个想法,重点关注一个被称为**情境判断测试(SJTs)**的概念。把 SJT 想象成一本“选择你自己的冒险”类书籍,只不过书里的故事不是关于魔法巨龙,而是关于现实生活中的问题,比如一名警察如何处理一名困惑的公民,或者一名政治家面临一次艰难的投票。在这些故事中,AI 必须从几种可能的行动中做出选择。每种行动都被秘密设计用来展示特定的性格特征,比如诚实、谨慎或友好。

为了让测试既公平又有趣,团队不仅仅要求 AI 扮演“机器人”。他们给了 AI 一个完整的人格(Persona)。想象一下你是一名演员。你不会只说“我要演一个警察”,你会穿上戏服,学习角色的背景故事,了解他们的年龄、在哪里长大,甚至他们的爱好是什么。研究人员创造了数千个这样的数字角色,配备了详细的人生经历、名字,甚至连走路和说话的方式都各不相同。然后,他们要求不同的 AI 模型“扮演”这些角色,并解决故事书中的问题。

重大发现:表演 vs. 仅仅交谈

团队进行了一项大规模实验,观察了超过 400 万个来自这些“AI 演员”的响应。他们发现了一些迷人的现象:当 AI 被赋予一个特定的角色时,它并不仅仅是在随机猜测;它实际上发展出了一种稳定的性格。如果你今天要求“强硬警察”这个角色解决一个问题,明天再问他,他依然会做出同样强硬的选择。这并非偶然,AI 的行为具有一致性,就像一个拥有固定习惯的真实人类一样。

然而,论文也发现,旧有的测试 AI 的方法具有误导性。当他们要求 AI 填写标准的性格清单(如“我很诚实”)时,结果很微弱,并且与 AI 在故事中的实际表现并不匹配。事实证明,要求 AI 描述自己,就像是要求一条鱼去描述游泳;它可能掌握了正确的词汇,但无法捕捉到真实的动作。这种“选择你自己的冒险”风格的测试(SJTs)在预测 AI 在现实世界中的行为方面表现得更好,能够与已知的 AI 诚实度和情绪智力测试相吻合。

“特质渗漏”问题及其解决方法

这项研究中一个棘手的环节是作者所称的**“特质渗漏”(Trait Bleed)**问题。想象你在写一个故事,角色必须在“勇敢”和“善良”之间做出选择。有时,“勇敢”的选择听起来也会带有一点“善良”的味道。如果测试不够完美,AI 就会产生困惑,导致结果变得模糊不清。研究人员必须像严厉的编辑一样,审视他们的数千个故事,并不断重写,直到每一个选项都清晰无比。他们使用了一种特殊的计算机程序来检查一个故事选项是否真正关乎“诚实”,而不是意外地涉及了“快乐”。一旦他们清理了这些故事,测试就变得异常精准,能够以极高的精确度区分出“问题解决者”和“懒散的警员”。如此之高。

这对未来意味着什么

这项研究表明,我们现在可以以前所未有的细节水平来衡量 AI 的行为。他们发现不同的“原型”(Archetypes)(例如超级友好的“互惠者”,或是害羞且犹豫的“回避者”)表现出了截然不同的模式。例如,“回避者”角色不太可能发声或做出艰难的决定,而“互惠者”则非常擅长展现友好和开放。

研究人员谨慎地指出,这并不意味着 AI 拥有灵魂或真实的情感。他们并不是在说 AI 感到“悲伤”或“快乐”。相反,他们是在说,当我们给 AI 一个角色时,它学会了以一种看起来非常像人类人格的一致方式去行动。这是一个巨大的进步,因为它为我们在让 AI 与医院、学校或警察部门的真实人类接触之前,提供了一个检查其安全性与可靠性的更好工具。

简而言之,论文表明,如果你想了解一个 AI 到底是什么样的,不要让它填写调查问卷。给它一套戏服,给它一个故事,然后观察它的所作所为。那才是真相隐藏的地方。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →