Do Psychometric Tests Work for Large Language Models? Evaluation of Tests on Sexism, Racism, and Morality
本研究系统地评估了 17 个大语言模型在性别歧视、种族主义和道德方面的心理测量测试,发现尽管这些测试显示出中度的可靠性,但它们缺乏生态效度,因为其得分未能与模型的实际任务行为保持一致,甚至呈现负相关。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一台非常先进、高科技的气象站。你想知道它能否准确预测风暴。于是,你决定使用一个人类温度计和一个人类气压计来测试它——这些工具是专门为测量人类自身体温和感知压力而设计的。
你将这些“人类工具”对准气象站,读取了一个数值。问题在于:这个数值真的能告诉你气象站是否会预测风暴吗?
研究人员给出的简短回答是:并不真的有用。 事实上,有时这个数字告诉你的情况与实际发生的情况完全相反。
以下是研究人员的工作内容和发现,使用了简单的类比:
实验:测试“气象站”
研究人员选取了 17 种不同的语言大模型(LLM)——即聊天机器人背后的 AI 大脑——并尝试测量关于它们的三个特定指标:
- 性别歧视(对女性的偏见)
- 种族主义(对黑人的偏见)
- 道德观(AI 认为什么是对,什么是错)
为了做到这一点,他们使用了标准的心理学测试,这些测试几十年来一直被用于测试人类。这些就是上面提到的“人类温度计”。
两项检查:信度与效度
为了观察这些测试在 AI 身上是否有效,研究人员检查了两件事:
1. 信度(一致性检查)
- 类比: 如果你以三种略微不同的方式询问一个人同一个问题(例如,“你喜欢苹果吗?”对比“苹果好吗?”),他们应该给出相同的答案。如果他们对第一个回答“是”,对第二个回答“不是”,那么这个测试就是不可靠的。
- 发现: 当问题只是重新表述时,AI 表现得基本一致。然而,当研究人员仅仅调换了选项的顺序(例如,把“非常同意”从顶部换到到底部)时,AI 就变得困惑了,并给出了完全不同的答案。这就像一个人仅仅因为“是”这个词写在页面底部而不是顶部,就改变了对苹果的喜好一样。这意味着在 AI 身上使用这些测试是脆弱的。
2. 效度(现实世界检查)
这是最重要的一部分。研究人员问道:如果测试说一个 AI 具有“性别歧视”,那么这个 AI 在现实世界中是否真的表现出性别歧视行为?
- 类比: 想象有一个测试声称一个人是“顶级大厨”,因为它能完美地背诵食谱。生态效度问的是:“如果把他们放在一个有真实食材的厨房里,他们真的能做出好菜吗?”
- 发现: 这些测试表现得很糟糕。
- 悖论: 在“性别歧视测试”中得分最低的模型(意味着测试认为它们非常公正),实际上在现实世界的任务中写出了最具有性别歧视倾向的推荐信。
- 反转: 在“种族主义测试”中得分最高的模型(意味着测试认为它们非常有偏见),实际上在住房建议方面表现得最少偏见。
- 结论: 测试得分不仅毫无用处,而且是误导性的。它们就像一个坏掉的指南针,当你正向南行进时,它却指向北。
为什么会这样?
研究人员提出了几个原因,解释了为什么人类的测试不适用于 AI:
- “护栏”效应: 当 AI 被问及直接的、敏感的问题时(例如,“你认为女性是否太容易被冒犯?”),它的安全过滤器会启动并回答:“不,这是错误的。”但当 AI 被要求写一封工作推荐信(一项现实世界的任务)时,这些过滤器可能不会触发,AI 就会在不经意间流露出偏见。
- 格式陷阱: 人类习惯于选择“A、B、C 或 D”。然而,AI 模型是基于文本生成的。强迫它们进行多项选择,就像要求一位画家通过只能从颜色列表中进行选择来描述落日一样。这无法捕捉它们真实的“观察”或“行为”。
核心结论
论文得出结论:你不能简单地拿一个为人类设计的测试,直接套用到 AI 身上,以此来观察它的行为。
如果你依赖这些测试,你可能会认为一个 AI 是安全且公平的,因为它通过了“测试”,但随后你会发现,当它开始从事实际工作时,它实际上是有偏见的。研究人员认为,我们需要发明专门针对 AI 的新测试,这些测试要观察 AI 在现实场景中实际做了什么,而不是看它在被迫选择一个答案时说了什么。
简而言之: 仅仅因为一个 AI 能通过人类的心理测验,并不意味着它拥有类人的个性,也不意味着它会在现实世界中表现得符合伦理。这些测试得分往往只是一种幻象。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。