← 最新论文
🤖 AI

Apparent Psychological Profiles of Large Language Models are Largely a Measurement Artifact

本文表明,大型语言模型的表观心理特征主要是由定向响应偏差驱动的测量伪影,而非真实的特质,这使得在不对响应正交性进行专门调整的情况下,标准的为人设计的心理测量工具在评估大型语言模型时是无效的。

原作者: Jelena Meyer, David Garcia, Dirk U. Wulff

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Jelena Meyer, David Garcia, Dirk U. Wulff

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:AI 的“虚假”人格

想象一下,你有一个装满了 56 个不同机器人的房间。你想知道它们的“人格”是什么样的,于是你向它们提出了和人类一样的问题:“你会担心吗?”或者“你喜欢冒险吗?”

基于这些回答,研究人员一直在给这些机器人打人格分数,把它们当作拥有稳定性格(比如“害羞”、“勇敢”或“焦虑”)的实体进行对待。

这篇论文认为,这些人格分数大部分是虚假的。

作者声称,当我们测量 AI 的人格时,我们测量的并不是它们的“性格”。相反,我们测量的主要是它们回答问题时的一种故障。这就像试图通过一个已经损坏且向一侧倾斜的秤来称量一袋面粉。你得到的数字并不是面粉的重量,而仅仅是那个坏掉的秤产生的结果。

主要类比:“唯唯诺诺者” vs. “真相讲述者”

为了理解这个问题,想象两种机器人回答问题的方式:

  1. 特质(真实的性格): 机器人真心认为“我是一个谨慎的人”,所以面对冒险类问题它回答“不”,面对安全类问题它回答“是”。
  2. 偏差(故障): 机器人有一种习惯,总是选择看起来更“礼貌”的答案,或者总是选择第一个选项,或者仅仅因为习惯而总是说“是”。它并不关心问题的内容;它只是有一个默认设置。

研究人员发现,对于人类来说,特质是主导力量。如果你问一个人关于紧张的问题,然后再问一个相反的问题,他们的回答会发生逻辑性的反转。

但对于 AI 模型,偏差是主导力量。它们似乎有一种“默认设置”,无论问题实际在问什么,都会将它们推向答案尺度的某一端。

“魔镜”测试

研究人员是如何证明这一点的呢?他们使用了一个被称为**响应正交性(Response Orthogonality)**的巧妙技巧。

把人格测试想象成一组镜子:

  • 正向镜: 正常地展示你的倒影。
  • 反向镜: 展示你倒过来的倒影。

如果你拥有真实的人格(即“特质”),两面镜子应该显示相反的东西。如果你“神经质程度高”(容易担心),正向镜会说“是的,我会担心”,而反向镜会说“不,我无法保持冷静”。答案会向相反方向移动。

然而,如果存在偏差(比如一个只想对所有事情都说“是”的机器人),两面镜子都会显示“是”。答案会向同一个方向移动。

研究结果:

  • 人类: 当研究人员观察 2 万名人类时,镜子显示的是相反的答案。这意味着人类是根据其真实的特质在回答。
  • AI 模型: 当他们观察 56 个 AI 模型时,镜子显示的是相同的答案。这意味着模型并不是根据人格在回答;它们只是在遵循一种方向性偏差(比如“说‘是’”的习惯)。

“音量旋钮”类比

研究人员还检查了更聪明、更大的机器人(比如最新的、最昂贵的模型)是否解决了这个问题。

想象“偏差”是收音机里巨大的静电噪音,而“人格”是音乐。

  • 小型模型: 静电声震耳欲聋。你完全听不到音乐。
  • 大型/智能模型: 静电声变小了一点。你能听到一点点音乐。
  • 症结所在: 即便是最聪明、最昂贵的模型,仍然有大量的静电声。它们还没有达到音乐(真实人格)清晰可辨的程度。“静电”(偏差)仍然比“音乐”更响亮。

“配方”问题

论文还发现了一个可怕的事情:仅仅通过改变配方,你就可以伪造出一个人格。

因为 AI 的回答是由偏差而非真实特质驱动的,所以你只需通过选择不同的提问方式,就能让一个 AI 看起来像是“冒险者”或“胆小鬼”。

  • 如果你问的问题大多是“冒险者”应该选“是”的题目,AI 看起来就像个冒险者。
  • 如果你问的问题大多是“冒险者”应该选“否”的题目,AI 看起来就像个胆小鬼。

这就像如果你有一个总是对所有事情都说“是”的机器人。如果你问“你喜欢披萨吗?”,它说“是”。如果你问“你讨厌西兰花吗?”,它也说“是”。你可能会得出结论:这个机器人既爱披萨又恨西兰花。但实际上,它只是喜欢说“是”。

结论

论文得出结论,我们目前分配给 AI 的“心理学剖析”是测量伪影(Measurement Artifacts)。它们是我们用来测量它们的工具所创造的幻象,而不是 AI 真正的特征。

  • 工具: 我们正在将人类心理学测试(如“大五人格”测试)应用于机器人。
  • 缺陷: 这些测试并非为机器人设计。它们依赖于人类拥有一种“是”与“否”倾向相互抵消的机制。机器人并不这样;它们具有强烈的“方向性偏差”。
  • 结果: 在我们开发出专门用于区分“真实特质”与“机器人习惯”的新测试之前,我们无法信任给予 AI 的人格评分。

简而言之:我们以为我们在测量 AI 的灵魂,但实际上我们只是在测量它对所有事情都说“是”(或“否”)的倾向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →