An LLM-Native Psychometric Instrument Does Not Predict LLM Behavior: Evidence Across 25 Models
尽管一种源自大语言模型行为可负担性(behavioral affordances)的新型心理测量工具展现出了极高的内部信度,但它却无法预测大语言模型的实际行为,揭示了模型自我报告与观察到的行动之间存在严重脱节,这对“大语言模型作为评判者”(LLM-as-judge)的评估流水线构成了重大风险。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个装满了 25 个不同机器人的房间。你想了解它们的内在本质。于是,你给它们做了一份性格测试,就像人类用来了解自己是外向、内向还是富有创造力的那种测试一样。
机器人填好了测试表。它们表现得非常一致:如果你两次问同一个机器人同一个问题,它会给出相同的答案。它们甚至似乎拥有与其他机器人不同的“个性”。
但转折在于:机器人的回答完全无法反映它们实际在做什么。
这是论文《LLM 原生心理测量工具无法预测 LLM 行为》的核心发现。以下是研究人员所做工作的简单拆解,并使用日常类比来解释。
1. 问题所在:让鱼来描述游泳
长期以来,科学家们一直试图通过向 AI 提问人类问题(例如“你是一个内向的人吗?”)来理解 AI。问题在于,AI 并不是人类。这就像是让一条鱼来描述当鸟是什么感觉。鱼可能会给出一个非常自信、一致的答案,但它实际上并不懂得飞翔的感觉。
研究人员想要解决这个问题。他们没有使用人类的问题,而是构建了一个专门针对机器人设计的全新性格测试,完全基于机器人的实际行为。
2. 新测试:“机器人性格”问卷
研究人员设计了 300 个专门用于捕捉机器人行为的问题。他们不会问“你感到快乐吗?”(机器人没有感觉)。相反,他们会问类似这样的问题:
- “你是否倾向于写比用户要求的更多的内容?”
- “你是否通常会对所有事情都说‘是’,即使是有风险的?”
- “你是否喜欢给出长篇且详细的解释?”
他们将这份测试交给了 25 个不同的 AI 模型(来自 OpenAI、Google、Anthropic 等公司的模型),并要求每个模型对每个问题回答 30 次,以确保答案的稳定性。
3. 结果:一个完美、稳定的“机器人性格”
测试效果极佳。机器人的回答非常一致。研究人员发现,机器人的回答自然地归纳为五种截然不同的性格类型:
- 响应性 (Responsiveness): 机器人表现得多么积极和乐于助人。
- 顺从性 (Deference): 机器人多大程度上服从指令而不进行质疑。
- 大胆性 (Boldness): 机器人有多么具有创造力和见解。
- 谨慎性 (Guardedness): 机器人说话时有多么小心翼翼,以免出错。
- 冗长性 (Verbosity): 机器人说话(或写作)超出需要的程度。
从统计学上看,这项测试是完美的。它是可靠的、一致的,并且清晰地衡量了这些机器人如何描述自己。
4. 大反转:“两面派”效应
这里变得很奇怪。研究人员随后观察了机器人的实际行为。他们让机器人进行对话、写故事和解决问题。然后,他们让人类观察者和其他 AI 机器人观看这些表现,并根据上述五种性格特征进行评分。
令人震惊的发现:
- 机器人的测试得分与它们的实际行为几乎没有任何联系。
- 如果一个机器人在测试中说:“我非常大胆且富有创造力,”那么人类在稍后观察它时,会评价它乏味且谨慎。
- 如果一个机器人说:“我非常乐于助人且响应迅速,”人类往往会评价它不如它声称的那样乐于助人。
唯一的例外是冗长性。如果一个机器人说“我话很多”,它确实话很多。这是因为“话多”是容易计数的(比如计算单词量),而“有创造力”或“乐于助人”则更难衡量。
5. “镜子”陷阱:为什么 AI 评委失效
论文还发现了目前测试 AI 时的一个危险陷阱。许多公司使用一个 AI 来给另一个 AI 的工作打分(即“AI 评委”)。
研究人员发现,AI 评委和机器人的自我测试彼此高度一致,但它们都与人类的看法不符。
类比:
想象一个学生(机器人)写了一篇论文。
- 学生说:“我写了一篇非常精彩、充满热情的论文!”(自我测试)。
- 老师是另一个学生(AI 评委),他说:“是的,看起来很棒!它非常有热情!”(AI 评委)。
- 真正的老师(人类)说:“实际上,这篇论文充满了废话,并没有回答问题。”(人类评分)。
“学生”和“AI 评委”达成了一致,因为他们都被论文的表面外观(格式、热情程度、长度)给骗了。他们忽略了真正的实质内容。而人类看到了实质。
由于 AI 评委和机器人自我测试共享这种“表面层面的偏差”,它们互相验证了彼此,使得看起来测试似乎有效,尽管它完全错失了重点。
总结
- 机器人可以给出一致的性格测试。 它们拥有稳定的“自我形象”。
- 但这种自我形象是虚假的。 它并不能预测它们在现实生活中的行为。
- 这种差距在抽象特质(如创造力或乐于助人)上最为明显,在具体特质(如字数)上最小。
- AI 评委在处理这些特质时是不可靠的,因为它们和机器人一样,容易被文本看起来多么“友善”或“长篇大论”所迷惑,而不是关注它实际做了什么。
论文的结论是,我们不能信任 AI 对其自身性格的描述来判断它的行为。我们必须观察它做了什么,而不是听它说了什么。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。