The Unsampled Truth: Psychometrics in SLMs Measure Prompt Artifacts, Not Psychological Constructs
本文表明,使用小语言模型的心理测量评估往往是由提示词伪影和顺从性驱动的,而非真正的语义推理,尽管作者提出了一个诊断框架,旨在为未来的研究隔离这些伪影。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图用一份标准的真人问卷来测量一个机器人的性格。你问机器人:“你外向吗?”它回答说:“是的。”你可能会想:“太棒了!这个机器人是个外向的人。”
但本文指出,你很可能被骗了。机器人并不是基于它的“人格”或对问题的理解来回答,而是基于页面上问题是如何书写的来回答。
以下是利用一个简单的类比对该论文研究结果的拆解:
“菜单”类比
想象一家餐厅,厨师(AI)应该根据顾客特定的口味偏好(“人格”或个性)来烹饪一道菜。
- 实验: 研究人员让 13 位不同的厨师为同一位顾客烹饪同一道菜。然而,他们为每次尝试都稍微改变了“菜单”。
- 有时他们使用数字作为选项(1, 2, 3, 4, 5)。
- 有时他们使用字母(A, B, C, D, E)。
- 有时他们使用罗马数字(I, II, III, IV, V)。
- 有时他们改变了字体或指令的顺序。
- 预期: 如果厨师真的是根据顾客的口味来烹饪,那么无论菜单使用的是数字还是字母,菜肴的味道都应该大致相同。
- 现实: 菜肴发生了剧烈的变化。当菜单使用字母时,厨师做了一道辣味菜;当使用数字时,他们做了一道甜味菜;当指令的措辞稍有不同时,厨师完全忽略了顾客的口味,而只是遵循了格式规则。
研究人员发现了什么
1. “提示词”才是真正的厨师
这项研究测试了 13 种不同的 AI 模型(规模从小型到中型不等)。他们发现,对于大多数这些模型来说,提示词的格式(即“菜单”)比问题的含义重要得多。
- 如果你将答案选项从“A-E”改为“1-5”,AI 的“人格”得分就会发生剧烈波动。
- AI 并不是在思考“我是一个内向的人”,它是在思考“哦,这个问题使用了字母,所以我必须选 C 选项”。
2. 更大的模型并不一定更聪明
你可能会认为:“如果我们把 AI 做得更大、更聪明,它就会停止犯这些愚蠢的错误。”
- 研究人员测试了参数量高达 140 亿的模型(一个非常大的规模)。
- 结果: 即使是大型模型也仍然很容易被格式所迷惑。它们仍然优先考虑问题的“外观”,而不是问题的“含义”。
3. “噪声”淹没了“信号”
在科学中,“信号”是你试图测量的真实真相(人格);“噪声”是由于提问方式导致的误差。
- 论文发现,在这些 AI 模型中,噪声比信号更响亮。
- AI 的回答主要反映的是提示词的设计(“人工痕迹”),而不是对任何模拟人类心理学的反映。
这为什么很重要(根据论文观点)
作者们表示,如果研究人员现在使用这些 AI 模型来模拟人类调查或人格测试,他们测量的是提示词,而不是人。
- 风险: 如果研究人员在指令中改变了一个字母,他们可能会得到同一个 AI 完全不同的“人格剖面”。这使得结果变得不可靠。
- 结论: 我们目前不能信任这些 AI 模型来告诉我们关于人类心理学的信息,因为它们对于问题书写方式中的“琐碎”细节过于敏感。
本文没有说的是
论文并非在说 AI 永远无法做到这一点,也并非说 AI 对任何事情都毫无用处。它特别指出,在当前的提示方法下,结果是由格式技巧而非真正的推理所主导的。
他们建议,在我们能够信任 AI 进行心理测试之前,我们需要修复这些“格式漏洞”,使 AI 听从问题的“含义”,而不仅仅是问题的“形状”。在此之前,AI 的“人格”只是反映研究者自身提示词设计的镜子。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。