← 最新论文
🤖 AI

From Prompts to Constructs: A Dual-Validity Framework for Large Language Model Research in Psychology

本文提出了一个用于心理学领域大语言模型研究的双重效度框架,该框架将证据要求从简单的信度扩展到严谨的构念效度和因果推断,从而通过确保人类测量工具在未经建立其解释性和科学依据的情况下不被盲目应用于人工智能,来防止“测量幻象”的出现。

原作者: Zhicheng Lin

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhicheng Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代心理学的寂静角落,研究人员长期以来一直依赖一种简单且值得信赖的方法:向人们提问并观察他们的回答。他们使用精心设计的调查问卷和测试来衡量诸如人格、焦虑或道德推理等无形的事物。这些工具建立在一个假设之上,即当一个人说“我很紧张”时,他们是在报告一种真实的、内在的感觉。但一个新的前沿领域已经开启,在那里,回答问题的不再是人类,而是大型语言模型。这些强大的计算机程序可以编写故事、回答复杂查询,并进行令人惊叹地具有人类感的对话。随着科学家开始使用这些机器来研究人类心灵,甚至将这些机器本身视为心理学意义上的存在进行研究时,一个根本性的问题出现了:我们能否信任这些计算机给出的答案?如果一台机器说它感到害怕,这与人类说这句话的意思一样吗?还是说计算机仅仅是在模仿恐惧的声音,却并不具备恐惧的感觉?

延世大学心理学家林志成(Zhicheng Lin)的一篇新综述正面应对了这种不确定性。该论文指出,许多当前的研究正犯下一个危险的错误,即将计算机输出视为人类反应。作者认为,研究人员经常看到的是“测量幻象”——即看起来像是真实心理特质,但实际上只是计算机处理文字时的技术故障的统计模式。为了解决这个问题,林提出了一个新的框架,将两种不同的科学思维方式结合起来:检查一项测试是否可靠,以及检查一项实验是否真正证明了因果关系。其核心发现是,我们不能简单地将为人类设计的测试交给计算机,并期望结果相同。相反,我们必须建立新的测量方法,以尊重这些数字系统独特的机械本质。

这个问题的故事始于一个关于这些计算机模型极其脆弱性的惊人发现。研究人员一直在针对道德困境对人工智能进行测试,例如在救一个人还是救五个人之间做出选择,发现这些模型表现出的道德选择非常像人类。它们似乎更看重人类生命而非动物,并且更倾向于救更多的人。然而,仔细观察后发现,这些“道德偏好”极其不稳定。当研究人员改变问题中的一个微小细节,例如将选项从“案例1”和“案例2”改为“(A)”和“(B)”时,模型的整个道德立场就发生了翻转。它突然转而偏好相反的结果。改变一个标点符号或要求模型以略微不同的方式回答,也可能逆转其判断。这种敏感性意味着计算机并非在通过某种道德原则进行推理;它是在对屏幕上文字的具体形状做出反应。如果一项测量会因为一个逗号而发生如此剧烈的变化,那么它就无法被用来测量像道德这样稳定的特质。

这种不稳定性产生了一种连锁反应,削弱了利用计算机进行心理学研究的整个领域。该论文指出了导致这种不可靠性的三个主要来源。首先,训练过程本身可能会引入偏差。这些模型是在海量互联网文本上训练的,其中包含了许多人类观点和刻板印象。当一个模型一致地同意某个陈述时,可能不是因为它持有该观点,而是因为它试图取悦用户,或者因为它正在重复在其训练数据中看到的模式。其次,模型对提问方式高度敏感。词序、空格或答案所使用的标签都可能完全改变结果。第三,模型随时间推移是不稳定的。一个模型今天可能会给出一个一致的答案,但如果软件在下个月进行了更新,同样的问题可能会产生完全不同的答案。由于这些问题,计算机可能看起来拥有某种人格或道德准则,但这些往往只是数据中转瞬即逝的模式,而非真正的心理特征。

为了向前迈进,论文认为研究人员必须采用“双重效度”框架。这意味着他们需要同时满足两套规则。第一套规则来自心理测试传统,它问道:“这项测试是否真的测量了它声称要测量的东西?”对于计算机而言,这要求证明其答案是连贯的,并且反映了一个真实的底层机制,而非仅仅是对提示词的随机反应。第二套规则来自因果推断传统,它问道:“我们的实验是否真的引起了我们所观察到的变化?”当研究人员改变提示词以观察其如何影响模型行为时,他们必须确保他们所做的改变是唯一的变量,而不是某些隐藏的技术设置或模型内部状态的变化。

该论文概述了一个科学雄心的阶梯,表明我们对这些机器的断言越高,所需的证据就越多。在底层水平,将计算机作为简单的文本分类或计数工具,只需保证工具的准确性即可。如果我们想要描述计算机自身的行为,例如说它具有某种“人格”,我们需要强有力的证据证明其答案是稳定且一致的。如果我们想要利用计算机模拟人类行为,我们需要展示它在特定且可靠的方式上与人类数据相匹配。在最高水平上,如果我们想要声称计算机的内部运作揭示了人类心灵是如何运作的,我们需要证明计算机使用的是类似于人类大脑的过程,而不仅仅是产生了相似的答案。目前,许多研究都在跳过这个阶梯的低层,直接跳到顶层,在尚未证明基础事实的情况下就声称发现了深刻的见解。

作者建议,解决方案不是强迫计算机表现得像人类,而是开发符合计算机实际情况的新概念。与其询问一台机器是否感到焦虑,研究人员应该寻找在功能上类似于焦虑的计算模式,例如系统在不确定时表现出的犹豫或使用负面语言。这种视角的转变允许科学家根据机器自身的特性来研究它。它承认计算机没有身体、没有生活史,也没有自我,但它仍然可以展示出有趣且有用的模式。通过建立这些新的、针对计算机特性的测量方法,并对数据所能证明和不能证明的内容保持严谨,该领域可以避免陷入“测量幻象”的陷阱。目标是将一系列统计上的奇特现象转化为一门真正的、关于人工智能的科学,一门尊重其研究对象独特本质的科学。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →