← 最新论文
💬 NLP

A validity-guided workflow for robust large language model research in psychology

为了应对“测量幻象”威胁大语言模型心理学研究有效性的问题,本文提出了一个六阶段双重效度框架,旨在根据研究目标缩放严谨的心理测量与因果验证要求,从而为人工智能心理学确保稳健的实证基础。

原作者: Zhicheng Lin

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhicheng Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图研究一个非常精密的、会说话的机器人的性格。你向它提问,比如:“你是一个内向的人吗?”或者“在这样的道德困境中你会怎么做?”机器人给出的回答听起来非常像人类。但问题在于:这个机器人可能只是一个模仿大师,而不是一个拥有真实心灵的存在。

这篇由林志诚(Zhicheng Lin)撰写的论文指出,许多研究人员目前正在犯一个巨大的错误。他们将这些机器人(大语言模型,简称 LLM)视为真实的人,在没有意识到机器人往往只是在对问题中微小的、不可见的技巧(比如标点符号的变化或不同的字体)做出反应时,就草率地得出关于它们“思想”或“感受”的结论。

作者将这些虚假的结果称为**“测量幻象”(Measurement Phantoms)**。把它们想象成错觉。你看到一个看起来像脸的形状,但那只是光影造成的视觉差。同样,机器人可能看起来拥有“心理理论”(理解他人的能力),但它实际上只是根据其训练数据中的模式进行猜测。

为了解决这个问题,论文提出了一个六步“安全检查清单”(工作流),以确保我们不是在追逐幽灵。以下是它的运作方式,使用简单的类比来解释:

问题所在:“魔术 8 号球”陷阱

想象你有一个魔术 8 号球(Magic 8-Ball)。如果你以一种方式摇晃它,它说“是”;如果你稍微换一种方式摇晃,它说“否”。如果你声称这个 8 号球的“性格”会根据你握持的方式而改变,那你就错了。它只是一个机械性的把戏。

论文指出,许多当前关于 AI 心理学的研究就像这样。你问 AI 一个问题,得到一个答案,然后说:“看!这个 AI 有良知!”但如果你把问题从“案例 1”改为“(A)”,AI 的“良知”就消失了。这项研究测量的不是心灵,而是一个程序漏洞(glitch)。

解决方案:六阶段工作流

作者建议我们停止猜测,开始建立一个用于测试 AI 的科学工厂。以下是六个阶段:

第一阶段:定义你的目标(“我们在做什么?”步骤)

在开始之前,你必须决定你到底在寻找什么。

  • 类比: 你是在雇佣一个机器人来做一项工作(比如分拣邮件)?还是在试图研究机器人的性格(比如心理学家研究对象)?
  • 规则: 如果你只是想让机器人分拣邮件,你只需要检查它的准确性。但如果你想声称这个机器人具有“焦虑”或“道德推理”能力,你需要一个更严格、更全面的心理学测试。你不能用一把尺子去测量温度。

第二阶段:构建有效的测试(“校准”步骤)

你不能只是随机问机器人问题。你需要一个真正有效的测试。

  • 类比: 想象你想测试一个新的温度计是否有效。你不会直接把它插进一杯水里然后凭感觉猜测。你会先用沸水和冰水来校准它。
  • 规则:
    • 可靠性(Reliability): 如果你问机器人同一个问题 20 次,它是否给出相同的答案?(如果每次都在变,说明测试失效了)。
    • 无“提示词技巧”(No "Prompt Tricks"): 如果你把逗号换成句号,答案会改变吗?如果是,那么这个测试测量的是标点符号,而不是机器人的“心灵”。
    • 重新概念化(Reconceptualize): 由于机器人没有感受,你不能直接测量“悲伤”。你必须测量在机器人身上“悲伤”表现出的特征(例如:它是否一致地使用悲伤的词汇?)。

第三阶段:设计实验(“控制”步骤)

现在你开始运行测试,但你必须成为一名严谨的科学家。

  • 类比: 如果你在测试一种新药,你需要一个对照组。你不能只给一个人服药,然后就说“它奏效了!”
  • 规则: 你必须控制所有变量。机器人改变答案是因为你的实验,还是因为后台的模型更新了?你必须锁定每一个变量,这样你才能确定结果是真实的。

第四阶段:执行与记录(“录像记录”步骤)

运行实验并记录下所有细节。

  • 类比: 如果你在拍摄电影,你不仅要保留最终剪辑版。你还要保留原始素材、剧本和灯光设置。
  • 规则: 由于 AI 模型不断变化(例如软件更新),你必须保存你使用的确切版本、提问的确切时间以及你输入的精确文字。如果你不这样做,以后就没人能核查你的工作。

第五阶段:分析数据(“数学检查”步骤)

观察结果,但要小心你的数学计算。

  • 类比: 如果你问你的好朋友 100 次“你喜欢披萨吗?”,他们回答了 100 次“是”,这并不意味着有 100 个不同的人喜欢披萨。这只是同一个人回答了 100 次。
  • 规则: 标准数学假设每个答案都来自不同的人。但在 AI 研究中,所有的答案都来自同一个“大脑”。论文指出,你需要特殊的数学方法来解释这一点,否则你会误以为发现了一个并不存在的模式。

第六阶段:报告与完善(“诚实的故事”步骤)

告诉世界你的发现,但不要夸大其词。

  • 类比: 如果你发现了一种新的鸟类,你应该准确描述它的样子。不要仅仅因为它有翅膀就说“它是一条龙”。
  • 规则: 不要说“AI 拥有灵魂”。要说“当以此种方式提示时,该 AI 会一致地使用自我指涉性语言”。利用这些结果为下次测试构建更好的工具。

大局观

论文的结论是,我们需要放慢脚步。那种急于发布关于“AI 拥有情感”这类耸动标题的行为,正在制造一座纸牌屋。

相反,我们需要建立一个坚实的、经过验证的工具基础。如果我们这样做,我们就不会只是在追逐“测量幻象”。我们将真正理解这些机器是如何运作的,从而区分出一个机器人是在进行真正的“思考”(在计算意义上),还是仅仅是一个非常出色的演员。

简而言之: 不要仅仅因为机器人的回答听起来很聪明就相信它。建立一个更好的测试,控制你的变量,并且在证明它不仅仅是一个光影把计时,不要声称机器人是人类。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →