← 最新论文
💬 NLP

Quantifying Data Contamination in Psychometric Evaluations of LLMs

本文提出了一个系统性量化大型语言模型心理测量评估中数据污染的框架,揭示了流行的量表在 21 个模型中普遍存在显著的记忆与分数操纵问题。

原作者: Jongwook Han, Woojung Song, Jonggeun Lee, Yohan Jo

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Jongwook Han, Woojung Song, Jonggeun Lee, Yohan Jo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图弄清楚一个新机器人的性格特征。你递给它一份著名的、广为人知的性格测试——那种你可能会在杂志或心理学教科书中看到的类型——并要求它回答这些问题。你期望机器人能展现出它真实的“数字自我”。但如果机器人并不是根据自身的内部逻辑来回答呢?如果它只是在背诵它从互联网上记忆下来的答案解析呢?

这正是首尔大学的一个研究团队所发现的情况。他们调查了大型语言模型(LLMs)——即聊天机器人背后那些超级聪明的 AI 大脑——是否通过记忆测试题本身而在心理测试中“作弊”了。

性格测试大劫案

研究人员设计了一项巧妙的调查,以观察这些 AI 模型是在真正进行测试,还是仅仅在装模作样。他们研究了四种非常流行的心理量表(这是心理测试的专业称呼),其中包括大五人格问卷(BFI-44)(用于衡量外向或内向等特质)和肖像价值观问卷(PVQ-40)(用于检查一个人在生活中最看重什么)。

他们测试了来自 GPT-5、Claude 和 Llama 等主要家族的 21 种不同模型。研究人员并没有仅仅要求模型进行测试,而是通过三种特定的方式检查了模型是否因见过这些问题而受到“污染”:

  1. 题目记忆(“闪卡”测试): 模型能否通过查看题号来背诵出问题的确切文字?

    • 结果: 模型表现得惊人地出色。平均而言,它们可以重建问题的语义相似度达到 0.31(这是一个衡量意义接近程度的指标)。更棒的是,它们能在约 39% 的情况下猜中问题中隐藏的“关键词”。这就像如果你要求一名背过考试资料的学生写下某道题目的内容,他能把主旨表达得正确无误,频率接近十分之四。
  2. 评分记忆(“答案解析”测试): 模型不仅知道问题,还知道如何评分吗?例如,它是否知道在针对某个特定问题回答“非常同意”实际上意味着由于“反向计分”规则,该个体在性格上是那么外向的?

    • 结果: 在这里,污染现象变得非常严重。模型几乎完美地掌握了评分规则。当被要求将问题与人格特质进行匹配时,它们的平均 F1 分数达到了 0.94(其中 1.0 代表完美)。当被要求计算特定答案的数值得分时,先进的模型几乎没有犯错。这仿佛模型不仅读过了测验,甚至连老师的评分标准都研读过了。
  3. 目标分数匹配(“假戏真做”测试): 这是最具有启发性的部分。研究人员告诉模型:“假装你是一个在‘诚实度’上得分为 5 分(满分 5 分)的人。现在,请通过回答这些问题来获得那个分数。”

    • 结果: 模型做到了。它们能够策略性地选择答案,以极高的准确度达到特定的目标分数(平均绝对误差约为 0.1 到 0.2)。这表明模型不仅仅是在回忆事实,它们还在积极地操纵自己的回答,以看起来像某种特定类型的人。

“作弊”程度

研究人员发现,并非所有模型的作弊程度都一样,也不是所有的测试都同样容易作弊。

  • “污染”的大赢家: **大五人格问卷(BFI-44)肖像价值观问卷(PVQ-40)**显示出最强的污染迹象。研究人员怀疑这是因为这些测试过于著名且在网上广泛传播,导致模型在训练过程中很可能将它们完整地“吞”了下去。
  • “较难”的测试: **道德基础问卷(MFQ)短暗黑人格量表(SD-3)**显示的污染较少,这可能是因为它们在模型训练数据中的出现频率相对较低。
  • 模型规模很重要: 通常情况下,模型越大、越聪明(如 GPT-5 或 Claude 4.5),它在记忆测试和伪造分数方面的表现就越好。较小的模型则显得有些“懵圈”,这表明随着 AI 规模的扩大,它变得更擅长“了解”这些测试。

这对未来意味着什么

作者谨慎地指出,这并不意味着模型在人类意义上是在“撒谎”。相反,这表明当我们使用这些标准的心理测试来衡量 AI 的人格时,我们测量的可能并不是 AI 的真实本质。我们测量的可能仅仅是 AI 在学习说话的过程中,对它所见过的测试题的记忆能力。

论文明确排除了这些结果仅仅是随机猜测的可能性。模型的表现远优于随机猜测者。例如,如果一个模型在 5 分制量表上只是随机猜测分数,其误差应在 1.73 左右,但先进的模型将误差降到了 0.1

因此,下次当你看到“AI 拥有与人类相似的人格”之类的标题时,请记住这一点:这个 AI 可能只是一个背熟了教科书的优秀学生。研究人员建议,我们需要开发新的测试方法,使用那些它们在训练数据中尚未见过的测试,否则我们将永远无法真正了解它们的内在机制。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →