← 最新论文
💬 NLP

Aligning LLM-Simulated and Human Examinees for Psychometric Calibration: A Cognitive Diagnostic Profiling Approach

本文介绍了认知诊断剖析(CDP),这是一个零样本框架,通过提示大语言模型模拟多样化的考生认知剖析,显著提升了它们在能力分布、掌握模式和题目难度方面与人类受试者的对齐程度,从而实现实用且具成本效益的心理测量校准。

原作者: Wenjie Zhou, Yunting Liu, Renjiao Tang, Mark Wilson

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenjie Zhou, Yunting Liu, Renjiao Tang, Mark Wilson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位试图编写新数学测试题的老师。在把试卷发给真正的学生之前,你需要知道:这道题是不是太难了?那道题是不是太简单了?通常情况下,唯一的办法是让一大群真实的儿童参加测试,批改他们的试卷,然后进行数据分析。这既缓慢、昂贵,又费时费力。

于是,“模拟学生”出现了。科学家们一直尝试使用人工智能(AI)来扮演这些学生的角色。其核心想法是要求一个超级聪明的计算机参加测试,生成答案,然后利用这些答案来判断题目难度。这听起来像是节省时间和金钱的捷径。但问题在于:这些 AI 学生实在“太完美”了。他们就像是一个班级的学生全都是从不犯错的天才,而且每个人回答问题的方式都完全一样。如果你根据一群完美天才的表现来评分,你会认为每道题都很简单,从而忽略了那些真正遇到困难的学生。AI 太过统一且过于精准,无法成为一个真实、复杂课堂的现实替代品。

这就是 Wenjie Zhou 及其同事的一项新研究所要解决的问题。他们提出了一个简单的问题:我们能否教会 AI 成为一名“差生”?不仅仅是一个随机的差生,而是一个拥有特定、现实技能组合的学生——比如,一个擅长加法分数但极其不擅长简化分数的学生?他们开发了一种名为**认知诊断剖析(Cognitive Diagnostic Profiling, CDP)**的方法。他们不再只是要求 AI “参加测试”,而是给它一份详细的“角色设定表”,描述这个 AI 学生掌握了哪些技能,又缺失了哪些技能。通过向 AI 输入这些特定的剖析信息,他们成功创建了一个看起来和行为上都与真实课堂高度相似的模拟课堂,其中既有天才,也有普通学生,还有在特定概念上挣扎的学生。

“完美”AI 学生的问题

研究人员首先测试了如果仅仅要求大型语言模型(LLM)——即驱动聊天机器人的那种 AI——去参加测试会发生什么。他们使用了一个经典数据集:536 名参加了 15 道分数减法测试的真实初中生。该测试旨在检测五项特定技能,例如“从整数中借位”或“将整数转换为分数”。

当 AI 在没有任何特殊指令(“无剖析”基准)的情况下参加测试时,它的表现得像个超人。它几乎答对了所有题目。结果呈现出一种枯燥的统一性:AI 学生都聚集在得分范围的顶端,使得测试看起来异常简单。研究人员发现,AI 的答案与真实的人类数据完全不匹配。AI 太聪明、太一致了,产生了一种“过度准确的诅咒”,导致它无法模拟真实课堂的多样性。这就像是通过只观察晴天来预测天气一样;你会错过雨、风暴和云层。

解决方案:给 AI 一份“角色设定表”

为了解决这个问题,团队引入了认知诊断剖析(CDP)。你可以把它理解为在 AI 开始测试前,给它一份详细的传记。

  1. 蓝图: 首先,他们将测试分解为五个核心技能(属性)。
  2. 剖析: 他们不再只是说“扮演一个学生”,而是为每个模拟学生创建了一个“剖析”。这个剖析是一组二进制开关:“会技能 A 吗?是。会技能 B 吗?否。”
  3. 转化: 他们将这些开关转化为自然语言。例如,一个剖析可能会写道:“你是一名非常擅长简化分数,但在从整数中借位方面感到困难的学生。你理解基础知识,但在处理复杂数字时会感到困惑。”
  4. 模拟: 他们将这段描述与测试题目一起输入给 AI。随后,AI 就会仿佛是那个特定的学生一样进行回答。

他们测试了两种创建剖析的方法。第一种方法是无信息 CDP(Uninformative CDP),他们随机分配技能给 AI 学生,创造了广泛的能力组合。第二种方法是有信息 CDP(Informative CDP),他们利用真实人类学生的数据来决定创造多少“天才”、多少“普通”学生以及多少“挣扎”的学生,从而模仿现实课堂中真实的技能分布。

结果:从“完美”到“真实”

结果带来了颠覆性的变化。当 AI 学生获得这些角色设定表后,模拟过程突然变得真实起来。

  • 分布情况: 在“无剖析”版本中,AI 学生都挤在顶端。有了剖析后,分数分布开来了。使用“有信息 CDP”方法生成的钟形曲线与真实人类的分布几乎完全一致。AI 的能力分布与人类分布之间的重叠度从最初较低的 0.36 跃升到了 0.83(其中 1.0 代表完全相同)。
  • 剖析一致性: 研究人员检查了 AI 是否真的表现得像它所扮演的角色。如果剖析说“不擅长借位”,那么 AI 是否会在相关题目上出错?是的。AI 的表现与针对该特定技能剖析的预期人类表现之间的相关性极高,范围在 0.92 到 0.98 之间。这意味着 AI 不仅仅是在瞎猜,它确实在模拟具有特定优劣势的学生的认知状态。
  • 测试难度: 这是最重要的一部分。目标是看 AI 能否帮助确定测试题目的难度。没有剖析时,AI 认为题目太简单了(其难度估计的误差——“均方根误差”超过了 6)。有了剖析后,AI 的估计变得精准得多。对于表现最好的模型(开启了“思考”模式的 Gemini 3.0 Flash),误差从 6.31 大幅下降到了仅 0.90。AI 从认为每道题都是小菜一碟,转变为能够准确预测哪些题目难、哪些题目易,几乎完美地匹配了真实的人类数据。

这为什么很重要

这项研究表明,我们不需要等待成千上万名真实学生参加测试才能知道一份试卷的好坏。通过使用这种“基于剖析”的方法,我们可以生成真实的模拟数据,从而更快、更便宜地校准测试。核心启示在于:AI 需要被告知它“是谁”。如果没有特定的认知剖析,AI 默认会变成一个完美且不真实的机器人。有了剖析,它就变成了一个多样化、有缺陷且真实的个体。

研究人员发现,这种方法在具有“推理”能力的模型(如某些 AI 模型中的“思考”模式)中效果最好,因为这些模型似乎能更好地遵循复杂的技能剖析逻辑。然而,他们也指出,这是一种模拟。虽然 AI 的答案与人类的数学表现相符,但我们并不知道 AI 是否真的以人类的方式在“思考”,还是仅仅在预测正确的词汇。但就设计更好测试的目的而言,这种模拟是一个强大的工具,它让我们向着一个测试开发更快、更便宜、更具包容性的未来迈出了巨大的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →