Measurement-bounded predictive inference in international large-scale assessment: how the plausible-value ceiling governs attainable accuracy and the stability of predictor rankings in PISA 2022
本研究表明,PISA 2022 合理值中固有的测量精度天花板从根本上限制了可达到的预测准确度,并导致不同领域和教育体系间的预测因子排名发生不稳定,因此必须要求绩效比较和模型解释以这些可计算的测量界限为基础。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
每年,全球有数百万青少年参加一项名为 PISA 的大规模测试,旨在评估他们在数学、阅读和科学方面的理解能力。这些结果被政府和教育工作者用于评判哪些学校和国家做得更好。近年来,研究人员开始利用这些测试成绩来构建计算机模型,试图根据学生的背景(如家庭收入、家中的书籍或学校氛围)来预测其成功程度。这些研究通常会产生一份重要因素的排名列表,暗示如果我们想要提高分数,就应该关注该列表顶端的项目。然而,这种方法存在一个隐藏的问题。这些研究中使用的测试成绩并不是对学生能力的直接观察。相反,它们是统计估计值,是通过从可能性云团中为每个学生抽取十个不同的可能数值而创建的。因为这些数字是估计值,所以它们包含了一定程度的内置噪声或不确定性,这是任何数据都无法解释消除的。这种不确定性为任何模型预测学生表现的能力设定了一个硬性限制,而这个限制会根据所测试的学科以及进行测试的国家而变化。
Jonas Mandalunes 的一项新研究调查了这种隐藏的噪声究竟在多大程度上限制了我们从这些大规模测试中学习的能力。研究人员使用了 2022 年 PISA 周期中的国际数据库,其中包括来自 80 个不同教育系统的 60 多万名学生的数据。该研究聚焦于四个领域:数学、阅读、科学,以及一个较新的领域——创造性思维。核心问题非常简单:计算机模型实际上能解释多少学生的得分,以及这种限制是否会改变看似最重要的因素列表?为了回答这个问题,研究人员为每个学科在每个国家计算了一个“天花板”。这个天花板代表了任何预测模型可能达到的最高准确度,仅仅是因为测试成绩本身并不完美。研究发现,这个天花板的变化范围极大。对于创造性思维,根据国家的不同,限制范围从大约 65% 到接近 90% 不等。对于数学,范围较窄但仍有变化,从大约 81% 到 93%。这意味着,在某些地方,没有任何模型能够解释超过三分之二的学生得分差异,而在其他地方,限制则要高得多。
该研究进一步探讨了这一限制是否会影响影响分数的因素排名。研究人员反复运行相同的计算机模型,每次使用十个可能的学生得分估计值中的不同一个。在测量最精确的学科中,顶层因素的列表基本保持不变。但在不太精确的学科(如创造性思维)中,列表发生了剧烈变化。当研究人员从一种得分估计值切换到另一种时,排名前五位的因素中,有超过 40% 会易位。这意味着,如果一项研究报告了一个单一的“最重要”因素列表,它本质上只是展示了一个更广泛、不断变化的现实中的随机快照。如果研究人员选择了不同的得分估计值,他们可能会得出完全不同的关于驱动学生成功的因素集的结论。
另一个关键发现涉及如何划分用于测试模型的数据。许多研究将来自不同学校的学生随机混合到训练组和测试组中。新研究表明,这种方法会产生一种虚假的准确感。由于同一学校的学生往往具有相似性,一个在训练期间见过特定学校学生的模型,可以学习到针对该学校的特定模式,而不是学习关于学生本身的信息。当研究人员强制要求模型在训练和测试期间保持整个学校的分离时,预测的准确度显著下降。在某些情况下,下降幅度巨大,揭示了之前的研究由于没有考虑学校结构,从而夸大了其结果多达 0.36 分。这种膨胀的大小取决于研究中包含多少所学校,而不是取决于所使用的计算机模型的复杂程度。
研究还探讨了为什么不同学科之间的得分精确度差异如此之大。研究发现,测试越依赖人工对开放式答案进行评分,得分的精确度往往就越低,尤其是在规模很大的国家。创造性思维完全由阅读书面回答的人类进行评分,显示出了最广泛的精确度变化。相比之下,主要由机器评分的数学则更为一致。这表明,测试的实施和评分方式与问题本身一样重要,决定了我们能从结果中学习多少。
这些发现对于任何试图理解教育数据的人来说,其意义是非常明确的。在不知道特定背景下的精确度天花板之前,你不能将一个模型的表现与另一个国家或另一个学科进行比较。在一个天花板较低的国家,一个解释了 45% 方差的模型实际上表现得相当好,捕捉到了几乎所有可知的信号。而同一个模型在天花板较高的国家可能表现较差,留下了大量的未解释信号。此外,任何源自这些测试的重要因素列表都应谨慎对待。由于排名会根据使用的得分估计值而发生大幅偏移,单一的列表不是一个稳定的事实,而是一个暂时的实现。研究结论指出,研究人员应始终在结果中报告精确度天花板,并应针对所有可能的得分估计值测试其模型,以观察其结论是否成立。如果没有这些检查,指导教育政策的排名和比较可能会建立在统计噪声而非坚实证据的基础之上。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。