← 最新论文
📊 statistics

An Examination of the Performance of Variance Estimators in International Large-Scale Assessments

这项蒙特卡洛模拟研究评估了国际大规模评估中 BRR、JK2 和自助法(Bootstrapping)方差估计量的性能,发现虽然 JK2 对于均值等平滑统计量具有更高的精确度,但自助法和 BRR 对于非平滑统计量更为准确,并且 Fay 调整和无回答处理显著影响估计量的可靠性。

原作者: Umut Atasever, Sabine Meinck, Diego Cortes

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Umut Atasever, Sabine Meinck, Diego Cortes

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在大规模教育测试领域,各国都在比较其学生在数学和科学方面的学习水平,而报告的数字绝非简单的平均值。每一个关于国家排名的头条新闻背后,都隐藏着一段复杂的统计旅程。为了获得可靠的数字,研究人员不会测试每一位学生;相反,他们会从数千所学校中抽取具有代表性的群体。这个过程被称为抽样,它引入了自然的确定性缺失。正如气象预报员无法绝对确定每个城镇的温度一样,教育工作者如果不测试所有学生,就无法得知一个国家所有学生的精确平均分。样本结果与真实总体值之间的差距被称为抽样误差。为了使结果值得信赖,科学家必须计算出这种误差可能有多大。他们通过估算“方差”来实现这一点,方差是衡量如果使用另一组学生重复进行研究时,结果可能会产生多大波动的指标。如果该估算值过小,研究人员可能会错误地声称两组之间的差异是真实的,而实际上它只是随机噪声;如果估算值过大,他们可能会错过真正的进步。几十年来,用于进行这些估算的标准化工具是专门设计的数学配方,旨在处理学校调查中混乱的现实情况,即学生聚集在教室中,且学校规模差异巨大。

国际教育成就评估协会的一个研究小组致力于测试这些标准配方究竟表现如何。他们并非在观察特定年份的真实测试成绩,而是构建了一个庞大的、真实的数字化学生与学校世界,以观察应用这些数学方法时会发生什么。他们创建了一个包含超过50 0万名学生和5000所学校的模拟总体,镜像了真实国际评估的结构。从这个数字宇宙中,他们抽取了数千个不同的样本,模拟了真实调查的开展方式,包括一些学校拒绝参与的情景。随后,他们将数据代入目前最常用的统计方法:平衡重复复制法(Balanced Repeated Replication)、杰克奈夫重复复制法(Jackknife Repeated Replication)以及自助法(Bootstrapping)。他们在各种条件下测试了这些方法,例如样本中的学校数量为奇数时、样本量较小时,以及非响应导致数据出现缺口时。他们的目标是观察哪种方法产生的误差估算值最接近“真实”的不确定性,因为他们拥有整个模拟总体来进行对比。

调查结果显示,最好的工具很大程度上取决于你想要测量的内容以及你的样本规模。当研究人员观察平滑统计量(如所有学生的平均分)时,标准方法表现得非常好。在这种情况下,杰克奈夫方法——其原理是通过系统地每次剔除一对学校来观察结果的变化——表现出了最高的精确度。它始终能提供最稳定的估算,这意味着计算出的误差不会随一个样本到另一个样本之间剧烈跳动。然而,当研究人员观察非平滑统计量(如中位数或达到特定基准的学生百分比)时,情况发生了变化。这类数字更加崎岖且难以捉摸。在这里,平衡重复复制法(利用不同的数学平衡机制来创建数据子集)和自助法(通过有放回地对数据进行重采样)的表现优于杰克夫法。它们为这些更复杂的统计量提供了更准确的误差估算。

研究的很大一部分集中在研究人员为处理现实世界的复杂情况(如学校退出调查或一组学校的数量为奇数)而进行的调整上。一种被称为 Fay 修改的方法旨在平滑计算过程。研究人员发现,虽然这种调整对某些方法很有帮助,但如果应用过于激进,它实际上会对其他方法产生负面影响。具体而言,使用某些主要国际报告中常见的 50% 高调整因子,往往会导致某些统计量的误差被高估。研究表明,较为温和的调整(约 10% 或 30%)通常会产生更好的结果,使估算值更接近真相,而不会引入不必要的噪声。此外,研究人员还检查了运行“全量”版本(生成两倍子集)的杰克奈夫方法是否值得投入额外的计算机时间。他们发现,额外的努力并没有带来太多的准确性提升;对于大多数用途而言,简单的“半量”版本同样出色,这提供了一种在不牺牲可靠性的前提下节省大量计算资源的方法。

研究还强调了研究人员在处理缺失数据时面临的一个关键问题。当学校不参与时,剩余学校的分组方式至关重要。一种方法是保持原有的分组计划,即使某个学校缺失;另一种方法则是重新对剩余学校进行分组以形成新的配对。模拟显示,在学校缺失时保留原始分组会导致误差被严重低估,使结果看起来比实际更精确。相反,另一种重新分组的方法可能会导致误差被高估。研究人员发现,重新配对参与学校以形成新组的标准做法通常能产生更可靠的结果,尽管处理这些缺口时需要仔细注意具体方法,以避免得出误导性的结论。

最终,这项研究为应对这些统计选择提供了一张清晰的地图。它表明,对于大规模评估,不存在适用于所有情况的单一“最佳”方法。如果目标是估算大规模群体的平均表现,杰克奈夫方法是一个稳健且高效的选择。如果关注点在于百分位数或特定的基准,那么平衡重复复制法或自助法可能更为优越。研究还提出了一个减少计算负担的实用建议:简单的“半量”杰克奈夫方法足以满足大多数需求,从而让研究人员无需为了边际收益而将计算时间增加一倍。通过理解哪种工具最适合哪项工作,并对如何处理缺失数据保持谨慎,负责运行这些全球测试的机构可以确保其发布的数字能够真实反映衡量数百万学生教育水平时所固有的不确定性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →