← 最新论文
📊 statistics

When the adjustment fails: population-denominator sensitivity in coverage-adjusted PISA trends

本文表明,PISA 的覆盖率调整后前四分之一趋势对人口分母的选择高度敏感,揭示了报告数据与《世界人口展望》估算值之间的显著差异,这强调了进行透明来源报告的必要性,并提醒在合成权重触发调整时应保持谨慎。

原作者: Jonas A. Mandalunes, Danica Jane S. Mandalunes

发布于 2026-08-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Jonas A. Mandalunes, Danica Jane S. Mandalunes

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

每隔几年,全球范围内就会在各地的教室里进行一次大规模的实验。成千上万名十五岁的青少年坐下来参加关于数学、阅读和科学的相同测试。这就是国际学生评估项目,即 PISA。这些结果不仅仅是学校的成绩单;它们是衡量一个国家年轻人为未来做好准备程度的一个缩影。由于这些测试是周期性进行的,研究人员可以回顾过去,观察一个国家的水平是在进步还是在退步。但这种比较中存在一个隐藏的复杂因素。参加测试的学生并不总是从前一年到下一年都代表同一类人口样本。在某些国家,测试可能覆盖了几乎所有的十五岁青少年;而在另一些国家,它可能只触及了极小的一部分。当学生群体发生变化时,平均分可能会发生偏移,这仅仅是因为人群的构成发生了变化,而不是因为学生本身学得更多或更少了。为了解决这个问题,组织测试的机构使用了一种特殊的数学调整方法。它试图估算如果测试触及了该国每一位十五岁青少年的话,那些表现最出色的学生会得到多少分,而不仅仅是那些实际参加测试的人。这个经过调整后的数字被认为是一种公平的方式,用于跨年份和跨国家地比较进步情况。

两位研究人员,Jonas A. Mandalunes 和 Danica Jane S. Mandalunes,决定看看这种调整到底有多脆弱。他们将注意力集中在拼图中最关键的一块:每个国家十五岁青少年的总数。这个数字充当了分母,或者说是分数的底部分,决定了调整的大小。研究人员提出了一个简单但深刻的问题:如果你改变这个底部的数字,最终结果会发生什么变化?他们并没有假设某一个来源的人口数据是完美的而另一个是错误的。相反,他们将两种不同的统计十五岁人口的方法视为两种不同的情景。一种情景使用了各国政府正式提交给测试组织者的数字。另一种情景则使用了联合国广泛认可的全球人口增长预测。通过用官方数字和全球预测进行两次完整的趋势分析,他们可以观察到一个国家的进步故事如何根据所使用的计数方式而发生变化。

研究人员查看了 2018 年至 2022 年间 73 个经济体的统计数据。他们发现,测试组织者使用的十五岁人口官方计数在许多地方发生了显著变化。平均而言,两个年份之间覆盖率的差异接近两个百分点,但在某些情况下,这种变化非常剧烈,单向波动可达 27 个百分点,或反向波动 45 个百分点。当他们拆解为什么这些数字会发生变化时,他们发现,在大多数情况下,这种转变来自于调查本身——也就是说,测试触及的在校学生比例发生了变化——而不是因为实际在校学生人数的变化。这一区别至关重要,因为它意味着得分上升可能并不意味着更多的孩子在接受教育,而可能仅仅意味着测试触及了不同的一群人。

最令人震惊的发现是最终趋势对这个分母的敏感程度。当研究人员将官方人口计数替换为联合国预测值时,估计的测试成绩变化发生了剧烈移动。在数学方面,两种情景之间的平均差异约为 3.4 分;在阅读方面为 3.5 分;在科学方面为 3.4 分。为了提供直观的参考,测试组织者发布了一个标准的“链接误差”(link error)值,以帮助读者理解其趋势中的不确定性程度。对于数学,该值为 2.24 分。仅仅通过改变人口计数所导致的差异,在 69 个国家中的 38 个国家里就超过了这个标准误差值。在阅读方面,这一差异在 52 个国家中超过了误差值,在科学方面,在 51 个国家中也超过了误差值。这意味着,对于大多数受研究的国家而言,选择使用哪个人口数字所产生的影响,比测试本身通常关联的统计不确定性还要大。

研究人员还检查了当数学运算遇到瓶颈时会发生什么。调整程序假设测试触及的学生人数少于实际存在的学生人数。但在少数特定案例中,数学计算却显示测试触及的学生人数超过了官方人口计数。当这种情况发生时,程序必须采取特殊补救措施:它简单地将多出的权重设为零,并报告参加测试学生的原始分数,实际上就是关闭了调整功能。这种情况发生在 2022 年的韩国和爱尔兰等国。研究人员指出,这种从调整后分数到原始分数的切换造成了数据的突然中断。这不是一个平滑的过渡,而是一个方法论完全改变的硬性停顿。他们还注意到,在某些情况下,官方人口计数高于测试声称触及的学生人数,如果两者的定义完全一致,这本应是不可能的,这表明测试组织者与人口统计学家对“十五岁”或“在校生”的定义可能存在差异。

这项研究并未得出结论说其中一个人口计数是真实的而另一个是错误的。研究人员谨慎地指出,无论是官方政府数据还是联合国预测,都不是绝对的真理。官方数字往往缺乏关于计数确切时间或所使用的具体“居民”定义的细节。全球预测则是基于假设的模型。核心问题在于,最终的趋势得分高度依赖于一个解释不充分且不一致的数字。研究人员发现,即使他们尝试通过剔除具有已知领土争议或记录不一致的国家来清理数据,差异依然存在。两种情景之间的差距并没有消失,只是发生了轻微偏移。这表明,这种敏感性是当前方法的一个基本特征,而不仅仅是数据混乱的结果。

最后,研究人员认为,这些趋势的报告方式需要做出改变,以便更诚实地对待这种不确定性。他们建议测试组织者应明确公布人口数字的来源,包括日期和具体的定义。他们建议,每当报告一个趋势时,都应附带一个范围,展示如果使用另一个合理的统计人口计数,结果会是什么样。这不会是统计学意义上的置信区间,而是一个清晰的陈述,说明结果在多大程度上取决于分母。最后,他们提议,如果因为数字无法匹配导致数学运算失效,那么调整后的分数不应被默默修复或隐藏,而应该被标记出来,直到输入数据得到统一。这项研究表明,国家正在进步或衰退的故事是真实的,但我们用来讲述这个故事的具体数字,远比看起来要脆弱得多。趋势确实存在,但其精确的幅度却受制于一个目前在黑暗中做出的数字选择。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →