Substituting National-IQ and Harmonized-Learning Indicators: An Output-Specific Replication and Sensitivity Audit
本文进行了一项比较国民智商与协调学习指标的敏感性审计,发现两者具有高相关性和相似的排名分布,但结论指出,尽管两者在统计学上具有相似性,但它们并非可以互换或因果等效的。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在对国家的研究中,研究人员经常试图衡量一个国家民众的集体智力水平。一种方法是收集通过对小规模群体进行智力测试所得到的得分,并将其平均化以创建一个国家估值。另一种方法则是观察数百万名中小学生在数学、阅读和科学方面参加的标准考试结果。多年来,这两组不同的数字一直被进行比较。当它们同步变动时——即拥有高考试成绩的国家也拥有高估算的智力得分时——有些人便假设这两者本质上是同一回事,是可以在研究中互换使用的等效工具。这种假设之所以诱人,是因为它简化了比较国家这一复杂任务。然而,两组数字之间的高相关性并不自动意味着它们在描述每一个具体国家时都在讲述同一个故事,也不保证在使用它们来预测经济成功时会得出相同的结论。
独立研究员乔治奥斯·基米诺斯(Georgios Kiminos)最近进行的一项审计挑战了这一假设。他并没有将这两种衡量标准视为孪生兄弟,而是将其视为需要针对特定问题进行测试的不同工具。这项研究提出了一个实际但并不华丽的问题:如果研究人员用一个协调后的学习得分取代国家智力得分,国家的排名会改变吗?表现最出色的国家名单是否保持不变?这些得分与一个国家财富之间的联系是否依然成立?为了回答这个问题,研究人员收集了恰好六十六个同时具备这两类得分的经济体的数据。随后,他进行了一系列检查,对比了这些国家在彼此之间的排序情况、哪些国家出现在列表的最顶端和最底端,以及每份名单对 2al 2017 年人均国内生产总值的预测强度。
结果显示,虽然这两个衡量标准密切相关,但它们并不能互换使用。当研究人员对这六十六个国家进行排名比较时,从智力得分切换到学习得分时,平均每个国家的排名上升或下降了近十个位次。虽然整体模式保持相似,但具体的顺序发生了足以产生影响的变化。例如,在观察顶尖国家群体时,两份名单在排名前七的国家中仅有四份达成一致。在列表底端,它们在排名最低的七个国家中仅有两份达成一致。这意味着,在一个系统中被视为领先者的国家,在另一个系统中可能仅被视为表现平平;而一个在其中一个系统中挣扎的国家,在另一个系统中看起来可能并不那么糟糕。这两个衡量标准就像两幅描绘同一地形的地图:它们展示了景观大致相同的轮廓,但如果你试图导航前往某个特定目的地,它们所建议的路线可能会大相径庭。
该研究还考察了这些得分在多大程度上能预测一个国家的经济财富。在这一特定的六十五个国家样本中,学习得分显示出与财富之间比智力得分略强的联系。然而,这种差异微小到统计测试无法确认其是一个真实的、可靠的优势,还是仅仅由于特定样本的使用而产生的偶然现象。研究人员发现,结果对于数据的构建方式非常敏感。当样本改变以包含不同的国家,或者当数据经过加权以反映人口规模而非将每个国家视为平等时,两种衡量标准之间的差异大小就会发生变化。在某些变体中,学习得分在预测财富方面表现得更好;而在另一些变体中,差距缩小甚至发生了逆转。至关重要的是,研究发现,尽管在主要分析中差异的方向保持一致,但差异的大小完全取决于包括了哪些国家以及如何对数据进行加权。
这项工作为任何使用国家数据进行广泛比较的人提供了一个警示案例。审计表明,高相关性并不是让两种不同衡量标准变得相同的魔杖。仅仅因为两份数字列表同步变动,并不意味着它们在细节上达成一致,也不意味着它们会导致相同的政策决策或研究结论。研究人员并未宣布其中一种衡量标准优于另一种,也没有证明其中一种是无效的。相反,这项研究强调了选择哪种数字是至关重要的。它表明,更换一种指标可能会改变国家排名,改变被识别为离群值的国家,并改变其与经济成果关系的强度。研究结果表明,在用一种衡量标准取代另一种之前,研究人员必须明确他们究竟想要保留什么——是具体的排名、顶尖表现者的分类,还是与某一结果的联系——并测试新指标是否确实能够守住这一阵地。如果没有这样的检查,这种替代行为就仍然是一个未经证实的猜测,而从中得出的结论也可能比看起来更为脆弱。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。