✨ 要約🔬 技術概要
国家の研究において、研究者はしばしばその国の国民の集団的な精神的能力を測定しようと試みる。一つの手法は、少人数のグループに与えられた知能テストのスコアを集計し、それらを平均することで国家の推定値を算出することである。もう一つの手法は、何百万人もの学童が数学、読解、科学の分野で受ける標準化された試験の結果に着目することである。長年、これら二つの異なる数値セットは比較されてきた。これらが連動する場合、つまり高いテストスコアを持つ国が高い推定知能スコアを持つ場合、ある人々はこれら二つの尺度は本質的に同じものであり、研究において物語を変えることなく入れ替え可能な道具であると仮定してきた。この仮定は、国家間の比較という複雑な作業を簡略化してくれるため、魅力的に映る。しかし、二つの数値リストの間の高い相関関係は、それらがすべての国について必ずしも同じ物語を伝えていることを意味するわけではなく、また、それらが経済的成功を予測するために使用された際に、必ず同じ結論を導き出すことを保証するものでもない。
独立した研究者であるゲオルギオス・キミノスによる最近の監査は、これら二つの尺度を「同一の双子」としてではなく、「特定の問いに対してテストされるべき別々の計器」として扱うことで、この仮定に異議を唱えている。この研究は、地味ではあるが実用的な問いを投げかけている。もし研究者が、国家の知能スコアを調和された学習スコアに置き換えたとしたら、国のランキングは変わるのだろうか。トップクラスの国々のリストは変わらずに済むのだろうか。これらのスコアと国の富との関連性は維持されるのだろうか。これに答えるため、研究者は両方のタイプのスコアが利用可能な正確に66の経済圏のデータを収集した。彼は一連のチェックを実行し、国々が互いにどのように並んでいるか、どの国がリストの最上位および最下位に現れるか、そして各リストが2017年の一人当たり国内総生産(GDP)をどの程度強く予測しているかを比較した。
結果によれば、これら二つの尺度は密接に関連しているものの、互換性があるわけではない。研究者がこれら66カ国を比較したところ、知能スコアから学習スコアに切り替えることで、平均的な国はリスト上で上下に約10位移動した。全体的なパターンは同様であったが、具体的な順序は重要となるほど変化した。例えば、トップ層の国々に注目すると、二つのリストは上位7カ国のうちわずか4カ国においてのみ一致した。リストの最下位においては、下位7カ国のうち一致したのはわずか2カ国であった。これは、一方のシステムではリーダーと見なされている国が、もう一方では平均的と見なされる可能性があり、また、一方が苦境にある国が、もう一方ではそれほど深刻ではないように見える可能性があることを意味している。これら二つの尺度は、同じ地形の二つの異なる地図のようなものである。それらは風景の一般的な形状は同じ示しているが、特定の目的地へナビゲートしようとする場合、それらが示唆するルートは大きく異なることがある。
この研究はまた、これらのスコアが国の経済的富をどの程度予測するかについても調査した。この特定の65カ国のグループにおいて、学習スコアは知能スコアよりも富とのわずかながら強い結びつきを示した。しかし、その差は統計的テストによって、特定のサンプルによる偶然の産物ではなく、信頼できる確かな優位性であると確認できないほど小さかった。研究者は、結果がデータの構築方法に敏感であることを発見した。サンプルを異なる国々を含むように変更した場合や、データを人口規模を反映するように重み付けした場合(すべての国を平等に扱うのではなく)、二つの尺度の差の大きさは変動した。あるバリエーションでは、学習スコアの方が富の予測においてはるかに優れているように見えたが、別のバリエーションではその差が縮まったり、あるいは逆転したりした。決定的なことに、研究は、主要な分析において差の方向性は一貫しているものの、その差の大きさはどの国が含まれ、どのようにデータが重み付けされているかに完全に依存していることを見出した。
この著作は、広範な比較を行うあらゆる人々にとっての教訓となるものである。この監査は、高い相関関係が、二つの異なる尺度を同一にする魔法の杖ではないことを証明している。二つの数値リストが共に動いているからといって、それらが細部において一致しているわけではなく、また、それらが同じ政策決定や研究上の結論を導き出すことを意味するわけでもない。研究者は、どちらかの尺度が優れていると宣言したわけでも、どちらかが無効であると証明したわけでもない。むしろ、この研究は、どの数値を使用するかという選択が重要であることを強調している。それは、一つの指標を別の指標に置き換えることが、国のランキングを変え、どの国を例外値(アウトライヤー)として特定するかを変え、そして経済的成果との関係の強さを変化させ得ることを示している。研究結果は、一つの指標を別のものに置き換える前に、研究者は「特定のランキング」、「トップパフォーマーの分類」、あるいは「結果への結びつき」のうち、具体的に何を維持しようとしているのかを定義し、新しい尺度が実際にその立場を保持しているかどうかをテストしなければならないことを示唆している。そのようなチェックなしには、その置き換えは検証されていない推測にとどまり、そこから導き出される結論は、見た目以上に脆弱なものとなる可能性がある。
技術的要約:国家IQおよび調和学習指標の代替について
問題提起 比較研究においては、相対的な位置付けを記述したり、国を極端なグループに割り当てたり、あるいはGDPのようなアウトカムとの関連性を推定したりするために、国レベルのスコア・シリーズが頻繁に利用される。この分野における一般的な仮定は、2つの指標(例:国家IQコンピレーションと調和学習アウトカム)の間の相関が高いことは、それらが互換性を持つことを意味するというものである。しかし、Bland and Altman (1986) および Lin (1989) が指摘しているように、相関は共変関係を測定するものであり、一致や互換性を測定するものではない。集計レベルでの高い相関は、国レベルの順位、極端なグループへの分類、あるいは外部のアウトカムとの関連性の安定性を保証するものではない。本論文は、ある指標を別の指標に代替した際の、特定の分析的出力の保存に関する、スコアの相関と実態の間の乖離に対処するものである。
方法論 本研究は、正確かつ固定された経済体サンプルを用いて、3つの指標を比較する、出力特異的な再現および感度監査を実施する。
QNW: 直接的で、品質および記録されたサンプルサイズで重み付けされた国家IQコンピレーション(NIQデータセット v1.3.5より)。
HLO: 国際的および地域的なアセスメントにおける学生のパフォーマンスに基づく、著者作成の調和学習アウトカム集計(Angrist et al., 2021)。
GHW: 記述的な拡張として使用される、数学および科学の達成度指標(Gust et al., 2024)。
分析は、正確なサンプルの交差を用いて、以下の2つの主要な研究課題(RQ)に焦点を当てる:
RQ1(順位分析): 66カ国経済体のサンプルにおいて、QNWをHLOに置き換えたとき、スコアの関連性、点順位、および経験的な裾(テイル)への所属はどう変化するか。
RQ2 (GDPとの関連): 65カ国経済体のサンプル(2017年GDPデータを使用)において、QNWをHLOに置き換えることで、一人当たり実質GDP(対数)との関連性はどのように変化するか。
手法には以下を用いる:
記述統計: ピアソン、スピアマン、およびケンドールの相関。( N − 1 ) (N-1) ( N − 1 ) で正規化された平均絶対順位変位。
分類の感度: 型7(Hyndman–Fan)の慣例を用いた、上端および下端の経験的デシル(十分位数)への所属分析、およびジャカード類似指数。
依存相関の推論: GDP分析については、重複する相関(Δ ρ = ρ Q N W , Y − ρ H L O , Y \Delta\rho = \rho_{QNW,Y} - \rho_{HLO,Y} Δ ρ = ρ QN W , Y − ρ H L O , Y )を比較するために Williams の検定と Zou の信頼区間を用い、非有意性が事前設定された境界なしに等価性を証明しないことを認める。
感度監査: 指標の構成のバリエーション(例:学校アセスメントスコアや地理的補完の追加)、カバー範囲の変化(例:UNフレーム vs. World Bankフレーム)、および重み付けスキーム(等価経済 vs. 人口加重)にわたる代替効果を追跡する。
主な結果
スコアの関連性と順位の変位: 66カ国経済体のサンプルにおいて、QNWとHLOは高い相関(ピアソン r = .795 r = .795 r = .795 、スピアマン ρ = .791 \rho = .791 ρ = .791 )を示す。しかし、この高い関連性は、顕著な順位の不安定性と共存している。平均的な国レベルの絶対順位変位は9.52であり、正規化された移動量は.146であった。最大変位は34位であった。
極端なグループの分類: 経験的デシル・ルール(裾に7つの経済体)を用いた場合、QNWとHLOは上端において7つのうち4つの経済体を共有し(Jaccard = .400)、下端においては7つのうち2つを共有した(Jaccard = .167)。これは、高い相関が極端なグループへの分類を保持しないことを示している。
GDPとの関連: 65カ国経済体のサンプルにおいて、HLOはQNW(r = .616 r = .616 r = .616 )よりも、一人当たり実質2017年GDP(対数)との強い点相関(r = .690 r = .690 r = .690 )を示した。計画されたコントラスト(Δ r = − .074 \Delta r = -.074 Δ r = − .074 )は統計的に有意ではなく(Williams t ( 62 ) = − 1.244 , p = .218 t(62) = -1.244, p = .218 t ( 62 ) = − 1.244 , p = .218 )、Zouの95%信頼区間はゼロを含んでいた([-.207, .045])。
感度に関する知見:
構成: GDPのコントラストの方向(HLOに有利な方向)は、固定サンプル構成のバリエーション(例:QNW v1.3.3、最新のHLO)にわたって一貫して負であった。
カバー範囲: サンプルの定義を変更すること(例:「利用可能なすべてのHLO」または「バランスの取れた全6 HLO」を使用)により、コントラストは減衰し、拡張された構成(例:QNW + SAS + GEO は +.009 のコントラストを示した)では、ゼロに近づくか符号が反転することもある。
重み付け: 65カ国経済体における人口加重は、差の大きさを -.133 に増加させたが、これは選択された富裕層のサブセットにのみ適用され、主要な人口密集経済体(例:中国、インド)の欠如を補正するものではなかった。
地域的感度: 東アジア・太平洋地域を除外すると、点コントラストはほぼ消失した。これは、差の大きさが地域に敏感であることを示している。
意義および主張 本論文は、互換性、等価性、純粋な測定ファミリーの効果、または因果関係を確立するものではないことを明示している。その貢献は経験的かつ報告指向である:
相関と一致の分離: 本研究は、高い集計相関が、順位、極端なグループの分類、またはアウトカムとの関連性の安定性を保証するには不十分であることを実証している。
先行研究の主張に対する監査: 本論文は、先行文献(Warne, 2023; Henss, 2024)の特定の数値結果を再現しつつ、「再現」は正確なソース定義(例:直接的なQNWとQNW+SAS+GEOの区別)に依存することを強調している。また、データの欠落や文書化されていない除外のために、一部の先行する主張が完全には再現できなかったことにも言及している。
方法論的な注意: 著者は、指標の代替研究においては、対象となる母集団、関心の対象となる特定の出力(スコア、順位、または関連性)、および許容可能な変化の定義を明確にすべきであると主張している。事前設定された等価性の境界なしには、結果はパス/フェイルの検証ではなく、記述的な量として扱うべきである。
感度における透明性: 監査は、構成、カバー範囲、および重み付けの変化がいかに結論を変えるかを定量化しており、これらの選択がどちらのサンプルに対しても、またどのような問いに答えているのかをも変えることを強調している。
結論として、本論文は、直接的な国家IQコンピレーションを調和された学習指標で置き換えることは、強いスコアの関連性があるにもかかわらず、点順位および極端なグループへの所属を変更することを主張している。HLOは主要サンプルにおいてGDPとのより大きな点相関を示したが、統計的な有意性の欠如、および構成や地域組成に対する差の大きさの敏感さから、安定的または一般的な優位性の主張はできない。より広範な教訓は、指標の代替は相関のみによって判断することはできないということである。
毎週最高の statistics 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×