Substituting National-IQ and Harmonized-Learning Indicators: An Output-Specific Replication and Sensitivity Audit
이 논문은 국가별 IQ와 조화된 학습 지표를 비교하는 민감도 감사를 수행하여 높은 상관관계와 유사한 순위 분포를 발견하였으나, 통계적 유사성에도 불구하고 두 데이터 세트가 상호 대체 가능하거나 인과적으로 동등하지는 않다고 결론짓는다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
국가 연구에 있어 연구자들은 종종 한 국가 국민의 집단적 정신 능력을 측정하려고 시도한다. 한 가지 접근 방식은 소수의 개인에게 지능 검사를 실시하여 얻은 점수를 수집하고 이를 평균하여 국가적 추정치를 만드는 것이다. 또 다른 접근 방식은 수학, 독해, 과학 분야에서 수백만 명의 학령기 아동들이 치른 표준화된 시험 결과를 살펴보는 것이다. 수년 동안 이 두 가지 서로 다른 수치 세트는 비교되어 왔다. 두 수치가 함께 움직일 때, 즉 높은 시험 점수를 가진 국가가 높은 추정 지능 점수도 가질 때, 일부는 이 두 척도가 본질적으로 동일한 것이며, 연구에서 이야기를 바꾸지 않고도 서로 교체하여 사용할 수 있는 상호 대체 가능한 도구라고 가정해 왔다. 이러한 가정은 국가 간의 비교라는 복잡한 과업을 단순화해주기 때문에 매력적이다. 그러나 두 숫자 목록 사이의 높은 상관관계가 자동으로 모든 개별 국가에 대해 동일한 이야기를 들려준다는 것을 의미하지는 않으며, 경제적 성공을 예측하는 데 사용될 때 동일한 결론으로 이어질 것이라는 보장도 하지 않는다.
독립 연구자인 게오르기오스 키미노스(Georgios Kiminos)가 수행한 최근의 감사는 이 두 척도를 동일한 쌍둥이가 아니라, 특정 질문에 대해 테스트가 필요한 별개의 도구로 취급함으로써 이 가설에 이의를 제기한다. 이 연구는 다소 투박하지만 실용적인 질문을 던진다. 만약 연구자가 국가 지능 점수를 조화된 학습 점수로 대체한다면, 국가 순위가 변하는가? 상위 성과 국가의 명단이 그대로 유지되는가? 이 점수들과 국가의 부 사이의 연결 고리가 유지되는가? 이에 답하기 위해, 연구자는 두 유형의 점수가 모두 존재하는 정확히 66개 경제권의 데이터를 수집했다. 그는 각 국가가 서로 어떻게 정렬되는지, 어떤 국가가 목록의 최상단과 최하단에 나타나는지, 그리고 각 목록이 2017년 1인당 국내총생산(GDP)을 얼마나 강력하게 예측하는지를 비교하며 일련의 점검을 수행했다.
결과는 두 척도가 밀접하게 연관되어 있기는 하지만, 서로 대체 가능하지는 않음을 보여준다. 연구자가 66개국의 순위를 비교했을 때, 지능 점수에서 학습 점수로 전환할 때 평균적으로 국가 순위가 위나 아래로 약 10단계 정도 이동했다. 전반적인 패턴은 유사하게 유지되었지만, 구체적인 순위는 유의미할 정도로 변했다. 예를 들어, 상위 국가 그룹을 살펴볼 때 두 목록은 상위 7개국 중 단 4개국에 대해서만 일치했다. 하위 목록에서는 7개 최하위 국가 중 단 2개국만이 일치했다. 이는 한 체계에서 리더로 간주되는 국가가 다른 체계에서는 그저 평균적인 수준으로 보일 수 있으며, 한 체계에서 어려움을 겪는 국가가 다른 체계에서는 상황이 덜 심각해 보일 수도 있음을 의미한다. 두 척도는 동일한 지형에 대한 두 개의 서로 다른 지도와 같다. 그것들은 지형의 전반적인 형태는 보여주지만, 특정 목적지로 항해하려 한다면 그들이 제시하는 경로는 크게 다를 수 있다.
연구는 또한 이 점수들이 국가의 경제적 부를 얼마나 잘 예측하는지도 조사했다. 이 65개국의 특정 집단에서, 학습 점수는 지능 점수보다 부와의 연결성이 약간 더 강하게 나타났다. 그러나 그 차이는 너무 작아서 통계적 검사 결과가 이것이 특정 표본에서 발생한 우연이 아닌 실제적이고 신뢰할 수 있는 우위임을 확증할 수 없었다. 연구자는 결과가 데이터가 구성되는 방식에 따라 민감하게 반응한다는 것을 발견했다. 샘플을 변경하여 다른 국가들을 포함하거나, 모든 국가를 동등하게 취급하는 대신 인구 규모를 반영하도록 데이터를 가중치 적용했을 때, 두 척도 사이의 차이는 변화했다. 어떤 변형 모델에서는 학습 점수가 부를 훨씬 더 잘 예측하는 것처럼 보였고, 다른 모델에서는 그 격차가 좁혀지거나 심지어 역전되기도 했다. 결정적으로, 연구는 주요 분석에서 차이의 방향은 일관되게 유지되었으나, 그 차이의 크기는 어떤 국가들이 포함되었는지와 데이터가 어떻게 가중치 적용되었는지에 전적으로 달려 있다는 것을 발견했다.
이 작업은 광범위한 비교를 위해 국가 데이터를 사용하는 모든 이들에게 경고의 메시지를 전달한다. 이 감사는 높은 상관관계가 두 가지 서로 다른 척도를 동일하게 만드는 마법 지팡이가 아님을 입증한다. 두 숫자 목록이 함께 움직인다고 해서 그것이 세부 사항까지 일치한다는 뜻은 아니며, 그것이 동일한 정책 결정이나 연구 결론으로 이어질 것이라는 의미도 아니다. 연구자는 한 척도가 다른 척도보다 우월하다고 선언하거나 하나가 유효하지 않음을 증명하려 한 것이 아니다. 대신, 이 연구는 어떤 수치를 사용할 것인가라는 선택이 중요하다는 점을 강조한다. 이는 하나의 지표를 다른 것으로 교체하는 것이 국가의 순위를 바꾸고, 어떤 국가를 예외적 사례로 식별할지를 변화시키며, 경제적 결과와의 관계 강도를 변화시킬 수 있음을 보여준다. 연구 결과는 하나의 척도를 다른 것으로 대체하기 전에, 연구자들이 자신이 지키고자 하는 것이 무엇인지—구체적인 순위인지, 상위 성과자의 분류인지, 혹은 결과와의 연결 고리인지—를 정확히 정의하고, 새로운 척도가 실제로 그 근거를 유지하는지 테스트해야 함을 시사한다. 그러한 점검 없이 대체하는 것은 검증되지 않은 추측에 불과하며, 그로부터 도출된 결론은 보이는 것보다 더 취약할 수 있다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.