When the adjustment fails: population-denominator sensitivity in coverage-adjusted PISA trends
이 논문은 PISA의 커버리지 조정 상위 4분위 추세가 인구 분모의 선택에 매우 민감하다는 점을 입증하며, 보고된 데이터와 세계 인구 전망(World Population Prospects) 추정치 사이의 상당한 불일치를 드러냄으로써 투명한 출처 보고의 필요성과 합성 가중치가 조정을 유발할 때 주의가 필요함을 강조한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
몇 년마다 한 번씩, 전 세계 교실에서는 거대한 글로벌 실험이 진행됩니다. 수십만 명의 15세 학생들이 수학, 읽기, 과학 분야에서 동일한 시험을 치릅니다. 이것이 바로 PISA(국제 학생 평가 프로그램)로 알려진 프로그램입니다. 이 결과는 단순히 학교의 성적표 그 이상입니다. 이는 한 국가의 젊은 세대가 미래를 위해 얼마나 잘 준비되어 있는지를 보여주는 스냅샷입니다. 이 시험은 주기적으로 실시되기 때문에, 연구자들은 과거를 되돌아보며 한 국가가 시간이 흐름에 따라 나아지고 있는지 혹은 나빠지고 있는지를 확인할 수 있습니다. 하지만 이 비교에는 숨겨진 복잡한 문제가 있습니다. 시험을 치르는 학생들은 매년 항상 동일한 인구 집단이 아니라는 점입니다. 어떤 국가에서는 이 시험이 거의 모든 15세 학생에게 도달할 수도 있지만, 다른 국가에서는 아주 적은 비율에만 도달할 수도 있습니다. 학생 집단이 변하면, 학생들 스스로가 더 많이 배웠거나 덜 배웠기 때문이 아니라 단지 사람들의 구성이 바뀌었기 때문에 평균 점수가 변할 수 있습니다. 이를 해결하기 위해, 시험을 운영하는 기관은 특별한 수학적 조정을 사용합니다. 이 방식은 만약 시험이 그 나라의 모든 15세 학생에게 도달했다면 상위 성적을 낸 학생들이 받았을 점수를 추정하려고 노력합니다. 이 조정된 수치는 서로 다른 해와 서로 다른 국가 간의 발전을 공정하게 비교하기 위한 방법입니다.
두 명의 연구자, Jonas A. Mandalunes와 Danica Jane S. Mandalunes는 이 조정 작업이 실제로 얼마나 취약한지 확인해 보기로 했습니다. 그들은 가장 결정적인 퍼즐 조각인 각국의 15세 인구 총수에 집중했습니다. 이 숫자는 조정의 크기를 결정하는 분모, 즉 분수의 밑부분 역할을 합니다. 연구자들은 단순하지만 심오한 질문을 던졌습니다: 만약 이 밑의 숫자를 바꾼다면 최종 결과에 어떤 일이 벌어질 것인가? 그들은 한 가지 인구 데이터 소스가 완벽하고 다른 하나는 틀렸다고 가정하지 않았습니다. 대신, 두 가지 서로 다른 15세 인구 집단 산출 방식을 두 가지 서로 다른 시나리오로 취급했습니다. 한 시나리오는 각국 정부가 시험 주관 기관에 공식적으로 제출한 수치를 사용했습니다. 다른 시나리오는 유엔(UN)의 널리 신뢰받는 글로벌 인구 성장 전망치를 사용했습니다. 그들은 전체 추세 분석을 두 번 실행함으로써—한 번은 공식 수치로, 또 한 한 번은 글로벌 전망치로—어떤 인구 집계가 사용되느냐에 따라 한 국가의 발전이라는 이야기가 어떻게 변하는지 확인할 수 있었습니다.
연구자들은 2018년부터 2022년 사이 73개 경제 체제의 데이터를 살펴보았습니다. 그들은 시험 주관 기관이 사용하는 공식 15세 인구 집계가 많은 곳에서 크게 변했다는 사실을 발견했습니다. 평균적으로 두 연도 사이의 표본 추출률 차이는 거의 2퍼센트 포인트였지만, 어떤 경우에는 한 방향으로 27포인트, 혹은 반대 방향으로 45포인트만큼 급격히 요동치는 등 엄청난 변화를 보이기도 했습니다. 이러한 수치가 왜 변했는지 분석했을 때, 그들은 대부분의 경우 그 변화가 실제 학교 등록 학생 수의 변화보다는 조사 자체에서 기인했다는 것을 발견했습니다. 즉, 시험이 등록된 학생 중 서로 다른 비율의 학생들에게 도달했다는 의미입니다. 이 구분은 매우 중요한데, 이는 점수 상승이 더 많은 아이들이 학교에 다니게 되었음을 의미하는 것이 아니라, 단지 시험이 그들 중 다른 그룹에 도달했음을 의미할 수도 있기 때문입니다.
가장 놀라운 발견은 최종 추세가 이 분모에 얼마나 민감한가 하는 점이었습니다. 연구자들이 공식 인구 수를 UN 전망치로 바꾸었을 때, 추정된 시험 점수의 변화는 극적으로 변했습니다. 수학에서 두 시나리오 사이의 평균 차이는 약 3.4점이었고, 읽기에서는 3.5점, 과학에서는 3.4점이었습니다. 이를 이해하기 위해, 시험 주관 기관은 독자들이 추세의 불확실성 범위를 이해할 수 있도록 표준 "연결 오차(link error)" 값을 발표합니다. 수학의 경우 그 값은 2.24점입니다. 단순히 인구 수를 바꿈으로써 발생한 차이는 69개국 중 38개국에서 이 표준 오차 범위를 넘어섰습니다. 읽기에서는 52개국에서, 과학에서는 51개국에서 이 범위를 초과했습니다. 이는 연구된 대다수의 국가에서, 어떤 인구 수를 사용하느냐의 선택이 시험 자체와 관련된 통계적 불확실성보다 더 중요했다는 것을 의미합니다.
연구자들은 또한 수학적 계산이 한계에 부딪힐 때 어떤 일이 발생하는지도 조사했습니다. 조정 절차는 시험이 실제로 존재하는 학생보다 적은 수의 학생에게 도달했다고 가정합니다. 그러나 몇몇 특정 사례에서는 수학적으로 시험이 공식 인구 수보다 더 많은 학생에게 도달한 것으로 나타났습니다. 이 경우, 절차는 특별한 처방을 내려야 했습니다. 즉, 초과된 가중치를 단순히 0으로 설정하고 시험을 치른 학생들의 원점수를 보고함으로써, 사실상 조정을 꺼버리는 것이었습니다. 이러한 현상은 2022년 한국과 아일랜드 같은 국가에서 발생했습니다. 연구자들은 조정된 점수에서 원점수로 전환되는 이 과정이 데이터의 갑작스러운 단절을 만든다는 점을 보여주었습니다. 이는 매끄러운 전환이 아니라, 방법론 자체가 완전히 바뀌는 급격한 중단입니다. 또한 그들은 어떤 경우에는 공식 인구 수가 시험이 도달했다고 주장하는 학생 수보다 많았는데, 이는 정의가 완벽하게 일치한다면 불가능한 일이며, 이는 "15세" 또는 "재학 중"이라는 정의가 시험 주관 기관과 인구 통계학자 사이에 다를 수 있음을 시사한다고 언급했습니다.
이 연구는 한쪽 인구 집계가 참이고 다른 쪽이 틀렸다고 결론짓지 않았습니다. 연구자들은 정부의 공식 수치나 UN의 전망치 중 어느 것도 절대적인 진리가 아니라는 점을 명시하며 신중을 기했습니다. 공식 수치는 정확히 언제 집계가 이루어졌는지, 혹은 어떤 "거주자" 정의가 사용되었는지에 대한 세부 정보가 부족한 경우가 많습니다. 글로벌 전망치는 가정에 기반한 모델입니다. 핵심 문제는 최종 추세 점수가 충분히 설명되지 않거나 일관되지 않은 숫자에 크게 의존한다는 점입니다. 연구자들은 영토 분쟁이나 기록이 불일치하는 국가들을 제거하여 데이터를 정제하려 시도했음에도 불구하고, 차이가 여전히 남아 있음을 발견했습니다. 두 시나리오 사이의 격차는 사라지지 않았고, 단지 약간 이동했을 뿐입니다. 이는 이러한 민감성이 단순히 지저집한 데이터의 결과가 아니라, 현재 방식의 근본적인 특징임을 시사합니다.
결론적으로, 연구자들은 이러한 추세가 보고되는 방식이 불확실성에 대해 더 정직해질 필요가 있다고 주장합니다. 그들은 시험 주관 기관이 인구 수의 출처를 포함하여 정확히 어디서 온 것인지, 그리고 구체적인 정의가 무엇인지를 밝혀야 한다고 권고합니다. 또한 추세가 보고될 때마다, 다른 합리적인 인구 수를 사용했을 경우 결과가 어떻게 달라질지를 보여주는 범위를 함께 제시해야 한다고 제안합니다. 이것은 통계적 의미의 신뢰 구간이 아니라, 결과가 분모에 얼마나 의존하는지를 보여주는 명확한 진술이어야 합니다. 마지막으로, 숫자가 맞지 않아 수학적 계산이 무너지는 경우, 조정된 점수를 조용히 수정하거나 숨기는 것이 아니라, 입력값이 조정될 때까지 표시를 하고 보류해야 한다고 제안합니다. 이 연구는 국가들이 발전하고 있는지 혹은 쇠퇴하고 있는지에 대한 이야기는 실재하지만, 그 이야기를 전달하기 위해 사용하는 구체적인 숫자들은 보이는 것보다 훨씬 더 섬세하다는 것을 보여줍니다. 추세는 존재하지만, 그 정밀한 크기는 현재 암흑 속에서 결정되는 숫자의 선택에 묶여 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.