← 최신 논문
📊 statistics

Incremental Predictive Value of Item-Adjusted Process Indicators for Mathematics Achievement among Korean Students in PISA 2022: A School-Level Out-of-Sample Validation Study

본 연구는 컴퓨터 기반 평가에서 도출된 문항 조정 프로세스 지표가 엄격한 학교 수준의 표본 외 검증 설계 하에서도 기존의 설문 데이터보다 한국 학생들의 수학 성취도를 예측하는 데 유의미하게 기여함을 입증한다.

원저자: Hejing Li¹

게시일 2026-09-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hejing Li¹

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매년 전 세계 수백만 명의 15세 학생들이 자신이 알고 있는 것을 실제 상황에서 얼마나 잘 활용할 수 있는지 확인하기 위해 설계된 PISA라는 거대한 시험을 치릅니다. 이 시험의 수학 부문에서 학생들은 컴퓨터 앞에 앉아 문제를 해결합니다. 최종 점수는 그들이 몇 문제를 맞혔는지를 알려주지만, 컴퓨터는 숨겨진 데이터 층 또한 기록합니다. 즉, 각 문제에 정확히 얼마나 시간을 소비했는지, 몇 번이나 클릭했는지, 그리고 답을 바꾸기 위해 얼마나 자주 되돌아갔는지와 같은 데이터입니다. 수년간 연구자들은 이러한 디지털 행동 흔적이 단순한 설문조사가 할 수 없는 학생의 능력에 대해 무언가를 말해줄 수 있는지 궁금해해 왔습니다. 우리는 학생들에게 자신감, 불안감, 학교 환경에 대해 물어보는 것이 그들의 잠재력에 대한 좋은 그림을 제공한다는 것을 알고 있지만, 동시에 학생이 자신이 무엇을 한다고 말하는 것과 문제를 풀면서 실제로 하는 행동은 매우 다를 수 있다는 것도 알고 있습니다. 핵심적인 질문은 학생의 배경과 감정에 대해 이미 물어본 상태에서, 학생의 상호작용에 대한 가공되지 않은 여과 없는 기록이 새롭고 유용한 정보를 추가하는가 하는 점입니다.

한국의 한 연구자는 2022년 수학 시험을 치른 6,000명 이상의 학생들로부터 얻은 데이터를 사용하여 매우 신중한 접근 방식으로 이 질문에 답하고자 했습니다. 연구자는 학생들이 설문조사에서 제공한 정보만을 사용하여 강력한 기초 모델(baseline model)을 구축하는 것으로 시작했습니다. 이 설문조사는 가족의 경제적 상태, 자신의 수학 능력에 대한 믿음, 불안감의 정도, 학교에 대한 애착, 그리고 수업 시간에 접했던 수학 문제의 유형 등 광범위한 주제를 다루었습니다. 이 설문 데이터만으로도 학생들의 최종 점수를 예측하는 데 매우 강력한 예측 변수가 되었습니다. 연구자가 학생들이 실제로 시험을 어떻게 풀어 나갔는지에 대한 컴퓨터 기록, 즉 얼마나 오래 걸렸고 얼마나 많은 행동을 취했는지를 살펴보았을 때, 이 행동 데이터 역시 그 자체로는 유용하지만 설문 데이터만큼 정확하지는 않다는 것을 발견했습니다. 학생이 스스로 보고한 감정과 배경 조건이 단순히 클릭 횟수나 소요 시간과 같은 가공되지 않은 수치보다 최종 점수를 더 잘 예측했습니다.

하지만 연구자가 이 두 가지 유형의 정보가 어떻게 함께 작용하는지 살펴보았을 때 이야기는 달라졌습니다. 문제는 컴퓨터 기록이 무질서했다는 점이었습니다. 특정 문제에 긴 시간을 소비했다는 것은 학생이 어려움을 겪고 있다는 뜻일 수도 있고, 단지 그 특정 문제가 다른 문제들보다 더 어려웠다는 뜻일 수도 있습니다. 이를 해결하기 위해 연구자는 모든 학생의 시간과 행동이 정확히 동일한 문제를 마주한 다른 학생들과 비교되도록 데이터를 조정했습니다. 이를 통해 테스트 설계 자체의 영향을 제거하고 오직 학생의 상대적인 행동만을 남겼습니다. 이 조정된 행동 지표들을 설문 모델에 추가했을 때, 학생들의 수학 점수 예측치는 유의미하게 향 향상되었습니다. 결합된 모델은 설문 모델 단독일 때보다 테스트 척도상 약 11점 더 낮은 오차를 보였습니다. 이러한 개선은 다양한 컴퓨터 알고리즘 전반에서 일관되게 나타났으며, 연구자가 시스템에 완전히 새로운 학교들을 대상으로 모델을 테스트했을 때도, 즉 모델이 한 번도 본 적 없는 학생들의 성과를 예측해야 하는 상황에서도 유효했습니다.

연구자는 이 개선이 무엇을 의미하고 무엇을 의미하지 않는지를 설명하는 데 주의를 기울였습니다. 연구자는 행동 데이터가 더 많은 시간을 소비하거나 더 많은 버튼을 클릭하는 것이 학생의 더 높은 점수를 유발한다는 것을 증명하는 것이 아님을 강조했습니다. 대신, 이 연구는 학생의 노력과 전략에 대한 디지털 기록이 질문을 통해 파악할 수 없는 능력에 대한 추가적인 단서를 포함하고 있음을 보여주었습니다. 또한 연구는 이 개선이 단순히 시험 형식의 결과라는 생각을 배제했습니다. 각 문제의 난이도를 고려하여 데이터를 조정함으로써, 연구자는 그 가치가 특정 학생들을 더 어렵거나 쉬운 문제로 안내했다는 사실에서 온 것이 아니라 학생의 실제 행동에서 온 것임을 보여주었습니다. 이러한 결과는 대규모 시험에서 학생이 컴퓨터와 상호작용하는 방식이 자신에 대해 말하는 내용에 대한 가치 있는 보완재가 되어, 수학적 능력에 대한 더 명확하고 완전한 그림을 제공할 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →