Predicting At Risk Student Performance at the First Quarter Semester Boundary Using Ensemble Learning
본 연구는 OULAD 데이터셋으로 학습되고 SMOTE를 통해 강화된 앙상블 학습 모델을 사용하여 1분기 경계 시점에서 학업 위기 학생의 성과를 효과적으로 예측하는 조기 경보 의사결정 지원 프레임으로를 제안하며, LightGBM이 적시의 학업 개입이 필요한 학생을 식별하는 데 있어 우수한 정확도를 달성함을 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
고등 교육이라는 광활한 풍경 속에서 대학들은 학생들을 졸업의 길로 계속 인도하는 데 있어 지속적이고도 비용이 많이 드는 과제에 직면해 있습니다. 학생이 어려움을 겪기 시작할 때, 그 징후는 종종 그들의 일상적인 디지털 상호작용 속에 숨겨진 조용한 리듬 속에서 초기에 나타납니다. 지난 20년 동안 온라인 학습 플랫폼의 부상은 이러한 상호작용을 풍부한 데이터의 흐름으로 변화시켰습니다. 학생이 로그인하거나, 링크를 클릭하거나, 과제를 제출할 때마다 기록이 생성됩니다. 러닝 애널리틱스(learning analytics)라고 알려진 이 분야는 이러한 디지털 발자국을 이해하고자 노력합니다. 교육자들은 이 데이터에 통계적 도구를 적용함으로써, 최종 성적이 나오기 훨씬 전에 학생이 곤경에 처했음을 알리는 패턴을 포착하기를 희망합니다. 목표는 미래를 확실하게 예측하는 것이 아니라, 학생이 중도 탈락하거나 낙제하기 전에 교사가 개입하여 지원할 수 있도록 시의적절한 경고를 제공하는 것입니다.
우간다의 유니버설 테크놀로지 앤 매니지먼트 대학교(Universal Technology and Management University)의 오마라 이노센트(Omara Innocent)가 수행한 새로운 연구는 데이터로부터 학습하도록 설계된 특정 유형의 컴퓨터 프로그램을 테스트함으로써 이 문제를 다룹니다. 이 연구는 학기의 매우 초기 단계, 구체적으로 첫 1분기에 초점을 맞추어, 이 시기에 위험군 학생을 식별하는 것이 가능한지를 묻습니다. 이를 위해 연구자는 영국 오픈 유니버시티(Open University)의 공개 데이터 세트를 사용했는데, 여기에는 수천 명의 학생, 그들의 인구통계학적 특성, 그리고 가상 학습 환경에서의 상세한 활동 로그가 포함되어 있습니다. 이 연구의 핵심은 세 가지 다른 유형의 고급 컴퓨터 모델을 훈련시켜 이 데이터를 살펴보고, 어떤 학생이 성공할 가능성이 높고 어떤 학생이 실패할 가능성이 높은지를 결정하게 하는 것이었습니다. 이러한 모델들은 앙상블 러너(ensemble learners)라고 불리는데, 이는 여러 개의 단순한 의사결정자들을 결합하여 하나의 더 똑똑한 예측기를 만드는 방법입니다. 연구자는 이 모델들의 세 가지 특정 버전인 랜덤 포레스트(Random Forest), XGBoost, 그리고 LightGBM을 테스트했습니다.
연구 결과, LightGBM이라 불리는 하나의 모델이 다른 모델들을 크게 압도하는 것으로 나타났습니다. 데이터로 테스트했을 때, 이 모델은 높은 정확도로 위험군 학생을 식별해 냈으며, 높을수록 좋은 점수인 0.89의 점수를 달성했습니다. 또한 이 모델은 가장 빨랐는데, 데이터 세트를 훈련하는 데 약 4.1초밖에 걸리지 않았으며, 이는 그다음으로 우수한 모델의 약 29초와 비교되는 수치입니다. 또한 연구는 이 분야의 흔한 문제, 즉 어떤 집단 내에서도 성공한 학생이 실패한 학생보다 훨씬 더 많다는 사실을 다루었습니다. 이를 해결하기 위해 연구자는 위험군 학생의 합성 예시를 만들어 데이터를 균형 있게 만드는 SMOTE라는 기법을 사용했습니다. 이 조정은 매우 중요했습니다. 이는 모델이 소수 집단을 무시하는 것을 방り지하고, 안전하다고 잘못 분류된 실패 학생의 수를 크게 줄이는 데 도움을 주었습니다. 이 단계가 없었다면, 모델들은 모든 학생이 통과할 것이라고 너무 쉽게 가정했을 것입니다.
아마도 가장 드러나는 발견은 어떤 모델이 가장 잘 작동했느냐가 아니라, 모델이 결정을 내리기 위해 실제로 무엇을 살펴보았느냐 하는 점일 것입니다. 컴퓨터 프로그램은 학생들이 누구인지보다 어떻게 온라인에서 행동하는지에 훨씬 더 많은 비중을 두었습니다. 과제를 얼마나 늦게 제출했는지, 퀴즈 페이지를 얼마나 자주 조회했는지, 그리고 토론 포럼에 얼마나 활발하게 참여했는지와 같은 요인들이 실패를 예측하는 가장 강력한 변수였습니다. 반면, 학생의 연령, 성별, 또는 이전 교육 성적과 같은 정적인 세부 사항은 예측에 거의 기여하지 못했습니다. 이는 학생이 학기 초 몇 주 동안 코스 자료에 어떻게 참여하느냐가 그들의 배경보다 미래의 성공을 나타내는 더 신뢰할 수 있는 지표라는 점을 시사합니다. 이 연구는 클릭의 타이밍이나 제출 지연과 같은 행동 데이터가 전통적인 인구통계학적 정보보다 학업적 위험에 대한 더 명확한 신호를 제공한다는 것을 확인해 줍니다.
연구자는 또한 학생의 프라이버시를 침해하지 않으면서 이러한 연구 결과를 현실 세계에 적용하는 방법을 제안했습니다. 제안된 시스템은 스스로 결정을 내리지 않을 것입니다. 대신, 학생이 어려움을 겪는 징후를 보일 때 학술 직원에게 보안이 유지되는 익명의 경고를 보내는 의사결정 지원 도구로서 역할을 할 것입니다. 이 경고는 학생의 운명에 대한 최종 판결이라기보다는 인간 상담사가 연락을 취할 수 있도록 하는 자극제가 될 것입니다. 이 프레임워크는 컴퓨터가 패턴을 포착할 수는 있지만, 개입은 윤리와 배려에 기반한 인간의 행위여야 함을 강조합니다. 연구는 이러한 도구들이 강력하지만 마법 같은 해결책은 아니라고 결론짓습니다. 이 도구들은 교육자의 판단을 대체하는 것이 아니라 지원할 때 가장 잘 작동합니다. 연구 결과는 대학을 위한 실질적인 경로를 제시합니다. 즉, 초기 디지털 행동에 세심한 주의를 기울이고 효율적인 컴퓨터 모델을 사용하여 이를 강조함으로써, 기관은 더 빨리 개입하여 잠재적으로 학생들이 실패의 길로 들어서는 것을 막을 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.