An Optimized Stacking Ensemble Model for Forecasting Student Dropout
본 연구는 K-최근접 이웃(K-Nearest Neighbors)과 베이지안 네트워크(Bayesian Network) 분류기를 통합하고 하이퍼파라미터 튜닝 및 SMOTE 기반 불균형 해소를 통해 강화된 최적화된 스태킹 앙상블 모델을 제시하며, 이는 85.9%의 정확도를 달상하여 기존 방법들을 능가함으로써 학생 중도 탈락 예측을 위한 효과적인 조기 경보 도구를 제공한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매년 전 세계의 대학교들은 조용하지만 지속적인 위기에 직면합니다. 바로 학업을 시작했지만 끝까지 마치지 못하는 학생들로 인한 문제입니다. 이러한 중도 탈락은 개인에게는 비극일 뿐만 아니라, 기관의 자원을 소모하고 졸업률을 낮추며, 지역 사회가 필요로 하는 숙련된 전문가를 확보하지 못하게 만듭니다. 수십 년 동안 학교들은 성적과 출석률을 수동으로 검토하여 낙제할 것 같은 학생들을 찾아내는 방식으로 이 문제를 해결하려 노력해 왔습니다. 그러나 이러한 방식은 학생을 돕기에는 너무 늦은 경우가 많습니다. 최근 몇 년 동안 연구자들은 소프트웨어가 명시적인 규칙 없이 데이터의 패턴을 인식하도록 학습하는 컴퓨터 과학의 한 분야인 머신러닝에 주목했습니다. 수천 명의 학생들의 과거 기록을 이러한 시스템에 입력함으로써, 컴퓨터는 인간 관찰자가 놓칠 수 있는 미묘한 경고 신호를 식서히 식별하여, 학생들이 졸업이라는 경로를 유지할 수 있도록 조기에 개입할 기회를 제공할 수 있습니다.
Victoria University in Kampala, Uganda와 소말릴란드 하르게이사 소재 유니티 대학교의 연구팀은 이 과제에 특화된 새로운 유형의 예측 시스템을 개발함으로써 이러한 접근 방식을 한 단계 더 발전시켰습니다. 단일 컴퓨터 알고리즘에 판단을 맡기는 대신, 그들은 두 가지 서로 다른 방법의 강점을 결합한 시스템을 구축했습니다. 첫 번째 방법인 K-최근접 이웃(K-Nearest Neighbors)은 학생의 기록을 살펴보고 가장 유사한 과거의 학생들을 찾아 그들에게 어떤 일이 일스러웠는지 확인하는 방식으로 작동합니다. 두로 번째 방법은 베이지안 네트워크(Bayesian Network)는 성적, 재정 상태, 개인적 상황 사이의 복잡한 관계망을 바탕으로 학생이 중도 탈락할 가능성을 계산합니다. 각 방법은 단독으로도 유용하지만, 연구진은 이들이 동일한 데이터에서 서로 다른 것을 보고 있다는 사실을 발견했습니다. 이를 해결하기 위해 그들은 '스태킹(stacking)' 모델을 만들었는데, 이는 세 번째의 더 똑똑한 프로그램이 앞선 두 모델의 예측을 듣고 최종 결정을 내리는 구조입니다. 이 최종 프로그램은 숙련된 편집자처럼 두 소스의 증거를 저울질하여, 단독으로 달성할 수 있는 것보다 더 신뢰할 수 있는 판결을 내립니다.
연구진은 2021년부터 2025년까지 유니티 대학교의 방대한 실제 학생 기록을 사용하여 이 시스템을 테스트했습니다. 이 데이터셋에는 4,400명 이상의 학생이 포함되었으며, 이수 과목 수부터 재정 상태 및 인구통계학적 배경에 이르기까지 36가지의 다양한 요인을 추적했습니다. 이러한 유형의 연구에서 주요한 장애물은 대부분의 학생은 학교에 남는 반면, 중도 탈락하는 학생은 훨씬 적다는 점이며, 이는 컴퓨터에게 불균형한 운동장을 만듭니다. 이를 해결하기 위해 연구팀은 데이터를 인위적으로 균형 있게 만드는 기술을 사용하여, 시스템이 중도 탈락의 경고 신호를 인식하는 것만큼이나 안전한 학생을 인식하는 법도 잘 배울 수 있도록 했습니다. 그 후 연구진은 데이터를 나누어, 대부분은 시스템을 학습시키는 데 사용하고 일부는 본 적 없는 학생들에 대해 얼마나 잘 수행하는지 테스트하기 위해 남겨두었습니다.
결과는 새로운 결합 시스템이 개별 방법들보다 확실히 우수하다는 것을 보여주었습니다. 테스트 결과, 스태킹 모델은 학생이 중도 탈락할지 아니면 학교에 남을지를 약 86%의 정확도로 식별했습니다. 더욱 중요한 것은, 이 모델이 실제로 위험에 처한 학생들을 포착하는 데 매우 뛰어났다는 점입니다. 이 모델은 결국 학교를 떠나게 될 학생의 81%를 정확히 찾아냈는데, 이는 학교가 개입을 시도하는 데 있어 매우 중요한 지표입니다. 이에 비해, 단일 방법들과 더 단순한 결합 방식(소프트 보팅이라 불리는)은 덜 정확했으며, 위험한 학생을 더 많이 놓치거나 안전한 학생을 잘못 분류했습니다. 분석 결과에 따르면 어떤 요인이 가장 중요한지도 밝혀졌는데, 학업 성취도, 특히 승인된 과목 수와 누적 성적이 가장 강력한 예측 인자였으며, 등록금 납부 상태나 학교에 미납금이 있는지와 같은 재정적 지표가 그 뒤를 바짝 쫓았습니다.
이 연구는 서로 다른 유형의 머신러닝을 엮음으로써 대학교가 학생들을 위한 더 견고한 안전망을 구축할 수 있음을 보여줍니다. 이 모델은 인간 상담사를 대체하는 것이 아니라, 상담사가 노력을 우선순위에 둘 수 있도록 강력한 도구를 제공합니다. 학생들이 실제로 떠나기 전에 그럴 가능성이 높은 학생들을 식별함으로써, 기관은 정확히 필요한 순간에 재정 지원, 학업 튜터링 또는 상담을 제공할 수 있습니다. 연구진은 이 모델이 단일 대학교의 데이터로 학습되었다는 점과 향후 연구에서 다양한 지역을 대상으로 테스트하고 더 발전된 기술을 적용해야 한다는 점을 언급했지만, 이번 연구 결과는 명확한 방향을 제시합니다. 적절한 데이터와 알고리즘의 조합을 통해, 중도 탈락을 관리하는 반응적인 과정을 학생들을 학교에 머물게 하는 선제적인 전략으로 전환하는 것이 가능하다는 것을 이들은 입증했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.