An Optimized Stacking Ensemble Model for Forecasting Student Dropout
Cette étude présente un modèle d'ensemble de type stacking optimisé intégrant des classifieurs K-Plus Proches Voisins et Réseau Bayésien, amélioré par un ajustement des hyperparamètres et un rééquilibrage basé sur la méthode SMOTE, lequel atteint une précision de 85,9 % et surpasse les méthodes existantes pour fournir un outil d'alerte précoce efficace pour la prévision du décrochage scolaire.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Chaque année, les universités du monde entier sont confrontées à une crise discrète mais persistante : les étudiants qui commencent leurs études mais ne les terminent jamais. Cet attrition n'est pas seulement une tragédie personnelle pour les individus concernés ; elle épuise les ressources des institutions, fait baisser les taux de diplomation et prive les communautés des professionnels qualifiés dont elles ont besoin. Pendant des décennies, les établissements ont tenté de résoudre ce problème en examinant manuellement les notes et l'assiduité, à la recherche d'étudiants qui semblent décliner. Cependant, ces méthodes sont souvent trop lentes pour aider un étudiant avant qu'il ne soit trop tard. Ces dernières années, les chercheurs se sont tournés vers l'apprentissage automatique, une branche de l'informatique où le logiciel apprend à reconnaître des modèles dans les données sans être explicitement programmé avec des règles. En injectant dans ces systèmes les dossiers historiques de milliers d'étudiants, les ordinateurs peuvent identifier des signes avant-coureurs subtils que les observateurs humains pourraient manquer, offrant ainsi une chance d'intervenir tôt et de maintenir les étudiants sur la voie de l'obtention de leur diplôme.
Une équipe de chercheurs de la Victoria University in Kampala, Uganda et de l'Université Unity à Hargeisa, au Somaliland, a franchi une étape supplémentaire en développant un nouveau type de système de prédiction conçu spécifiquement pour ce défi. Au lieu de s'appuyer sur un seul algorithme informatique pour rendre un jugement, ils ont construit un système qui combine les forces de deux méthodes différentes. La première méthode, connue sous le nom de K-plus proches voisins (K-Nearest Neighbors), fonctionne en examinant le dossier d'un étudiant et en trouvant les étudiants passés les plus similaires pour voir ce qui leur est arrivé. La seconde méthode, un réseau bayésien, calcule la probabilité qu'un étudiant abandonne ses études en fonction du réseau complexe de relations entre ses notes, sa situation financière et ses circonstances personnelles. Bien que chaque méthode soit utile individuellement, les chercheurs ont constaté qu'elles perçoivent parfois des choses différentes dans les mêmes données. Pour résoudre cela, ils ont créé un modèle de « stacking » (empilement), une structure où un troisième programme plus intelligent écoute les prédictions des deux premiers et rend la décision finale. Ce programme final agit comme un éditeur chevronné, pesant les preuves provenant des deux sources pour produire un verdict plus fiable que ce qu'aucun des deux ne pourrait accomplir seul.
Les chercheurs ont testé ce système en utilisant une vaste collection de dossiers réels d'étudiants de l'Université Unity, couvrant les années 2021 à 2025. Le jeu de données comprenait plus de 4 400 étudiants et suivait trente-six facteurs différents, allant du nombre de cours réussis par un étudiant à sa situation financière et son profil démographique. Un obstacle majeur dans ce type de recherche est que la plupart des étudiants restent à l'école, tandis qu'un nombre beaucoup plus faible abandonne, créant un terrain de jeu inégal pour l'ordinateur. Pour corriger cela, l'équipe a utilisé une technique pour équilibrer artificiellement les données, garantissant que le système apprenne à reconnaître les signes avant-coureurs d'abandon aussi bien qu'il apprend à reconnaître les étudiants qui sont en sécurité. Ils ont ensuite divisé les données, utilisant la majeure partie pour enseigner au système et en réservant une partie pour tester ses performances sur des étudiants qu'il n'avait jamais vus auparavant.
Les résultats ont montré que le nouveau système combiné était effectivement supérieur aux méthodes individuelles. Lors des tests, le modèle de stacking a correctement identifié si un étudiant allait abandonner ou rester à l'école environ 86 % du temps. Plus important encore, il était très efficace pour détecter les étudiants qui étaient réellement à risque. Il a correctement signalé 81 % des étudiants qui ont fini par partir, une métrique cruciale pour les établissements tentant d'intervenir. En comparaison, les méthodes uniques et une façon plus simple de combiner les données (appelée vote mou ou "soft voting") étaient moins précises, manquant plus d'étudiants à risque ou signalant à tort ceux qui étaient en sécurité. L'analyse a également révélé quels facteurs comptaient le plus : la performance académique, spécifiquement le nombre de cours approuvés et les notes cumulées, était le prédicteur le plus fort, suivie de près par les indicateurs financiers comme le statut des frais de scolarité et le fait qu'un étudiant doive de l'argent à l'institution.
Cette étude démontre qu'en tissant ensemble différents types d'apprentissage automatique, les universités peuvent construire un filet de sécurité plus robuste pour leurs étudiants. Le modèle ne remplace pas les conseillers humains, mais leur fournit un outil puissant pour prioriser leurs efforts. En identifiant les étudiants les plus susceptibles de partir avant qu'ils ne le fassent réellement, les institutions peuvent offrir une aide financière, un tutorat académique ou un soutien psychologique au moment précis où cela est nécessaire. Bien que les chercheurs notent que leur modèle a été entraîné sur les données d'une seule université et que les travaux futurs devraient le tester dans différentes régions et avec des techniques plus avancées, les conclusions offrent une voie claire à suivre. Ils prouvent qu'avec la bonne combinaison de données et d'algorithmes, il est possible de renverser la tendance de l'attrition étudiante, transformant un processus réactif de gestion des abandons en une stratégie proactive pour maintenir les étudiants à l'école.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.