Analysis and Prediction of At-Risk Students Using Machine Learning Algorithms
Cet article étudie l'application d'algorithmes d'apprentissage automatique, mettant particulièrement en évidence la précision supérieure des modèles de régression logistique et de SVM linéaire, pour prédire l'attrition des étudiants à l'aide de données académiques, démographiques et d'inscription afin de soutenir la prise de décision stratégique institutionnelle.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez une université comme un grand jardin très animé. L'objectif est d'aider chaque étudiant (les plantes) à pousser avec force et à atteindre la pleine floraison (l'obtention du diplôme). Cependant, il arrive que certaines plantes commencent à flétrir ou s'arrêtent de croître avant d'être prêtes. Par le passé, les jardiniers (le personnel universitaire) ne remarquaient qu'une plante en difficulté que lorsqu'elle avait déjà jauni ou perdu ses feuilles. À ce stade, il était souvent trop tard pour la sauver.
Ce document porte sur la création d'un système de prévisions météorologiques intelligent pour ce jardin. Au lieu d'attendre que les feuilles jaunissent, les chercheurs ont utilisé des programmes informatiques (Apprentissage Automatique / Machine Learning) pour observer le sol, l'eau et l'historique de la plante afin de prédire à l'avance lesquelles pourraient avoir des difficultés.
Voici une décomposition simple de ce qu'ils ont fait et de ce qu'ils ont trouvé :
Le Problème : L'« Alarme Tardive »
Les universités perdent de l'argent et de la réputation lorsque les étudiants partent prématurément. Actuellement, les écoles tentent d'aider les étudiants en proposant des conseils ou du tutorat, mais elles le font souvent de manière réactive. C'est comme appeler un médecin seulement après s'être déjà cassé la jambe. Les chercheurs voulaient trouver un moyen de prédire la fracture avant qu'elle ne se produise afin de pouvoir proposer un plâtre (un soutien) tôt.
L'Outil : Les Algorithmes de la « Boule de Cristal »
Les chercheurs ont collecté des données auprès de la Sydney International School of Technology and Commerce (SISTC). Ils ont examiné 2 405 dossiers d'étudiants, mais les ont nettoyés pour se concentrer sur 1 027 étudiants qui avaient soit terminé leurs études, soit abandonné.
Ils ont injecté ces données dans quatre différentes « boules de cristal » (algorithmes de Machine Learning) pour voir laquelle pouvait le mieux prédire l'avenir :
- Régression Logistique : Un calculateur simple et linéaire qui évalue différents facteurs.
- Forêt Aléatoire (Random Forest) : Une équipe de nombreux décideurs (comme un comité d'experts) votant sur le résultat.
- K-Plus Proches Voisins (KNN) : Une méthode qui regarde les « voisins » d'un étudiant (des étudiants ayant des notes et des parcours similaires) pour deviner ce qui va lui arriver.
- Machines à Vecteurs de Support (SVM) : Une méthode qui trace une ligne pour séparer les « diplômés » des « abandons ».
Les Ingrédients : Qu'ont-ils observé ?
Pour faire leurs prédictions, l'ordinateur a examiné 14 indices spécifiques, tels que :
- Historique Académique : Le nombre de matières réussies, échouées ou sautées.
- Démographie : L'âge, le genre, la nationalité et le type de visa.
- Temps : Le temps passé à étudier et le nombre de tentatives pour un cours.
Les Résultats : Qui a gagné la course ?
Les chercheurs ont testé ces « boules de cristal » pour voir leur précision. Les résultats étaient étonnamment élevés :
- Les Gagnants : La Régression Logistique et le SVM (Noyau Linéaire) ont été les champions. Ils ont atteint 99 % de précision. Cela signifie qu'ils étaient presque parfaits pour deviner quels étudiants termineraient leurs études et lesquels partiraient.
- Le Deuxième : La Forêt Aléatoire était également très performante avec 98,7 %.
- Les Autres : Le KNN et la version plus complexe du SVM étaient bons aussi, mais légèrement moins précis (environ 96-97 %).
Ce que la « Boule de Cristal » leur a dit
Lorsque les chercheurs ont examiné pourquoi les modèles gagnants faisaient leurs prédictions, ils ont trouvé des schémas intéressants :
- Type de Visa : Les étudiants possédant un « Visa Étudiant » standard étaient beaucoup plus susceptibles de terminer leurs études.
- Nationalité : Les données ont montré que les étudiants venant du Pakistan avaient une probabilité plus élevée d'abandonner par rapport aux autres dans ce jeu de données spécifique.
- Notes : Le nombre de matières qu'un étudiant a échouées était un énorme signal d'alarme. Plus ils échouaient, plus le risque de départ était élevé.
- Choix du Cours : Les étudiants du programme « Master of IT » étaient plus susceptibles de rester et de terminer.
Le Contrôle de Sécurité
Les chercheurs ont été prudents concernant la confidentialité. Ils ont supprimé tous les noms et détails personnels des données, traitant les étudiants comme des numéros anonymes. Ils ont également noté un problème potentiel : si les données ne contiennent pas assez d'exemples pour certains groupes (comme des genres ou des nationalités spécifiques), l'ordinateur pourrait être biaisé. Ils ont suggéré de vérifier cela à l'avenir.
L'Essentiel à Retenir
Cette étude prouve qu'en utilisant des mathématiques simples et des modèles informatiques, les universités peuvent agir comme des jardiniers proactifs. Au lieu d'attendre qu'un étudiant échoue, elles peuvent utiliser les données pour repérer les signes avant-coureurs tôt. L'étude a révélé que les modèles simples (Régression Logistique et SVM Linéaire) sont en réalité les meilleurs outils pour cette tâche, offrant une chance de 99 % d'identifier correctement les étudiants qui ont besoin d'aide avant de décider de partir.
Les chercheurs suggèrent qu'à l'avenir, les écoles pourraient ajouter encore plus de détails — comme la participation d'un étudiant en classe ou ses habitudes de travail personnel — pour rendre ces prédictions encore plus aiguisées, mais pour l'instant, les données actuelles font déjà un travail fantastique.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.