An Optimized Stacking Ensemble Model for Forecasting Student Dropout
Deze studie presenteert een geoptimaliseerd stacking ensemble-model dat K-Nearest Neighbors en Bayesian Network-classifiers integreert, verbeterd door hyperparameteroptimalisatie en SMOTE-gebaseerde balansering, wat een nauwkeurigheid van 85,9% bereikt en bestaande methoden overtreft om zo een effectief vroegtijdig waarschuwingsinstrument te bieden voor het voorspellen van studentuitval.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Elk jaar worden universiteiten over de hele wereld geconfronteerd met een stille maar hardnekkige crisis: studenten die aan hun studie beginnen, maar deze nooit afronden. Dit uitvalpercentage is niet alleen een persoonlijke tragedie voor de betrokken individuen; het put de middelen van instellingen uit, verlaagt de diploma-cijfers en laat gemeenschappen achter zonder de deskundige professionals die zij nodig hebben. Decennialang hebben scholen geprobeerd dit op te lossen door handmatig cijfers en aanwezigheid te controleren, op zoek naar studenten die lijken af te glijden. Deze methoden zijn echter vaak te traag om een student te helpen voordat het te laat is. In de afgelopen jaren hebben onderzoekers zich tot machine learning gewend, een tak van de informatica waarbij software leert patronen in gegevens te herkennen zonder expliciet te worden geprogrammeerd met regels. Door historische gegevens van duizenden studenten in deze systemen te voeden, kunnen computers subtiele waarschuwingssignalen identificeren die menselijke waarnemers zouden kunnen missen, wat een kans biedt om vroegtijdig in te grijpen en studenten op het pad naar afstuderen te houden.
Een team onderzoekers van Victoria University in Kampala, Uganda en The Unity University in Hargeisa, Somaliland, heeft deze aanpak een stap verder gebracht door een nieuw type voorspellingssysteem te ontwikkelen dat specifiek is ontworpen voor deze uitdaging. In plaats van te vertrouwen op één enkel computeralgoritme om een oordeel te vellen, hebben zij een systeem gebouwd dat de sterke punten van twee verschillende methoden combineert. De eerste methode, bekend als K-Nearest Neighbors, werkt door naar het dossier van een student te kijken en de meest vergelijkbare studenten uit het verleden te vinden om te zien wat er met hen is gebeurd. De tweede methode, een Bayesiaans Netwerk, berekent de waarschijnlijkheid dat een student stopt op basis van het complexe web van relaties tussen hun cijfers, financiële status en persoonlijke omstandigheden. Hoewel elke methode op zichzelf nuttig is, ontdekten de onderzoekers dat ze soms verschillende dingen zien in dezelfde gegevens. Om dit op te lossen, creëerden zij een "stacking"-model, een structuur waarbij een derde, slimmer programma luistert naar de voorspellingen van de eerste twee en de uiteindelijke beslissing neemt. Dit laatste programma fungeert als een ervaren redacteur die het bewijs van beide bronnen weegt om een betrouwbaarder oordeel te produceren dan zij alleen zouden kunnen bereiken.
De onderzoekers testten dit systeem met behulp van een enorme collectie echte studentendossiers van The Unity University, die de jaren 2021 tot en met 2025 beslaan. De dataset bevatte meer dan 4.400 studenten en volgde zesendertig verschillende factoren, variërend van het aantal gevolgde vakken door een student tot hun financiële positie en demografische achtergrond. Een grote hindernis in dit type onderzoek is dat de meeste studenten op school blijven, terwijl veel minder studenten uitvallen, wat zorgt voor een ongelijk speelveld voor de computer. Om dit op te lossen, gebruikte het team een techniek om de gegevens kunstmatig in evenwicht te brengen, zodat het systeem leerde de waarschuwingssignalen van uitval net zo goed te herkennen als het leerde de studenten te herkennen die veilig waren. Vervolgens splitsten zij de gegevens, waarbij ze het grootste deel gebruikten om het systeem te onderwijzen en een deel achterhielden om te testen hoe goed het presteerde bij studenten die het systeem nog nooit eerder had gezien.
De resultaten toonden aan dat het nieuwe gecombineerde systeem inderdaad superieur was aan de individuele methoden. Bij de tests identificeerde het stacking-model correct of een student zou uitvallen of op school zou blijven in ongeveer 86 procent van de gevallen. Belangrijker nog, het was zeer goed in het detecteren van de studenten die daadwerkelijk een risico liepen. Het identificeerde correct 81 procent van de studenten die uiteindelijk vertrokken, een cruciale metriek voor scholen die proberen in te grijpen. In vergelijking hiermee waren de enkelvoudige methoden en een eenvoudigere manier van combineren (genaamd soft voting) minder accuraat, waarbij ze meer risicovolle studenten misten of degenen die veilig waren onterecht als risico markeerden. De analyse onthulde ook welke factoren het belangrijkst waren: academische prestaties, specifiek het aantal goedgekeurde vakken en cumulatieve cijfers, waren de sterkste voorspeller, gevolgd door financiële indicatoren zoals de status van het collegegeld en of een student geld verschuldigd was aan de instelling.
Deze studie demonstreert dat universiteiten, door verschillende soorten machine learning samen te weven, een robuuster vangnet voor hun studenten kunnen bouwen. Het model vervangt de menselijke adviseurs niet, maar biedt hen een krachtig hulpmiddel om hun inspanningen te prioriteren. Door de studenten te identificeren die het meest waarschijnlijk zullen vertrekken voordat ze dat daadwerkelijk doen, kunnen instellingen financiële steun, academische bijles of counseling aanbieden op het exacte moment dat dit nodig is. Hoewel de onderzoekers opmerken dat hun model getraind is op gegevens van een enkele universiteit en dat toekomstig werk het in verschillende regio's en met meer geavanceerde technieken moet testen, bieden de bevindingen een duidelijk pad voorwaarts. Zij bewijzen dat het met de juiste combinatie van gegevens en algoritmen mogelijk is om het tij te keren bij studentenuitval, waardoor een reactief proces van het beheren van uitvallers verandert in een proactieve strategie om studenten op school te houden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.