Incremental Predictive Value of Item-Adjusted Process Indicators for Mathematics Achievement among Korean Students in PISA 2022: A School-Level Out-of-Sample Validation Study
Deze studie toont aan dat item-gecorrigeerde procesindicatoren afgeleid van computergestuurde assessments de voorspelling van wiskundige prestaties onder Koreaanse studenten in PISA 2022 significant verbeteren ten opzichte van traditionele vragenlijstgegevens, zelfs onder een rigoureus schoolniveau out-of-sample validatieontwerp.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Elk jaar maken miljoenen vijftienjarigen over de hele wereld een enorme test genaamd PISA, die ontworpen is om te zien hoe goed ze kunnen gebruiken wat ze weten in realistische situaties. Voor het wiskundige deel van deze test zitten leerlingen achter een computer en lossen problemen op. Hoewel de uiteindelijke score ons vertelt hoeveel vragen ze goed hadden, legt de computer ook een verborgen laag aan data vast: precies hoe lang ze aan elk probleem besteedden, hoe vaak ze klikten en hoe vaak ze teruggingen om een antwoord te wijzigen. Jarenlang hebben onderzoekers zich afgevraagd of deze digitale voetafdrukken van gedrag ons iets kunnen vertellen over de bekwaamheid van een leerling dat een eenvoudige vragenlijst niet kan. We weten dat het vragen van leerlingen naar hun zelfvertrouwen, hun angst en hun schoolomgeving ons een goed beeld geeft van hun potentieel, maar we weten ook dat wat een leerling zegt te doen en wat ze daadwerkelijk doen tijdens het oplossen van een probleem heel verschillend kunnen zijn. De grote vraag is of het ruwe, ongefilterde verslag van de interactie van een leerling met de test nieuwe, nuttige informatie toevoegt zodra we hen al hebben gevraagd naar hun achtergrond en gevoelens.
Een onderzoeker in Zuid-Korea zette zich af om deze vraag te beantwoorden met een zeer zorgvuldige aanpak, waarbij gebruik werd gemaakt van gegevens van meer dan 6.000 leerlingen die de wiskundetest van 2022 hadden afgelegd. Ze begonnen met het bouwen van een sterk basismodel met alleen de informatie die leerlingen via een enquête hadden verstrekt. Deze enquête besloeg een breed scala aan onderwerpen, waaronder de economische status van hun gezin, hoeveel ze geloofden in hun eigen wiskundige vaardigheden, hoeveel angst ze voelden, hoeveel ze van school hielden en wat voor soort wiskundeproblemen ze in de klas hadden gezien. Deze enquêtegegevens alleen bleken een krachtige voorspeller te zijn van de uiteindelijke scores van de leerlingen. Toen de onderzoeker keek naar de computergegevens van hoe leerlingen daadwerkelijk door de test werkten — hoe lang ze erover deden en hoeveel acties ze ondernamen — ontdekte hij dat deze gedragsgegevens ook op zichzelf nuttig waren, maar ze waren niet zo nauwkeurig als de enquêtegegevens. De zelfgerapporteerde gevoelens en achtergrondcondities van een leerling waren simpelweg beter in staat om de uiteindelijke score te voorspellen dan een ruwe telling van klikken en de bestede seconden.
Echter, het verhaal veranderde toen de onderzoeker keek naar hoe deze twee soorten informatie samenwerkten. De uitdaging was dat de computergegevens rommelig waren; een lange tijd besteed aan een probleem kon betekenen dat een leerling worstelde, of het kon simpelweg betekend dat dat specifieke probleem moeilijker was dan de andere. Om dit op te lossen, paste de onderzoeker de gegevens aan zodat de tijd en acties van elke leerling alleen werden vergeleken met andere leerlingen die precies hetzelfde probleem voor zich hadden. Dit verwijderde de invloed van het testontwerp zelf en liet alleen het relatieve gedrag van de leerling over. Wanneer zij deze aangepaste gedragsindicatoren aan het enquête-model toevoegden, verbeterde de voorspelling van de wiskundescores van de leerlingen aanzienlijk. Het gecombineerde model maakte fouten die ongeveer 11 punten lager lagen op de wiskundeschaal dan het enquête-model alleen. Deze verbetering was consistent over verschillende computeralgoritmen en bleef overeind zelfs toen de onderzoeker het model testte op scholen die volledig nieuw waren voor het systeem, wat betekent dat het model de prestaties van leerlingen kon voorspellen die het nog nooit eerder had gezien.
De onderzoeker was zorgvuldig in het uitleggen van wat deze verbetering betekende en wat het niet betekende. Hij benadrukte dat de gedragsgegevens niet bewezen dat het besteden van meer tijd of het klikken op meer knoppen ervoor zorgt dat een leerling een betere score haalt. In plaats daarvan toonde de studie aan dat het digitale verslag van de inspanning en strategie van een leerling extra aanwijzingen bevat over hun bekwaamheid die niet worden gevangen door hen vragen te stellen. De studie weerlegde ook het idee dat deze verbetering slechts een resultaat was van het testformaat. Door de gegevens aan te passen om rekening te houden met de specifieke moeilijkheidsgraad van elk probleem, lieten zij zien dat de waarde voortkwam uit het werkelijke gedrag van de leerling, en niet uit het feit dat de computertest bepaalde leerlingen naar moeilijkere of makkelijkere vragen stuurde. De bevindingen suggereren dat in grootschalige toetsing de manier waarop een leerling met een computer interageert een waardevolle aanvulling is op wat zij ons over zichzelf vertellen, wat een duidelijker en completer beeld biedt van hun wiskundige vermogens.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.