Incremental Predictive Value of Item-Adjusted Process Indicators for Mathematics Achievement among Korean Students in PISA 2022: A School-Level Out-of-Sample Validation Study
Diese Studie zeigt, dass aus computergestützten Assessments abgeleitete, item-adjustierte Prozessindikatoren die Vorhersage der mathematischen Leistungen unter koreanischen Schülern in PISA 2022 über traditionelle Fragebogendaten hinaus signifikant verbessern, selbst unter einem strengen Out-of-Sample-Validierungsdesign auf Schulebene.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Jedes Jahr absolvieren Millionen von Fünfzehnjährigen auf der ganzen Welt einen massiven Test namens PISA, der darauf ausgelegt ist zu sehen, wie gut sie ihr Wissen in realen Situationen anwenden können. Für den Mathematikteil dieses Tests sitzen die Schüler an einem Computer und lösen Aufgaben. Während die Endpunktzahl uns sagt, wie viele Fragen sie richtig beantwortet haben, zeichnet der Computer auch eine verborgene Datenebene auf: genau, wie lange sie für jede Aufgabe gebraucht haben, wie oft sie geklickt haben und wie häufig sie zurückgegangen sind, um eine Antwort zu ändern. Jahrelang haben Forscher sich gefragt, ob diese digitalen Fußabdrücke des Verhaltens uns etwas über die Fähigkeit eines Schülers verraten könnten, was ein einfacher Fragebogen nicht kann. Wir wissen, dass die Abfrage von Selbstvertrauen, Angst und dem Schulumfeld der Schüler uns ein gutes Bild ihres Potenzials vermittelt, aber wir wissen auch, dass das, was ein Schüler über sein Tun sagt, und das, was er tatsächlich tut, während er eine Aufgabe löst, sehr unterschiedlich sein können. Die große Frage ist, ob die rohen, ungefilterten Aufzeichnungen der Interaktion eines Schülers mit dem Test neue, nützliche Informationen liefern, sobald wir ihn bereits nach seinem Hintergrund und seinen Gefühlen gefragt haben.
Ein Forscher in Südkorea ging diese Frage mit einem sehr sorgfältigen Ansatz an und nutzte Daten von über 6.000 Schülern, die den Mathematiktest von 2022 absolviert hatten. Er begann damit, ein starkes Basismodell aufzubauen, das nur die Informationen verwendete, die die Schüler in einer Umfrage angegeben hatten. Diese Umfrage deckte ein breites Spektrum an Themen ab, darunter der wirtschaftliche Status der Familie, wie sehr sie an ihre eigenen mathematischen Fähigkeiten glaubten, wie viel Angst sie empfanden, wie sehr sie die Schule mochten und welche Art von Mathematikaufgaben sie im Unterricht gesehen hatten. Diese Umfragedaten allein erwiesen sich als ein leistungsstarker Prädiktor für die Endergebnisse der Schüler. Als der Forscher die Computeraufzeichnungen betrachtete, wie die Schüler den Test tatsächlich bearbeiteten – wie lange sie brauchten und wie viele Aktionen sie ausführten –, stellte er fest, dass diese Verhaltensdaten für sich genommen ebenfalls nützlich waren, aber nicht so genau wie die Umfragedaten. Die selbstberichteten Gefühle und die Hintergrundbedingungen eines Schülers waren schlichtweg besser darin, sein Endergebnis vorherzusagen, als eine bloße Anzahl von Klicks und die auf eine Aufgabe verbrachte Zeit.
Die Geschichte änderte sich jedoch, als der Forscher betrachtete, wie diese beiden Arten von Informationen zusammenwirkten. Die Herausforderung bestand darin, dass die Computeraufzeichnungen unordentlich waren; eine lange Zeit, die für eine Aufgabe aufgewendet wurde, könnte bedeuten, dass ein Schüler Schwierigkeiten hatte, oder es könnte einfach bedeuten, dass diese spezifische Aufgabe schwieriger war als die anderen. Um dies zu beheben, passte der Forscher die Daten so an, dass die Zeit und die Aktionen jedes Schülers nur mit anderen Schülern verglichen wurden, die vor exakt derselben Aufgabe standen. Dies entfernte den Einfluss des Testdesigns selbst und hinterließ nur das relative Verhalten des Schülers. Als er diese angepassten Verhaltensindikatoren dem Umfragemodell hinzufügte, verbesserte sich die Vorhersage der Mathematiknoten der Schüler signifikant. Das kombinierte Modell wies Fehler auf, die auf der Testskala etwa 11 Punkte niedriger lagen als das reine Umfragemodell. Diese Verbesserung war über verschiedene Computeralgorithmen hinweg konsistent und blieb auch dann bestehen, wenn der Forscher das Modell an Schulen testete, die völlig neu in das System waren, was bedeutete, dass das Modell die Leistung von Schülern vorhersagen konnte, die es zuvor noch nie „gesehen“ hatte.
Der Forscher erklärte sorgfältig, was diese Verbesserung bedeutete und was sie nicht bedeutete. Er betonte, dass die Verhaltensdaten nicht bewiesen, dass das längere Zeitaufwenden oder das Klicken von mehr Schaltflächen dazu führt, dass ein Schüler eine bessere Punktzahl erzielt. Stattdessen zeigte die Studie, dass die digitale Aufzeichnung der Anstrengung und Strategie eines Schülers zusätzliche Hinweise auf seine Fähigkeit enthält, die nicht durch Fragen erfasst werden können. Die Studie widerlegte auch die Vorstellung, dass diese Verbesserung lediglich ein Ergebnis des Testformats sei. Durch die Anpassung der Daten, um die spezifische Schwierigkeit jeder Aufgabe zu berücksichtigen, zeigten sie, dass der Wert aus dem tatsächlichen Verhalten des Schülers kam und nicht daraus, dass der Computertest bestimmte Schüler zu schwereren oder leichteren Fragen leitete. Die Ergebnisse legen nahe, dass in groß angelegten Tests die Art und Weise, wie ein Schüler mit einem Computer interagiert, eine wertvolle Ergänzung zu dem ist, was er uns über sich selbst erzählt, und ein klareres, vollständigeres Bild seiner mathematischen Fähigkeiten vermittelt.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.