Incremental Predictive Value of Item-Adjusted Process Indicators for Mathematics Achievement among Korean Students in PISA 2022: A School-Level Out-of-Sample Validation Study
Questo studio dimostra che gli indicatori di processo aggiustati per item, derivati da valutazioni basate su computer, migliorano significativamente la previsione del rendimento in matematica tra gli studenti coreani in PISA 2022 rispetto ai tradizionali dati dei questionari, anche sotto un rigoroso disegno di validazione out-of-sample a livello scolastico.
Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Ogni anno, milioni di quindicenni in tutto il mondo sostengono un test massiccio chiamato PISA, progettato per vedere quanto bene sappiano utilizzare ciò che sanno in situazioni di vita reale. Per la parte di matematica di questo test, gli studenti siedono davanti a un computer e risolvono problemi. Mentre il punteggio finale ci dice quanti quesiti hanno completato correttamente, il computer registra anche uno strato nascosto di dati: esattamente quanto tempo hanno trascorso su ogni problema, quante volte hanno cliccato e quanto spesso sono tornati indietro per cambiare una risposta. Per anni, i ricercatori si sono chiesti se queste impronte digitali del comportamento possano dirci qualcosa sull'abilità di uno studente che un semplice questionario non può catturare. Sappiamo che chiedere agli studenti la loro fiducia, la loro ansia e il loro ambiente scolastico ci fornisce un buon quadro del loro potenziale, ma sappiamo anche che ciò che uno studente dice di fare e ciò che fa effettivamente mentre risolve un problema possono essere molto diversi. La grande domanda è se il registro grezzo e non filtrato dell'interazione di uno studente con il test aggiunga nuove, utili informazioni una volta che abbiamo già chiesto loro informazioni sul proprio background e sui propri sentimenti.
Un ricercatore in Corea del Sud ha deciso di rispondere a questa domanda con un approccio molto accurato, utilizzando i dati di oltre 6.000 studenti che hanno sostenuto il test di matematica del 2022. Ha iniziato costruendo un solido modello di base utilizzando solo le informazioni fornite dagli studenti in un sondaggio. Questo sondaggio copriva una vasta gamma di argomenti, tra cui lo stato economico della loro famiglia, quanto credessero nelle proprie abilità matematiche, quanta ansia provassero, quanto piacessero la scuola e quali tipi di problemi matematici avessero affrontato in classe. I dati di questo sondaggio da soli si sono rivelati un potente predittore dei punteggi finali degli studenti. Quando il ricercatore ha esaminato i registri informatici di come gli studenti avessero effettivamente lavorato durante il test — quanto tempo avessero impiegato e quante azioni avessero compiuto — ha scoperto che questi dati comportamentali erano utili anche da soli, ma non erano accurati quanto i dati del sondaggio. I sentimenti auto-riferiti e le condizioni di background di uno studente erano semplicemente più efficaci nel predire il loro punteggio finale rispetto a un conteggio grezzo di clic e secondi trascorsi.
Tuttavia, la storia è cambiata quando il ricercatore ha osservato come questi due tipi di informazioni lavorassero insieme. La sfida era che i registri informatici erano disordinati; un lungo tempo trascorso su un problema poteva significare che uno studente stava incontrando difficoltà, oppure poteva semplicemente significare che quel problema specifico era più difficile degli altri. Per risolvere questo problema, il ricercatore ha regolato i dati in modo che il tempo e le azioni di ogni studente fossero confrontati solo con altri studenti che affrontavano esattamente lo stesso problema. Ciò ha rimosso l'influenza del design del test e ha lasciato solo il comportamento relativo dello studente. Quando hanno aggiunto questi indicatori comportamentali aggiustati al modello del sondaggio, la previsione dei punteggi di matematica degli studenti è migliorata significativamente. Il modello combinato ha generato errori che erano di circa 11 punti inferiori sulla scala del test rispetto al solo modello del sondaggio. Questo miglioramento è stato costante attraverso diversi algoritmi informatici ed è rimasto valido anche quando il ricercatore ha testato il modello su scuole completamente nuove rispetto al sistema, il che significa che il modello poteva prevedere la prestazione di studenti che non aveva mai visto prima.
Il ricercatore è stato attento a spiegare cosa significasse questo miglioramento e cosa non significasse. Ha sottolineato che i dati comportamentali non dimostravano che passare più tempo o cliccare più pulsanti causasse un punteggio migliore. Inveve, lo studio ha mostato che il registro digitale dello sforzo e della strategia di uno studente contiene indizi extra sulla sua abilità che non vengono catturati chiedendogli informazioni. Lo studio ha anche escluso l'idea che questo miglioramento fosse solo il risultato del formato del test. Regolando i dati per tenere conto della specifica difficoltà di ogni problema, hanno dimostrato che il valore derivava dal comportamento effettivo dello studente, e non dal fatto che il test al computer avesse indirizzato determinati studenti verso domande più difficili o più facili. Le conclusioni suggeriscono che, nei test su larga scala, il modo in cui uno studente interagisce con un computer è un supplemento prezioso a ciò che ci dicono su se stessi, offrendo un quadro più chiaro e completo delle loro abilità matematiche.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.