Incremental Predictive Value of Item-Adjusted Process Indicators for Mathematics Achievement among Korean Students in PISA 2022: A School-Level Out-of-Sample Validation Study
Este estudio demuestra que los indicadores de proceso ajustados por ítem derivados de evaluaciones basadas en computadora mejoran significativamente la predicción del logro en matemáticas entre los estudiantes coreanos en PISA 2022 más allá de los datos tradicionales de cuestionarios, incluso bajo un riguroso diseño de validación fuera de la muestra a nivel escolar.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Cada año, millones de jóvenes de quince años de todo el mundo realizan una prueba masiva llamada PISA, diseñada para ver qué tan bien pueden utilizar lo que saben en situaciones de la vida real. Para la parte de matemáticas de esta prueba, los estudiantes se sientan ante una computadora y resuelven problemas. Si bien la puntuación final nos indica cuántas preguntas respondieron correctamente, la computadora también registra una capa oculta de datos: exactamente cuánto tiempo dedicaron a cada problema, cuántas veces hicieron clic y con qué frecuencia regresaron para cambiar una respuesta. Durante años, los investigadores se han preguntado si estas huellas digitales de comportamiento podrían decirnos algo sobre la capacidad de un estudiante que un simple cuestionario no puede. Sabemos que preguntar a los estudiantes sobre su confianza, su ansiedad y su entorno escolar nos brinda una buena imagen de su potencial, pero también sabemos que lo que un estudiante dice que hace y lo que realmente hace mientras resuelve un problema pueden ser muy diferentes. La gran pregunta es si el registro bruto y sin filtros de la interacción de un estudiante con la prueba aporta alguna información nueva y útil una vez que ya les hemos preguntado sobre su contexto y sus sentimientos.
Un investigador en Corea del Sur se propuso responder a esta pregunta con un enfoque muy cuidadoso, utilizando datos de más de 6,000 estudiantes que realizaron la prueba de matemáticas de 2022. Comenzó construyendo un sólido modelo de base utilizando únicamente la información que los estudiantes proporcionaron en una encuesta. Esta encuesta cubría una amplia gama de temas, incluyendo el estatus económico de su familia, cuánto creían en sus propias habilidades matemáticas, qué tan ansiosos se sentían, cuánto les gustaba la escuela y qué tipo de problemas matemáticos habían visto en clase. Estos datos de la encuesta por sí solos demostraron ser un poderoso predictor de las puntuaciones finales de los estudiantes. Cuando el investigador observó los registros de la computadora sobre cómo los estudiantes trabajaron realmente a través de la prueba —cuánto tiempo tardaron y cuántas acciones realizaron—, encontró que estos datos de comportamiento también eran útiles por sí mismos, pero no eran tan precisos como los datos de la encuesta. Los sentimientos y las condiciones de trasfondo autoinformados de un estudiante eran simplemente mejores para predecir su puntuación final que un recuento bruto de sus clics y los segundos transcurridos.
Sin embargo, la historia cambió cuando el investigador observó cómo estos dos tipos de información trabajaban juntos. El desafío era que los registros de la computadora eran desordenados; el tiempo prolongado dedicado a un problema podía significar que un estudiante estaba teniendo dificultades, o simplemente podía significar que ese problema específico era más difícil que los otros. Para solucionar esto, el investigador ajustó los datos de modo que el tiempo y las acciones de cada estudiante se compararan únicamente con otros estudiantes que enfrentaron exactamente el mismo problema. Esto eliminó la influencia del diseño de la prueba y dejó solo el comportamiento relativo del estudiante. Cuando agregaron estos indicadores de comportamiento ajustados al modelo de la encuesta, la predicción de las puntuaciones de matemáticas de los estudiantes mejoró significamente. El modelo combinado cometió errores que fueron aproximadamente 11 puntos menores en la escala de la prueba que el modelo de la encuesta por sí solo. Esta mejora fue consistente a través de diferentes algoritmos computacionales y se mantuvo incluso cuando el investigador probó el modelo en escuelas que eran completamente nuevas para el sistema, lo que significa que el modelo podía predecir el desempeño de estudiantes que nunca había visto antes.
El investigador tuvo cuidado de explicar lo que esta mejora significaba y lo que no significaba. Enfatizó que los datos de comportamiento no demostraban que dedicar más tiempo o hacer más clics causara que un estudiante obtuviera una mejor puntuación. En cambio, el estudio mostró que el registro digital del esfuerzo y la estrategia de un estudiante contiene pistas adicionales sobre su capacidad que no se capturan al hacerles preguntas. El estudio también descartó la idea de que esta mejora fuera simplemente un resultado del formato de la prueba. Al ajustar los datos para tener en cuenta la dificultad específica de cada problema, demostraron que el valor provenía del comportamiento real del estudiante, no del hecho de que la prueba por computadora haya dirigido a ciertos estudiantes hacia preguntas más difíciles o más fáciles. Los hallazgos sugieren que en las evaluaciones a gran escala, la forma en que un estudiante interactúa con una computadora es un suplemento valioso para lo que nos cuentan sobre sí mismos, ofreciendo una imagen más clara y completa de sus habilidades matemáticas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.