Incremental Predictive Value of Item-Adjusted Process Indicators for Mathematics Achievement among Korean Students in PISA 2022: A School-Level Out-of-Sample Validation Study
Este estudo demonstra que indicadores de processo ajustados por item, derivados de avaliações baseadas em computador, melhoram significativamente a previsão do desempenho em matemática entre estudantes coreanos no PISA 2022 para além dos dados tradicionais de questionários, mesmo sob um rigoroso desenho de validação fora da amostra ao nível escolar.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Todos os anos, milhões de jovens de quinze anos ao redor do mundo realizam um teste massivo chamado PISA, projetado para ver o quão bem eles conseguem usar o que sabem em situações da vida real. Para a parte de matemática deste teste, os alunos sentam-se diante de um computador e resolvem problemas. Embora a pontuação final nos diga quantos acertos eles tiveram, o computador também registra uma camada oculta de dados: exatamente quanto tempo eles passaram em cada problema, quantas vezes clicaram e com que frequência voltaram para alterar uma resposta. Durante anos, pesquisadores se perguntaram se essas pegadas digitais de comportamento poderiam nos dizer algo sobre a habilidade de um aluno que um simples questionário não consegue. Sabemos que perguntar aos alunos sobre sua confiança, sua ansiedade e seu ambiente escolar nos dá um bom panorama de seu potencial, mas também sabemos que o que um aluno diz que faz e o que ele realmente faz enquanto resolve um problema podem ser muito diferentes. A grande questão é se o registro bruto e não filtrado da interação de um aluno com o teste adiciona qualquer informação nova e útil depois que já perguntamos sobre seu histórico e seus sentimentos.
Um pesquisador na Coreia do Sul partiu para responder a essa pergunta com uma abordagem muito cuidadosa, utilizando dados de mais de 6.000 alunos que realizaram o teste de matemática de 2022. Ele começou construindo um modelo de linha de base sólido usando apenas as informações fornecidas pelos alunos em uma pesquisa. Esta pesquisa cobriu uma ampla gama de tópicos, incluindo o status econômico de sua família, o quanto eles acreditavam em suas próprias habilidades matemáticas, o quanto se sentiam ansiosos, o quanto gostavam da escola e que tipo de problemas matemáticos haviam visto em sala de aula. Esses dados da pesquisa sozinhos provaram ser um preditor poderoso das pontuações finais dos alunos. Quando o pesquisador observou os registros do computador sobre como os alunos realmente trabalharam ao longo do teste — quanto tempo levaram e quantas ações realizaram — ele descobriu que esses dados comportamentais também eram úteis por si só, mas não eram tão precisos quanto os dados da pesquisa. Os sentimentos e condições de contexto autorrelatados de um aluno foram simplesmente melhores para prever sua pontuação final do que uma contagem bruta de cliques e segundos gastos.
No entanto, a história mudou quando o pesquisador observou como esses dois tipos de informações trabalhavam juntos. O desafio era que os registros do computador eram desordenados; um longo tempo gasto em um problema poderia significar que o aluno estava tendo dificuldades, ou poderia apenas significar que aquele problema específico era mais difícil do que os outros. Para corrigir isso, o pesquisador ajustou os dados para que o tempo e as ações de cada aluno fossem comparados apenas com outros alunos que enfrentaram exatamente o mesmo problema. Isso removeu a influência do design do teste em si e deixou apenas o comportamento relativo do aluno. Quando eles adicionaram esses indicadores comportamentais ajustados ao modelo da pesquisa, a previsão das pontuações de matemática dos alunos melhorou significamente. O modelo combinado apresentou erros cerca de 11 pontos menores na escala do teste do que o modelo baseado apenas na pesquisa. Essa melhoria foi consistente em diferentes algoritmos de computador e manteve-se verdadeira mesmo quando o pesquisador testou o modelo em escolas que eram completamente novas ao sistema, significando que o modelo poderia prever o desempenho de alunos que ele nunca havia visto antes.
O pesquisador foi cuidadoso ao explicar o que essa melhoria significava e o que ela não significava. Ele enfatizou que os dados comportamentais não provaram que gastar mais tempo ou clicar em mais botões faz com que um aluno obtenha uma pontuação melhor. Em vez disso, o estudo mostrou que o registro digital do esforço e da estratégia de um aluno contém pistas extras sobre sua habilidade que não são capturadas ao fazer perguntas a eles. O estudo também descartou a ideia de que essa melhoria fosse apenas um resultado do formato do teste. Ao ajustar os dados para levar em conta a dificuldade específica de cada problema, eles mostraram que o valor vinha do comportamento real do aluno, e não do fato de o teste no computador ter direcionado certos alunos para questões mais difíceis ou mais fáceis. As descobertas sugerem que, em testes de larga escala, a maneira como um aluno interage com um computador é um suplemento valioso para o que eles nos dizem sobre si mesmos, ofereando uma imagem mais clara e completa de suas habilidades matemáticas.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.