← Últimos artigos
💻 computer science

Multi model deliberation improves the stability of automated scoring by large language models across genres and assessment contexts

Este estudo demonstra que um framework de deliberação multimodelo, no qual três grandes modelos de linguagem chineses heterogêneos trocam pontuações e justificativas iterativamente, melhora significativamente a estabilidade e a precisão da correção automatizada de redações através de diversos gêneros e contextos de avaliação, sendo qualquer viés sistemático resultante efetivamente corrigível por meio de calibração padrão ancorada em humanos.

Autores originais: Xiaoying ZHENG, Benhui CHEN, Yuqing CHEN, Yun YANG

Publicado 2026-08-19
📖 1 min de leitura☕ Leitura rápida

Autores originais: Xiaoying ZHENG, Benhui CHEN, Yuqing CHEN, Yun YANG

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Resumo Técnico: Deliberação Multimodelo para Estabilidade de Pontuação Automatizada

Definição do Problema
Embora os Grandes Modelos de Linguagem (LLMs) demonstrem potencial para a pontuação automatizada de redações, sua implementação prática na avaliação educacional é dificultada pela instabilidade da pontuação e pela falta de validação em múltiplos contextos. Pesquisas existentes priorizam a precisão preditiva (concordância com avaliadores humanos), mas frequentemente negligenciam a confiabilidade — especificamente, a consistência de um modelo ao avaliar repetidamente a mesma resposta. Como geradores probabilísticos, os LLMs introduzem uma variabilidade estocástica semelhante à fadiga do avaliador humano, o que ameaça a equidade e a validade educacional. A teoria da medida clássica postula que a confiabilidade é uma precondição para a validade; um instrumento que produz pontuações diferentes para a mesma resposta não pode sustentar inferências válidas. Além disso, métodos de conjunto tradicionais (ex.: média simples) falham em promover a "calibração cognitiva", pois agregam julgamentos isolados sem facilitar a troca de informações ou o raciocínio conjunto.

Metodologia
O estudo propõe um Framework de Deliberação Multimodelo fundamentado na teoria da inteligência coletiva. Este framework reconceitualiza a pontuação automatizada como um processo deliberativo envolvendo três LLMs de código aberto heterogêneos em chinês: Baichuan2-13B, Qwen2.5-14B e ChatGLM4-9B. O processo opera em três rodadas sequenciais:

  1. Pontuação Independente (R1): Os modelos pontuam uma resposta isoladamente, gerando pontuações iniciais e justificativas.
  2. Troca de Informações (R2): Os modelos recebem as pontuações e justificativas dos outros dois modelos. Eles são instruídos a reavaliar a resposta, com a opção de ajustar sua pontuação ou manter seu julgamento original com base nas novas evidências.
  3. Confirmação Final (R3): Os modelos recebem o conjunto completo de ajustes e justificativas de R2 e submetem uma pontuação final definitiva.

O framework foi avaliado através de dois conjuntos de dados complementares para testar a generalização e a estabilidade:

  • Corpus ASAP-AES: Um benchmark público contendo aproximadamente 13.000 redações de alunos do K-12 distribuídas em oito temas de escrita. Para este estudo, cinco redações foram deliberadamente amostradas de cada um dos oito temas (cobrindo segmentos de pontuação superior, médio e inferior) para criar um conjunto de teste de 40 redações, com 30 tentativas realizadas por redação (7.350 observações de nível de traço).
  • Corpus de Jornalismo: Respostas autênticas de um curso de jornalismo universitário chinês (10 redações, 100 tentativas cada, 9.000 registros de pontuação) pontuadas por um avaliador humano especialista.

O estudo comparou o conjunto de deliberação proposto contra basais de modelo único, conjuntos de média/mediana simples e pontuação de modelo único pós-deliberação. As métricas incluíram o Erro Médio Absoluto (MAE) entre modelos para convergência, o Coeficiente de Variação (CV) para estabilidade e correlações de ordem de classificação com as pontuações humanas.

Resultos Principais

  • Redução Significativa de Desacordo: No corpus ASAP-AES, o desacordo entre modelos (MAE) diminuiu significativamente de R1 para R3 em todos os temas (p corrigido por Holm < 0,001). O efeito agrupado foi grande (Cohen's dz = 1,08), com uma correlação de rank-biserial de 0,92, indicando que a deliberação impulsionou consistentemente a convergência, independentemente do gênero ou da escala de rubrica.
  • Estabilidade Aprimorada: No corpus de jornalismo, o Coeficiente de Variação (CV) para o conjunto de deliberação caiu de 7,29% (baseline) para 2,78%, representando uma melhoria relativa de 61,9% (t(9) = 7,98, p < 0,001). Esta melhoria superou significativamente as estratégias de conjunto simples (que reduziram o CV em 40,8%) e a pontuação de modelo único pós-deliberação (melhoria de 34,2%), demonstrando um efeito sinérgico entre deliberação e agregação.
  • Decomposição de Rodadas: O efeito de convergência foi particionado em dois segmentos. A rodada de troca de informações (R1 para R2) respondeu por aproximadamente dois terços (66–69%) da convergência total, enquanto a rodada de confirmação final (R2 para R3) contribuiu com o um terço restante (31–34%). Ambos os estágios foram considerados estatisticamente significativos e não redundantes.
  • Heterogeneidade e Comportamento dos Modelos: Os três modelos exibiram papéis distintos e consistentes através dos conjuntos de dados. O Baichuan2 atuou como uma "âncora" conservadora com mudanças mínimas de pontuação; o Qwen serviu como um "ajustador ativo", revisando frequentemente as pontuações para cima; e o ChatGLM funcionou como um "juiz robusto", equilibrando o ajuste com a resistência ao pensamento de grupo (groupthink). Essa heterogeneidade evitou a convergência prematura.
  • Alinhamento com Pontuações Humanas: Embora a deliberação tenha melhorado a precisão (estabilidade), ela induziu um deslocamento sistemático para cima nas pontuações absolutas em relação aos avaliadores humanos (ex.: +13,46 pontos na escala de 100 pontos do jornalismo). No entanto, a correspondência de ordem de classificação com as pontuações humanas foi amplamente preservada (Spearman ρ = 0,75 no corpus de jornalismo). O estudo demonstrou que esse viés sistemático poderia ser corrigido através de uma calibração linear padrão contra âncoras humanas, reduzindo o Erro Médio Absoluto em 50,3%.

Principais Contribuições

  1. Reenquadramento da Confiabilidade da Pontuação: O estudo altera o foco da pura precisão preditiva para a confiabilidade da medida, propondo um framework de deliberação que alcança estabilidade através de uma calibração cognitiva ativa, em vez de apenas cancelamento numérico de erros.
  2. Validação Empírica: Fornece evidências robustas da eficácia do framework através de diversos idiomas (Chinês/Inglês), gêneros (argumentativo/narrativo) e escalas de avaliação, validando a generalização da deliberação multimodelo.
  3. Caracterização de Mecanismos: A pesquisa caracteriza os padrões específicos de convergência e comportamentos de ajuste de modelos heterogêneos, revelando que a troca de informações impulsiona a maior parte da convergência, enquanto uma rodada de confirmação final fornece a estabilização necessária.

Significância e Alegações
O artigo afirma que a deliberação multimodelo aumenta substancialmente a estabilidade da pontuação automatizada, tornando os LLMs mais viáveis para a avaliação educacional onde a consistência é crítica para a equidade. Os autores argumentam que, embora a deliberação melhore a precisão (confiabilidade) das pontuações, ela não garante automaticamente a validade (alinhamento absoluto com padrões humanos). Portanto, o framework é apresentado como uma camada de aumento de precisão que deve ser acompanhada de calibração ancorada por humanos para aplicações de alto risco. O estudo conclui que tal sistema pode apoiar a avaliação formativa e reduzir a carga de trabalho de correção, desde que o julgamento profissional humano permaneça central ao processo de avaliação e que os vieses sistemáticos sejam gerenciados através de calibração. Os achados sugerem que a "sabedoria coletiva" de modelos heterogêneos, quando estruturada através da deliberação, oferece um caminho para uma pontuação automatizada mais confiável do que abordagens de agregação simples ou de modelo único.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →