Multi model deliberation improves the stability of automated scoring by large language models across genres and assessment contexts
Questo studio dimostra che un framework di deliberazione multi-modello, in cui tre grandi modelli linguistici cinesi eterogenei si scambiano iterativamente punteggi e motivazioni, migliora significativamente la stabilità e la precisione della valutazione automatizzata dei saggi attraverso diversi generi e contesti di valutazione, con qualsiasi eventuale pregiudizio sistematico che viene efficacemente correggibile attraverso la calibrazione standard ancorata all'uomo.