Multi model deliberation improves the stability of automated scoring by large language models across genres and assessment contexts
Deze studie toont aan dat een multi-model deliberatiekader, waarbij drie heterogene Chinese grote taalmodellen iteratief scores en rationale uitwisselen, de stabiliteit en precisie van automatische essaybeoordeling over diverse genres en beoordelingscontexten aanzienlijk verbetert, waarbij elke resulterende systematische bias effectief corrigeerbaar is door middel van standaard mens-geankerde kalibratie.