Condence, Calibration, and Abstention in Small Open-Weight Language Models on Psychiatric Knowledge Questions: A Cross-Domain Replication
Questo studio pilota dimostra che i piccoli modelli linguistici a pesi aperti applicati a quesiti di conoscenza psichiatrica esibiscono una scarsa calibrazione della fiducia, classifiche di accuratezza dipendenti dal dominio e che l'istruirli ad astenersi dal rispondere spesso degrada piuttosto che migliorare le prestazioni quando valutati con statistiche accoppiate rigorose.
Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.