Performance, safety, and repeated-query stability of large language models versus early-career urologists in urological oncology: a source-masked vignette benchmark
Questo studio dimostra che, sebbene gli urologi all'inizio della carriera superino significativamente i modelli linguistici di grandi dimensioni rivolti al consumatore in materia di oncologia urologica per quanto riguarda l'accuratezza complessiva, la sicurezza e la stabilità della risposta, gli errori frequenti critici per la sicurezza e le uscite incoerenti dei modelli sottolineano la necessità di una supervisione clinica piuttosto che di un impiego autonomo.