Can Large Language Models Detect Contradicted Biomedical Evidence? A Dual-Annotator Benchmark Audit
Questo studio dimostra che gli attuali modelli linguistici di grandi dimensioni e i sistemi di generazione aumentata dalla ricerca falliscono significativamente nel rilevare le contraddizioni tra le risposte biomediche generate e le prove recuperate, spesso classificandole erroneamente come insufficienti, evidenziando così che tali verificatori automatizzati non sono ancora pronti per lo screening clinico autonomo.