Can Large Language Models Detect Contradicted Biomedical Evidence? A Dual-Annotator Benchmark Audit
Deze studie toont aan dat huidige grote taalmodellen en systemen voor retrieval-augmented generation er aanzienlijk in falen om tegenstrijdigheden te detecteren tussen gegenereerde biomedische antwoorden en opgehaalde bewijslast, waarbij ze deze vaak onterecht als onvoldoende classificeren, wat benadrukt dat dergelijke geautomatiseerde verifiers nog niet klaar zijn voor klinische autonome screening.