Can Large Language Models Detect Contradicted Biomedical Evidence? A Dual-Annotator Benchmark Audit
Diese Studie zeigt, dass aktuelle große Sprachmodelle und Retrieval-Augmented-Generation-Systeme signifikant daran scheitern, Widersprüche zwischen generierten biomedizinischen Antworten und abgerufenen Belegen zu erkennen, indem sie diese oft fälschlicherweise als unzureichend klassifizieren, was verdeutlicht, dass solche automatisierten Verifizierer noch nicht bereit für die klinische autonome Überprüfung sind.