Can Large Language Models Detect Contradicted Biomedical Evidence? A Dual-Annotator Benchmark Audit
Este estudio demuestra que los modelos de lenguaje de gran tamaño actuales y los sistemas de generación aumentada por recuperación fallan significativamente al detectar contradicciones entre las respuestas biomédicas generadas y la evidencia recuperada, clasificándolas a menudo erróneamente como insuficientes, lo que resalta que tales verificadores automatizados aún no están listos para el cribado clínico autónomo.