Can Large Language Models Detect Contradicted Biomedical Evidence? A Dual-Annotator Benchmark Audit
Este estudo demonstra que os atuais modelos de linguagem de grande escala e sistemas de geração aumentada por recuperação falham significativamente em detectar contradições entre respostas biomédicas geradas e evidências recuperadas, frequentemente classificando-as erroneamente como insuficientes, destacando assim que tais verificadores automatizados ainda não estão prontos para a triagem clínica autônoma.