Can Large Language Models Detect Contradicted Biomedical Evidence? A Dual-Annotator Benchmark Audit
Cette étude démontre que les modèles de langage de grande taille et les systèmes de génération augmentée par récupération actuels échouent considérablement à détecter les contradictions entre les réponses biomédicales générées et les preuves récupérées, les classant souvent par erreur comme insuffisantes, soulignant ainsi que de tels vérificateurs automatisés ne sont pas encore prêts pour le dépistage clinique autonome.