Comparative Performance of General-Purpose Large Language Models and a Specialized Clinical AI Tool on OKAP-Style Ophthalmology Questions
Este estudio evalúa cinco modelos de lenguaje de gran tamaño en preguntas de oftalmología al estilo del OKAP, revelando que los modelos de propósito general, particularmente Gemini-Pro-3, superaron a la herramienta de IA clínica especializada OpenEvidence en precisión y calibración, al tiempo que resaltan una heterogeneidad de rendimiento significativa y fallos de razonamiento compartidos en todos los sistemas.