Comparative Performance of General-Purpose Large Language Models and a Specialized Clinical AI Tool on OKAP-Style Ophthalmology Questions
Este estudo avalia cinco modelos de linguagem de grande escala em questões de oftalmologia no estilo OKAP, revelando que modelos de propósito geral, particularmente o Gemini-Pro-3, superaram a ferramenta de IA clínica especializada OpenEvidence em precisão e calibração, ao mesmo tempo em que destacou uma heterogeneidade de desempenho significativa e falhas de raciocínio compartilhadas entre todos os sistemas.