Comparative Performance of General-Purpose Large Language Models and a Specialized Clinical AI Tool on OKAP-Style Ophthalmology Questions
Cette étude évalue cinq grands modèles de langage sur des questions d'ophtalmologie de type OKAP, révélant que les modèles polyvalents, particulièrement Gemini-Pro-3, ont surpassé l'outil d'IA clinique spécialisé OpenEvidence en termes de précision et de calibration, tout en mettant en évidence une hétérogénéité de performance significative et des échecs de raisonnement partagés entre tous les systèmes.