Comparative Performance of General-Purpose Large Language Models and a Specialized Clinical AI Tool on OKAP-Style Ophthalmology Questions
Questo studio valuta cinque modelli linguistici di grandi dimensioni su domande di oftalmologia in stile OKAP, rivelando che i modelli generalisti, in particolare Gemini-Pro-3, hanno superato lo strumento di IA clinica specializzato OpenEvidence in termini di accuratezza e calibrazione, evidenziando al contempo una significativa eterogeneità delle prestazioni e fallimenti comuni nel ragionamento tra tutti i sistemi.