Comparative Performance of General-Purpose Large Language Models and a Specialized Clinical AI Tool on OKAP-Style Ophthalmology Questions
Deze studie evalueert vijf grote taalmodellen op OKAP-stijl vragen over oogheelkunde, waarbij wordt onthuld dat algemene modellen, in het bijzonder Gemini-Pro-3, de gespecialiseerde klinische AI-tool OpenEvidence overtroffen op het gebied van nauwkeurigheid en kalibratie, terwijl tegelijkertijd een significante prestatieheterogeniteit en gedeelde redeneerfouten bij alle systemen werden aangetoond.