Comparative Performance of General-Purpose Large Language Models and a Specialized Clinical AI Tool on OKAP-Style Ophthalmology Questions
Diese Studie evaluiert fünf große Sprachmodelle anhand von OKAP-typischen Ophthalmologie-Fragen und zeigt auf, dass allgemeine Modelle, insbesondere Gemini-Pro-3, das spezialisierte klinische KI-Tool OpenEvidence in Bezug auf Genauigkeit und Kalibrierung übertraf, während sie gleichzeitig eine signifikante Leistungsheterogenität und gemeinsame Fehlleistungen im logischen Schlussfolgern bei allen Systemen hervorhob.