Comparative Performance of General-Purpose Large Language Models and a Specialized Clinical AI Tool on OKAP-Style Ophthalmology Questions
本研究评估了五种大语言模型在 OKAP 式眼科学问题上的表现,结果显示通用型模型(尤其是 Gemini-Pro-3)在准确性和校准度方面优于专门的临床 AI 工具 OpenEvidence,同时也凸显了所有系统都存在的显著性能异质性以及共同的推理失败问题。