Comparative Performance of General-Purpose Large Language Models and a Specialized Clinical AI Tool on OKAP-Style Ophthalmology Questions
本研究は、OKAP形式の眼科学問題を用いて5つの大規模言語モデルを評価し、汎用モデル、特にGemini-Pro-3が、精度および較正において特化型臨床AIツールであるOpenEvidenceを上回ったことを明らかにするとともに、すべてのシステムにおける顕著な性能の不均一性と共通の推論上の失敗を浮き彫りにした。