Evaluating Clinical Competencies of Large Language Models with a General Practice Benchmark
यह शोध पत्र सामान्य अभ्यास (जनरल प्रैक्टिस) के लिए एक नवीन क्षमता-आधारित बेंचमार्क, GPBench को प्रस्तुत करता है, जो दस अत्याधुनिक लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है और यह निष्कर्ष निकालता है कि वर्तमान मॉडल अभी स्वायत्त नैदानिक तैनाती के लिए उपयुक्त नहीं हैं, जिसके लिए निरंतर मानवीय पर्यवेक्षण और आगे के अनुकूलन की आवश्यकता है।