Human-in-the-Loop Benchmarking of Heterogeneous LLMs for Automated Competency Assessment in Secondary Level Mathematics
यह शोध पत्र नेपाल में स्वचालित माध्यमिक-स्तर के गणित मूल्यांकन के लिए विषम (heterogeneous) एलएलएम (LLMs) का मूल्यांकन करने हेतु एक बहु-आयामी रूब्रिक का उपयोग करते हुए एक ह्युमन-इन-द-लूप बेंचमार्किंग फ्रेमवर्क प्रस्तुत करता है, जो यह प्रकट करता है कि मानव विशेषज्ञों के साथ सहमति प्राप्त करने के लिए मॉडल का पैमाना (scale) तुलना में निर्देश बाधाओं (instruction constraints) के साथ स्थापत्य अनुकूलता (architectural compatibility) अधिक महत्वपूर्ण है और यह निष्कर्ष निकालता है कि ये मॉडल स्वायत्त प्रमाणन के बजाय सहायक साक्ष्य निष्कर्षण (assistive evidence extraction) के लिए सबसे उपयुक्त हैं।