QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI
यह शोध पत्र QQJ को प्रस्तुत करता है, जो एक स्केलेबल और मानव-संरेखित मूल्यांकन ढांचा है जो विशेषज्ञ-निर्मित, बहु-आयामी रूब्रिक्स में लार्ज लैंग्वेज मॉडल इवैल्यूएटर्स को एंकर करके स्वचालित मूल्यांकन और मानवीय निर्णय के बीच के अंतर को पाटता है, जिससे पारंपरिक मेट्रिक्स और अनकन्स्ट्रेंड एलएलएम इवैल्यूएटर्स की तुलना में जनरेटिव एआई सिस्टम के लिए बेहतर निरंतरता, व्याख्यात्मकता और नैदानिक क्षमता प्राप्त होती है।