An Interpretable and Scalable Framework for Evaluating Large Language Models
यह शोध पत्र पारंपरिक आइटम रिस्पॉन्स थ्योरी (Item Response Theory) विधियों की कम्प्यूटेशनल और स्थिरता संबंधी सीमाओं को दूर करने के लिए मेजराइजेशन-मिनिमाइजेशन (majorization-minimization) सिद्धांत पर आधारित एक स्केलेबल और व्याख्या योग्य ढांचे का प्रस्ताव करता है, जो विविध बेंचमार्क पर लार्ज लैंग्वेज मॉडल्स के कुशल और सटीक मूल्यांकन को सक्षम बनाता है।