Rubric-Conditioned LLM Grading: Alignment, Uncertainty, and Robustness
यह शोध पत्र स्वचालित लघु-उत्तर ग्रेडिंग के लिए रूब्रिक-कंडीशन्ड (rubric-conditioned) एलएलएम (LLM) के प्रदर्शन का व्यवस्थित रूप से मूल्यांकन करता है, जो यह प्रकट करता है कि जहाँ बाइनरी कार्यों के लिए विशेषज्ञों के साथ संरेखण मजबूत है, वहीं जटिल रूब्रिक्स के साथ यह घट जाता है, हालांकि अनिश्चितता-आधारित विdeferral (deferral) के माध्यम से सटीकता में सुधार किया जा सकता है और मजबूती परीक्षण (robustness testing) प्रॉम्प्ट इंजेक्शन के प्रति लचीलेपन के बावजूद पर्यायवाची प्रतिस्थापन के प्रति संवेदनशीलता को उजागर करता है।