Quantifying the Statistical Effect of Rubric Modifications on Human-Autorater Agreement
यह शोध पत्र इस बात की जांच करता है कि मूल्यांकन रूपरेखाओं (rubrics) में संशोधन करना—विशेष रूप से उदाहरण, संदर्भ जोड़कर और स्थितिजन्य पूर्वाग्रह (positional bias) को कम करके, बनाम जटिलता बढ़ाकर या रूढ़िवादी एकत्रीकरण (conservative aggregation) का उपयोग करके—निबंध स्कोरिंग और निर्देश पालन जैसे डोमेन में मानव और एलएलएम-आधारित ऑटोरेटर के बीच सांख्यिकीय सहमति को कैसे प्रभावित करता है, यह पाते हुए कि कुछ संपादन संरेखण (alignment) को बढ़ाते हैं जबकि अन्य इसे बाधित करते हैं।