Self-Preference Bias in Rubric-Based Evaluation of Large Language Models
यह शोधपत्र यह प्रदर्शित करने वाला पहला अध्ययन प्रस्तुत करता है कि रूब्रिक-आधारित एलएलएम (LLM) मूल्यांकनों में स्व-वरीयता पूर्वाग्रह (self-preference bias) बना रहता है—वस्तुनिष्ठ मानदंडों के बावजूद—जो मॉडल के स्कोर और रैंकिंग को महत्वपूर्ण रूप से प्रभावित करता है, हालांकि कई जजों के समूह (ensembling) का उपयोग इस समस्या को आंशिक रूप से कम कर सकता है।