When LLMs Benchmark Themselves: Deconstructing Self-Bias in Automated Evaluation
यह शोध पत्र प्रकट करता है कि LLMs द्वारा निर्मित और मूल्यांकित स्वचालित बेंचमार्क एक मौलिक आत्म-पक्षपात (self-bias) से ग्रस्त होते हैं जहाँ मॉडल परीक्षण सेट निर्माण और मूल्यांकन दोनों में योगात्मक शैलीगत प्रवृत्तियों के कारण व्यवस्थित रूप से अपने स्वयं के आउटपुट का पक्ष लेते हैं, जिससे अक्सर वे स्वयं को साथियों की तुलना में श्रेष्ठ के रूप में गलत तरीके से रैंक करते हैं।