← नवीनतम पेपर
💬 NLP

Evaluating Scoring Bias in LLM-as-a-Judge

यह शोध पत्र 'LLM-as-a-Judge' प्रणालियों में स्कोरिंग पूर्वाग्रह के अल्प-अन्वेषित मुद्दे को संबोधित करता है, जिसमें तीन नवीन पूर्वाग्रह प्रकारों—रूब्रिक ऑर्डर (rubric order), स्कोर आईडी (score ID), और संदर्भ उत्तर स्कोर (reference answer score) पूर्वाग्रहों को परिभाषित और परिमाणित किया गया है, तथा बेहतर प्रॉम्प्ट डिज़ाइन और स्वचालित मूल्यांकन के माध्यम से उन्हें कम करने के लिए एक व्यापक ढांचे का प्रस्ताव दिया गया है।

मूल लेखक: Qingquan Li, Shaoyu Dou, Kailai Shao, Chao Chen, Haixiang Hu

प्रकाशित 2026-05-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qingquan Li, Shaoyu Dou, Kailai Shao, Chao Chen, Haixiang Hu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने निबंधों को ग्रेड देने के लिए एक बहुत ही स्मार्ट, स्वचालित रोबोट शिक्षक को काम पर रखा है। इस रोबोट को निष्पक्ष, वस्तुनिष्ठ और सुसंगत होना चाहिए। आप इसे एक छात्र का निबंध और एक रूब्रिक (एक चेकलिस्ट कि एक अच्छा निबंध कैसा होता है) देते हैं और यह निबंध को 1 से 5 तक का स्कोर देता है।

यह पेपर इस बारे में है कि यह पता लगाने के लिए कि सबसे स्मार्ट रोबोट शिक्षक भी वास्तव में कितनी आसानी से धोखा खा सकते हैं। वे केवल निबंध को नहीं देखते; वे इस बात से भ्रमित हो जाते हैं कि निर्देशों को कैसे लिखा गया है, भले ही निर्देश बिल्कुल एक ही बात कह रहे हों।

यहाँ शोध के निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

मुख्य समस्या: "मैजिक 8-बॉल" प्रभाव

शोधकर्ताओं ने पाया कि यदि आप ग्रेडिंग निर्देशों के फॉर्मेटिंग को थोड़ा बदल देते हैं—बिना वास्तविक अर्थ बदले—तो एक ही निबंध के लिए रोबोट का स्कोर नाटकीय रूप से बदल सकता है। यह एक दोस्त से पूछने जैसा है, "यह फिल्म कैसी है?" और अगर आप विनम्रता से पूछते हैं तो "5 में से 5" मिलता है, लेकिन अगर आप सिर के बल खड़े होकर पूछते हैं तो "5 में से 2" मिलता है। फिल्म नहीं बदली, लेकिन उत्तर बदल गया।

यह पेपर स्कोरिंग बायस (Scoring Bias) पर केंद्रित है, जो तब होता है जब रोबोट केवल प्रॉम्प्ट में बदलाव के कारण अलग स्कोर (जैसे 3 या 4) देता है, न कि इसलिए कि उत्तर बदला है।

तीन तरीके जिनसे रोबोट भ्रमित होता है

  1. मेन्यू ऑर्डर बायस (रूब्रिक ऑर्डर):
    एक रेस्टोरेंट के मेन्यू की कल्पना करें। आमतौर पर, स्टार्टर्स पहले सूचीबद्ध होते हैं, फिर मुख्य व्यंजन। यदि आप मेन्यू को पलट देते हैं ताकि मुख्य व्यंजन पहले आ जाएं, तो क्या भोजन का स्वाद बदल जाता है? नहीं। लेकिन रोबोट शिक्षक ऐसा सोचता है।

    • निष्कर्ष: यदि ग्रेडिंग नियम "1 से 5" (कम से उच्च) के क्रम में सूचीबद्ध हैं, तो रोबोट अलग तरह से ग्रेड करता है यदि वे "5 से 1" (उच्च से कम) या किसी यादृच्छिक (random) क्रम में सूचीबद्ध हों। रोबोट अनुक्रम (sequence) से भ्रमित हो जाता है।
  2. नेम टैग बायस (स्कोर आईडी):
    आमतौर पर, हम 1, 2, 3, 4, 5 जैसे नंबरों का उपयोग करते हैं। लेकिन क्या होगा यदि हम अक्षरों (A, B, C, D, E) या रोमन अंकों (I, II, III, IV, V) का उपयोग करें?

    • निष्कर्ष: रोबोट का मस्तिष्क इन अलग-अलग "नामों" के प्रति अलग तरह से प्रतिक्रिया करता है। कभी-कभी रोमन अंकों का उपयोग करने से रोबोट बेहतर ग्रेडर बनता है; कभी-कभी यह उसे बदतर बना देता है। ऐसा लगता है जैसे रोबोट का अपना पसंदीदा वर्णमाला है।
  3. "परफेक्ट उदाहरण" बायस (रेफरेंस आंसर स्कोर):
    कभी-कभी, शिक्षक छात्रों को यह दिखाने के लिए कि "5" कैसा दिखता है, एक "परफेक्ट उदाहरण" देते हैं। शोधकर्ताओं ने परीक्षण किया कि उस उदाहरण के साथ एक स्कोर जोड़ने से क्या होता है।

    • निष्कर्ष: यदि आप एक परफेक्ट उदाहरण दिखाते हैं और उसे "स्कोर 5" लेबल करते हैं, तो रोबलेट बहुत सुसंगत और सटीक हो जाता है। हालांकि, यदि आप उसी परफेक्ट उदाहरण को "स्कोर 3" लेबल करते हैं, तो रोबोट भ्रमित हो जाता है और बाकी सब कुछ के लिए कम स्कोर देना शुरू कर देता है, यह सोचते हुए, "ओह, अगर परफेक्ट उदाहरण केवल 3 है, तो इस छात्र का निबंध तो बहुत बुरा ही होगा।"

प्रयोग: रोबोटों का परीक्षण करना

शोधकर्ताओं ने कई अलग-अलग "रोबोट शिक्षकों" (AI मॉडल्स) पर इसका परीक्षण किया, जिनमें सबसे शक्तिशाली (जैसे GPT-4o) से लेकर छोटे, सस्ते मॉडल शामिल थे।

  • बड़े रोबोट बनाम छोटे रोबोट: सबसे शक्तिशाली रोबोट कम आसानी से भ्रमित होते थे। वे एक वरिष्ठ शिक्षक की तरह थे जो विषय को इतनी अच्छी तरह जानते हैं कि मेन्यू का क्रम पलटने से वे विचलित नहीं होते। छोटे रोबोट घबराए हुए छात्र शिक्षकों की तरह थे; निर्देशों में एक छोटा सा बदलाव उनके स्कोर को बेतहाशा ऊपर-नीचे कर देता था।
  • आश्चर्य: कभी-कभी, ये "ट्रिक्स" मदद करते थे! कुछ रोबोटों के लिए, रोमन अंकों का उपयोग करना या नियमों के क्रम को पलटना उन्हें मानक तरीके की तुलना में अधिक सटीक रूप से ग्रेड करने में मदद करता था। यह पता चलता है कि जिस "मानक" तरीके से हम इंसान प्रॉम्प्ट लिखते हैं, वह हमेशा रोबोटों के लिए सबसे अच्छा नहीं होता है।

समाधान: ग्रेडिंग को कैसे ठीक करें

अपने प्रयोगों के आधार पर, लेखक इन रोबोट जजों को अधिक विश्वसनीय बनाने के लिए तीन सुझाव देते हैं:

  1. बड़े रोबोटों को काम पर रखें: यदि आपको एक महत्वपूर्ण ग्रेड (जैसे नौकरी या स्कूल के लिए) की आवश्यकता है, तो उपलब्ध सबसे शक्तिशाली AI मॉडल का उपयोग करें। वे स्वाभाविक रूप से अधिक स्थिर होते हैं और फॉर्मेटिंग के ट्रिक्स से आसानी से विचलित नहीं होते।
  2. नियमों को तोड़ें (जानबूझकर): केवल मानक "1 से 5" की सूची की नकल न करें। नियमों को "5 से 1" की ओर नीचे की ओर सूचीबद्ध करने का प्रयास करें, या नंबरों के बजाय अक्षरों का उपयोग करें। पेपर सुझाव देता है कि कुछ "गैर-पारंपरिक" लेकिन स्पष्ट करना वास्तव में रोबोट को उसके सामान्य बायस ट्रैप में फंसने से रोक सकता है।
  3. परफेक्ट उदाहरण दिखाएं (5 के साथ): यदि आप रोबोट को ग्रेड करने में मदद करने के लिए एक "गोल्ड स्टैंडर्ड" उत्तर दिखा रहे हैं, तो सुनिश्चित करें कि आप उसे "5" लेबल करें (जो उच्चतम स्कोर है)। यह रोबोट की सोच को स्थिर (anchor) करता है और इसे बहुत सटीक बनाता है।

निचोड़ (Bottom Line)

पेपर यह निष्कर्ष निकालता है कि "LLM-as-a-Judge" (AI द्वारा AI को ग्रेड देना) उतना वस्तुनिष्ठ नहीं है जितना कि हम सोचते थे। रोबोट नियमों के बजाय, नियमों की प्रस्तुति के प्रति संवेदनशील होते हैं। निष्पक्ष ग्रेड प्राप्त करने के लिए, हमें यह बहुत ध्यान रखना होगा कि हम निर्देशों को कैसे लिखते हैं, शायद सबसे शक्तिशाली मॉडलों का उपयोग करके और अपने प्रॉम्प्ट को उन तरीकों से डिजाइन करके जो हमारे उपयोग के तरीकों से थोड़े अलग हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →