← नवीनतम पेपर
💬 NLP

Am I More Pointwise or Pairwise? Revealing Position Bias in Rubric-Based LLM-as-a-Judge

यह शोध पत्र प्रकट करता है कि रूब्रिक-आधारित LLM-as-a-judge मूल्यांकन स्वाभाविक रूप से बहुविकल्पीय कार्यों के समान मॉडल-विशिष्ट स्थिति पूर्वाग्रह (position bias) प्रदर्शित करता है, जहाँ स्कोर विकल्पों और मानदंडों का क्रम निर्णयों को महत्वपूर्ण रूप से प्रभावित करता है, लेकिन यह भी दर्शाता है कि इन क्रमों पर यादृच्छिक क्रमपरिवर्तन (random permutations) लागू करने से इस पूर्वाग्रह को प्रभावी ढंग से कम किया जा सकता है और मानव एनोटेशन के साथ संरेखण में सुधार किया जा सकता है।

मूल लेखक: Yuzheng Xu, Tosho Hirasawa, Tadashi Kozuno, Yoshitaka Ushiku

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuzheng Xu, Tosho Hirasawa, Tadashi Kozuno, Yoshitaka Ushiku

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक रोबोट जज (एक लार्ज लैंग्वेज मॉडल, या LLM) है जिसका काम छात्रों के निबंधों को ग्रेड देना है। आप उस रोबोट को एक रूब्रिक (rubric) देते हैं—स्कोरिंग विकल्पों की एक सूची जैसे कि "1: भयानक," "2: खराब," "3: ठीक-ठाक," "4: अच्छा," और "5: उत्कृष्ट।"

पेपर "Am I More Pointwise or Pairwise?" एक सरल लेकिन आश्चर्यजनक प्रश्न पूछता है: क्या रोबोट इस बात की परवाह करता है कि विकल्प पेज पर कहाँ सूचीबद्ध हैं?

यहाँ उनके निष्कर्षों का विवरण दिया गया, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए।

1. "मेन्यू" की समस्या

आमतौर पर, हम इन रूब्रिक्स को एक साधारण चेकलिस्ट के रूप में देखते हैं। लेकिन शोधकर्ताओं ने पाया कि इन AI जजों के लिए, एक रूब्रिक एक बहुविकल्पीय परीक्षा (multiple-choice test) की तरह काम करता है।

जब रोबोट सूची को पढ़ता है, तो वह केवल स्कोर के अर्थ को ही नहीं देखता; वह उनकी स्थिति को भी देखता है। ठीक वैसे ही जैसे एक इंसान अवचेतन रूप से मेन्यू में पहले विकल्प को चुन सकता है क्योंकि वह पहली चीज़ है जो उसे दिखती है, या आखिरी विकल्प को क्योंकि वह सबसे यादगार है, इन AI जजों में भी एक "पोजीशन बायस" (स्थान संबंधी पूर्वाग्रह) होता है।

  • निष्कर्ष: कुछ रोबोट पहले विकल्प को पसंद करते हैं (एक "फर्स्ट-बायस्ड" जज)। अन्य आखिरी विकल्प को पसंद करते हैं (एक "लास्ट-बायस्ड" जज)।
  • आश्चर्य: यह सबके लिए एक जैसा नहीं है। एक मॉडल हमेशा "अच्छा" चुन सकता है क्योंकि वह सूची में सबसे ऊपर है, जबकि एक दूसरा मॉडल "उत्कृष्ट" चुन सकता है क्योंकि वह सबसे नीचे है। यह किसी विशिष्ट रोबोट का व्यक्तित्व संबंधी व्यवहार (personality quirk) है, न कि रूब्रिक की कोई खामी।

2. "लाइन-अप" बायस

शोधकर्ताओं ने एक और परिदृश्य भी देखा जहाँ रोबोट को एक साथ कई चीजों (जैसे, सुसंगतता (Coherence), सहानुभूति (Empathy), और आश्चर्य (Surprise)) पर निबंध को ग्रेड देना होता है।

संदों (suspects) की एक लाइन-अप की कल्पना करें। यदि आप पुलिस से अपराधी की पहचान करने के लिए कहते हैं, तो वे लाइन में सबसे आगे खड़े व्यक्ति पर अधिक ध्यान केंद्रित कर सकते हैं। इसी तरह, पेपर में पाया गया कि मानदंडों (criteria) का क्रम मायने रखता है।

  • यदि "सुसंगतता" पहले सूचीबद्ध है, तो रोब를 इसे तब थोड़ा अलग स्कोर दे सकता है जब यह तीसरे स्थान पर हो।
  • ऐसा तब भी होता है जब रोबोट टेक्स्ट को समझने में पूरी तरह सक्षम हो। प्रश्नों का क्रम अंतिम स्कोर को बदल देता है।

3. "शफल" समाधान

तो, उस रोबोट को कैसे ठीक किया जाए जो इस बात से आसानी से विचलित हो जाता है कि चीजें कहाँ लिखी गई हैं?

शोधकर्ताओं ने बैलेंस्ड परम्यूटेशन (Balanced Permutation) नामक एक विधि का परीक्षण किया। इसे ताश के पत्तों को फेंटने (shuffling) की तरह समझें।

  • इसके बजाय रोबोट से क्रम में दी गई सूची (1, 2, 3, 4, 5) के साथ निबंध को एक बार ग्रेड कराने के बजाय, उन्होंने उससे उसी निबंध को दस बार ग्रेड करवाया।
  • हर बार, उन्होंने स्कोर के क्रम को बदला (जैसे, 3, 1, 5, 2, 4; फिर 5, 2, 1, 4, 3, आदि)।
  • परिणामों का औसत निकालकर, "पोजीशन बायस" खुद को रद्द कर देता है, जिससे केवल वास्तविक स्कोर बचता है।

कैच (Catch): पेपर में पाया गया कि आपको एक पूर्ण शफल की आवश्यकता नहीं है। आपको एक पूरी तरह संतुलित सूची बनाने के लिए सारा गणित करने की आवश्यकता नहीं है।

  • उपमा: यह एक औसत तापमान प्राप्त करने की कोशिश करने जैसा है। आपको दिन के हर एक सेकंड में माप लेने की आवश्यकता नहीं है। यदि आप दिन के दौरान कुछ यादृच्छिक (random) माप लेते हैं, तो आपको एक अच्छा औसत मिल जाता है।
  • परिणाम: सूची को केवल कुछ बार (लग तरीन 3 से 5 बार) यादृच्छिक रूप से बदलना, एक जटिल, पूर्ण शफल करने जितना ही प्रभावी काम करता है। यह रोबोट को क्रम से विचलित होने से रोकने का एक सस्ता और आसान तरीका है।

4. यह क्यों मायने रखता है ( "विजेता" बदल जाता है)

आप सोच सकते हैं, "ठीक है, स्कोर थोड़ा बदल जाता है, लेकिन क्या वास्तव में इससे फर्क पड़ता है?"

पेपर कहता है कि हाँ, यह बहुत मायने रखता है जब आप एक विजेता चुन रहे होते हैं।

  • कल्पना कीजिए कि 4 प्रतियोगियों के बीच एक प्रतियोगिता चल रही है। यदि रोबोट का बायस स्कोर को थोड़ा बदल देता है, तो शीर्ष-रैंक वाला प्रतियोगी बदल सकता है।
  • शोधकर्ताओं ने पाया कि केवल रूब्रिक विकल्पों के क्रम को बदलने से 16% से 39% मामलों में "विजेता" बदल गया।
  • रूपक: यह एक ऐसी दौड़ की तरह है जहाँ फिनिश लाइन (finish line) थोड़ी बदल जाती है यदि आप अपनी लेन के आधार पर दौड़ रहे हैं। यदि आप एक दौड़ का निर्णय लेने जा रहे हैं जिससे छात्रवृत्ति मिलती है, तो फिनिश लाइन को बदलना (रूब्रिक का क्रम बदलना) अनजाने में गलत व्यक्ति को पुरस्कार दिला सकता है।

सारांश

  • समस्या: AI जज गुप्त रूप से उन विकल्पों के क्रम से प्रभावित होते हैं जिन्हें वे देखते हैं, ठीक वैसे ही जैसे इंसान होते हैं।
  • विशेषता: कुछ AI मॉडल पहले विकल्प को पसंद करते हैं, अन्य अंतिम को।
  • समाधान: आप इसे तब ठीक कर सकते हैं जब आप AI को अलग-अलग क्रम में बदले गए (shuffled) क्रम के साथ एक ही चीज़ को कई बार ग्रेड करने के लिए कहें।
  • शॉर्टकट: आपको पूर्ण शफल की आवश्यकता नहीं है; कुछ यादृच्छिक शफल ही एक निष्पक्ष परिणाम प्राप्त करने के लिए पर्याप्त हैं।
  • प्रभाव: यदि आप इसे ठीक नहीं करते हैं, तो आप अनजाने में गलत "सर्वश्रेष्ठ" उत्तर चुन सकते हैं, भले ही AI बहुत बुद्धिमान हो।

पेपर निष्कर्ष निकालता है कि हमें इन रूब्रिक-आधारित AI जजों के साथ एक बहुविकल्पीय परीक्षा देने वाले छात्र की तरह व्यवहार करने की आवश्यकता है, जहाँ उत्तर की स्थिति मायने रखती है, और सच्चाई जानने के लिए हमें ताश के पत्तों को शफल करने की आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →