← नवीनतम पेपर
💬 NLP

BabelJudge: Measuring LLM-as-a-Judge Reliability Across Languages and Agent Trajectories

यह शोध पत्र BabelJudge को प्रस्तुत करता है, जो एक ओपन-सोर्स बेंचमार्क और विश्वसनीयता ऑडिट फ्रेमवर्क है, जो नियंत्रित परिवर्तनों (controlled perturbations) के माध्यम से गोल्ड-स्टैंडर्ड लेबल उत्पन्न करके कई भाषाओं और एजेंट ट्रेजेक्टरीज में LLM-as-a-Judge मॉडलों का मूल्यांकन करता है ताकि उन छिपे हुए विफलता मोडों (failure modes) को उजागर किया जा सके जैसे कि पोजीशन और वर्बोसिटी बायस, जिन्हें कच्चे सटीकता मेट्रिक्स पकड़ने में विफल रहते हैं।

मूल लेखक: Shreyas KC

प्रकाशित 2026-06-23✓ Author reviewed
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shreyas KC

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने दो उत्तरों में से बेहतर का निर्णय लेने के लिए एक बहुत ही बुद्धिमान, बहुत तेज़ जज (न्यायाधीश) (एक AI) को काम पर रखा है। आप चाहते हैं कि यह जज निष्पक्ष, सटीक और सुसंगत हो। लेकिन क्या होगा अगर इस जज की कुछ गुप्त आदतें हों जो उन्हें पक्षपाती बना दें? क्या होगा अगर वे हमेशा उस उत्तर को चुनें जो पहले लिखा गया है, या जो लंबा है, भले ही वह निरर्थक हो?

यह बिल्कुल वही है जिसकी जांच BabelJudge नामक शोध पत्र करता है। यह एक "रिपोर्ट कार्ड" प्रणाली है जिसे इन AI जजों का ऑडिट करने के लिए डिज़ाइन किया गया है, इससे पहले कि हम उन्हें महत्वपूर्ण निर्णयों के लिए भरोसेमंद मानें।

यहाँ सरल उपमाओं (analogies) का उपयोग करके शोध पत्र के निष्कर्षों का विवरण दिया गया है:

1. समस्या: "पक्षपाती जज" (The "Biased Judge")

लेखकों ने पाया कि AI जज तटस्थ नहीं होते हैं। उनके पास तीन मुख्य "बुरी आदतें" (पक्षपात) हैं जो "सटीकता" के उच्च स्कोर के पीछे छिपी होती हैं:

  • "पहली सीट" का पक्षपात (Position Bias): जज हमेशा उस उत्तर को पसंद करता है जो ऊपर वाले स्लॉट (स्लॉट A) में लिखा गया होता है, चाहे वास्तव में बेहतर उत्तर कोई भी हो। यह एक फिल्म समीक्षक की तरह है जो पहले देखे गए मूवी को अधिक रेटिंग देता है, सिर्फ इसलिए क्योंकि उसने दूसरी फिल्म अभी तक नहीं देखी है।
  • "लंबा होना बेहतर है" का पक्षपात (Verbosity Bias): जज लंबे, शब्दबहुल उत्तरों को पसंद करता है। भले ही एक छोटा उत्तर एकदम सही हो और एक लंबा उत्तर केवल फालतू बातों से भरा हो, जज लंबे वाले को चुन लेता है। यह एक शिक्षक की तरह है जो उस छात्र को 'A' ग्रेड देता है जिसने केवल अधिक लिखने के कारण 10 पेज का निरर्थक निबंध लिखा, जबकि दूसरे छात्र ने एक सटीक पैराग्राफ लिखा था।
  • "भाषा की बाधा" का पक्षपात (Language Barrier Bias): जज अंग्रेजी में बहुत अच्छा है लेकिन अन्य भाषाओं (जैसे स्वाहिली) में भ्रमित और अविश्वसनीय हो जाता है।

2. समाधान: "तोड़फोड़ परीक्षण" (The "Sabotage Test")

आप हर उत्तर को ग्रेड देने के लिए इंसानों को पूछे बिना (जो महंगा और धीमा है) एक जज का परीक्षण कैसे कर सकते हैं?

लेखकों ने "Gold-Labelling by Degradation" नामक एक चतुर तकनीक का आविष्कार किया।

  • उपमा: कल्पना कीजिए कि आपके पास एक आदर्श, सुनहरा सेब है। फिर आप एक चाकू लेते हैं और जानबूझकर उससे एक टुकड़ा काट देते हैं, या उसमें थोड़ी मिट्टी मिला देते है। अब आपके पास दो सेब हैं: परफेक्ट वाला और खराब (डैमेज्ड) वाला
  • परीक्षण: आप इन दोनों सेबों को जज को दिखाते हैं और पूछते हैं, "कौन सा बेहतर है?"
  • तर्क: आप जानते हैं कि परफेक्ट वाला ही सही है क्योंकि आपने ही दूसरे को खराब किया है। यदि जज खराब वाले को चुनता है, तो आप जानते हैं कि जज विफल हो रहा है।
  • ट्विस्ट: वे इसे दो तरीकों से करते हैं:
    1. वे कभी-कभी खराब वाले को लंबा बनाते हैं (यह देखने के लिए कि क्या जज गुणवत्ता के बजाय लंबाई को पसंद करता है)।
    2. वे क्रम को बदलते हैं (कभी परफेक्ट वाला पहले होता है, कभी दूसरा) यह देखने के लिए कि क्या जज में "पहली सीट" का पक्षपात है।

3. परिणाम: "विश्वसनीयता स्कोर" (The "Reliability Score")

शोध पत्र ने एक लोकप्रिय AI जज (Qwen2.5) का चार भाषाओं में परीक्षण किया: अंग्रेजी, हिंदी, अरबी और स्वाहिली।

  • "Raw Accuracy" का जाल: यदि आप केवल यह पूछते हैं कि "जज कितनी बार सही उत्तर चुनता है?" तो स्कोर ठीक दिखते हैं (औसतन लगभग 77%)। ऐसा लगता है कि जज अच्छा काम कर रहा है।
  • रियलिटी चेक: जब लेखकों ने अपने "विश्वसनीयता स्कोर" (जो जज को पक्षपाती होने के लिए दंडित करता है) को लागू किया, तो स्कोर काफी कम हो गए।
    • अंग्रेजी और हिंदी: जज पास हो गया, लेकिन मुश्किल से।
    • स्वाहिली: जज फेल हो गया।
      • स्वाहिली में, जज का "विश्वसनीयता स्कोर" केवल 0.55 था (जो 0.65 की पासिंग लाइन से नीचे है)।
      • क्यों? क्योंकि स्वाहिली में, जज मूल रूप से सिक्का उछालने (coin toss) जैसा काम कर रहा था। जब उन्होंने उत्तरों का क्रम बदला, तो जज का निर्णय पूरी तरह से बदल गया। वह गुणवत्ता का निर्णय नहीं ले रहा था; वह बस इस आधार पर अनुमान लगा रहा था कि उत्तर किस तरफ है।

4. "एजेंट" विस्तार: "रोबोट वर्कर" (The "Agent" Extension)

शोध पत्र ने यह भी परीक्षण किया कि ये जज AI एजेंट्स (रोबोट जो टूल्स का उपयोग करते हैं, जैसे मौसम की जाँच करना या फ्लाइट बुक करना) को कैसे संभालते हैं।

उन्होंने जज के विफल होने के नए तरीके खोजे:

  • Hallucination Blindness (भ्रम के प्रति अंधापन): जज ने यह ध्यान नहीं दिया कि रोबोट ने एक ऐसे टूल का उपयोग किया जो अस्तित्व में ही नहीं है।
  • Argument Blindness (तर्क के प्रति अंधापन): जज ने यह ध्यान नहीं दिया कि रोबोट ने टूल को गलत जानकारी दी (उदाहरण के लिए, "पेरिस, फ्रांस" के लिए मौसम पूछना लेकिन गलती से "पेरिस, टेक्सस" टाइप करना)।
  • "Step Pad" Bias: ठीक वैसे ही जैसे टेक्स्ट के साथ होता है, यदि रोबोट की योजना लंबी थी (भले ही उसमें अतिरिक्त, बेकार स्टेप्स हों), तो जज उसे पसंद करता था।

5. मुख्य निष्कर्ष (The Takeaway)

शोध पत्र निष्कर्ष निकालता है कि आप केवल उच्च सटीकता स्कोर के आधार पर एक AI जज पर भरोसा नहीं कर सकते।

  • चेतावनी: यदि आप स्वाहिली जैसी भाषा के लिए एक जज तैनात करते हैं, तो बिना इन पक्षपातों की जाँच किए, आपके परिणाम शोर-शराबे वाले और अविश्वसनीय होंगे। आपका जज यह चुनने के आधार पर उत्तर चुन सकता है कि कौन सा पहले लिखा गया था, न कि इस आधार पर कि कौन सा सच है।
  • सिफारिश: किसी भी महत्वपूर्ण चीज़ को ग्रेड देने के लिए AI जज का उपयोग करने से पहले, उसे BabelJudge के माध्यम से परखें।
    • यदि स्कोर कम है, तो उसे अकेले उपयोग न करें।
    • इसके बजाय, जजों की एक "टीम" (बहुमत वोट) का उपयोग करें या उस विशिष्ट भाषा के लिए मानव की ओर स्विच करें।

संक्षेप में: BabelJudge, AI जजों के लिए एक "झूठ पकड़ने वाली मशीन" (lie detector) है। यह प्रकट करता है कि हालांकि वे कागज़ पर स्मार्ट लग सकते हैं, लेकिन उनमें अक्सर छिपे हुए पक्षपात होते हैं जो उन्हें अविश्वसनीय बनाते हैं, विशेष रूपकर अंग्रेजी के अलावा अन्य भाषाओं में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →