← नवीनतम पेपर
💬 NLP

Does the Judge Prefer English? Evaluating Language-Switching Invariance in LLM-as-a-Judge

यह शोध पत्र Judge-LS को प्रस्तुत करता है, जो एक मेटा-इवैल्यूएशन प्रोटोकॉल है जो यह दर्शाता है कि जबकि LLM-as-a-Judge सिस्टम अंग्रेजी की तुलना में चीनी या भाषा-परिवर्तित सामग्री का मूल्यांकन करते समय महत्वपूर्ण प्राथमिकता अस्थिरता और सटीकता में गिरावट प्रदर्शित करते हैं, वे अनुवाद-तुल्य चीनी प्रतिक्रियाओं के ऊपर व्यवस्थित रूप से अंग्रेजी का पक्ष नहीं लेते हैं।

मूल लेखक: Shaojie Yin

प्रकाशित 2026-06-15✓ Author reviewed
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shaojie Yin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, स्वचालित रेफरी (एक AI) है जिसका काम दो लोगों के उत्तरों को देखना और यह तय करना है कि किसने बेहतर काम किया। आज कई आधुनिक AI सिस्टम इसी तरह से टेस्ट किए जाते हैं: एक AI दूसरे AI के लिए जज का काम करता है।

यह शोध पत्र एक सरल लेकिन पेचीदा सवाल पूछता है: क्या यह रेफरी इस बात की परवाह करता है कि उत्तर किस भाषा में दिए गए हैं, या इसे केवल उत्तरों की गुणवत्ता की परवाह है?

इसे एक कुकिंग कॉम्पिटिशन (खाना पकाने की प्रतियोगिता) की तरह समझें। यदि दो शेफ एक ही तरह का स्वादिष्ट सूप बनाते हैं, लेकिन एक शेफ उसे एक शानदार फ्रांसीसी रेस्टोरेंट में पेश करता है और दूसरा एक साधारण ढाबे में, तो क्या जज शानदार प्रस्तुति के कारण उसे अधिक स्कोर देता है? या क्या जज सूप का स्वाद चखकर यह समझ जाता है कि वे दोनों बिल्कुल एक जैसे हैं?

प्रयोग: "भाषा अनुवादक" परीक्षण (The "Language Translator" Test)

शोधकर्ताओं ने प्रश्नों और उत्तरों के एक मानक सेट (जिसे LLMBar बेंचमार्क कहा जाता है) को लिया और उसे चार अलग-अलग AI जजों के माध्यम से चलाया। उन्होंने इसे तीन अलग-अलग "वेशभूषा" (costumes) में किया:

  1. अंग्रेजी: मूल संस्करण।
  2. चीनी: वही प्रश्न और उत्तर, लेकिन उन्हें पूरी तरह से चीनी भाषा में अनुवादित किया गया है।
  3. कोड-स्विचिंग (Code-Switching): अंग्रेजी और चीनी का मिश्रण (जैसे कि "Please send the email to the manager" कहना, जहाँ भाषाओं को स्वाभाविक रूप से मिलाया गया हो)।

उन्होंने एक विशेष "टाई-ब्रेकर" परीक्षण भी किया। उन्होंने एक आदर्श अंग्रेजी उत्तर और उसके आदर्श चीनी अनुवाद को लिया और जज से उनकी तुलना करने को कहा। चूंकि सामग्री समान है, इसलिए जज को कहना चाहिए, "यह बराबरी का मुकाबला है!"

उन्हें क्या मिला

परिणाम थोड़े आश्चर्यजनक थे और उन्होंने दिखाया कि रेफरी उतने निष्पक्ष नहीं हैं जितनी हम उम्मीद करते हैं।

  • "अंग्रेजी लहजे" का पूर्वाग्रह (The "English Accent" Bias): प्रत्येक जज ने तब सबसे अच्छा प्रदर्शन किया जब उत्तर अंग्रेजी में थे। जब उत्तर चीनी या मिश्रित भाषाओं में थे, तो जजों ने अधिक गलतियाँ कीं। ऐसा लगता है जैसे रेफरी थोड़ा भ्रमित या कम सटीक हो जाता है जब प्रतियोगी एक अलग बोली बोलते हैं, भले ही तर्क (logic) वही हो।
  • "पलटने" की समस्या (The "Flip-Flop" Problem): लगभग 11% से 14% मामलों में, भाषा बदलने के कारण जज ने अपना निर्णय बदल दिया।
    • उपमा: कल्पना कीजिए कि जज A कहता है, "शेफ 1 जीतता है!" जब मेनू अंग्रेजी में होता है। लेकिन अगर आप उन्हें वही मेनू चीनी में अनुवादित करके देते हैं, तो जज A अचानक कहता है, "वास्तव में, शेफ 2 जीतता है!" भले ही खाना बिल्कुल नहीं बदला है। इसे "प्रेफरेंस फ्लिप" (preference flip) कहा जाता है।
  • यह केवल "अंग्रेजी बेहतर है" वाली बात नहीं है: आप सोच सकते हैं कि जज बस अंग्रेजी को पसंद करते हैं और बाकी सब को नापसंद करते हैं। लेकिन "टाई-ब्रेकर" परीक्षण ने कुछ अधिक जटिल दिखाया। जब जजों ने अंग्रेजी उत्तर और उसके चीनी अनुवाद के बीच विजेता चुना, तो उन्होंने वास्तव में अंग्रेजी की तुलना में चीनी को अधिक बार चुना!
    • निष्कर्ष: समस्या यह नहीं है कि जज अंधे होकर अंग्रेजी को पसंद करते हैं। समस्या यह है कि वे अस्थिर (unstable) हैं। वे इस बात से आसानी से प्रभावित हो जाते हैं कि जानकारी कैसे प्रस्तुत की गई है, चाहे वह भाषा हो, उत्तरों का क्रम हो, या दोनों का मिश्रण।

यह क्यों महत्वपूर्ण है

यदि आप चीन में लोगों की मदद करने के लिए या मिश्रित भाषा के संवादों को संभालने के लिए एक AI सिस्टम बना रहे हैं, तो आप एक अंग्रेजी-प्रशिक्षित जज पर निष्पक्ष होने के लिए भरोसा नहीं कर सकते।

  • "भंगुर" जज (The "Brittle" Judge): एक अच्छा जज एक ठोस तराजू की तरह होना चाहिए। यदि आप उस पर समान वजन रखते हैं, तो उसे समान रीडिंग देनी चाहिए, चाहे आप वजन को किलोग्राम में बताएं या पाउंड में। ये AI जज एक डगमगाते तराजू की तरह हैं; रीडिंग इस बात पर निर्भर करती है कि आप उसे कैसे पकड़ते हैं।
  • भ्रम की लागत: क्योंकि जज अपने निर्णय इतनी बार बदलते हैं (लग लगभग 10 में से 1 बार), वे गलती से एक खराब AI को विजेता के रूप में चुन सकते हैं क्योंकि टेस्ट एक अलग भाषा में लिखा गया था।

प्रस्तावित समाधान

लेखक एक नया, हल्का "हेल्थ चेक" सुझाते हैं जिसे Judge-LS कहा जाता है। बहुभाषी दुनिया के लिए मॉडल को रैंक करने के लिए किसी AI जज पर भरोसा करने से पहले, आपको यह सरल परीक्षण चलाना चाहिए:

  1. टेस्ट को लक्षित भाषा में अनुवादित करें।
  2. जज को फिर से चलाएं।
  3. जांचें कि क्या जज अपना निर्णय बदलता है।

यदि जज बहुत बार अपना निर्णय बदलता है, तो वह इस काम के लिए तैयार नहीं है। यह एक ऐसे रेफरी को काम पर रखने जैसा है जो अलग लहजे से भ्रमित हो जाता है; आपको एक ऐसे रेफरी की आवश्यकता है जो खेल का न्याय करे, न कि भाषा का।

संक्षेप में: यह शोध पत्र सिद्ध करता है कि AI जज वर्तमान में भाषा परिवर्तन के प्रति संवेदनशील हैं। वे केवल "अंग्रेजी प्रेमी" नहीं हैं; वे "अस्थिर पर्यवेक्षक" हैं जिन्हें हमें यह तय करने के लिए कि कौन सा AI सबसे अच्छा है, उन्हें भरोसेमंद बनाने से पहले स्थिरता के लिए टेस्ट करने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →