← नवीनतम पेपर
💬 NLP

Towards Reliable Multilingual LLMs-as-a-Judge: An Empirical Study

यह अनुभवजन्य अध्ययन उच्च-, मध्यम- और निम्न-संसाधन वाली भाषाओं में विश्वसनीय बहुभाषी LLM-as-a-judge विकसित करने की रणनीतियों की जांच करता है, जो यह प्रकट करता है कि फाइन-ट्यून किए गए छोटे मॉडल इन-डोमेन डेटा के साथ उत्कृष्ट प्रदर्शन करते हैं जबकि बड़े ज़ीरो-शॉट मॉडल आउट-ऑफ-डोमेन परिदृश्यों के लिए बेहतर होते हैं, और यह चेतावनी देता है कि आउट-ऑफ-डोमेन फाइन-ट्यूनिंग प्रदर्शन को कम कर सकती है।

मूल लेखक: Irune Zubiaga, Aitor Soroa, Rodrigo Agerri

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Irune Zubiaga, Aitor Soroa, Rodrigo Agerri

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, सुपर-स्मार्ट रोबोट लाइब्रेरियन (एक लार्ज लैंग्वेज मॉडल, या LLM) है जिसका काम अन्य रोबोटों द्वारा लिखे गए निबंधों को ग्रेड करना है। आमतौर पर, यह लाइब्रेरियन केवल अंग्रेजी बोलता है। लेकिन अब, हमें इसे स्पेनिश और बास्क (एक अनूठी भाषा जो बास्क देश में बोली जाती है) में निबंधों को ग्रेड करने के लिए भी तैयार करना है।

प्रश्न यह है: हम इस रोबोट लाइब्रेरियन को उन भाषाओं में एक निष्पक्ष और सटीक जज बनने के लिए कैसे सिखा सकते हैं जिन्हें वह मूल रूप से नहीं जानता, खासकर तब जब हमारे पास उसे सिखाने के लिए बहुत अधिक "नमूना निबंध" (sample essays) उपलब्ध न हों?

यहाँ उनके प्रयोग की कहानी दी गई है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. तीन भाषाएँ (परीक्षण विषय)

शोधकर्ताओं ने डेटा की उपलब्धता के स्तर का प्रतिनिधित्व करने के लिए तीन भाषाओं को चुना:

  • अंग्रेजी: "हाई-रिसोर्स" (High-Resource) भाषा। यह एक ऐसी लाइब्रेरी की तरह है जिसमें लाखों किताबें हैं। रोबोट इसे अच्छी तरह जानता है।
  • स्पेनिश: "मिड-रिसोर्स" (Mid-Resource) भाषा। इसके पास एक अच्छी लाइब्रेरी है, लेकिन अंग्रेजी जितनी बड़ी नहीं है।
  • बास्क: "लो-रिसोर्स" (Low-Resource) भाषा। यह एक छोटे से गाँव की लाइब्रेरी की तरह है जहाँ बहुत कम किताबें हैं। रोबोट इसके बारे में स्वाभाविक रूप से बहुत कम जानता है।

2. परिदृश्य A: जब आपके पास "शिक्षक की मार्गदर्शिका" हो (इन-डोमेन डेटा)

कल्प_ना कीजिए कि आपके पास ग्रेड किए गए निबंधों का एक ढेर है जिसमें शिक्षक की टिप्पणियाँ और स्कोर (यह "इन-डोमेन डेटा" है) शामिल हैं। आप अपने रोबोट को इस मार्गदर्शिका का उपयोग करके नए निबंधों को ग्रेड करने के लिए प्रशिक्षित करना चाहते हैं।

बड़ी खोज: रूब्रिक (Rubric) को अंग्रेजी में ही रखें!
शोधकर्ताओं ने प्रशिक्षण सामग्री को अनुवाद करने के दो तरीके आजमाए:

  • विधि 1 (पूर्ण अनुवाद): निबंध, छात्र के उत्तर और शिक्षक के ग्रेडिंग रूब्रिक (स्कोरिंग के नियम) तीनों का स्पेनिश या बास्क में अनुवाद करें।
  • विधि 2 (आंशिक अनुवाद): निबंध और छात्र के उत्तर का अनुवाद करें, लेकिन ग्रेडिंग रूब्रिक और निर्देशों को अंग्रेजी में ही रहने दें।

परिणाम: रोबोट का प्रदर्शन बहुत बेहतर रहा जब ग्रेडिंग के नियम अंग्रेजी में रहे।

  • उपमा: ग्रेडिंग रूब्रिक को रोबोट के "ऑपरेटिंग सिस्टम" के रूप में सोचें। भले ही रोबोट स्पेनिश में एक कहानी पढ़ रहा हो, यदि ग्रेड करने के निर्देश अंग्रेजी में हैं, तो रोबोट का मस्तिष्क केंद्रित और सुसंगत रहता है। नियमों को उस भाषा में अनुवाद करना जिसमें रोबोट कम परिचित है, वास्तव में उसे भ्रमित कर देता है और उसकी ग्रेडिंग को ढीला बना देता है।

आकार मायने रखता है (लेकिन जितना आप सोचते हैं उससे कम):
उन्होंने छोटे रोबोट (8 बिलियन "मस्तिष्क कोशिकाएं" या पैरामीटर्स) और विशाल रोबोट (70 बिलियन) का परीक्षण किया।

  • निष्कर्ष: जब आपके पास एक अच्छी शिक्षक की मार्गदर्शिका (प्रशिक्षण डेटा) होती है, तो एक छोटा रोबोट एक विशाल, महंगे रोबोट के समान ही अच्छा काम कर सकता है। आपको सबसे बड़े मॉडल की आवश्यकता नहीं है यदि आपके पास उसे सिखाने के लिए अच्छा डेटा है।
  • बोनस: एक साथ तीनों भाषाओं के मिश्रण (Multilingual) पर रोबोट को प्रशिक्षित करने से वह स्पेनिश और बास्क में एक-एक भाषा में प्रशिक्षित करने की तुलना में बेहतर बना। यह ऐसा है जैसे तीनों भाषाएँ एक साथ सीखने से आपको उन सभी के व्याकरण के नियमों को समझने में मदद मिलती है।

3. परिदृश्य B: जब आपके पास कोई "शिक्षक की मार्गदर्शिका" न हो (आउट-ऑफ-डोमेन डेटा)

अब, कल्पना कीजिए कि आपको निबंधों के एक पूरी तरह से नए प्रकार (जैसे कहानी के बजाय विज्ञान रिपोर्ट) को ग्रेड करना है और आपके पास रोबोट को दिखाने के लिए कोई ग्रेड किए गए निबंध नहीं हैं। आपको रोबोट की स्वाभाविक बुद्धिमत्ता पर भरोसा करना होगा (ज़ीरो-शॉट)।

बड़ी खोज: बड़े रोबोटों को "ओवर-ट्रेन" न करें
शोधकर्ताओं ने यह देखने के लिए कि क्या अन्य विषयों से डेटा का उपयोग करने से उन्हें नए निबंधों को सीखने में मदद मिलेगी, रोबोटों को अन्य विषयों (आउट-ऑफ-डोमेन) के डेटा का उपयोग करके सिखाने का प्रयास किया।

  • छोटे रोबोट: वे वास्तव में इस अतिरिक्त अभ्यास के साथ थोड़े बेहतर हो गए। उन्हें मदद की आवश्यकता थी।
  • बड़े रोबोट (70B): यह उल्टा पड़ गया! जब उन्होंने विशाल रोबोटों को असंबंधित डेटा के साथ फाइन-ट्यून करने की कोशिश की, तो वे हैलुसिनेट (Hallucinating) करने लगे। वे अत्यधिक आत्मविश्वासी हो गए, और खराब निबंध होने पर भी सबको 5 का परफेक्ट स्कोर देने लगे।
  • उपमा: एक प्रतिभाशाली प्रोफेसर (बड़ा रोबोट) की कल्पना करें जो पहले से ही सब कुछ जानता है। यदि आप उन्हें उस खेल के बुनियादी नियम सिखाने की कोशिश करते हैं जिसे वे नहीं खेलते, तो वे भ्रमित हो सकते हैं और अपने स्वयं के अजीब नियम बनाने लग सकते हैं, यह सोचकर कि वे सही हैं। वहीं दूसरी ओर, एक स्मार्ट छात्र (छोटा रोबोट) इस अतिरिक्त अभ्यास से वास्तव में लाभान्वित होता है।

नए विषयों के लिए सर्वश्रेष्ठ रणनीति:
यदि आपके पास विशिष्ट प्रशिक्षण डेटा नहीं है, तो रोबोट को बिल्कुल भी फाइन-ट्यून करने की कोशिश न करें। बस बड़े, स्मार्ट रोबोट को "जैसा है" (ज़ीरो-शॉट) वैसे ही ग्रेड करने दें। यह असंबंधित डेटा से सीखने की कोशिश करने की तुलना में अधिक विश्वसनीय है।

4. निष्कर्षों का सारांश

  • उन भाषाओं के लिए जिन्हें आप अच्छी तरह जानते हैं (या जिनके लिए डेटा है): एक छोटे, सस्ते रोबोट का उपयोग करें। निबंधों को स्पेनिश या बास्क में होने पर भी ग्रेडिंग निर्देशों को अंग्रेजी में रखें।
  • उन भाषाओं के लिए जिन्हें आप कम जानते हैं या जिनके लिए कोई डेटा नहीं है: रोबोट को यादृच्छिक उदाहरणों के साथ सिखाने की कोशिश न करें। बस सबसे बड़े, सबसे स्मार्ट रोबोट का उपयोग करें और उसे स्वाभाविक रूप से ग्रेड करने दें।
  • "अनुवाद का जाल" (Translation Trap): खेल के नियमों को लो-रिसोर्स भाषा में अनुवाद करने से अक्सर रोबोट बेहतर होने के बजाय बदतर हो जाता है।

उन्होंने क्या नहीं किया

यह पेपर यह दावा नहीं करता है कि यह चिकित्सा निदान, कानूनी निर्णय या भावनात्मक परामर्श को ठीक कर देगा। यह सख्ती से इस बात पर केंद्रित है कि विभिन्न भाषाओं में स्वचालित रूप से टेक्स्ट को ग्रेड करने के लिए बेहतर उपकरण कैसे बनाए जाएं। उन्होंने यह भी उल्लेख किया कि उनका "प्रशिक्षण डेटा" अन्य AI मॉडल द्वारा बनाया गया था, न कि मनुष्यों द्वारा, जो एक सीमा है, लेकिन बास्क जैसी भाषाओं के लिए यही उपलब्ध सर्वोत्तम डेटा था।

संक्षेप में: एक विश्वसनीय बहुभाषी जज बनाने के लिए, कभी-कभी आपको निर्देशों के लिए रोबोट की मूल भाषा (अंग्रेजी) बोलने की आवश्यकता होती है, और कभी-कभी आपको बड़े रोबोटों को अकेला छोड़ देना चाहिए और उन्हें अपनी स्वाभाविक बुद्धिमत्ता का उपयोग करने देना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →