← नवीनतम पेपर
💬 NLP

Multilingual Prompt Localization for Agent-as-a-Judge: Language and Backbone Sensitivity in Requirement-Level Evaluation

यह शोध पत्र प्रदर्शित करता है कि डेवलपर-एजेंट फ्रेमवर्क की प्रदर्शन रैंकिंग मूल्यांकन भाषा और जज बैकबोन के प्रति अत्यधिक संवेदनशील है, जो यह प्रकट करता है कि कोई भी एकल मॉडल सभी भाषाओं में प्रभुत्व नहीं रखता है और सटीक बहुभाषी मूल्यांकन के लिए जज निर्देशों का स्थानीयकरण करना महत्वपूर्ण है।

मूल लेखक: Alhasan Mahmood, Samir Abdaljalil, Hasan Kurban

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alhasan Mahmood, Samir Abdaljalil, Hasan Kurban

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक घर बनाने के लिए विशेषज्ञ आर्किटेक्ट्स (AI कोडिंग एजेंटों) की एक टीम को काम पर रख रहे हैं। आप जानना चाहते हैं कि क्या उन्होंने अच्छा काम किया है। आमतौर पर, आप उनके काम की जांच करने के लिए एक एकल, सख्त निरीक्षक (AI जज) भेजेंगे जो केवल अंग्रेजी बोलता है।

यह शोध पत्र एक सरल लेकिन क्रांतिकारी प्रश्न पूछता है: क्या होगा यदि निरीक्षक उस भाषा में न बोले जिसमें ब्लूप्रिंट (नक्शे) लिखे गए हैं?

शोधकर्ताओं ने पाया कि निरीक्षक जिस भाषा में बात करता है वह न केवल उनके बोलने के तरीके को बदलती है; बल्कि यह पूरी तरह से बदल देती है कि वे किसे सबसे अच्छा आर्किटेक्ट समझते हैं।

यहाँ उनके निष्कर्षों का रोजमर्रा के उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. "लहजे" (Accent) की समस्या

कल्पना कीजिए कि आपके पास दो प्रसिद्ध शेफ हैं, शेफ GPT और शेफ जेमिनी

  • जब एक जज जो अंग्रेजी बोलता है, उनके खाने का स्वाद लेता है, तो शेफ GPT को 5-स्टार रेटिंग मिलती है, और शेफ जेमिनी को 3-स्टार।
  • लेकिन, जब एक जज जो अरबी या हिंदी बोलता है, वही सटीक भोजन चखता है, तो परिणाम उलट जाते हैं! शेफ जेमिनी अचानक 5 स्टार पाता है, और शेफ GPT गिरकर 3 स्टार पर आ जाता है।

सबक: "सबसे अच्छा" AI एक सार्वभौमिक सत्य नहीं है। यह पूरी तरह से इस पर निर्भर करता है कि उन्हें ग्रेड देने वाला व्यक्ति कौन सी भाषा बोल रहा है। यदि आप केवल अंग्रेजी में परीक्षण करते हैं, तो आप दुनिया के बाकी हिस्सों के लिए गलत AI को बढ़ावा दे सकते हैं।

2. "अनुवादक बनाम मस्तिष्क" प्रयोग

शोधकर्ताओं ने यह देखने के लिए कि ऐसा क्यों होता है, एक दिलचस्प प्रयोग चलाया। उन्होंने एक ही कार्य और एक ही AI जज लिया, लेकिन उन्होंने निर्देश बदल दिए:

  • परिदृश्य A (पूर्ण स्थानीयकरण/Full Localization): जज को हिंदी में कार्य विवरण मिलता है, और ग्रेडिंग कैसे करनी है इसके निर्देश भी हिंदी में होते हैं।
  • परिदृश्य B (आंशिक स्थानीयकरण/Partial Localization): कार्य विवरण हिंदी में है, लेकिन ग्रेडिंग कैसे करनी है इसके निर्देश अभी भी अंग्रेजी में हैं।

परिणाम: परिदृश्य B में, जज का प्रदर्शन गिर गया। यह एक प्रतिभाशाली शेफ को एक जटिल भारतीय व्यंजन पकाने के लिए कहने जैसा था, लेकिन उन्हें अंग्रेजी में रेसिपी दी गई जबकि वे केवल हिंदी बोलते हैं। वे भ्रमित हो गए और विफल रहे।

  • सीख: आप केवल होमवर्क का अनुवाद नहीं कर सकते; आपको शिक्षक के निर्देशों का भी अनुवाद करना होगा। यदि आप ऐसा नहीं करते हैं, तो AI अनुवाद के बीच खो जाता है।

3. "कमजोर बनाम मजबूत" छात्र

अध्ययन ने छह अलग-अलग AI "जजों" (बैकबोन) को देखा।

  • टॉप छात्र (GPT-4o और जेमिनी): ये सूक्ष्मताओं (nuance) को समझने के लिए पर्याप्त स्मार्ट हैं। क्योंकि वे स्मार्ट हैं, वे विभिन्न भाषाओं के प्रति अलग तरह से प्रतिक्रिया करते हैं। एक अंग्रेजी तर्क में बहुत अच्छा हो सकता है लेकिन अरबी बारीकियों में संघर्ष कर सकता है, और दूसरा इसके विपरीत। उनकी रैंकिंग भाषा के आधार पर उलट-पुलट (flip-flop) हो जाती है।
  • संघर्ष कर रहे छात्र (DeepSeek और Qwen): ये मॉडल कोडिंग कार्यों से इतने भ्रमित थे कि वे लगभग हर चीज़ में विफल रहे, चाहे भाषा कोई भी हो। क्योंकि वे इतनी बुरी तरह विफल हो रहे थे, भाषा से उन्हें कोई फर्क नहीं पड़ा—वे हर भाषा में बस "बुरे" थे।
  • सीख: आप इन भाषाई विचित्रताओं को केवल तभी देख पाते हैं जब AI वास्तव में एक राय रखने के लिए पर्याप्त स्मार्ट होता है।

4. "सहमति" की समस्या

शोधकर्ताओं ने छह अलग-अलग जजों को एक ही 55 कोडिंग प्रोजेक्ट्स को ग्रेड करने के लिए कहा।

  • परिणाम: वे आपस में शायद ही कभी सहमत हुए। यह छह अलग-अलग कला समीक्षकों से एक पेंटिंग को ग्रेड करने के लिए पूछने जैसा था, और उन सभी ने उसे पूरी तरह से अलग स्कोर दिया।
  • रूपक: यदि आप एक पैनल से किसी फिल्म को रेट करने के लिए कहते हैं, और एक उसे पसंद करता है जबकि दूसरा उससे नफरत करता है, तो आप "औसत" स्कोर पर भरोसा नहीं कर सकते। पेपर दिखाता है कि AI कोडिंग में, "स्कोर" अक्सर केवल इस बात का प्रतिबिंब होता है कि उस दिन कौन सा विशिष्ट AI मॉडल जज बना था।

यह क्यों मायने रखता है?

वर्तमान में, अधिकांश AI बेंचमार्क एक एकभाषी खेल लीग (monolingual sports league) की तरह हैं। वे केवल अंग्रेजी में परीक्षण करते हैं।

  • जोखिम: यदि आप भारत या मध्य पूर्व की किसी कंपनी के लिए एक AI ऐप बनाते हैं, और आपने इसे केवल अंग्रेजी बोलने वाले AI जज के साथ टेस्ट किया है, तो आप गलत टूल चुन सकते हैं। आप सोच सकते हैं कि "मॉडल A" सबसे अच्छा है क्योंकि उसने अंग्रेजी टूर्नामेंट जीता है, लेकिन "मॉडल B" वास्तव में हिंदी या अरबी में चैंपियन हो सकता है।

मुख्य बात (Bottom Line)

यह पेपर एक चेतावनी है: भाषा केवल एक सेटिंग नहीं है; यह एक वेरिएबल (variable) है।

यदि आप जानना चाहते हैं कि कोई AI कोडिंग में कैसा है, तो आप केवल इसे अंग्रेजी में नहीं पूछ सकते। आपको इसे उस भाषा में पूछना होगा जिसमें इसका वास्तव में उपयोग किया जाएगा, और आपको यह सुनिश्चित करना होगा कि इसे ग्रेड करने वाला "शिक्षक" भी उस भाषा में धाराप्रवाह हो। अन्यथा, आप केवल अपनी तकनीक के साथ किस्मत का खेल खेल रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →