← नवीनतम पेपर
🤖 AI

Large Language Models for Code Generation from Multilingual Prompts: A Curated Benchmark and a Study on Code Quality

यह शोध पत्र एक क्यूरेटेड बहुभाषी बेंचमार्क प्रस्तुत करता है और एक ऐसा अध्ययन प्रदर्शित करता है जो यह दर्शाता है कि प्रॉम्प्ट में उपयोग की जाने वाली भाषा एलएलएम (LLMs) द्वारा जनरेट किए गए कोड की कार्यात्मक शुद्धता, संरचनात्मक गुणवत्ता और शाब्दिक विशेषताओं को महत्वपूर्ण रूप से प्रभावित करती है, जिससे यह पता चलता है कि अंग्रेजी प्रॉम्प्ट लगातार सर्वोत्तम परिणाम नहीं देते हैं और इसका प्रभाव विभिन्न मॉडलों और प्रोग्रामिंग भाषाओं में भिन्न होता है।

मूल लेखक: Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez, Mario Linares-Vásquez, Weiyuan Ding, Bowen Xu, Massimiliano Di Penta, Antonio Mastropaolo

प्रकाशित 2026-07-17
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez, Mario Linares-Vásquez, Weiyuan Ding, Bowen Xu, Massimiliano Di Penta, Antonio Mastropaolo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

द ग्रेट कोड ट्रांसलेटर एक्सपेरिमेंट (The Great Code Translator Experiment)

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट दोस्त है जो कुछ भी बना सकता है, एक साधारण पक्षी घर से लेकर एक जटिल अंतरिक्ष यान तक। यह रोबोट, जिसे लार्ज लैंग्वेज मॉडल (LLM) कहा जाता है, ने इंटरनेट पर लिखी गई लगभग हर चीज़ को पढ़ा है, जिसमें कंप्यूटर कोड की लाखों लाइनें भी शामिल हैं। क्योंकि इसने इतना कुछ पढ़ा है, इसलिए यह हमारे लिए नया कोड लिखने के लिए निर्देशों का पालन करने में अविश्वसनीय रूप से कुशल है। आमतौर पर, हम इस रोबोट से अंग्रेजी में बात करते हैं क्योंकि इसके द्वारा सीखे गए अधिकांश कोड उसी भाषा में लिखे गए थे। लेकिन क्या होगा अगर आप रोबोट को स्पेनिश, हिंदी या चीनी भाषा में निर्देश देकर एक अंतरिक्ष यान बनाने के लिए कहें? क्या रोबोट भ्रमित हो जाएगा? क्या अंतरिक्ष यान बिखर जाएगा? या क्या वह बिल्कुल वही चीज़ बनाएगा, बस एक अलग लहजे के साथ?

यह एक शोध टीम द्वारा किए गए एक नए अध्ययन के पीछे का बड़ा सवाल है। वे यह देखना चाहते थे कि जिस भाषा में हम इन AI रोबोटों से बात करते हैं, क्या वह उनके द्वारा लिखे गए कोड की गुणवत्ता को बदल देती है। सॉफ्टवेयर इंजीनियरिंग की दुनिया में, "कोड" उन निर्देशों का समूह है जो कंप्यूटर को बताता है कि क्या करना है। "सटीकता" (Correctness) का अर्थ है कि कोड वास्तव में काम करता है और सभी परीक्षणों को पास करता है, जैसे कि एक पुल जो बिना गिरे कार का भार सह सके। "गुणवत्ता" (Quality) थोड़ा व्यापक है; इसका अर्थ है कि कोड पढ़ने में आसान है, यह पड़ोस के नियमों का पालन करता है (जैसे फुटपाथ पर कचरा न छोड़ना), और इसमें ऐसे छिपे हुए जाल नहीं हैं जो बाद में इसे तोड़ सकें। शोधकर्ता जिज्ञासु थे कि क्या किसी अन्य भाषा में पुल बनाने के लिए कहने से रोबто एक डगमगाता हुआ पुल बनाएगा, या क्या रोबोट किसी भी भाषा में निर्माण करने में उतना ही सक्षम है।

प्रयोग: एक बहुभाषी कोडिंग चुनौती (The Experiment: A Multilingual Coding Challenge)

यह पता लगाने के लिए, शोधकर्ताओं ने एक विशाल कोडिंग प्रतियोगिता आयोजित की। उन्होंने कोडरइवैल (CoderEval) नामक एक प्रसिद्ध बेंचमार्क से 460 अलग-अलग प्रोग्रामिंग कार्य लिए—230 पायथन (Python) के लिए और 230 जावा (Java) के लिए। ये केवल साधारण "प्रिंट हेलो" वाले कार्य नहीं थे; ये वास्तविक दुनिया की चुनौतियाँ थीं जिनमें AI को समस्याओं को हल करने, डेटा को संभालने और संरचनाओं को बनाने की आवश्यकता थी।

फिर, उन्होंने कुछ चतुर किया। केवल अंग्रेजी में AI से पूछने के बजाय, उन्होंने इन 460 कार्यों को चार अन्य भाषाओं में अनुवादित किया: चीनी, हिंदी, स्पेनिश और इतालवी। लेकिन उन्होंने केवल एक त्वरित मशीन अनुवादक का उपयोग नहीं किया। उन्होंने कंप्यूटर विज्ञान के विशेषज्ञों वाले मूल भाषियों (native speakers) से प्रत्येक अनुवाद की मैन्युअल रूप से जांच और सुधार करवाया। वे सुनिश्चित करना चाहते थे कि निर्देश एकदम सही और स्वाभाविक हों, ठीक वैसे ही जैसे एक इंसान अपने दोस्त से मदद मांगता है।

इसके बाद, उन्होंने इन अनुवादित निर्देशों को आज के तीन सबसे शक्तिशाली AI रोबोटों में से एक में डाला: GPT-4o mini, DeepSeek, और Claude। उन्होंने प्रत्येक रोबोट को पाँचों भाषाओं (अंग्रेजी प्लस अन्य चार) में समान 460 समस्याओं को हल करने के लिए कहा। कुल मिलाकर, उन्होंने तुलना करने के लिए हजारों कोड जनरेट किए।

बड़ी हैरानी: अंग्रेजी हमेशा विजेता नहीं होती (The Big Surprise: English Isn't Always King)

परिणाम थोड़े चौंकाने वाले थे। यह एक आम धारणा थी कि यदि आप AI से अंग्रेजी में पूछते हैं, तो आपको सबसे अच्छा कोड मिलता है क्योंकि उस भाषा में AI ने सबसे अधिक अध्ययन किया है। लेकिन अध्ययन में पाया गया कि यह हमेशा सच नहीं होता है

वास्तव में, पायथन कार्यों के लिए, AI से चीनी में पूछने से अंग्रेजी में पूछने की तुलना में बेहतर परिणाम मिले! चीनी प्रॉम्प्ट से उत्पन्न कोड ने अधिक परीक्षण पास किए और अधिक विश्वसनीय रूप से काम किया। यह एक शेफ से कोई व्यंजन बनाने के लिए कहने जैसा है; कभी-कभी, अलग भाषा में रेसिपी देने से शेफ खाना पकाने का बेहतर तरीका सोच लेता है। हालाँकि, यह "चीनी लाभ" हर रोबोट या हर प्रकार के कार्य के लिए नहीं हुआ। जावा के लिए, परिणाम अधिक मिश्रित थे, और कोई भी एक भाषा स्पष्ट रूप से विजेता नहीं थी। मुख्य निष्कर्ष यह है कि AI से अंग्रेजी में बात करना बेहतर कोड की गारंटी नहीं देता है, और किसी अन्य भाषा में बात करने का मतलब यह स्वतः ही नहीं है कि कोड खराब होगा।

कोड अलग दिखता है, लेकिन क्या यह खराब है? (The Code Looks Different, But Is It Worse?)

शोधकर्ताओं ने न केवल यह देखा कि क्या यह काम करता है, बल्कि कोड की "गुणवत्ता" की भी जांच की। उन्होंने निम्नलिखित चीजों की जांच की:

  • जटिलता (Complexity): क्या कोड एक उलझा हुआ जाल है या एक सीधी रेखा?
  • टिप्पणियाँ (Comments): क्या रोबोट ने यह समझाया कि वह क्या कर रहा था?
  • चेतावनी (Warnings): क्या कोड ने किसी नियम को तोड़ा या यह अव्यवस्थित दिखा?

उन्होंने पाया कि गैर-अंग्रेजी भाषाओं में उत्पन्न कोड अनिवार्य रूप से "खराब" नहीं था। यह बस अलग दिखता था। उदाहरण के लिए, चीनी प्रॉम्प्ट से लिखे गए कोड में अक्सर अधिक टिप्पणियाँ (comments) थीं, जैसे कि रोबोट अतिरिक्त मददगार होने की कोशिश कर रहा हो। हिंदी प्रॉम्प्ट से बने कोड में कभी-कभी अधिक स्टाइल संबंधी गलतियाँ थीं, जैसे कि विराम चिह्न गायब होना या अजीब स्पेसिंग, लेकिन ये आमतौर पर छोटी समस्याएँ थीं जिन्हें आसानी से ठीक किया जा सकता था।

एक दिलचस्प खोज हिंदी के बारे में थी। जब AI को हिंदी में कोड करने के लिए कहा गया, तो इसने कभी-कभी ऐसा कोड बनाया जो थोड़ा जोखिम भरा था, जिसमें अधिक संभावित बग या भ्रमित करने वाला तर्क (logic) था। लेकिन स्पेनिश और इतालवी के लिए, कोड आम तौर पर अंग्रेजी संस्करण के समान ही अच्छा था, कभी-कभी कुछ गलतियों से बचने के मामले में इससे भी बेहतर था।

"मिक्स-एंड-मैच" की समस्या (The "Mix-and-Match" Problem)

यहाँ चीजें थोड़ी गड़बड़ा जाती हैं। भले ही कोड का तर्क (logic) शानदार हो, लेकिन कोड के अंदर के शब्द अक्सर एक भ्रमित करने वाला मिश्रण थे। शोधकर्ताओं ने पाया कि भले ही आपने AI को स्पेनिश या चीनी में पूछा हो, रोबोट अक्सर टिप्पणियों (कोड समझाने वाले नोट्स) और वेरिएबल नामों (डेटा के लेबल) को अंग्रेजी में लिखता था।

यह एक शेफ से इतालवी में रेसिपी लिखने के लिए कहने जैसा है, लेकिन वे सामग्री की सूची अंग्रेजी में लिखते हैं और निर्देश दोनों के मिश्रण में लिखते हैं। शोधकर्ताओं ने पाया कि AI बहुत असंगत है। कभी-कभी यह आपकी भाषा का पालन करता है, कभी-कभी नहीं। यह उन डेवलपर्स की टीमों के लिए एक समस्या है जिन्हें एक सुसंगत भाषा में कोड की आवश्यकता होती है ताकि सभी इसे समझ सकें। अध्ययन बताता है कि केवल किसी विशिष्ट भाषा में कोड मांगना पर्याप्त नहीं है; आपको AI को यह बताने के लिए बहुत विशिष्ट होने की आवश्यकता हो सकती है कि वह नोट्स और लेबल को उसी भाषा में रखे।

यह हमारे लिए क्या मायने रखता है? (What Does This Mean for Us?)

अध्ययन यह निष्कर्ष निकालता है कि हमें AI कोडिंग सहायकों से बात करने के लिए अपनी मातृभाषा का उपयोग करने से डरने की आवश्यकता नहीं है। आप बिना इस चिंता के स्पेनिश, चीनी या हिंदी में कोड मांग सकते हैं कि रोबमा विफल हो जाएगा। कुछ मामलों में, जैसे पायथन में, आपको बेहतर परिणाम भी मिल सकते हैं!

हालाँकि, दो चीजों पर ध्यान देने की आवश्यकता है:

  1. "स्टाइल" का मुद्दा: गैर-अंग्रेजी भाषाओं में लिखे जाने पर कोड में छोटी फॉर्मेटिंग त्रुटियाँ (जैसे कॉमा गायब होना या लंबी लाइनें) अधिक हो सकती हैं। लेकिन ये स्वचालित टूल के साथ आसानी से ठीक की जा सकती हैं।
  2. "भाषा मिश्रण" का मुद्दा: AI आपके द्वारा मांगी गई भाषा में टिप्पणियों और लेबल को बनाए रखने में विफल हो सकता है। यदि आपको सब कुछ एक ही भाषा में चाहिए, तो आपको कोड की दोबारा जांच करने या AI को अतिरिक्त निर्देश देने की आवश्यकता हो सकती है।

कुल मिलाकर, यह शोध दिखाता है कि AI अधिक लचीला होता जा रहा है। यह कई भाषाओं में समझ और निर्माण कर सकता है, जिससे उस बाधा को तोड़ दिया गया है जो पहले सबको अच्छा कोड प्राप्त करने के लिए अंग्रेजी बोलने के लिए मजबूर करती थी। लेकिन किसी भी नए उपकरण की तरह, इसकी भी अपनी कुछ विचित्रताएं हैं, और सर्वोत्तम परिणाम प्राप्त करने के लिए हमें यह सीखना होगा कि उनके साथ कैसे काम किया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →