← नवीनतम पेपर
🤖 AI

Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages

यह शोध पत्र Multi-LCB प्रस्तुत करता है, जो एक संदूषण-जागरूक (contamination-aware) बेंचमार्क है जो पायथन कार्यों को रूपांतरित करके LiveCodeBench डेटासेट को बारह प्रोग्रामिंग भाषाओं तक विस्तारित करता है, जिससे बड़े भाषा मॉडलों की क्रॉस-लैंग्वेज कोड जनरेशन क्षमताओं के कठोर मूल्यांकन को सक्षम बनाया जा सके और महत्वपूर्ण प्रदर्शन असमानताओं तथा पायथन ओवरफिटिंग को उजागर किया जा सके।

मूल लेखक: Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Babaev

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Babaev

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट सहायक है जिसने लाखों रेसिपी पढ़कर खाना बनाना सीखा है। लेकिन यहाँ एक पेंच है: उनमें से 99% रेसिपी इतालवी पास्ता (Italian pasta) के लिए थीं।

जब आप उस रोबोट से एक बेहतरीन स्पैगेटी कार्बोनारा बनाने के लिए कहते हैं, तो वह जीनियस है। वह लगभग हर बार इसे सही बनाता है। लेकिन अगर आप उससे सुशी रोल, टैको या करी बनाने के लिए कहते हैं, तो वह अचानक संघर्ष करने लगता है। वह मछली पर पास्ता सॉस डालने की कोशिश कर सकता है या चॉपस्टिक्स के बजाय कांटे (fork) का उपयोग कर सकता है।

यह बिल्कुल वही समस्या है जो शोधकर्ताओं ने Multi-LCB के साथ खोजी है, जो आज के सबसे उन्नत एआई कोडिंग सहायकों (AI coding assistants) के साथ हो रही है।

समस्या: "इतालवी पास्ता" का पूर्वाग्रह (The "Italian Pasta" Bias)

कुछ समय के लिए, इन एआई कोडर्स को टेस्ट करने के लिए गोल्ड स्टैंडर्ड एक बेंचमार्क था जिसे LiveCodeBench (LCB) कहा जाता है। LCB को एक विशाल, लगातार अपडेट होने वाली कोडिंग पहेलियों की लाइब्रेरी समझें। यह बेहतरीन है क्योंकि यह उन नई पहेलियों को जोड़ता रहता है जिन्हें एआई ने पहले नहीं देखा है, ताकि हमें पता चल सके कि एआई केवल उत्तर रटकर नकल (cheating) नहीं कर रहा है।

हालाँकि, इसमें एक बड़ी खामी थी: LiveCodeBench ने एआई का परीक्षण केवल पायथन (Python) में किया था। पायथन कोडिंग की दुनिया का "इतालवी पास्ता" जैसा है—यह लोकप्रिय और आसान है। लेकिन वास्तविक दुनिया में, सॉफ्टवेयर इंजीनियर केवल पास्ता नहीं बनाते; वे सब कुछ बनाते हैं। उन्हें हाई-स्पीड सिस्टम के लिए C++, बड़े बिजनेस ऐप्स के लिए Java और वेबसाइटों के लिए JavaScript की आवश्यकता होती है।

बड़ा सवाल यह था: क्या एआई वास्तव में कोडिंग में स्मार्ट है, या यह केवल पायथन में बहुत अच्छा है?

समाधान: Multi-LCB (एक "अंतर्राष्ट्रीय पॉटलक")

लेखकों ने Multi-LCB बनाया, जो उसी कोडिंग पहेलियों की लाइब्रेरी को 12 अलग-अलग भाषाओं (पायथन, C++, Java, Rust, Go और अन्य सहित) में अनुवादित करने जैसा है।

उन्होंने केवल एआई को कोड को "अनुवाद" करने के लिए नहीं कहा। इसके बजाय, उन्होंने मूल पहेली (जैसे, "इन संख्याओं का योग ज्ञात करें") को लिया और निर्देशों को इस तरह से फिर से लिखा ताकि एआई को C++, Java, Rust और अन्य के नियमों का उपयोग करके इसे हल करना पड़े।

यह कैसे काम करता है (रसोई का उदाहरण):

  1. रेसिपी: वे कोडिंग प्रतियोगिता (जैसे गणित की समस्या) से एक पहेली लेते हैं।
  2. अनुवाद: वे "टेस्ट केसेस" (जिस तरह से आप जाँचते हैं कि उत्तर सही है या नहीं) को एक सार्वभौमिक प्रारूप (universal format) में बदलते हैं। कल्पना कीजिए कि एक रेसिपी को जो कहती है "2 कप आटा डालें" को एक ऐसे प्रारूप में बदलना जो काम करे चाहे आप कप, ग्राम स्केल या चम्मच का उपयोग कर रहे हों। यह सुनिश्चित करता है कि एआई का परीक्षण उसके तर्क (logic) पर हो रहा है, न कि केवल सही प्रारूप का अनुमान लगाने की उसकी क्षमता पर।
  3. परीक्षण: एआई एक ही पहेली को 12 अलग-अलग भाषाओं में हल करने की कोशिश करता है।
  4. निर्णय: वे जाँचते हैं कि क्या कोड वास्तव में चलता है और बिना क्रैश हुए समस्या को हल करता है।

उन्हें क्या मिला (स्वाद परीक्षण के परिणाम)

शोधकर्ताओं ने 24 अलग-अलग एआई मॉडल का परीक्षण किया। इस "स्वाद परीक्षण" ने क्या खुलासा किया:

  • "पास्ता" ओवरफिटिंग: कई मॉडल जो पायथन में चैंपियन थे, वे अन्य भाषाओं में औसत या खराब हो गए। यह एक ऐसे शेफ की तरह है जो एक बेहतरीन लाज़ानिया बना सकता है लेकिन टोस्ट जला देता है। यह साबित करता है कि पायथन में अच्छा होना अपने आप में यह गारंटी नहीं है कि एआई सामान्य कोडिंग में भी अच्छा है।
  • "गुप्त सामग्री" का रिसाव (The "Secret Ingredient" Leak): कुछ मॉडल विशिष्ट भाषाओं में पुरानी पहेलियों पर संदिग्ध रूप से अच्छा प्रदर्शन करते हैं। इससे पता चलता है कि उन मॉडलों ने अनजाने में अपने प्रशिक्षण डेटा (training data) से उत्तरों को "याद" कर लिया होगा (जैसे कि एक छात्र जिसने टेस्ट की कुंजी रट ली हो) बजाय इसके कि वे समस्या को हल करना सीखें।
  • कठिनाई का अंतर: एआई को कुछ भाषाएँ दूसरों की तुलना में बहुत कठिन लगीं। इसने उन भाषाओं के साथ सबसे अधिक संघर्ष किया जो अधिक सख्त या कम प्रचलित हैं (जैसे Scala या Rust), ठीक वैसे ही जैसे एक इंसान उस भाषा के साथ संघर्ष कर सकता है जिसका उसने बहुत कम उपयोग किया हो।

यह क्यों मायने रखता है

इस पेपर से पहले, हम सोचते थे कि जो एआई पायथन टेस्ट में अव्वल आता है, वह एक "कोडिंग जीनियस" है। Multi-LCB ने हमें दिखाया कि कई "जीनियस" वास्तव में केवल पायथन विशेषज्ञ हैं।

लेख का निष्कर्ष है कि सॉफ्टवेयर इंजीनियरिंग के लिए वास्तव में उपयोगी एआई बनाने के लिए, हमें केवल उन्हें "इतालवी पास्ता" (पायथन) पर टेस्ट करना बंद करना होगा और पूरे मेनू पर टेस्ट करना शुरू करना होगा। Multi-LCB वह रसोई, रेसिपी और जज प्रदान करता है जिससे यह देखा जा सके कि कौन सा एआई वास्तव में एक पूर्ण अंतर्राष्ट्रीय दावत तैयार कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →