← नवीनतम पेपर
💬 NLP

Mellum2 Technical Report

मैलम 2 (Mellum 2) एक ओपन-वेट, 12B-पैरामीटर वाला मिक्स्चर-ऑफ-एक्सपर्ट्स (Mixture-of-Experts) लैंग्वेज मॉडल है जिसमें प्रति टोकन 2.5B सक्रिय पैरामीटर्स हैं, जो सॉफ्टवेयर इंजीनियरिंग और एजेंटिक कार्यों के लिए विशिष्ट है, और यह मल्टी-टोकन प्रेडिक्शन (Multi-Token Prediction) और 10.6 ट्रिलियन टोकन तक फैले तीन-चरणों वाले प्रशिक्षण पाठ्यक्रम जैसे वास्तुशिल्प नवाचारों के माध्यम से बड़े मॉडलों के साथ प्रतिस्पर्धी प्रदर्शन प्राप्त करता है।

मूल लेखक: Marko Kojic, Ivan Bondyrev, Aral de Moor, Joseph Shtok, Petr Borovlev, Kseniia Lysaniuk, Madeeswaran Kannan, Ivan Dolgov, Nikita Pavlichenko

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Marko Kojic, Ivan Bondyrev, Aral de Moor, Joseph Shtok, Petr Borovlev, Kseniia Lysaniuk, Madeeswaran Kannan, Ivan Dolgov, Nikita Pavlichenko

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने कंप्यूटर के अंदर रहने वाला एक सुपर-स्मार्ट कोडिंग असिस्टेंट बनाना चाहते हैं। चुनौती यह है कि आप चाहते हैं कि यह अविश्वसनीय रूप से स्मार्ट हो (एक सीनियर इंजीनियर की तरह) लेकिन साथ ही अविश्वसनीय रूप से तेज़ और सस्ता भी हो (एक स्टैंडर्ड ऑफिस लैपटॉप की तरह)। आमतौर पर, आपको एक को चुनना पड़ता है: या तो "स्मार्ट" वाला संस्करण बहुत बड़ा और धीमा होता है, या "तेज़" वाला संस्करण कठिन समस्याओं को संभालने के लिए बहुत सरल होता है।

JetBrains की टीम ने ठीक इसी समस्या को हल करने के लिए Mellum 2 बनाया है। यहाँ उन्होंने इसे कैसे किया, इसका सरल विवरण दिया गया है:

1. "स्विस आर्मी नाइफ" जैसा दिमाग (आर्किटेक्चर)

अधिकांश AI मॉडल एक विशाल, एकल मस्तिष्क कोशिका की तरह होते हैं जो सब कुछ करता है। Mellum 2 अलग है। यह एक Mixture-of-Experts (MoE) की तरह बनाया गया है।

  • उपमा: एक विशाल लाइब्रेरी की कल्पना करें जिसमें 64 अलग-अलग विशेषज्ञ लाइब्रेरियन हैं। जब आप कोई सवाल पूछते हैं, तो मॉडल सभी 64 लाइब्रेरियनों को नहीं जगाता। इसके बजाय, इसमें एक स्मार्ट मैनेजर होता है जो आपके विशिष्ट प्रश्न के लिए केवल 8 सबसे प्रासंगिक लाइब्रेरियनों को चुनता है।
  • परिणाम: मॉडल के पास 12-बिलियन-पैरामीटर वाले "विशाल" मस्तिष्क का कुल ज्ञान है, लेकिन आपके द्वारा लिखे गए हर शब्द के लिए, यह केवल 2.5-बिलियन-पैरामीटर वाले मस्तिष्क की शक्ति के साथ "सोचता" है। यह इसे मानक हार्डवेयर पर चलाने के लिए पर्याप्त तेज़ बनाता है जबकि यह अभी भी बहुत स्मार्ट रहता है।

2. "स्लाइडिंग विंडो" और "ड्राफ्टिंग" के नुस्खे

इसे और भी तेज़ बनाने के लिए, उन्होंने दो चतुर शॉर्टकट जोड़े:

  • स्लाइडिंग विंडो (Sliding Window): मॉडल यह याद रखने की कोशिश करने के बजाय कि आपने बातचीत में अब तक क्या लिखा है (जो धीमा हो जाता है), यह ट्रेन के स्लाइडिंग विंडो की तरह पिछले 1,024 शब्दों पर ध्यान केंद्रित करता है। यह हालिया संदर्भ को स्पष्ट रखता है जबकि पुराने विवरणों को धुंधला होने देता है, जिससे बहुत ऊर्जा बचती है।
  • "ड्राफ्ट" असिस्टेंट: मॉडल के पास एक छोटा, अंतर्निर्मित "ड्राफ्टिंग" असिस्टेंट है। अंतिम उत्तर लिखने के लिए प्रतिबद्ध होने से पहले, यह छोटा असिस्टेंट अगले कुछ शब्दों का अनुमान लगाता है। यदि अनुमान सही है, तो मुख्य मॉडल काम को छोड़ देता है और उसे बस स्वीकार कर लेता है। यह एक लेखक के पास अपने दोस्त के होने जैसा है जो अगला वाक्य फुसफुसाता है ताकि वह तेज़ी से टाइप कर सके।

3. "थ्री-फेज" स्कूल करिकुलम

उन्होंने मॉडल को केवल रैंडम डेटा नहीं खिलाया। उन्होंने इसे तीन विशिष्ट चरणों में पढ़ाया, जैसे एक स्कूल करिकुलम:

  • फेज 1 (जनरलिस्ट): उन्होंने सामान्य इंटरनेट डेटा (70%) और कुछ कोड (23%) के एक बड़े मिश्रण के साथ शुरुआत की। इसने मॉडल को यह समझने की व्यापक समझ दी कि इंसान कैसे बात करते हैं और लिखते हैं।
  • फेज 2 (स्पेशलिस्ट): उन्होंने मिश्रण को अधिक उच्च-गुणवत्ता वाले कोड (42%) और गणित को शामिल करने के लिए बदल दिया। यहीं से मॉडल ने प्रोग्रामिंग के विशिष्ट नियम सीखना शुरू किया।
  • फेज 3 (मास्टर): अंतिम चरण में, मिश्रण लगभग पूरी तरह से कोड और गणित (59% कोड) था। यह वह "बूट कैंप" है जहाँ मॉडल ने अपने कौशल को निखारा ताकि वह एक विशेषज्ञ कोडर बन सके।

4. दो व्यक्तित्व: "इंस्ट्रक्ट" और "थिंकिंग"

उसी प्रशिक्षित मस्तिष्क से, उन्होंने मॉडल के दो संस्करण जारी किए:

  • "इंस्ट्रक्ट" (Instruct) मॉडल: यह एक सीधा कार्यकर्ता है। आप एक सवाल पूछते हैं, और यह तुरंत उत्तर दे देता है। यह त्वरित कार्यों के लिए बेहतरीन है।
  • "थिंकिंग" (Thinking) मॉडल: यह गहरा विचारक है। उत्तर देने से पहले, यह एक "रीजनिंग ट्रेस" (तर्क प्रक्रिया) लिखता है—यह समझाने के लिए एक चरण-दर-चरण विवरण कि इसने समस्या को कैसे हल किया। यह एक छात्र द्वारा गणित के टेस्ट में अपना काम दिखाने जैसा है। पेपर में पाया गया कि यह "थिंकिंग" मोड मॉडल को कठिन लॉजिक पहेलियों और जटिल कोडिंग चुनौतियों को हल करने में बहुत बेहतर बनाता है।

5. "प्रूफ" (परीक्षण)

उन्होंने अन्य लोकप्रिय मॉडलों के खिलाफ Mellum 2 का परीक्षण किया।

  • गति: यह 7-बिलियन-पैरामीटर मॉडल जितना तेज़ चलता है (जो इसके 12-बिलियन कुल आकार से बहुत छोटा है) लेकिन यह अपने आकार के कई मॉडलों से अधिक स्मार्ट है।
  • कोडिंग: यह कोड लिखने, डिबगिंग करने और टूल्स (जैसे वेब खोजने या कमांड चलाने) का उपयोग करने में उत्कृष्ट है।
  • ट्रेड-ऑफ (समझौता): क्योंकि उन्होंने इसे कोडिंग विशेषज्ञ बनाने पर बहुत अधिक ध्यान केंद्रित किया, इसलिए यह सामान्य दुनिया के तथ्यों (जैसे इतिहास या जीव विज्ञान) के बारे में सामान्य चैटबॉट्स के रूप में प्रशिक्षित मॉडलों की तुलना में थोड़ा कम जानकार है। हालांकि, इसके इच्छित काम—डेवलपर्स की मदद करने—के लिए, यह एक शीर्ष प्रदर्शन करने वाला मॉडल है।

सारांश

Mellul 2 एक विशेषज्ञ कोडिंग असिस्टेंट है जो "विशेषज्ञों की टीम" वाले आर्किटेक्चर का उपयोग करता है ताकि यह स्मार्ट और तेज़ दोनों हो सके। इसे कोड और गणित में महारत हासिल करने के लिए एक सावधानीपूर्वक डिज़ाइन किए गए करिकुलम के माध्यम से प्रशिक्षित किया गया था, और यह दो रूपों में आता है: त्वरित उत्तरों के लिए और गहरे, चरण-दर-चरण तर्क के लिए। टीम ने इसे मुफ्त में जारी किया है ताकि कोई भी बेहतर सॉफ़्टवेयर बनाने के लिए इसका उपयोग कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →