Mellum2 Technical Report
मैलम 2 (Mellum 2) एक ओपन-वेट, 12B-पैरामीटर वाला मिक्स्चर-ऑफ-एक्सपर्ट्स (Mixture-of-Experts) लैंग्वेज मॉडल है जिसमें प्रति टोकन 2.5B सक्रिय पैरामीटर्स हैं, जो सॉफ्टवेयर इंजीनियरिंग और एजेंटिक कार्यों के लिए विशिष्ट है, और यह मल्टी-टोकन प्रेडिक्शन (Multi-Token Prediction) और 10.6 ट्रिलियन टोकन तक फैले तीन-चरणों वाले प्रशिक्षण पाठ्यक्रम जैसे वास्तुशिल्प नवाचारों के माध्यम से बड़े मॉडलों के साथ प्रतिस्पर्धी प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपने कंप्यूटर के अंदर रहने वाला एक सुपर-स्मार्ट कोडिंग असिस्टेंट बनाना चाहते हैं। चुनौती यह है कि आप चाहते हैं कि यह अविश्वसनीय रूप से स्मार्ट हो (एक सीनियर इंजीनियर की तरह) लेकिन साथ ही अविश्वसनीय रूप से तेज़ और सस्ता भी हो (एक स्टैंडर्ड ऑफिस लैपटॉप की तरह)। आमतौर पर, आपको एक को चुनना पड़ता है: या तो "स्मार्ट" वाला संस्करण बहुत बड़ा और धीमा होता है, या "तेज़" वाला संस्करण कठिन समस्याओं को संभालने के लिए बहुत सरल होता है।
JetBrains की टीम ने ठीक इसी समस्या को हल करने के लिए Mellum 2 बनाया है। यहाँ उन्होंने इसे कैसे किया, इसका सरल विवरण दिया गया है:
1. "स्विस आर्मी नाइफ" जैसा दिमाग (आर्किटेक्चर)
अधिकांश AI मॉडल एक विशाल, एकल मस्तिष्क कोशिका की तरह होते हैं जो सब कुछ करता है। Mellum 2 अलग है। यह एक Mixture-of-Experts (MoE) की तरह बनाया गया है।
- उपमा: एक विशाल लाइब्रेरी की कल्पना करें जिसमें 64 अलग-अलग विशेषज्ञ लाइब्रेरियन हैं। जब आप कोई सवाल पूछते हैं, तो मॉडल सभी 64 लाइब्रेरियनों को नहीं जगाता। इसके बजाय, इसमें एक स्मार्ट मैनेजर होता है जो आपके विशिष्ट प्रश्न के लिए केवल 8 सबसे प्रासंगिक लाइब्रेरियनों को चुनता है।
- परिणाम: मॉडल के पास 12-बिलियन-पैरामीटर वाले "विशाल" मस्तिष्क का कुल ज्ञान है, लेकिन आपके द्वारा लिखे गए हर शब्द के लिए, यह केवल 2.5-बिलियन-पैरामीटर वाले मस्तिष्क की शक्ति के साथ "सोचता" है। यह इसे मानक हार्डवेयर पर चलाने के लिए पर्याप्त तेज़ बनाता है जबकि यह अभी भी बहुत स्मार्ट रहता है।
2. "स्लाइडिंग विंडो" और "ड्राफ्टिंग" के नुस्खे
इसे और भी तेज़ बनाने के लिए, उन्होंने दो चतुर शॉर्टकट जोड़े:
- स्लाइडिंग विंडो (Sliding Window): मॉडल यह याद रखने की कोशिश करने के बजाय कि आपने बातचीत में अब तक क्या लिखा है (जो धीमा हो जाता है), यह ट्रेन के स्लाइडिंग विंडो की तरह पिछले 1,024 शब्दों पर ध्यान केंद्रित करता है। यह हालिया संदर्भ को स्पष्ट रखता है जबकि पुराने विवरणों को धुंधला होने देता है, जिससे बहुत ऊर्जा बचती है।
- "ड्राफ्ट" असिस्टेंट: मॉडल के पास एक छोटा, अंतर्निर्मित "ड्राफ्टिंग" असिस्टेंट है। अंतिम उत्तर लिखने के लिए प्रतिबद्ध होने से पहले, यह छोटा असिस्टेंट अगले कुछ शब्दों का अनुमान लगाता है। यदि अनुमान सही है, तो मुख्य मॉडल काम को छोड़ देता है और उसे बस स्वीकार कर लेता है। यह एक लेखक के पास अपने दोस्त के होने जैसा है जो अगला वाक्य फुसफुसाता है ताकि वह तेज़ी से टाइप कर सके।
3. "थ्री-फेज" स्कूल करिकुलम
उन्होंने मॉडल को केवल रैंडम डेटा नहीं खिलाया। उन्होंने इसे तीन विशिष्ट चरणों में पढ़ाया, जैसे एक स्कूल करिकुलम:
- फेज 1 (जनरलिस्ट): उन्होंने सामान्य इंटरनेट डेटा (70%) और कुछ कोड (23%) के एक बड़े मिश्रण के साथ शुरुआत की। इसने मॉडल को यह समझने की व्यापक समझ दी कि इंसान कैसे बात करते हैं और लिखते हैं।
- फेज 2 (स्पेशलिस्ट): उन्होंने मिश्रण को अधिक उच्च-गुणवत्ता वाले कोड (42%) और गणित को शामिल करने के लिए बदल दिया। यहीं से मॉडल ने प्रोग्रामिंग के विशिष्ट नियम सीखना शुरू किया।
- फेज 3 (मास्टर): अंतिम चरण में, मिश्रण लगभग पूरी तरह से कोड और गणित (59% कोड) था। यह वह "बूट कैंप" है जहाँ मॉडल ने अपने कौशल को निखारा ताकि वह एक विशेषज्ञ कोडर बन सके।
4. दो व्यक्तित्व: "इंस्ट्रक्ट" और "थिंकिंग"
उसी प्रशिक्षित मस्तिष्क से, उन्होंने मॉडल के दो संस्करण जारी किए:
- "इंस्ट्रक्ट" (Instruct) मॉडल: यह एक सीधा कार्यकर्ता है। आप एक सवाल पूछते हैं, और यह तुरंत उत्तर दे देता है। यह त्वरित कार्यों के लिए बेहतरीन है।
- "थिंकिंग" (Thinking) मॉडल: यह गहरा विचारक है। उत्तर देने से पहले, यह एक "रीजनिंग ट्रेस" (तर्क प्रक्रिया) लिखता है—यह समझाने के लिए एक चरण-दर-चरण विवरण कि इसने समस्या को कैसे हल किया। यह एक छात्र द्वारा गणित के टेस्ट में अपना काम दिखाने जैसा है। पेपर में पाया गया कि यह "थिंकिंग" मोड मॉडल को कठिन लॉजिक पहेलियों और जटिल कोडिंग चुनौतियों को हल करने में बहुत बेहतर बनाता है।
5. "प्रूफ" (परीक्षण)
उन्होंने अन्य लोकप्रिय मॉडलों के खिलाफ Mellum 2 का परीक्षण किया।
- गति: यह 7-बिलियन-पैरामीटर मॉडल जितना तेज़ चलता है (जो इसके 12-बिलियन कुल आकार से बहुत छोटा है) लेकिन यह अपने आकार के कई मॉडलों से अधिक स्मार्ट है।
- कोडिंग: यह कोड लिखने, डिबगिंग करने और टूल्स (जैसे वेब खोजने या कमांड चलाने) का उपयोग करने में उत्कृष्ट है।
- ट्रेड-ऑफ (समझौता): क्योंकि उन्होंने इसे कोडिंग विशेषज्ञ बनाने पर बहुत अधिक ध्यान केंद्रित किया, इसलिए यह सामान्य दुनिया के तथ्यों (जैसे इतिहास या जीव विज्ञान) के बारे में सामान्य चैटबॉट्स के रूप में प्रशिक्षित मॉडलों की तुलना में थोड़ा कम जानकार है। हालांकि, इसके इच्छित काम—डेवलपर्स की मदद करने—के लिए, यह एक शीर्ष प्रदर्शन करने वाला मॉडल है।
सारांश
Mellul 2 एक विशेषज्ञ कोडिंग असिस्टेंट है जो "विशेषज्ञों की टीम" वाले आर्किटेक्चर का उपयोग करता है ताकि यह स्मार्ट और तेज़ दोनों हो सके। इसे कोड और गणित में महारत हासिल करने के लिए एक सावधानीपूर्वक डिज़ाइन किए गए करिकुलम के माध्यम से प्रशिक्षित किया गया था, और यह दो रूपों में आता है: त्वरित उत्तरों के लिए और गहरे, चरण-दर-चरण तर्क के लिए। टीम ने इसे मुफ्त में जारी किया है ताकि कोई भी बेहतर सॉफ़्टवेयर बनाने के लिए इसका उपयोग कर सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।