A Sovereign, Open-Source Foundation Model for German and English
यह शोध पत्र Soofi S 30B-A3B को प्रस्तुत करता है, जो एक संप्रभु, ओपन-सोर्स मिक्स्चर-ऑफ-एक्सपर्ट्स हाइब्रिड माम्बा ट्रांसफॉर्मर मॉडल है जिसे जर्मन और अंग्रेजी पर ध्यान केंद्रित करते हुए 27 ट्रिलियन टोकन पर प्रशिक्षित किया गया है, जो लंबी-संदर्भ अनुप्रयोगों के लिए बेहतर अनुमान दक्षता प्रदान करते हुए ओपन मॉडलों के बीच अत्याधुनिक प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक परम द्विभाषी रोबोट शेफ बनाने की कोशिश कर रहे हैं जो अंग्रेजी और जर्मन दोनों में शानदार खाना बना सके। ज्यादातर लोग सोचते हैं कि एक महान शेफ का रहस्य केवल एक बड़ा किचन या अधिक रसोइयों (अधिक पैरामीटर्स) को काम पर रखना है। लेकिन Soofi S की टीम ने एक अलग ही तरकीब खोजी है: 30 अरब रसोइयों को काम पर रखने के बजाय, उन्होंने केवल 3 अरब सक्रिय रसोइयों की एक छोटी, अत्यंत कुशल टीम चुनी जो कार्यों को बदलने में अविश्वसनीय रूप से तेज़ है, जबकि बाकी 27 अरब को व्यंजनों के एक विशाल, शांत पुस्तकालय के रूप में रखा है जिससे वे तुरंत जानकारी निकाल सकते हैं।
यह केवल एक सिद्धांत नहीं है; यह एक पूरी तरह से निर्मित, ओपन-सोर्स रोबोट शेफ है जिसका नाम Soofi S 30B-A3B है, जिसे लेखकों ने वास्तव में प्रशिक्षित और परीक्षित किया है। यह कहानी है कि उन्होंने इसे कैसे किया, यह क्या कर सकता है, और इसकी राह में अभी भी कहाँ कुछ मुश्किलें हैं।
गुप्त सॉस: एक हाइब्रिड किचन
अधिकांश AI मॉडल एक घनी भीड़ की तरह होते हैं जहाँ हर किसी को सुना जाने के लिए चिल्लाना पड़ता है, जो कमरे के बहुत बड़ा होने पर (लंबी बातचीत में) अव्यवस्थित और धीमा हो जाता है। Soofi S अलग है। यह एक हाइब्रिड डिज़ाइन का उपयोग करता है जो दो प्रकार के "रसोइयों" को मिलाता है:
- Mamba-2 लेयर्स: इन्हें उन शेफ के रूप में सोचें जो पूरी कहानी को अपने दिमाग में याद रखते हैं बिना उसे लिखने की आवश्यकता के। उन्हें एक विशाल नोटबुक (जिसे "KV कैश" कहा जाता है) रखने की आवश्यकता नहीं है जो कहानी लंबी होने के साथ भारी होती जाती है।
- MoE (Mixture of Experts): यह "3 बिलियन सक्रिय" वाला हिस्सा है। कुल 31.6 बिलियन पैरामीटर्स में से, मॉडल प्रत्येक शब्द उत्पन्न करने के लिए केवल 3.2 बिलियन को ही "जगाता" है।
परिणाम? जब आप इस मॉडल को 1 मिलियन शब्दों की किताब पढ़ने के लिए कहते हैं, तो यह धीमा नहीं होता। जहाँ अन्य मॉडल सुस्त हो जाते हैं क्योंकि उन्हें एक भारी नोटबुक ढोना पड़ता है, Soofi S अपनी गति स्थिर रखता है। लेखकों ने इसे मापा और पाया कि 40,000 टोकन (लगभग 30,000 शब्द) की संदर्भ लंबाई (context length) पर, Soofi S समान आकार के अन्य डेंस मॉडल्स की तुलना में टेक्स्ट जेनरेट करने में 8 से 9 गुना तेज़ था।
रेसिपी: जर्मन-अंग्रेजी फोकस
टीम ने केवल इंटरनेट का रैंडम टेक्स्ट इसमें नहीं डाला। उन्होंने एक सख्त, तीन-चरणीय रेसिपी का पालन किया जिसे विशेष रूप से जर्मन और अंग्रेजी में चैंपियन बनाने के लिए डिज़ाइन किया गया था, न कि 100 भाषाओं के लिए एक औसत दर्जे का शेफ बनाने के लिए।
- चरण 1 (द बिग मिक्स): उन्होंने 20 ट्रिलियन टोकन के विविध डेटा के साथ शुरुआत की। उन्होंने जानबूझकर यह सुनिश्चित किया कि जर्मन केवल एक साइड डिश न हो; उन्होंने इसे मिश्रण में 7.2% तक बढ़ा दिया (अन्य मॉडलों में सामान्य 5% की तुलना में)।
- चरण 2 (हाई-क्वालिटी एनीलिंग): जैसे-जैसे मॉडल स्मार्ट हुआ, उन्होंने एक "उच्च गुणवत्ता वाले" आहार की ओर रुख किया। उन्होंने बेकार सामग्री को हटा दिया और बेहतरीन कोड, गणित और तर्क (reasoning) डेटा पर ध्यान केंद्रित किया। यहाँ, उन्होंने जर्मन हिस्से को और भी अधिक बढ़ाकर 15.3% कर दिया।
- चरण 3 (लॉन्ग-स्टोरी एक्सटेंशन): अंत में, उन्होंने मॉडल को लंबी कहानियों को संभालने के तरीके सिखाए, इसे 4,000 से 1 मिलियन टोकन लंबे डेटा पर प्रशिक्षित किया।
लेखक इस बारे में बहुत पारदर्शी हैं: उन्होंने सामग्रियों की सटीक सूची जारी की है, जिसमें यह भी शामिल है कि उन्होंने कुछ उच्च-गुणवत्ता वाले व्यंजनों को कितनी बार दोहराया (epochs) और किन चीजों का उपयोग करने का निर्णय नहीं लिया। वे यह भी स्वीकार करते हैं कि उनके जर्मन डेटा का लगभग 1.3% एक व्यावसायिक लाइसेंस प्राप्त स्रोत (Genios) से आया है जिसके लिए वे कच्चा टेक्स्ट साझा नहीं कर सकते, लेकिन उन्होंने सटीक आंकड़े प्रदान किए हैं ताकि कोई भी इस मिश्रण का ऑडिट कर सके।
टेस्ट ऑफ टेस्ट: यह कितना अच्छा है?
टीम ने 16 अन्य ओपन मॉडल्स के खिलाफ, जिनमें Olmo 3 32B, Apertus 70B, और Qwen3.5 35B जैसे दिग्गज शामिल हैं, Soori S का कड़ा परीक्षण किया।
- बड़ी जीत: Soofi S अंग्रेजी और जर्मन दोनों के लिए पूरी तरह से ओपन मॉडल्स में शीर्ष प्रदर्शन करने वाला बन गया। इसने हर यूरोपीय सॉवरेन बेसलाइन को हराया, जो अक्सर बड़े अंतर से जीत हासिल की। उदाहरण के लिए, जर्मन कोड बेंचमार्क पर, इसने MBPP-DE पर 84.2 स्कोर किया, जो अगले सर्वश्रेष्ठ से काफी आगे है।
- "सक्रिय" लाभ: भले ही यह एक बार में केवल 3 बिलियन पैरामीटर्स को सक्रिय करता है, फिर भी इसने उन डेंस मॉडल्स की बराबरी की या उन्हें हराया जिनके पास 14 से 27 बिलियन सक्रिय पैरामीटर्स हैं। यह एक स्प्रिंट में भारी मुक्केबाज को हराने वाले एक हल्के धावक की तरह है।
- "ओपन" लाभ: कई "ओपन" मॉडल्स के विपरीत जो केवल अंतिम वेट्स (पका हुआ व्यंजन) साझा करते हैं लेकिन रेसिपी छिपाते हैं, Soofi S वेट्स, कोड, हाइपरपैरामीटर्स और सटीक डेटा अकाउंटिंग साझा करता है।
राह की बाधाएं (सीमाएं)
लेखक इस बारे में ईमानदार हैं कि रोबोट शेफ कहाँ लड़खड़ाता है:
- जर्मन गणित: हालांकि यह जर्मन ग्रेड-स्कूल गणित में बहुत अच्छा है (GSM8K-Platinum-DE पर 87.1 स्कोर करता है), यह कठिन, प्रतियोगिता-शैली के जर्मन गणित (Minerva MATH-DE पर 56.0 स्कोर करता है) में पीछे रह जाता है, जो Qwen3.5 जैसे मॉडल्स से पीछे है।
- मेमोरी रिकॉल: क्योंकि इसमें केवल 3 बिलियन सक्रिय पैरामीटर्स हैं, यह कभी-कभी बाहरी दुनिया के अज्ञात तथ्यों को याद करने में संघर्ष करता है (NaturalQuestions पर 79.0 स्कोर करता है), जबकि बड़े, डेंस मॉडल्स अधिक याद रखते हैं। लेखक सुझाव देते हैं कि वास्तविक जीवन में, आप इसे ठीक करने के लिए एक सर्च इंजन के साथ जोड़ सकते हैं।
- कोड कंटैमिनेशन: एक विशिष्ट कोड बेंचमार्क जिसे LBPP कहा जाता है (जो यह परीक्षण करता है कि क्या मॉडल केवल प्रशिक्षण डेटा को याद कर रहा है), इसमें इसने 31.0 स्कोर किया, जो कुछ बड़े मॉडल्स की तुलना में कम है।
निष्कर्ष
Soofi S साबित करता है कि शीर्ष स्तर का AI होने के लिए आपको एक विशाल, धीमे, डेंस मस्तिष्क की आवश्यकता नहीं है। एक हाइब्रिड मंबा-ट्रांसफॉर्मर डिज़ाइन का उपयोग करके और जर्मन और अंग्रेजी पर तीव्रता से ध्यान केंद्रित करके, टीम ने एक ऐसा मॉडल बनाया है जो सॉवरेन (जर्मन मिट्टी पर जर्मन फंडिंग के साथ निर्मित) है, ओपन (पूरी तरह से पारदर्शी) है, और कुशल (तेज़ और चलाने में सस्ता) है।
यह कोई जादुई समाधान नहीं है जो सब कुछ हल कर दे—विशेष रूप से कठिन जर्मन गणित या शुद्ध तथ्य रिकॉल में—लेकिन लंबी बातचीत, कोडिंग और द्विभाषी कार्यों के लिए, यह एक नया मानक स्थापित करता है कि एक "सॉवरेन" यूरोपीय मॉडल क्या हासिल कर सकता है। लेखकों का सुझाव है कि अधिक उच्च-गुणवत्ता वाले जर्मन डेटा के साथ, यह मॉडल और भी बेहतर हो सकता है, लेकिन फिलहाल, यह उनके द्वारा परीक्षण किए गए सबसे मजबूत पूर्ण ओपन जर्मन-अंग्रेजी बेस मॉडल के रूप में खड़ा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।