← नवीनतम पेपर
💬 NLP

A Sovereign, Open-Source Foundation Model for German and English

यह शोध पत्र Soofi S 30B-A3B को प्रस्तुत करता है, जो एक संप्रभु, ओपन-सोर्स मिक्स्चर-ऑफ-एक्सपर्ट्स हाइब्रिड माम्बा ट्रांसफॉर्मर मॉडल है जिसे जर्मन और अंग्रेजी पर ध्यान केंद्रित करते हुए 27 ट्रिलियन टोकन पर प्रशिक्षित किया गया है, जो लंबी-संदर्भ अनुप्रयोगों के लिए बेहतर अनुमान दक्षता प्रदान करते हुए ओपन मॉडलों के बीच अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: The Soofi-Team, :, Benedikt Droste, David Fitzek, Ruben Härle, Lukas Helff, Maximilian Idahl, Alex Jude, Abbas Goher Khan, Maurice Kraus, Timm Ruland, Richard Rutmann, Sebastian Sztwiertnia, Markus F
प्रकाशित 2026-07-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: The Soofi-Team, :, Benedikt Droste, David Fitzek, Ruben Härle, Lukas Helff, Maximilian Idahl, Alex Jude, Abbas Goher Khan, Maurice Kraus, Timm Ruland, Richard Rutmann, Sebastian Sztwiertnia, Markus Frey, Daniil Gurgurov, Jan Pfister, Tom Röhr, Sebastian von Rohrscheidt, Jörg Bienert, Nicolas Flores-Herr, Simon Gottschalk, Andreas Hotho, Kristian Kersting, Joachim Köhler, Alexander Löser, Wolfgang Nejdl, Simon Ostermann, Jan Plogsties, Patrick Putzky, Mehdi Ali, Michael Fromm, Max Lübbering

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक परम द्विभाषी रोबोट शेफ बनाने की कोशिश कर रहे हैं जो अंग्रेजी और जर्मन दोनों में शानदार खाना बना सके। ज्यादातर लोग सोचते हैं कि एक महान शेफ का रहस्य केवल एक बड़ा किचन या अधिक रसोइयों (अधिक पैरामीटर्स) को काम पर रखना है। लेकिन Soofi S की टीम ने एक अलग ही तरकीब खोजी है: 30 अरब रसोइयों को काम पर रखने के बजाय, उन्होंने केवल 3 अरब सक्रिय रसोइयों की एक छोटी, अत्यंत कुशल टीम चुनी जो कार्यों को बदलने में अविश्वसनीय रूप से तेज़ है, जबकि बाकी 27 अरब को व्यंजनों के एक विशाल, शांत पुस्तकालय के रूप में रखा है जिससे वे तुरंत जानकारी निकाल सकते हैं।

यह केवल एक सिद्धांत नहीं है; यह एक पूरी तरह से निर्मित, ओपन-सोर्स रोबोट शेफ है जिसका नाम Soofi S 30B-A3B है, जिसे लेखकों ने वास्तव में प्रशिक्षित और परीक्षित किया है। यह कहानी है कि उन्होंने इसे कैसे किया, यह क्या कर सकता है, और इसकी राह में अभी भी कहाँ कुछ मुश्किलें हैं।

गुप्त सॉस: एक हाइब्रिड किचन

अधिकांश AI मॉडल एक घनी भीड़ की तरह होते हैं जहाँ हर किसी को सुना जाने के लिए चिल्लाना पड़ता है, जो कमरे के बहुत बड़ा होने पर (लंबी बातचीत में) अव्यवस्थित और धीमा हो जाता है। Soofi S अलग है। यह एक हाइब्रिड डिज़ाइन का उपयोग करता है जो दो प्रकार के "रसोइयों" को मिलाता है:

  1. Mamba-2 लेयर्स: इन्हें उन शेफ के रूप में सोचें जो पूरी कहानी को अपने दिमाग में याद रखते हैं बिना उसे लिखने की आवश्यकता के। उन्हें एक विशाल नोटबुक (जिसे "KV कैश" कहा जाता है) रखने की आवश्यकता नहीं है जो कहानी लंबी होने के साथ भारी होती जाती है।
  2. MoE (Mixture of Experts): यह "3 बिलियन सक्रिय" वाला हिस्सा है। कुल 31.6 बिलियन पैरामीटर्स में से, मॉडल प्रत्येक शब्द उत्पन्न करने के लिए केवल 3.2 बिलियन को ही "जगाता" है।

परिणाम? जब आप इस मॉडल को 1 मिलियन शब्दों की किताब पढ़ने के लिए कहते हैं, तो यह धीमा नहीं होता। जहाँ अन्य मॉडल सुस्त हो जाते हैं क्योंकि उन्हें एक भारी नोटबुक ढोना पड़ता है, Soofi S अपनी गति स्थिर रखता है। लेखकों ने इसे मापा और पाया कि 40,000 टोकन (लगभग 30,000 शब्द) की संदर्भ लंबाई (context length) पर, Soofi S समान आकार के अन्य डेंस मॉडल्स की तुलना में टेक्स्ट जेनरेट करने में 8 से 9 गुना तेज़ था।

रेसिपी: जर्मन-अंग्रेजी फोकस

टीम ने केवल इंटरनेट का रैंडम टेक्स्ट इसमें नहीं डाला। उन्होंने एक सख्त, तीन-चरणीय रेसिपी का पालन किया जिसे विशेष रूप से जर्मन और अंग्रेजी में चैंपियन बनाने के लिए डिज़ाइन किया गया था, न कि 100 भाषाओं के लिए एक औसत दर्जे का शेफ बनाने के लिए।

  • चरण 1 (द बिग मिक्स): उन्होंने 20 ट्रिलियन टोकन के विविध डेटा के साथ शुरुआत की। उन्होंने जानबूझकर यह सुनिश्चित किया कि जर्मन केवल एक साइड डिश न हो; उन्होंने इसे मिश्रण में 7.2% तक बढ़ा दिया (अन्य मॉडलों में सामान्य 5% की तुलना में)।
  • चरण 2 (हाई-क्वालिटी एनीलिंग): जैसे-जैसे मॉडल स्मार्ट हुआ, उन्होंने एक "उच्च गुणवत्ता वाले" आहार की ओर रुख किया। उन्होंने बेकार सामग्री को हटा दिया और बेहतरीन कोड, गणित और तर्क (reasoning) डेटा पर ध्यान केंद्रित किया। यहाँ, उन्होंने जर्मन हिस्से को और भी अधिक बढ़ाकर 15.3% कर दिया।
  • चरण 3 (लॉन्ग-स्टोरी एक्सटेंशन): अंत में, उन्होंने मॉडल को लंबी कहानियों को संभालने के तरीके सिखाए, इसे 4,000 से 1 मिलियन टोकन लंबे डेटा पर प्रशिक्षित किया।

लेखक इस बारे में बहुत पारदर्शी हैं: उन्होंने सामग्रियों की सटीक सूची जारी की है, जिसमें यह भी शामिल है कि उन्होंने कुछ उच्च-गुणवत्ता वाले व्यंजनों को कितनी बार दोहराया (epochs) और किन चीजों का उपयोग करने का निर्णय नहीं लिया। वे यह भी स्वीकार करते हैं कि उनके जर्मन डेटा का लगभग 1.3% एक व्यावसायिक लाइसेंस प्राप्त स्रोत (Genios) से आया है जिसके लिए वे कच्चा टेक्स्ट साझा नहीं कर सकते, लेकिन उन्होंने सटीक आंकड़े प्रदान किए हैं ताकि कोई भी इस मिश्रण का ऑडिट कर सके।

टेस्ट ऑफ टेस्ट: यह कितना अच्छा है?

टीम ने 16 अन्य ओपन मॉडल्स के खिलाफ, जिनमें Olmo 3 32B, Apertus 70B, और Qwen3.5 35B जैसे दिग्गज शामिल हैं, Soori S का कड़ा परीक्षण किया।

  • बड़ी जीत: Soofi S अंग्रेजी और जर्मन दोनों के लिए पूरी तरह से ओपन मॉडल्स में शीर्ष प्रदर्शन करने वाला बन गया। इसने हर यूरोपीय सॉवरेन बेसलाइन को हराया, जो अक्सर बड़े अंतर से जीत हासिल की। उदाहरण के लिए, जर्मन कोड बेंचमार्क पर, इसने MBPP-DE पर 84.2 स्कोर किया, जो अगले सर्वश्रेष्ठ से काफी आगे है।
  • "सक्रिय" लाभ: भले ही यह एक बार में केवल 3 बिलियन पैरामीटर्स को सक्रिय करता है, फिर भी इसने उन डेंस मॉडल्स की बराबरी की या उन्हें हराया जिनके पास 14 से 27 बिलियन सक्रिय पैरामीटर्स हैं। यह एक स्प्रिंट में भारी मुक्केबाज को हराने वाले एक हल्के धावक की तरह है।
  • "ओपन" लाभ: कई "ओपन" मॉडल्स के विपरीत जो केवल अंतिम वेट्स (पका हुआ व्यंजन) साझा करते हैं लेकिन रेसिपी छिपाते हैं, Soofi S वेट्स, कोड, हाइपरपैरामीटर्स और सटीक डेटा अकाउंटिंग साझा करता है।

राह की बाधाएं (सीमाएं)

लेखक इस बारे में ईमानदार हैं कि रोबोट शेफ कहाँ लड़खड़ाता है:

  1. जर्मन गणित: हालांकि यह जर्मन ग्रेड-स्कूल गणित में बहुत अच्छा है (GSM8K-Platinum-DE पर 87.1 स्कोर करता है), यह कठिन, प्रतियोगिता-शैली के जर्मन गणित (Minerva MATH-DE पर 56.0 स्कोर करता है) में पीछे रह जाता है, जो Qwen3.5 जैसे मॉडल्स से पीछे है।
  2. मेमोरी रिकॉल: क्योंकि इसमें केवल 3 बिलियन सक्रिय पैरामीटर्स हैं, यह कभी-कभी बाहरी दुनिया के अज्ञात तथ्यों को याद करने में संघर्ष करता है (NaturalQuestions पर 79.0 स्कोर करता है), जबकि बड़े, डेंस मॉडल्स अधिक याद रखते हैं। लेखक सुझाव देते हैं कि वास्तविक जीवन में, आप इसे ठीक करने के लिए एक सर्च इंजन के साथ जोड़ सकते हैं।
  3. कोड कंटैमिनेशन: एक विशिष्ट कोड बेंचमार्क जिसे LBPP कहा जाता है (जो यह परीक्षण करता है कि क्या मॉडल केवल प्रशिक्षण डेटा को याद कर रहा है), इसमें इसने 31.0 स्कोर किया, जो कुछ बड़े मॉडल्स की तुलना में कम है।

निष्कर्ष

Soofi S साबित करता है कि शीर्ष स्तर का AI होने के लिए आपको एक विशाल, धीमे, डेंस मस्तिष्क की आवश्यकता नहीं है। एक हाइब्रिड मंबा-ट्रांसफॉर्मर डिज़ाइन का उपयोग करके और जर्मन और अंग्रेजी पर तीव्रता से ध्यान केंद्रित करके, टीम ने एक ऐसा मॉडल बनाया है जो सॉवरेन (जर्मन मिट्टी पर जर्मन फंडिंग के साथ निर्मित) है, ओपन (पूरी तरह से पारदर्शी) है, और कुशल (तेज़ और चलाने में सस्ता) है।

यह कोई जादुई समाधान नहीं है जो सब कुछ हल कर दे—विशेष रूप से कठिन जर्मन गणित या शुद्ध तथ्य रिकॉल में—लेकिन लंबी बातचीत, कोडिंग और द्विभाषी कार्यों के लिए, यह एक नया मानक स्थापित करता है कि एक "सॉवरेन" यूरोपीय मॉडल क्या हासिल कर सकता है। लेखकों का सुझाव है कि अधिक उच्च-गुणवत्ता वाले जर्मन डेटा के साथ, यह मॉडल और भी बेहतर हो सकता है, लेकिन फिलहाल, यह उनके द्वारा परीक्षण किए गए सबसे मजबूत पूर्ण ओपन जर्मन-अंग्रेजी बेस मॉडल के रूप में खड़ा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →