← नवीनतम पेपर
💬 NLP

From Data to Device: ELMOD An Efficient German-First 2.7B Language Model for Mobile Inference

ELMOD एक संक्षिप्त 2.7B जर्मन भाषा मॉडल है जिसे कुशल ऑन-डिवाइस इन्फरेंस के लिए डिज़ाइन किया गया है जो, विशेष डेटा प्रीप्रोसेसिंग और गुणवत्ता फ़िल्टरिंग के माध्यम से, एक सीमित कंप्यूटेशनल बजट के तहत काम करते हुए 7B-पैरामीटर वाले मॉडलों के तुलनीय प्रदर्शन प्राप्त करता है।

मूल लेखक: Darina Gold, Alexander Schwirjow, Viktor Haag, Viktor Hangya, Joel Schlotthauer, Fabian Küch, Luzian Hahn

प्रकाशित 2026-07-28
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Darina Gold, Alexander Schwirjow, Viktor Haag, Viktor Hangya, Joel Schlotthauer, Fabian Küch, Luzian Hahn

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया की कल्पना एक विशाल, हलचल भरी लाइब्रेरी के रूप में करें जहाँ विशाल रोबोट अस्तित्व की हर भाषा बोलने सीखने की कोशिश कर रहे हैं। लंबे समय तक, इन रोबोटों को इंटरनेट से जुड़े रहने के लिए दूर स्थित विशाल, सुपर-कूल्ड डेटा सेंटरों में रहने की आवश्यकता थी। वे उन बुद्धिमान विद्वानों की तरह थे जो केवल तभी सोच सकते थे जब वे एक विशाल पावर ग्रिड से जुड़े हों। लेकिन क्या होगा यदि आप एक ऐसा विद्वान चाहते हैं जो आपकी जेब में, आपके फोन में रह सके, और तब भी काम कर सके जब आप बिना किसी सिग्नल के किसी गुफा में हों? यही "ऑन-डिवाइस" (on-device) AI का सपना है। इसे साकार करने के लिए, वैज्ञानिक इन विशाल दिमागों को उनकी बुद्धिमत्ता खोए बिना छोटे स्थानों में फिट होने के लिए सिकोड़ने की कोशिश कर रहे हैं। बड़ी चुनौती यह है कि छोटे दिमाग का अर्थ आमतौर पर कम बुद्धिमान रोबोट होता है, जब तक कि आप उन्हें बहुत ही विशिष्ट, उच्च-गुणवत्ता वाले पाठों का उपयोग करके अविश्वसनीय रूप से अच्छी तरह से न सिखा सकें।

यहाँ ELMOD आता है, जो फ्रौनहोफर इंस्टीट्यूट के शोधकर्ताओं द्वारा एक नया प्रोजेक्ट है जिन्होंने विशेष रूप से जर्मन भाषा के लिए एक छोटा, सुपर-स्मार्ट लैंग्वेज मॉडल बनाने का निर्णय लिया। लैंग्वेज मॉडल्स को ऐसे छात्रों के रूप में समझें जो अरबों किताबें पढ़कर सीखते हैं। आमतौर पर, किसी छात्र को जीनियस बनाने के लिए, आप उनके सामने किताबों का एक पहाड़ फेंक देते हैं। लेकिन ELMOD के रचनाकारों ने यह देखना चाहा कि क्या वे एक छात्र को इस बात पर अधिक ध्यान देकर उतना ही स्मार्ट बना सकते हैं कि वह किन किताबों को पढ़ रहा है। उन्होंने केवल इंटरनेट से रैंडम पन्ने नहीं उठाए; उन्होंने शोर को छानने, व्याकरण को ठीक करने और यहाँ तक कि उबाऊ हिस्सों को और अधिक शैक्षिक बनाने के लिए उन्हें फिर से लिखने में एक सख्त लाइब्रेरियन की तरह काम किया। उनका लक्ष्य एक 2.7-बिलियन पैरामीटर वाला मॉडल (जो इसके मस्तिष्क के आकार का एक माप है) बनाना था जो मोबाइल उपकरणों पर कुशलतापूर्वक चल सके, जिससे यह सिद्ध हो सके कि एक स्मार्ट जर्मन बोलने वाला सहायक होने के लिए आपको सुपरकंप्यूटर की आवश्यकता नहीं है।

एक पॉकेट-साइज जीनियस की रेसिपी

ELMOD की कहानी एक सरल प्रश्न से शुरू होती है: क्या हम एक जर्मन बोलने वाला AI बना सकते हैं जो फोन में फिट होने के लिए पर्याप्त छोटा हो लेकिन बड़े मॉडल्स के साथ प्रतिस्पर्धा करने के लिए पर्याप्त स्मार्ट हो? शोधकर्ताओं ने डेटा के एक विशाल ढेर से शुरुआत की, जैसे इंटरनेट से प्राप्त टेक्स्ट का एक अराजक कबाड़खाना। उनके पास काम करने के लिए 4.83 ट्रिलियन शब्द थे, लेकिन उनमें से अधिकांश बेकार था—विज्ञापन, टूटे हुए लिंक और दोहराव वाला निरर्थक टेक्स्ट।

चरण 1: महान सफाई (The Great Cleanup)
सबसे पहले, उन्हें डेटा को साफ करना था। कल्पना कीजिए कि आप एक शानदार भोजन बनाने की कोशिश कर रहे हैं, लेकिन आपकी सामग्री में पत्थर और प्लास्टिक के रैपर मिले हुए हैं। टीम ने "पत्थरों" को हटाने के लिए कई फिल्टरों का उपयोग किया। उन्होंने उन पेजों को बाहर निकाल दिया जो केवल नंबरों की सूचियाँ थे, उस टेक्स्ट को हटाया जो मुख्य रूप से अंग्रेजी में था जब वे जर्मन चाहते थे, और यहाँ तक कि उन शब्दों को भी फ़िल्टर किया जो बहुत अशिष्ट या अनुपयुक्त थे। उन्होंने "डुप्लीकेशन" (deduplication) नामक एक चतुर तकनीक का भी उपयोग किया, जो बिल्कुल वैसा ही है जैसे किसी कुकबुक में किसी ने एक ही रेसिपी कार्ड को हज़ार बार पेस्ट कर दिया हो, उसे ढूँढना और हटाना। यह प्रक्रिया महत्वपूर्ण थी क्योंकि इसने उन्हें बार-बार एक ही उबाऊ चीज़ पढ़ने में समय और ऊर्जा बर्बाद करने से बचाया।

चरण 2: गुणवत्ता की जाँच (The Quality Check)
एक बार जब कचरा हट गया, तो उनके सामने एक नई समस्या आई: शेष बची सभी किताबें सीखने के लिए अच्छी नहीं थीं। कुछ केवल समाचार सुर्खियाँ थीं, अन्य गहरे वैज्ञानिक लेख थे। शोधकर्ता चाहते थे कि उनका AI "सर्वश्रेष्ठ" किताबों से सीखे। उन्होंने टेक्स्ट को कितना शैक्षिक है, इस पर 0 से 5 के पैमाने पर ग्रेड देने के लिए एक स्मार्ट AI जज (एक बड़ा मॉडल) का उपयोग किया। उन्होंने पाया कि उच्चतम-गुणवत्ता वाली किताबों (स्कोर 2 और उससे ऊपर) पर प्रशिक्षण देने से मॉडल अधिक स्मार्ट बना, लेकिन स्कोर को और अधिक बढ़ाने (स्कोर 3 और उससे ऊपर) से कोई अतिरिक्त लाभ नहीं मिला। हालाँकि, यहाँ एक चतुर हिस्सा है: उन्होंने महसूस किया कि यहाँ तक कि "मध्यम" स्कोर (लगभग 1.5 से 2) वाली किताबों को भी अपग्रेड किया जा सकता था।

चरण 3: रीराइट मैजिक (The Rewrite Magic)
यहीं पर जादू हुआ। टीम ने "मध्यम-गुणवत्ता" वाले टेक्स्ट लिए और एक अन्य AI से उन्हें फिर से लिखने के लिए कहा। उन्होंने AI को निर्देश दिया: "इस उबाऊ ब्लॉग पोस्ट को लें और इसे ऐसे फिर से लिखें जैसे यह विशेषज्ञों के लिए एक पाठ्यपुस्तक का अध्याय हो, या बच्चों के लिए एक मजेदार कहानी, या एक पेशेवर ब्लॉग।" ऐसा करके, उन्होंने औसत डेटा को उच्च-गुणवत्ता वाले पाठों में बदल दिया। यह एक कहानी के कच्चे ड्राफ्ट को तब तक पॉलिश करने जैसा था जब तक कि वह चमक न उठे। उन्होंने इस तरह से लगभग 73 बिलियन नए टोकन (टेक्स्ट के टुकड़े) उत्पन्न किए, प्रभावी रूप से नई किताबें खोजने के बजाय अपनी लाइब्रेरी को अपग्रेड किया।

चरण 4: प्रशिक्षण (The Training)
उनकी साफ और अपग्रेड की गई लाइब्रेरी तैयार होने के बाद, उन्होंने मॉडल को प्रशिक्षित करना शुरू किया। उनके पास एक सख्त बजट था: वे केवल 55,000 घंटों के शक्तिशाली H100 GPUs (वे इंजन जो AI ट्रेनिंग को शक्ति देते हैं) का उपयोग कर सकते थे। इसका अधिकतम लाभ उठाने के लिए, उन्होंने प्रयोग किया कि मॉडल कैसे सीखता है। उन्होंने संख्याओं को संभालने के विभिन्न तरीकों और जर्मन, अंग्रेजी और कोड के विभिन्न मिश्रणों का परीक्षण किया। उन्होंने पाया कि एक विशिष्ट मिश्रण—50% अंग्रेजी, 40% जर्मन और 10% कोड—सबसे अच्छा काम करता है। उन्होंने यह भी खोजा कि प्रशिक्षण प्रक्रिया को बिल्कुल अंत में धीमा करने (एक तकनीक जिसे "एनीलिंग" कहा जाता है) से मॉडल अपने ज्ञान को बेहतर तरीके से व्यवस्थित कर पाता है, ठीक वैसे ही जैसे एक छात्र बड़े टेस्ट से पहले शांति से नोट्स की समीक्षा करता है।

परिणाम: छोटा लेकिन शक्तिशाली

जब वे समाप्त हुए, तो उनके पास ELMOD-2.7B था, एक 2.7 बिलियन पैरामीटर वाला मॉडल। इसे समझने के लिए, यह उन दिग्गजों की तुलना में बहुत छोटा है जो आमतौर पर इस क्षेत्र में हावी रहते हैं। लेकिन जब उन्होंने इसे जर्मन भाषा की चुनौतियों पर परखा, तो परिणाम आश्चर्यजनक थे।

ELMOD ने न केवल अच्छा प्रदर्शन किया; बल्कि यह अपने आकार वर्ग (3 बिलियन पैरामीटर से कम) में सबसे मजबूत प्रदर्शन करने वाला मॉडल था और इसने जर्मनों बेंचमार्क पर लगभग तीन गुना बड़े (7 बिलियन पैरामीटर) मॉडल्स के बराबर प्रदर्शन किया। यह एक कॉम्पैक्ट स्पोर्ट्स कार की तरह था जो एक विशाल ट्रक की तरह तेज़ दौड़ सकती है। शोधकर्ताओं ने इसे विभिन्न कार्यों पर परखा, जटिल तर्क संबंधी प्रश्नों के उत्तर देने से लेकर जटिल कहानियों को समझने तक, और इसने उन बहुत बड़े मॉडल्स का डटकर मुकाबला किया जिन्हें दोगुने डेटा पर प्रशिक्षित किया गया था।

उन्होंने यह भी सुनिश्चित किया कि मॉडल सुरक्षित और वास्तविक जीवन के लिए तैयार हो। उन्होंने प्रशिक्षण डेटा से ईमेल पते और क्रेडिट कार्ड नंबर जैसी व्यक्तिगत जानकारी को हटा दिया, यह सुनिश्चित करते हुए कि AI गलती से निजी विवरणों को याद न कर ले। अंत में, उन्होंने साबित किया कि यह वास्तव में एक फोन पर चल सकता है। उन्होंने एक डेमो ऐप बनाया जो विभिन्न Android फोन और यहाँ तक कि एक MacBook Pro पर मॉडल को चलाता है, यह दिखाते हुए कि यह बिना किसी नजदीकी सुपरकंप्यूटर के भी मानव उपयोगकर्ता के लिए उपयोगी होने के लिए पर्याप्त तेज़ी से टेक्स्ट प्रोसेस कर सकता है।

यह क्यों महत्वपूर्ण है

यह पेपर दिखाता है कि एक महान AI बनाने के लिए आपको असीमित धन वाली विशाल टेक कंपनी होने की आवश्यकता नहीं है। डेटा की गुणवत्ता के बारे में स्मार्ट होकर—शोर को छानकर, औसत चीजों को अपग्रेड करके, और मॉडल को सिखाने के तरीके के प्रति सावधान रहकर—आप अपनी जेब में फिट होने वाला एक शक्तिशाली उपकरण बना सकते हैं। ELMOD यह सिद्ध करता है कि जर्मन भाषा के लिए, एक छोटा, कुशल मॉडल बड़े और महंगे मॉडल्स जितना सक्षम हो सकता है, जो कहीं भी, कभी भी काम करने वाले गोपनीयता-अनुकूल, ऑफलाइन AI सहायकों के लिए द्वार खोलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →