MobileMoE: Scaling On-Device Mixture of Experts
यह शोधपत्र MobileMoE को पेश करता है, जो एक बिलियन से कम पैरामीटर वाले ऑन-डिवाइस मिक्स्चर-ऑफ-एक्सपर्ट्स (Mixture-of-Experts) भाषा मॉडलों का एक परिवार है, जो मौजूदा डेंस और MoE बेसलाइनों की तुलना में बेहतर प्रदर्शन और दक्षता प्राप्त करने के लिए आर्किटेक्चर और प्रशिक्षण को अनुकूलित करता है, जिससे साधारण स्मार्टफोन पर तेज़ इन्फरेंस (inference) सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ MobileMoE पेपर का विवरण दिया गया है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों के साथ समझाया गया है।
मुख्य विचार: आपकी जेब में "सुपर-ब्रेन" लाना
कल्पना कीजिए कि आपके पास ज्ञान का एक विशाल पुस्तकालय (एक लार्ज लैंग्वेज मॉडल या LLM) है। आमतौर पर, सबसे अच्छे उत्तर पाने के लिए, आपको अपने प्रश्न एक विशाल, क्लाउड-आधारित सर्वर फार्म को भेजने पड़ते हैं। लेकिन क्या होगा अगर आप बिना इंटरनेट के, अपने फोन पर अपनी जेब में वह दिमाग लेकर चल सकें?
लंबे समय तक, फोन पर एक स्मार्ट दिमाग फिट करने का एकमात्र तरीका उसे "डेंस" (dense) बनाना था—जैसे कि एक अकेला, बहुत मेहनती छात्र जो हर सवाल के लिए सब कुछ याद रखने और सब कुछ करने की कोशिश करता है। यह धीमा है और बहुत अधिक जगह घेरता है।
MobileMoE मेटा (Meta) का एक नया AI मॉडल परिवार है जो खेल बदल देता है। एक मेहनती छात्र के बजाय, वे विशेषज्ञों की एक टीम का उपयोग करते हैं। इस दृष्टिकोण को मिक्सचर ऑफ एक्सपर्ट्स (Mixture of Experts - MoE) कहा जाता है, जो फोन को एक बहुत अधिक स्मार्ट दिमाग चलाने की अनुमति देता है जो तेज़ है, कम बैटरी खर्च करता है, और आधुनिक स्मार्टफोन की मेमोरी में समा जाता है।
1. समस्या: "एक ही आकार सबके लिए" (One-Size-Fits-All) की बाधा
एक मानक फोन AI (जैसे कि वर्तमान में बाजार में मौजूद हैं) को एक जनरलिस्ट (सामान्यज्ञ) के रूप में सोचें।
- उदाहरण: कल्पना कीजिए कि एक छोटे से किचन में एक अकेला शेफ है। यदि आप सुशी मांगते हैं, तो वह मछली काटता है। यदि आप केक मांगते हैं, तो वह उसे बेक करता है। यदि आप स्टेक मांगते हैं, तो वह उसे ग्रिल करता है। उसे हर काम में अच्छा होना पड़ता है, इसलिए वह हर काम के लिए रसोई के हर औज़ार को अपने साथ रखता है।
- समस्या: यह शेफ धीमा है क्योंकि उसे हर कार्य के लिए औजार बदलने पड़ते हैं, और किचन (आपका फोन मेमोरी) उन सभी औजारों से भर जाता है जिनकी उसे शायद ज़रूरत हो, भले ही अभी उनका उपयोग न किया जा रहा हो।
2. समाधान: "विशेषज्ञों की टीम" (MoE)
MobileMoE एकल शेफ को विशेषज्ञों की एक टीम से बदल देता है।
- उदाहरण: अब, एक किचन की कल्पना करें जिसमें एक राउटर (मैनेजर) और 64 अलग-अलग विशेषज्ञ शेफ हैं।
- एक शेफ केवल केक बनाना जानता है।
- एक केवल स्टेक ग्रिल करना जानता है।
- एक केवल सुशी बनाना जानता है।
- यह कैसे काम करता है: जब आप कोई प्रश्न पूछते हैं, तो राउटर जल्दी से उसे देखता है और कहता है, "ओह, यह गणित का सवाल है! इसे मैथ शेफ के पास भेज दो।" मैथ शेफ काम करता है, और बाकी 63 शेफ आराम करते हैं।
- लाभ: भले ही पूरी टीम बहुत बड़ी है (कुल ज्ञान बहुत अधिक है), लेकिन किसी भी दिए गए समय में केवल उनके एक बहुत छोटे हिस्से ही वास्तव में काम कर रहे होते हैं। इसका मतलब है कि फोन को बहुत अधिक भारी काम नहीं करना पड़ता, जिससे बैटरी और समय बचता है।
3. "स्वीट स्पॉट": सही टीम साइज का पता लगाना
शोधकर्ताओं ने केवल अनुमान नहीं लगाया; उन्होंने फोन के लिए सही टीम साइज खोजने के लिए एक स्केलिंग लॉ (Scaling Law) (एक गणितीय रेसिपी) का उपयोग किया।
- खोज: उन्होंने पाया कि फोन के लिए, आप ऐसी टीम नहीं चाहते जो बहुत छोटी हो (पर्याप्त स्मार्ट नहीं) या बहुत बड़ी (बहुत भारी)।
- परिणाम: उन्होंने 8 मुख्य विशेषज्ञों के साथ एक "स्वीट स्पॉट" पाया, जहाँ प्रत्येक विशेषज्ञ वास्तव में 8 छोटे उप-विशेषज्ञों (fine-grained) से बना है, साथ ही एक "जनरलिस्ट" (सामान्यज्ञ) विशेषज्ञ भी है जो हमेशा किसी भी चीज़ को संभालने के लिए तैयार रहता है।
- यह क्यों मायने रखता है: यह विशिष्ट मिश्रण इस बात की अनुमति देता है कि मॉडल अविश्वसनीय रूप से स्मार्ट हो सके जबकि यह इतना छोटा बना रहे कि फोन की 3-5 GB मेमोरी (जो iPhone 16 Pro या Samsung S25 जैसे फोन में मानक है) में समा सके।
4. प्रशिक्षण: एक चार-चरणों वाला बूट कैंप
इस टीम को पूरी तरह से काम करने के योग्य बनाने के लिए, उन्होंने उन्हें चार विशिष्ट चरणों में प्रशिक्षित किया, जो एक कठोर बूट कैंप की तरह है:
- प्री-ट्रेनिंग (Pre-training): टीम सामान्य भाषा सीखने के लिए किताबों के एक विशाल पुस्तकालय (6 ट्रिलियन शब्द) को पढ़ती है।
- मिड-ट्रेनिंग (Mid-training): वे अपने कौशल को तेज करने के लिए गणित, कोड और विज्ञान जैसे विशिष्ट, उच्च-गुणवत्ता वाले विषयों पर ध्यान केंद्रित करते हैं।
- इंस्ट्रक्शन फाइन-ट्यूनिंग (Instruction Fine-Tuning): वे मानव निर्देशों (जैसे "एक कविता लिखें" या "इस समीकरण को हल करें") का पालन करना सीखते हैं।
- क्वांटाइजेशन (Quantization - संपीड़न): यह एक जादुई ट्रिक है। वे मॉडल के मेमोरी फुटप्रिंट को 4 गुना कम कर देते हैं (इसे "INT4" फॉर्मेट में बदलकर) बिना बहुत अधिक बुद्धिमत्ता खोए, ताकि यह आसानी से फोन में फिट हो सके।
5. परिणाम: वास्तविक फोन पर तेज़ और स्मार्ट
टीम ने असली फ्लैगशिप फोन (Samsung Galaxy S25 और iPhone 16 Pro) पर MobileMoE का परीक्षण किया और इसकी तुलना सबसे अच्छे मौजूदा फोन AI (MobileLLM-Pro) से की।
- गति: MobileMoE, डेंस मॉडल्स की तुलना में टेक्स्ट जेनरेट करने में 2 से 4 गुना तेज़ है।
- उदाहरण: यदि पुराना मॉडल ट्रैफिक में फंसा हुआ डिलीवरी ट्रक था, तो MobileMoE ट्रैफिक के बीच से रास्ता बनाती एक मोटरसाइकिल है।
- स्मार्टनेस: यह बहुत बड़े मॉडल्स के प्रदर्शन के बराबर है या उनसे बेहतर है। उदाहरण के लिए, MobileMoE का "मीडियम" वर्जन उन मॉडल्स से अधिक स्मार्ट है जो उससे 3-4 गुना बड़े हैं।
- दक्षता (Efficiency): यह कम बैटरी और मेमोरी का उपयोग करता है क्योंकि यह केवल कार्य के लिए आवश्यक विशिष्ट विशेषज्ञों को ही "जगाता" है।
6. "लास्ट माइल": इसे आपके फोन पर चलाना
पेपर एक प्रमुख बाधा पर प्रकाश डालता है: अधिकांश फोन इस "विशेषज्ञों की टीम" को कुशलतापूर्वक चलाने के लिए इन-बिल्ट सॉफ्टवेयर नहीं रखते हैं।
- समाधान: शोधकर्ताओं ने एक कस्टम इंजन (एक विशेष सॉफ्टवेयर कर्नेल) बनाया जो एक ट्रैफिक कंट्रोलर की तरह काम करता है। यह डेटा को व्यवस्थित करता है ताकि फोन का प्रोसेसर विशेषज्ञों को कुशलतापूर्वक संभाल सके।
- प्रमाण: उन्होंने साबित किया कि यह हार्डवेयर पर काम करता है। iPhone 16 Pro पर, नए मॉडल ने पुराने डेंस मॉडल की तुलना में 3.4 गुना तेज़ टेक्स्ट जेनरेट किया, जबकि कम मेमोरी का उपयोग किया।
सारांश
MobileMoE यह सिद्ध करता है कि आपके फोन पर एक स्मार्ट AI होने के लिए आपको एक विशाल क्लाउड सर्वर की आवश्यकता नहीं है। एक विशेषज्ञों की टीम का उपयोग करके, न कि एक एकल जनरलिस्ट का, और टीम के आकार और प्रशिक्षण प्रक्रिया को सावधानीपूर्वक ट्यून करके, उन्होंने एक ऐसा AI बनाया है जो:
- वर्तमान फोन मॉडल्स से अधिक स्मार्ट है।
- तेज़ है (4 गुना तक की स्पीड वृद्धि)।
- कुशल है (यह आपके फोन की मेमोरी में फिट होता है और बैटरी बचाता है)।
यह पूरी तरह से आपके डिवाइस पर रहने वाले शक्तिशाली, निजी और इंस्टेंट AI असिस्टेंट के लिए नए दरवाजे खोलता है, जिसके लिए इंटरनेट से जुड़ने की आवश्यकता नहीं है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।