← नवीनतम पेपर
🤖 machine learning

Dense2MoE: Pushing the Pareto Frontier of On-Device LLMs via Unified Pruning and Upcycling

यह शोध पत्र Dense2MoE का प्रस्ताव करता है, जो एक नवीन ढांचा है जो डेंस (dense) LLMs को ऑन-डिवाइस-रेडी मिक्सचर ऑफ एक्सपर्ट्स (Mixture of Experts) मॉडल्स में कुशलतापूर्वक परिवर्तित करने के लिए लेयर प्रूनिंग (layer pruning) और अपसाइक्लिंग (upcycling) को एकीकृत करता है, जिससे स्क्रैच से प्रशिक्षण की अत्यधिक लागतों से बचते हुए सटीकता-विलंबता (accuracy-latency) पारेटो फ्रंटियर में महत्वपूर्ण सुधार होता है।

मूल लेखक: Fengfa Li, Hongjin Ji, Yifeng Ding, Lei Ren, Chen Wei

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fengfa Li, Hongjin Ji, Yifeng Ding, Lei Ren, Chen Wei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अत्यंत बुद्धिमान पुस्तकालय (एक लार्ज लैंग्वेज मॉडल) है जिसे आप अपनी जेब में रखना चाहते हैं। समस्या यह है कि यह पुस्तकालय इतना भारी है और इसे चलाने के लिए इतनी अधिक बिजली की आवश्यकता होती है कि यह आपके फोन की बैटरी तुरंत खत्म कर देता है और वास्तविक समय के कार्यों, जैसे कार चलाने या रोबोट को नियंत्रित करने के लिए बहुत धीमा है।

यह शोध पत्र Dense2MoE नामक एक नई विधि पेश करता है जो इस समस्या को हल करती है। इसे इन विशाल पुस्तकालयों के लिए एक "स्मार्ट रेनोवेशन" (सुधार कार्य) के रूप में समझें, जो इन्हें उतना ही बुद्धिमान रखते हुए इतना हल्का बनाता है कि इन्हें आसानी से ले जाया जा सके।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "ट्रैफिक जाम" बनाम "खाली कमरा"

वर्तमान AI मॉडल एक व्यस्त कार्यालय भवन की तरह हैं जहाँ प्रत्येक कर्मचारी (लेयर) को आने वाली हर डाक (डेटा) को प्रोसेस करना पड़ता है।

  • अवरोध (The Bottleneck): सबसे बड़ी देरी वास्तव में गणित करने में नहीं होती; बल्कि यह वह समय है जो स्टोरेज रूम (मेमोरी) से फाइलें लाने में लगता है। इसे "मेमोरी वॉल" कहा जाता है।
  • पुराने समाधान:
    • प्रूनिंग (कर्मचारियों को निकालना): कुछ विधियाँ स्थान बचाने के लिए पूरे कर्मचारियों (लेयर्स) को निकालने की कोशिश करती हैं। लेकिन यह अकाउंटिंग विभाग को पूरी तरह से निकालने जैसा है; इमारत हल्की तो हो जाएगी, लेकिन वह गणित करने में सक्षम नहीं रहेगी। AI मूर्ख हो जाएगा।
    • अपसाइक्लिंग (अधिक लोगों को काम पर रखना): अन्य विधियाँ कार्यालय को "मिक्सचर ऑफ एक्सपर्ट्स" (MoE) में बदलने की कोशिश करती हैं, जहाँ कई विशेषज्ञ होते हैं, लेकिन किसी भी कार्य के लिए केवल कुछ ही काम करते हैं। हालाँकि, यदि आप विशेषज्ञों को बनाने के लिए एक ही कर्मचारी की कॉपी-पेस्ट करते हैं, तो वे सभी एक ही तरह से सोचते हैं। उन्हें अलग होने के लिए सिखाने के लिए आपको महीनों तक रिट्रेनिंग करनी होगी, जो बहुत महंगा है।

2. समाधान: "स्मार्ट फ्यूजन" (Dense2MoE)

Dense2MoE एक चतुर रेनोवेशन योजना है जो दोनों दुनियाओं की सर्वश्रेष्ठ चीजों को जोड़ती है। यह लेयर-फ्यूजन अपसाइक्लिंग (LF-UC) नामक तकनीक का उपयोग करता है।

चरण 1: डुप्लिकेट्स को खोजें
सिस्टम पुस्तकालय को स्कैन करता है और उन लेयर्स को ढूंढता है जो लगभग एक ही काम कर रहे हैं। यह गलियारे में दो समान दिखने वाली फाइलिंग कैबिनेट खोजने जैसा है जिनमें बिल्कुल एक जैसे दस्तावेज़ रखे हों।

चरण 2: "ध्वस्तीकरण और पुन: उपयोग" रणनीति
इन डुप्लिकेट लेयर्स को केवल फेंक देने (जिससे जानकारी का नुकसान होगा) के बजाय, टीम कुछ चतुर करती है:

  • भारी दरवाजों को हटाना: वे इन डुप्लिकेट लेयर्स के "अटेंशन" (Attention) भागों को हटा देते हैं। ये भाग भारी, धीमे दरवाजों की तरह हैं जिन्हें खोलने और बंद करने में बहुत ऊर्जा लगती है (ये मेमोरी ट्रैफिक जाम का कारण बनते हैं)। इन्हें हटाने से प्रक्रिया नाटकीय रूप से तेज हो जाती है।
  • अलमारियों को बचाना: वे "MLP" भागों (ज्ञान रखने वाली अलमारियों) को रखते हैं। उन्हें फेंकने के बजाय, वे इन अलमारियों को लेते हैं और उन्हें विशेषज्ञ (Specialist Experts) में बदल देते हैं।

चरण 3: "स्मार्ट स्विच"
अब, हर डाक को हर शेल्फ से गुजरने के बजाय, एक स्मार्ट स्विच (रौटर) तय करता है कि किस शेल्फ का उपयोग करना है।

  • यदि डाक गणित के बारे में है, तो स्विच उसे "मैथ एक्सपर्ट" शेल्फ पर भेज देगा।
  • यदि यह कोडिंग के बारे में है, तो वह उसे "कोड एक्सपर्ट" शेल्फ पर भेजेगा।
  • अन्य शेल्फ बंद रहेंगे और कोई ऊर्जा खर्च नहीं करेंगे।

3. यह क्यों एक बड़ी बात है

शोध पत्र का दावा है कि यह विधि एक "पारेटो फ्रंटियर" (Pareto Frontier) बनाती है, जो एक फैंसी तरीका है यह कहने का कि यह उस "स्वीट स्पॉट" को प्राप्त करती है जहाँ आपको सबसे तेज़ गति मिलती है बिना बुद्धिमत्ता खोए।

  • यह तेज़ है: डुप्लिकेट लेयर्स से भारी "दरवाजों" (अटेंशन मॉड्यूल) को हटाकर, AI मेमोरी ट्रैफिक जाम में नहीं फंसता है। यह कार कंप्यूटर या फोन जैसे उपकरणों पर बहुत तेजी से चलता है।
  • यह बुद्धिमान है: क्योंकि उन्होंने हटाए गए लेयर्स के "शेल्फ" (ज्ञान) को बचाया और उन्हें विशेषज्ञों में बदल दिया, इसलिए AI अपनी दिमागी शक्ति नहीं खोता है। वास्तव में, क्योंकि ये विशेषज्ञ मूल रूप से अलग-अलग लेयर्स से आए थे, वे स्वाभाविक रूप से विविध हैं और उन्हें अलग होने के लिए महीनों की रिट्रेनिंग की आवश्यकता नहीं है।
  • यह सस्ता है: इसे सब कुछ सही ढंग से चलाने के लिए केवल थोड़ी सी अतिरिक्त ट्रेनिंग की आवश्यकता होती है (एक नया मॉडल बनाने की लागत के लगभग 1%)।

परिणाम

लेखकों ने विभिन्न आकार के AI मॉडल (0.5 बिलियन पैरामीटर से लेकर 7 बिलियन तक) पर इनका परीक्षण किया। उन्होंने पाया कि उनके "रेनोवेटेड" मॉडल:

  1. मूल भारी मॉडलों की तुलना में तेज़ थे।
  2. केवल "प्रून" किए गए (कर्मचारियों को निकाले गए) मॉडलों की तुलना में अधिक स्मार्ट थे।
  3. उन अन्य "MoE" मॉडलों की तुलना में अधिक कुशल थे जिन्हें भारी रिट्रेनिंग की आवश्यकता थी।

संक्षेप में, Dense2MoE एक धीमी, भारी ट्रक को लेने, अनावश्यक भारी कार्गो को हटाने और शेष कार्गो को किसी भी काम को संभालने के लिए विशेष, तेज़ डिलीवरी वैन के बेड़े में पुनर्गठित करने जैसा है। यह शक्तिशाली AI को सुपरकंप्यूटर की आवश्यकता के बिना कारों और रोबोट जैसे सामान्य उपकरणों पर चलाना संभव बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →