Dense2MoE: Pushing the Pareto Frontier of On-Device LLMs via Unified Pruning and Upcycling
यह शोध पत्र Dense2MoE का प्रस्ताव करता है, जो एक नवीन ढांचा है जो डेंस (dense) LLMs को ऑन-डिवाइस-रेडी मिक्सचर ऑफ एक्सपर्ट्स (Mixture of Experts) मॉडल्स में कुशलतापूर्वक परिवर्तित करने के लिए लेयर प्रूनिंग (layer pruning) और अपसाइक्लिंग (upcycling) को एकीकृत करता है, जिससे स्क्रैच से प्रशिक्षण की अत्यधिक लागतों से बचते हुए सटीकता-विलंबता (accuracy-latency) पारेटो फ्रंटियर में महत्वपूर्ण सुधार होता है।