Sticky Routing: Training MoE Models for Memory-Efficient Inference
यह शोधपत्र StickyMoE का प्रस्ताव करता है, जो एक डिफरेंशियल योग्य (differentiable) रूटिंग कंसिस्टेंसी लॉस है जो Mixture-of-Experts मॉडल्स को अर्थपूर्ण रूप से सुसंगत टोकन स्पैन (token spans) में विशेषज्ञ असाइनमेंट बनाए रखने के लिए प्रशिक्षित करता है, जिससे एज डिवाइसेस पर मेमोरी-गहन वेट स्वैपिंग (weight swapping) को न्यूनतम परप्लेक्सिटी डिग्रेडेशन के साथ काफी कम किया जा सकता है।