← नवीनतम पेपर
🤖 machine learning

WiSP: A Working-Set View of Mixture-of-Experts Serving on Extremely Low-Resource Hardware

यह शोधपत्र WiSP प्रस्तुत करता है, जो कम-संसाधन वाले हार्डवेयर पर Mixture-of-Experts मॉडल्स के लिए एक रूटिंग-अवेयर वर्किंग-सेट मैनेजमेंट सिस्टम है, जो अंडरलाइंग सर्विंग इंजन को संशोधित किए बिना विशेषज्ञ वेट्स (expert weights) को गतिशील रूप से पेज करता है और विशेषज्ञों एवं KV कैश के बीच VRAM आवंटन को अनुकूलित करके डिकोड थ्रूपुट में महत्वपूर्ण सुधार करता है।

मूल लेखक: Jiamu Zhang, Liang Wu, Mayank Darbari, Liangjie Hong

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiamu Zhang, Liang Wu, Mayank Darbari, Liangjie Hong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "WiSP: अत्यंत कम संसाधन वाले हार्डवेयर पर Mixture-of-Experts सर्विंग का वर्किंग-सेट व्यू" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी समस्या: "बहुत बड़ा जो फिट न हो सके" AI

कल्पना कीजिए कि आपके पास किताबों का एक विशाल पुस्तकालय (AI मॉडल) है जिसमें सैकड़ों अरबों पन्ने हैं। आप एक छोटी, पोर्टेबल ई-रीडर (एक मानक कंप्यूटर ग्राफिक्स कार्ड, या GPU) पर एक विशिष्ट कहानी पढ़ना चाहते हैं।

समस्या यह है कि ई-रीडर में पूरी लाइब्रेरी को एक साथ रखने के लिए पर्याप्त मेमोरी नहीं है। हालाँकि, आपके द्वारा पढ़े जाने वाले किसी भी एक वाक्य के लिए, आपको केवल कुछ विशिष्ट किताबों के कुछ विशिष्ट पन्नों की ही आवश्यकता होती है। बाकी लाइब्रेरी अप्रयुक्त पड़ी रहती है।

वर्तमान समाधान इसे हल करने के लिए पूरे पुस्तकालय को एक गोदाम (कंप्यूटर की मुख्य मेमोरी) में रखने और हर बार पन्ना पलटने पर उन पन्नों को लेने के लिए गोदाम की ओर दौड़ने की कोशिश करते हैं। यह धीमा है क्योंकि गोदाम तक की यात्रा (डेटा ट्रांसफर) में बहुत समय लगता है।

WiSP समाधान: "स्मार्ट लाइब्रेरियन"

लेखकों ने WiSP (वर्किंग-सेट पेजिंग) नामक एक सिस्टम बनाया है। हर एक पन्ने के लिए गोदाम की ओर दौड़ने के बजाय, WiSP एक स्मार्ट लाइब्रेरियन की तरह काम करता है जो देखता है कि आप क्या पढ़ रहे हैं और आपके डेस्क पर (GPU मेमोरी में) संभावित रूप से ज़रूरत पड़ने वाली किताबों का एक छोटा, क्यूरेटेड ढेर रखता है।

यह तीन सरल भागों में इस प्रकार काम करता है:

1. "स्मार्ट स्टैक" (एक्सपर्ट पेजिंग)

"Mixture-of-Experts" (MoE) वाले AI मॉडल में, मॉडल के पास कई अलग-अलग "एक्सपर्ट्स" (विशेषज्ञ/विशेष उप-मॉडल) होते हैं, लेकिन प्रत्येक शब्द को जेनरेट करने के लिए वह केवल कुछ ही उपयोग करता है।

  • पुराना तरीका: सिस्टम एक लेयर के लिए सभी एक्सपर्ट्स को लेता है, भले ही उसे केवल दो की आवश्यकता हो। यह जगह और समय दोनों बर्बाद करता है।
  • WiSP का तरीका: WiSP केवल उन्हीं विशिष्ट एक्सपर्ट्स को आपके डेस्क पर रखता है जिनका आप वास्तव में उपयोग कर रहे हैं। यदि आपको एक नए एक्सपर्ट की आवश्यकता होती है, तो यह स्टैक से एक को जल्दी से बाहर निकाल देता है और नया वाला गोदाम से ले आता है।
  • परिणाम: क्योंकि यह केवल उन छोटे टुकड़ों को ही हिलाता है जिनकी आपको वास्तव में आवश्यकता है, यह बहुत तेज़ है। शोध में पाया गया कि छोटे कंप्यूटरों पर, यह AI को पुराने तरीके की तुलना में 2 गुना तक तेज़ चलाता है।

2. "साझा डेस्क" (मेमोरी एलोकेशन)

आपका डेस्क (GPU मेमोरी) बहुत छोटा है। आपके पास दो चीजें हैं जो जगह के लिए लड़ रही हैं:

  1. एक्सपर्ट स्टैक: वे किताबें जिनकी आपको अभी ज़रूरत है।
  2. कॉन्टेक्स्ट नोट्स (KV कैश): कहानी के अब तक के हिस्से के बारे में आपने जो नोट्स लिखे हैं, ताकि आप भूल न जाएँ कि क्या हुआ था।

यदि आप अपने डेस्क को बहुत सारी किताबों से भर देते हैं, तो आपके पास अपने नोट्स के लिए जगह नहीं बचती। यदि आप बहुत सारे नोट्स से डेस्क भर देते हैं, तो आप किताबें लेने के लिए पर्याप्त जगह नहीं रख पाते।

  • WiSP समाधान (MV-WSA): यह आपके डेस्क स्पेस को विभाजित करने का निर्णय लेने वाला एक स्मार्ट नियम है। यह लगातार पूछता है: "क्या डेस्क पर अधिक किताबें रखना अधिक सहायक है, या अधिक नोट्स?"
  • यह विभाजन को गतिशील रूप से (dynamically) समायोजित करता है। यदि आप एक लंबी कहानी लिख रहे हैं, तो यह आपको नोट्स के लिए अधिक जगह देता है। यदि आप विषयों को तेज़ी से बदल रहे हैं, तो यह आपको किताबों के लिए अधिक जगह देता है। यह सुनिश्चित करता है कि आप दोनों में से किसी के लिए भी जगह खत्म न होने दें।

3. "क्रिस्टल बॉल" का मिथक (भविष्यवाणी ने मदद नहीं की)

शोधकर्ताओं ने सोचा: "क्या होगा यदि हम एक क्रिस्टल बॉल (AI भविष्यवाणी) का उपयोग करें जिससे यह अनुमान लगाया जा सके कि आपको अगली कौन सी किताब चाहिए होगी, और उसे आपके मांगने से पहले ही ले लिया जाए?"

  • आश्चर्य: उन्होंने पाया कि इस विशिष्ट सेटिंग में (एक समय में एक वाक्य पढ़ते समय), भविचारण (prediction) इसे तेज़ नहीं बनाता है।
  • क्यों? गोदाम और डेस्क के बीच का "रास्ता" (डेटा कनेक्शन) बहुत संकरा है। भले ही आप सटीक अनुमान लगा लें, ट्रक एक बार में बहुत कम सामान ही ले जा सकता है। बाधा सही किताब का अनुमान लगाना नहीं है; बाधा ट्रक की गति है।
  • वास्तविक मूल्य: "क्रिस्टल बॉल" अभी भी उपयोगी है, लेकिन गति के लिए नहीं। यह लाइब्रेरियन को यह जानने में मदद करता है कि विशेष रूप से आपके लिए स्टैक का आकार कितना होना चाहिए। यह सिस्टम को स्टैक को एकदम सही आकार तक सिकोड़ने की अनुमति देता है, जिससे आपके नोट्स के लिए अधिक डेस्क स्पेस खाली हो जाता है।

निचोड़ (The Bottom Line)

यह पेपर तर्क देता है कि बड़े AI मॉडल को छोटे कंप्यूटरों पर चलाना एक मेमोरी मैनेजमेंट की समस्या है, न कि केवल कंप्यूटिंग की समस्या।

  • WiSP एक उपकरण है जो एक स्मार्ट लाइब्रेरियन की तरह कार्य करता है, केवल आवश्यक किताबों को डेस्क पर रखता है और उन्हें कुशलतापूर्वक बदलता है।
  • यह AI मॉडल को स्वयं नहीं बदलता है; यह बस इसकी मेमोरी को बेहतर ढंग से प्रबंधित करता है।
  • यह AI को छोटे उपकरणों पर काफी तेज़ बनाता है क्योंकि यह अनावश्यक डेटा को हिलाने में समय बर्बाद करना बंद कर देता है।
  • यह हमें सिखाता है कि इस विशिष्ट परिदृश्य में, भविष्य बताने की कोशिश करने से कहीं अधिक महत्वपूर्ण अपने कार्यक्षेत्र (workspace) को कुशलतापूर्वक प्रबंधित करना है।

यह सिस्टम इतना अच्छा काम करता है कि यह बड़े AI मॉडल को एक सिंगल कंप्यूटर कार्ड पर भी चला सकता है जो पहले उन्हें संभाल ही नहीं सकता था, और ऐसा करते समय AI के उत्तरों की गुणवत्ता में कोई बदलाव नहीं आता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →