← नवीनतम पेपर
🤖 AI

SpecPrefetch: Parameter-Efficient Expert Prefetching for Sparse MoE Foundation Models

SpecPrefict एक पैरामीटर-कुशल फ्रेमवर्क है जो एक हल्के एडॉप्टर और एक विंडो-अवेयर शेड्यूलर का उपयोग करके एक्सपर्ट प्रीफेचिंग को नेटिव रूटिंग से अलग करता है, जिससे मॉडल आउटपुट को बदले बिना मेमोरी-सीमित उपकरणों पर स्पार्स मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल्स के लिए एक्सपर्ट-लोडिंग लेटेंसी को काफी कम किया जाता है और इन्फरेंस थ्रूपुट में सुधार किया जाता है।

मूल लेखक: Jinwei Kong, Runqi Meng, Fanyi Wang, Wentao Qiu, Haotian Hu, Yongjian Zhou, Zhenhua Ge

प्रकाशित 2026-07-29
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jinwei Kong, Runqi Meng, Fanyi Wang, Wentao Qiu, Haotian Hu, Yongjian Zhou, Zhenhua Ge

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक परम पुस्तकालय बनाने की कोशिश कर रहे हैं, लेकिन आपके पास केवल एक छोटे से कमरे में एक बहुत छोटी डेस्क है। आप लाखों किताबें (एक सुपर-स्मार्ट कंप्यूटर का "ज्ञान") रखना चाहते हैं, लेकिन आपकी डेस्क एक बार में केवल कुछ ही किताबें रख सकती है। यह फोन या लैपटॉप जैसे उपकरणों पर विशाल आर्टिफिशियल इंटेलिजेंस (AI) मॉडल चलाने का दैनिक संघर्ष है। ये मॉडल उन विशाल विश्वकोशों की तरह हैं जिन्होंने लिखना, चित्र बनाना और गणित की समस्याओं को हल करना सीखा है, लेकिन वे इतने बड़े हैं कि वे कंप्यूटर की मेमोरी में फिट नहीं होते। उन्हें काम करने के लिए, वैज्ञानिक एक चतुर तकनीक का उपयोग करते हैं जिसे "मिक्सचर ऑफ एक्सपर्ट्स" (MoE) कहा जाता है। इसे एक ऐसे पुस्तकालय के रूप में सोचें जहाँ, हर सवाल के लिए हर एक किताब पढ़ने के बजाय, लाइब्रेरियन ("राउटर") केवल उन विशिष्ट किताबों (विशेषज्ञों/एक्सपर्ट्स) को निकालता है जो वर्तमान वाक्य के लिए प्रासंगिक हैं। यह कुशल है! लेकिन यहाँ एक पेंच है: भले ही लाइब्रेरियन केवल कुछ ही किताबों का उपयोग करता है, फिर भी सभी किताबों को कहीं न कहीं स्टोर करना पड़ता है। यदि किताबें इतनी बड़ी हैं कि डेस्क पर फिट नहीं होतीं, तो उन्हें हॉलवे में एक शेल्फ (हार्ड ड्राइव या होस्ट मेमोरी) पर रखना पड़ता है। हर बार जब लाइब्रेरियन को एक नई किताब की आवश्यकता होती है, तो उसे हॉलवे में दौड़ना पड़ता है, उसे उठाना पड़ता है और वापस लाना पड़ता है। यह बार-बार दौड़ना धीमा है, और यह लाइब्रेरियन को किताबें लाने के दौरान सोचने से रोक देता है। बड़ा सवाल कंप्यूटर वैज्ञानिकों के लिए यह है: हम सही किताबों को डेस्क पर लाइब्रेरियन के मांगने से पहले ही कैसे ला सकते हैं, बिना लाइब्रेरियन की मूल योजना को बिगाड़े?

यहाँ SpecPrefetch आता है, जो शोधकर्ता जिन्वेई कोंग और उनकी टीम का एक नया विचार है जो इस "बार-बार दौड़ने" वाली समस्या को हल करने की कोशिश करता है। उन्होंने महसूस किया कि लाइब्रेरियन (AI) वास्तव में काफी अनुमान लगाने योग्य है। लाइब्रेरियन द्वारा वर्तमान में पढ़े जा रहे वाक्य को देखकर ही, आप काफी सटीक अंदाज़ा लगा सकते हैं कि उन्हें अगले वाक्य के लिए किन किताबों की आवश्यकता होगी। टीम ने एक छोटा, अत्यंत हल्का "सहायक" (एक पैरामीटर-एफिशिएंट एडॉप्टर) बनाया है जो एक भविष्य बताने वाले साथी (साइकिक साइडकिक) की तरह काम करता है। यह सहायक लाइब्रेरियन के काम करने का अवलोकन करता है और फुसफुसाता है, "हे, अगले चरण में, आपको शायद किताब 4 और किताब 9 की आवश्यकता होगी!" इसके बाद, वह एक धावक को उन विशिष्ट किताबों को हॉलवे से लाने के लिए भेजता है, जबकि लाइब्रेरियन अभी भी वर्तमान वाक्य को पूरा करने में व्यस्त है। यही जादू है: किताबें ठीक उसी समय डेस्क पर पहुँच जाती हैं जब उनकी ज़रूरत होती है, जिससे यात्रा का समय छिप जाता है।

महत्वपूर्ण बात यह है कि यह सहायक काम को संभाल नहीं लेता। मूल लाइब्रेरियन ही अभी भी यह अंतिम निर्णय लेता है कि वास्तव में कौन सी किताबें पढ़नी हैं। यदि सहायक गलत अनुमान लगाता है और गलत किताब ले आता है, तो वह बस बिना उपयोग के वहीं पड़ी रहेगी; यह उस कहानी को नहीं बदलता जो AI सुना रहा है। इसका मतलब है कि सिस्टम सुरक्षित और सटीक रहता है, लेकिन बहुत तेज़ भी होता है। शोधकर्ताओं ने दो अलग-अलग प्रकार के स्मार्ट AI मॉडल (Qwen3-VL और DeepSeek-VL2) पर गणित की समस्याएं हल करने, कोड लिखने और छवियों को समझने जैसे विभिन्न कार्यों का परीक्षण किया। उन्होंने पाया कि उनका "भविष्य बताने वाला सहायक" सही किताबों का अनुमान लगाने में अविश्वसनीय रूप से अच्छा था, अक्सर 10 में से 9 बार सही अनुमान लगाता था, और उसने यह सब अन्य तरीकों की तुलना में बहुत कम कंप्यूटर संसाधनों का उपयोग करके किया जो पूरी लाइब्रेरी को शून्य से सीखने की कोशिश करते हैं।

जब उन्होंने एक वास्तविक मोबाइल फोन (एक स्नैपड्रैगन 8 एलीट डिवाइस) पर इसका परीक्षण किया, तो परिणाम और भी रोमांचक थे। उन स्थितियों में जहाँ फोन को अपने स्टोरेज से डेटा लोड करने के लिए प्रतीक्षा करनी पड़ती थी, SpecPrefetch ने AI को 20% तक तेज़ बना दिया। यह एक ऐसे लाइब्रेरियन को बदलने जैसा है जिसे हर एक पन्ने के लिए हॉलवे की ओर दौड़ना पड़ता है, एक ऐसे लाइब्रेरियन में जो ज़रूरत पड़ने से ठीक पहले किताबों की कन्वेयर बेल्ट का उपयोग करता है। टीम ने दिखाया कि भविष्य की भविष्यवाणी करने के लिए आपको किसी विशाल, महंगे दिमाग की आवश्यकता नहीं है; एक छोटा, स्मार्ट संकेत ही इन विशाल AI मॉडलों को हमारे जेब में रखे उपकरणों पर सुचारू रूप से चलाने के लिए पर्याप्त है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →