← नवीनतम पेपर
💬 NLP

WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning

यह शोध पत्र WIDE को प्रस्तुत करता है, जो पहला एंड-टू-एंड डिफरेंशिएबल फ्रेमवर्क है जो अटेंशन हेड्स और FFN चैनल्स के फाइन-ग्रेन्ड चयन की अनुमति देकर LLMs के लिए टोकन-लेवल डायनेमिक विड्थ प्रूनिंग को सक्षम बनाता है, जिसे उच्च सटीकता बनाए रखते हुए महत्वपूर्ण एंड-टू-एंड इन्फरेंस त्वरण प्राप्त करने के लिए एक विशेष कर्नेल को-डिज़ाइन के साथ जोड़ा गया है।

मूल लेखक: Haozhe Hu, Hao Wu, Peiran Yin, Chao Han, Yunpu Ma, Xiaoyu Shen

प्रकाशित 2026-07-31
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haozhe Hu, Hao Wu, Peiran Yin, Chao Han, Yunpu Ma, Xiaoyu Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत छोटे, बैटरी से चलने वाले उपकरण पर एक विशाल, अविश्वसनीय रूप से बुद्धिमान रोबोटिक मस्तिष्क चलाना चाह रहे हैं। यह रोबोटिक मस्तिष्क एक लार्ज लैंग्वेज मॉडल (LLM) है, जो प्रकार का आर्टिफिशियल इंटेलिजेंस है जो कहानियाँ लिख सकता है, गणित की समस्याओं को हल कर सकता है और इंसान की तरह चैट कर सकता है। लेकिन पेच यह है कि ये मस्तिष्क बहुत बड़े होते हैं। वे इतने बड़े और ऊर्जा के भूखे होते हैं कि उन्हें चलाने के लिए सुपर-कंप्यूटरों की आवश्यकता होती है, जिससे उन्हें आपके फोन या लैपटॉप पर उपयोग करना धीमा और महंगा हो जाता है।

इसे ठीक करने के लिए, वैज्ञानिक इन मस्तिष्कों को "प्रून" (छंटनी) करने की कोशिश कर रहे हैं। प्रूनिंग को एक विशाल, अनियंत्रित झाड़ी की छंटनी करने जैसा समझें। आप झाड़ी को छोटा और तेज़ बनाने के लिए उन शाखाओं को काट देते हैं जो ज्यादा काम नहीं कर रही हैं। लंबे समय तक, इसे करने का सबसे अच्छा तरीका था कि झाड़ी के पूरे हिस्सों को स्थायी रूप से काट दिया जाए, चाहे उस दिन पौधा कुछ भी कर रहा हो। लेकिन यह थोड़ा अनाड़ी तरीका है; कभी-कभी आप एक ऐसी शाखा काट देते हैं जिसकी किसी विशिष्ट कार्य के लिए वास्तव में आवश्यकता थी, जिससे रोबोट भूलक्कड़ हो जाता है। हाल ही में, अधिक स्मार्ट तरीके आविष्कार किए गए हैं जो रोबोट को यह तय करने की अनुमति देते हैं कि वह सोचते समय किन हिस्सों का उपयोग करे। हालाँकि, ये स्मार्ट तरीके अभी भी थोड़े कच्चे थे—वे या तो एक पूरा हिस्सा उपयोग करते थे या उसे पूरी तरह से छोड़ देते थे, जैसे यह तय करना कि पूरे कमरे का उपयोग करना है या पूरे घर को खाली छोड़ देना है, बजाय इसके कि कुछ विशिष्ट लाइटों को चालू किया जाए।

यह पेपर WIDE (विड्थ-बेस्ड इन्फरेंस विद डायनेमिक एक्जीक्यूशन) नामक एक नई प्रणाली पेश करता है। यह रोबोट को उसके मस्तिष्क के हर एक बल्ब के लिए एक अत्यंत सटीक डिमर स्विच देने जैसा है। पूरे कमरों को चालू या बंद करने के बजाय, WIDE रोबोट को यह गतिशील रूप से तय करने की अनुमति देता है कि हर एक शब्द (टोकन) को प्रोसेस करते समय, न्यूरॉन्स के कौन से छोटे समूह सक्रिय होने चाहिए और किन्हें अंधेरे में रहना चाहिए। शोधकर्ताओं ने एक विशेष "ट्रैफिक कंट्रोलर" (राउटर) बनाया है जो इन क्षणिक निर्णयों को लेने में सक्षम है। उन्होंने एक नया तरीका भी डिज़ाइन किया है जिससे कंप्यूटर का हार्डवेयर बिना भ्रमित हुए या धीमा हुए इन निर्णयों को संभाल सके। परिणाम यह है कि रोबोट पहले जितना ही स्मार्ट रहता है, लेकिन यह बहुत तेज़ चलता है और कम ऊर्जा का उपयोग करता है, भले ही उन्होंने इसके मस्तिष्क की आधी क्षमता को काट दिया हो।

समस्या: "सब-या-कुछ-नहीं" का जाल

एक शेफ की कल्पना करें जो एक विशाल रसोई चला रहा है। आपके पास सैकड़ों शेफ (न्यूरॉन्स) हैं जो मिलकर भोजन पकाने के लिए काम कर रहे हैं। पुराने दिनों में, यदि आप समय बचाना चाहते थे, तो आप स्थायी रूप से आधे रसोई कर्मचारियों को निकाल देते थे। यह तब तक ठीक काम करता है जब आप हमेशा एक ही साधारण व्यंजन बना रहे हों, लेकिन यदि आपको अचानक एक जटिल केक बनाना पड़े, तो हो सकता है कि आपने उसी एकमात्र बेकर को निकाल दिया हो जिसकी आपको आवश्यकता थी। यही स्टैटिक प्रूनिंग के साथ होता है: मॉडल को एक बार और हमेशा के लिए ट्रिम कर दिया जाता है, चाहे वह किसी भी प्रश्न का उत्तर दे रहा हो।

फिर डायनेमिक प्रूनिंग आई, जो एक मैनेजर को नियुक्त करने जैसा था जो शेफ को बता सकता था, "हे, इस विशिष्ट ऑर्डर के लिए, केवल ग्रिल स्टेशन की आवश्यकता है; बेकरी ब्रेक ले सकती है।" यह बेहतर था, लेकिन मैनेजर अभी भी थोड़ा अनाड़ी था। वे कहेंगे, "पूरी बेकरी को छोड़ दें," भले ही बेकरी को दस में से केवल दो ओवन की आवश्यकता हो। यह रसोई के बड़े हिस्सों के लिए एक "सब-या-कुछ-नहीं" का निर्णय था।

समस्या यह है कि आधुनिक AI मॉडल इतने जटिल हैं कि एक पूरा हिस्सा छोड़ देने से अक्सर उपयोगी जानकारी नष्ट हो जाती है, जिससे उत्तर की गुणवत्ता खराब हो जाती है। इसके अलावा, यदि मैनेजर हर सेकंड शेड्यूल बदलता रहता है, तो रसोई के कर्मचारी भ्रमित हो जाते हैं, और वास्तविक खाना पकाने की गति बहुत तेज़ नहीं होती क्योंकि स्विचिंग के ओवरहेड में बहुत समय बर्बाद होता है।

समाधान: WIDE का "डिमर स्विच"

इस पेपर के लेखकों ने, जो निंगबो इंस्टीट्यूट ऑफ डिजिटल ट्विन और एलएमयू म्यूनिख में कार्यरत हैं, WIDE बनाया है। पूरे विभागों को निकालने या पूरे कमरों को छोड़ने के बजाय, WIDE मॉडल को यह तय करने देता है कि प्रत्येक शब्द (टोकन) को प्रोसेस करते समय, न्यूरॉन्स के कौन से छोटे समूहों को सक्रिय किया जाना चाहिए।

मॉडल के मस्तिष्क को प्रकाश के स्विचों के एक विशाल ग्रिड के रूप में सोचें।

  • पुराने डायनेमिक तरीके: "घर के पूरे बाएं हिस्से को बंद कर दें।"
  • WIDE: "इस विशिष्ट शब्द के लिए, रसोई में लाइट चालू करें, लेकिन केवल उन्हीं को जो चूल्हे और फ्रिज के ऊपर हैं। बाकी रसोई को अंधेरे में रहने दें।"

WIDE यह करने के लिए मॉडल के प्रत्येक स्तर से जुड़ा एक हल्का "राउटर" (एक छोटा निर्णय लेने वाला) उपयोग करता है। यह राउटर वर्तमान शब्द को देखता है और पूछता है: "क्या मुझे इस अटेंशन हेड्स के समूह की आवश्यकता है (वे हिस्से जो अन्य शब्दों को देखते हैं)?" और "क्या मुझे इस FFN चैनल्स के समूह की आवश्यकता है (वे हिस्से जो अर्थ को प्रोसेस करते हैं)?" यह एक बाइनरी विकल्प बनाता है: इस समूह का उपयोग करें या इसे छोड़ दें।

महत्वपूर्ण बात यह है कि WIDE केवल निर्णय लेने तक ही सीमित नहीं है; यह हार्डवेयर की समस्या को भी हल करता है। आमतौर पर, यदि आप कंप्यूटर को गणना के यादृच्छिक (random) हिस्सों को छोड़ने के लिए कहते हैं, तो कंप्यूटर डेटा कहाँ है यह समझने में फंस जाता है। WIDE मास्क रीऑर्डरिंग (mask reordering) नामक एक चतुर ट्रिक का उपयोग करता है। कल्पना करें कि आपके पास मेल का एक बिखरा हुआ ढेर है जहाँ कुछ पत्र वितरण के लिए हैं और कुछ कचरा हैं। कचरे को फेंकने और फिर मेल को छाँटने की कोशिश करने के बजाय, WIDE पहले ढेर को इस तरह व्यवस्थित करता है कि सभी "रखने योग्य" पत्र एक व्यवस्थित ब्लॉक के रूप में ऊपर आ जाएं, और सभी "कचरा" पत्र नीचे चले जाएं। यह कंप्यूटर को बिना रुके बहुत कुशलता से "रखने योग्य" ब्लॉक को प्रोसेस करने की अनुमति देता है।

उन्होंने क्या पाया: गति और बुद्धिमत्ता

शोधकर्ताओं ने Llama 3.1 (8 बिलियन पैरामीटर्स) और Llama 3.2 (3 बिलियन पैरामीटर्स) जैसे लोकप्रिय AI मॉडलों पर WIDE का परीक्षण किया। उन्होंने स्टेटिक और डायनेमिक प्रूनिंग दोनों के लिए मौजूदा सर्वोत्तम तरीकों के साथ इसकी तुलना की।

यहाँ आंकड़े क्या बताते हैं:

  • स्मार्ट प्रूनिंग: जब उन्होंने मॉडल की 50% क्षमता को काट दिया (एक बहुत ही आक्रामक ट्रिम), तो WIDE ने अन्य सभी की तुलना में मॉडल की बुद्धिमत्ता को बहुत बेहतर बनाए रखा। उदाहरण के लिए, Llama 3.1 मॉडल पर, WIDE ने प्रूनिंग के बाद मूल सटीकता का 86.42% बरकरार रखा, जबकि अगला सबसे अच्छा डायनेमिक तरीका (SkipGPT) केवल 59.42% ही रख पाया। बिना किसी अतिरिक्त फाइन-ट्यूनिंग के भी, WIDE पहले से ही सर्वश्रेष्ठ स्टैटिक तरीकों को पछाड़ रहा था।
  • वास्तविक दुनिया की गति: पेपर में यह भी मापा गया कि मॉडल वास्तव में कितनी तेज़ी से चला। "प्रीफिल" चरण (एक लंबा प्रॉम्प्ट पढ़ने) के लिए, WIDE मूल मॉडल की तुलना में 1.68 गुना तेज़ था। "डिकोड" चरण (उत्तर को शब्द दर शब्द जेनरेट करना) के लिए, यह 1.55 गुना तेज़ था।
  • कर्नेल-लेवल मैजिक: यदि आप केवल गणितीय गणनाओं को देखें (अन्य ओवरहेड्स को छोड़कर), तो स्पीडअप और भी नाटकीय था, जो प्रीफिल के लिए 1.98x और डिकोडिंग के लिए 4.95x तक पहुँच गया। यह सुझाव देता है कि बाधा (bottleneck) पिछले तरीकों द्वारा "स्किपिंग" को संभालने के अक्षम तरीके में थी, और WIDE के नए हार्डवेयर डिज़ाइन ने इसे ठीक कर दिया।

लेखकों ने यह भी पाया कि मॉडल बहुत रणनीतिक होना सीख गया। इसने केवल रैंडम हिस्से नहीं छोड़े; इसने सीखा कि "उबाऊ" शब्दों (जैसे "the" या "a") को कैसे छोड़ना है और "महत्वपूर्ण" शब्दों (जैसे "running" या "track") को कैसे रखना है। एक परीक्षण में, मॉडल ने 66% अटेंशन कार्य को छोड़ दिया लेकिन केवल 28% प्रोसेसिंग कार्य को, जिससे पता चला कि वह जानता था कि ऊर्जा कहाँ बचानी है।

निष्कर्ष

WIDE यह सुझाव देता है कि कुशल AI का भविष्य केवल मॉडल को छोटा करने के बारे में नहीं है, बल्कि इस बारे में है कि मॉडल अपने शेष हिस्सों का उपयोग कैसे करता है। "पूरा कमरा छोड़ दें" से "विशिष्ट लाइटों को डिम करें" की ओर बढ़कर, और इन डिमर्स को कुशलतापूर्वक संभालने के लिए रसोई को फिर से डिज़ाइन करके, लेखकों ने एक ऐसा ढांचा तैयार किया है जो बड़े AI मॉडलों को उनकी बुद्धिमत्ता खोए बिना काफी तेज़ और कुशल बनाता है।

हालाँकि परिणाम आशाजनक हैं, पेपर नोट करता है कि यह GPU हार्डवेयर (कंप्यूटर में लगे चिप्स) के लिए एक विशिष्ट समाधान है और यह एक दो-चरणीय प्रशिक्षण प्रक्रिया पर निर्भर करता है जहाँ मॉडल पहले निर्णय लेना सीखता है और फिर किसी भी खोई हुई सटीकता को वापस पाने के लिए एक त्वरित ट्यून-अप प्राप्त करता है। यह शक्तिशाली AI को रोजमर्रा के उपकरणों तक पहुँचाने की दिशा में एक महत्वपूर्ण कदम है, जो यह साबित करता है कि बुद्धिमान होने के लिए आपको एक विशाल मस्तिष्क की आवश्यकता नहीं है—आपको बस यह जानने की आवश्यकता है कि सही समय पर अपने मस्तिष्क के किन हिस्सों का उपयोग कैसे करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →