RAP: Runtime Adaptive Pruning for LLM Inference
यह शोध पत्र RAP को प्रस्तुत करता है, जो एक सुदृढीकरण लर्निंग (reinforcement learning) द्वारा संचालित फ्रेमवर्क है जो बदलते मेमोरी बजट और वर्कलोड स्थितियों के तहत उपयोगिता को अधिकतम करने के लिए मॉडल वेट्स और KV-कैशे रिटेंशन को संयुक्त रूप से अनुकूलित करके, वास्तविक समय में LLM इन्फरेंस प्रूनिंग रणनीतियों को गतिशील रूप से अनुकूलित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से बुद्धिमान पुस्तकालय सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो कहानियाँ लिख सकता है, सवालों के जवाब दे सकता है और समस्याओं को हल कर सकता है। लेकिन एक पेंच है: यह सहायक इतना विशाल है कि इसे चलाने के लिए केवल अलमारियों (मेमोरी) से भरा एक गोदाम और कामगारों की एक बड़ी टीम (कंप्यूटिंग पावर) की आवश्यकता होती है।
यदि आप इस सहायक को किसी छोटे डिवाइस, जैसे कि स्मार्टफोन या लैपटॉप पर चलाने की कोशिश करते हैं, तो यह अक्सर क्रैश हो जाता है क्योंकि इसके पास जगह खत्म हो जाती है या यह बहुत धीमा हो जाता है।
समस्या: "एक ही आकार सबके लिए" (One-Size-Fits-All) वाली गलती
वर्तमान में, अधिकांश लोग इस विशाल सहायक को स्थायी रूप से इसके हिस्से काटकर छोटा करने की कोशिश करते हैं, जैसे कि अलमारियों को हटा देना या निश्चित नियम के आधार पर कर्मचारियों को निकाल देना। वे कहते हैं, "ठीक है, हम हमेशा लाइब्रेरी का 30% हिस्सा काट देंगे।"
लेख का तर्क है कि यह एक बुरा विचार है क्योंकि लाइब्रेरी की ज़रूरतें हर दिन बदलती हैं।
- परिदृश्य A: एक उपयोगकर्ता एक बहुत छोटा प्रश्न पूछता है। बातचीत को याद रखने के लिए सहायक को केवल बहुत कम जगह की आवश्यकता होती है।
- परिदृश्य B: एक उपयोगकर्ता किसी को 10,000 शब्दों का उपन्यास लिखने के लिए कहता है। सहायक को कहानी को ट्रैक करने के लिए "स्क्रैचपैड" (जिसे KV कैश कहा जाता है) को संभालने के लिए अचानक बहुत अधिक स्थान की आवश्यकता होती है।
यदि आप फोन में फिट होने के लिए सहायक के दिमाग का 30% हिस्सा स्थायी रूप से काट देते हैं, तो आप लंबे सवाल पूछने पर उसे खराब कर सकते हैं। यदि आप कुछ भी नहीं काटते हैं, तो वह फोन में बिल्कुल भी फिट नहीं होगा। मौजूदा तरीके एक कठोर कवच की तरह हैं: या तो वे पहनने के लिए बहुत भारी हैं, या यदि आप उन्हें हल्का बनाने के लिए काटते हैं, तो आप असुरक्षित रह जाते हैं।
समाधान: RAP (रनटाइम अडैप्टिव प्रूनिंग)
लेखक RAP का प्रस्ताव करते हैं, जो ऐसा है जैसे सहायक को एक स्मार्ट, लचीला सूट देना जो वास्तविक समय में आकार बदल लेता है।
इसे एक बार में काटने के बजाय, RAP एक रीइन्फोर्समेंट लर्निंग (RL) एजेंट का उपयोग करता है। इस एजेंट को एक अत्यधिक कुशल ट्रैफिक कंट्रोलर या स्टेज मैनेजर के रूप में सोचें।
- यह भीड़ पर नज़र रखता है: सहायक काम शुरू करने से पहले, एजेंट विशिष्ट अनुरोध को देखता है। क्या यह एक छोटा प्रश्न है? एक लंबी कहानी? क्या फोन की मेमोरी फुल है क्योंकि कोई अन्य ऐप चल रहा है?
- यह तुरंत निर्णय लेता है: जो कुछ भी वह देखता है, उसके आधार पर, एजेंट तय करता है कि अभी के लिए अस्थायी रूप से किसे छिपाना है।
- यदि अनुरोध छोटा है और मेमोरी कम है, तो यह जगह बचाने के लिए कुछ भारी "सोचने वाले" हिस्सों (FFN लेयर्स) को छिपा सकता है।
- यदि अनुरोध लंबा है और मेमोरी फुल है, तो यह "अटेंशन" वाले हिस्सों (MHA लेयर्स) को छिपा सकता है जो लंबी कहानी को ट्रैक करने के लिए आवश्यक हैं।
- यह सबसे अच्छे हिस्सों को सुरक्षित रखता है: एजेंट जानता है कि दिमाग के सभी हिस्से समान नहीं होते। कुछ लेयर्स कुछ कार्यों के लिए अधिक महत्वपूर्ण होती हैं। यह यह पता लगाने के लिए कि कौन से हिस्सों को बिना उत्तर खराब किए सुरक्षित रूप से हटाया जा सकता है, एक विशेष "महत्व स्कैनर" (Greedy Sequential Importance) का उपयोग करता है।
यह कैसे काम करता है (उपमा)
कल्पना कीजिए कि आप यात्रा के लिए एक सूटकेस पैक कर रहे हैं, लेकिन आपको अभी तक मौसम का पता नहीं है।
- पुराना तरीका: आप हमेशा अपना भारी विंटर कोट और अपने स्विमिंग ट्रंक्स घर पर ही छोड़ देते हैं। यदि बारिश होती है, तो आप भीग जाते हैं। यदि धूप निकलती है, तो आपके पास स्विमवियर भी नहीं होता।
- RAP का तरीका: आपके पास एक स्मार्ट रोबोट सहायक है।
- आप उसे बताते हैं, "मेरे पास एक छोटा सूटकेस है (मेमोरी लिमिट) और मैं एक समुद्र तट (लंबी बातचीत) पर जा रहा हूँ।"
- रोबोट तुरंत आपके भारी कोट को हल्के टी-शर्ट से बदल देता है और स्विम ट्रंक्स को रखता है।
- आप उसे बताते हैं, "मेरे पास एक छोटा सूटकेस है और मैं एक पहाड़ (छोटी बातचीत) पर जा रहा हूँ।"
- रोबोट स्विम ट्रंक्स को गर्म टोपी से बदल देता है।
रोबोट अनुभव से सीखता है (Reinforcement Learning) ताकि वह हर बार सही बदलाव कर सके, यह सुनिश्चित करते हुए कि आप सूटकेस में फिट हों और आपके पास वही सब कुछ हो जिसकी आपको उस विशिष्ट यात्रा के लिए आवश्यकता है।
उन्होंने क्या पाया
पेपर ने कई लोकप्रिय AI मॉडल्स (जैसे Llama और Qwen) पर इस "स्मार्ट रोबोट" का परीक्षण किया।
- बेहतर परिणाम: जब मेमोरी कम थी, तब RAP ने पुराने "फिक्स्ड कटिंग" तरीकों की तुलना में AI को बहुत बेहतर तरीके से काम करने दिया। यह क्रैश नहीं हुआ, और उत्तर भी समझदारी भरे थे।
- लचीलापन: इसने बिना किसी मानवीय ट्यूनिंग के विभिन्न प्रकार के अनुरोधों (छोटे बनाम लंबे) को संभाला।
- गति: निर्णय लेने वाला "रोबोट" इतना तेज़ और छोटा था कि उसने प्रक्रिया को धीमा नहीं किया। इसने बातचीत में लगभग कोई अतिरिक्त समय नहीं जोड़ा।
निष्कर्ष
RAP छोटे उपकरणों पर बड़े AI मॉडल चलाने का एक नया तरीका है। AI के हिस्सों को स्थायी रूप से काटने के बजाय, यह ऑन-द-फ्लाई (चलते समय) AI को गतिशील रूप से नया आकार देता है, केवल उन हिस्सों को रखता है जो विशिष्ट कार्य और उपलब्ध स्थान के लिए आवश्यक हैं। यह एक कठोर, भारी सूट पहनने और एक स्मार्ट, स्ट्रेची सूट पहनने के बीच का अंतर है जो आपके दिन के कामों के अनुसार खुद को ढाल लेता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।