F-WANDA: Fisher-Reweighted Post-Training Pruning for Sustainable Deployment of Large Language Models
F-WANDA एक ऊर्जा-कुशल, वन-शॉट पोस्ट-ट्रेनिंग प्रूनिंग विधि है जो एम्पेरिकल फिशर इंफॉर्मेशन के आधार पर न्यूरॉन रिटेंशन बजट को पुनर्वितरित करके WANDA में सुधार करती है, जिससे SPARSEGPT की तुलना में काफी कम कम्प्यूटेशनल लागत के साथ बेहतर लैंग्वेज मॉडल प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से बुद्धिमान रोबोट है जो कहानियाँ लिख सकता है, गणित की समस्याओं को हल कर सकता है और मनुष्यों की तरह बातचीत कर सकता है। यह रोबोट एक "लार्ज लैंग्वेज मॉडल" (LLM) है। लेकिन एक पेंच है: यह रोबोट बहुत बड़ा है। इसे चलाने के लिए विशाल कंप्यूटरों और बहुत अधिक बिजली की आवश्यकता होती है, ठीक वैसे ही जैसे एक शहर को चलाने के लिए एक ही बैटरी का उपयोग करने की कोशिश करना। वैज्ञानिक हमेशा इन रोबकों को छोटा करने के तरीके खोजते रहते हैं ताकि वे अपनी बुद्धिमत्ता खोए बिना छोटे उपकरणों पर चल सकें।
इन्हें छोटा करने का एक लोकप्रिय तरीका है जिसे "प्रूनिंग" (Pruning) कहा जाता है। प्रूनिंग को ऐसे समझें जैसे रोबोट का मस्तिष्क न्यूरॉन्स के बीच कनेक्शन का एक विशाल पुस्तकालय हो। प्रूनिंग उस पुस्तकालय में जाने और उन किताबों को फेंक देने जैसा है जो कम महत्वपूर्ण लगती हैं। लक्ष्य पुस्तकालय को इतना छोटा रखना है कि वह एक बैकपैक में फिट हो सके, लेकिन फिर भी सवाल पूछने के लिए पर्याप्त स्मार्ट बना रहे। हालाँकि, इसमें एक पेचीदा संतुलन है: यदि आप गलती से बहुत अधिक "महत्वपूर्ण" किताबें फेंक देते हैं, तो रोबोट गलतियाँ करने लगता है या रोबोटिक लगने लगता है। यदि आप इस बात में बहुत अधिक सावधान रहने की कोशिश करते हैं कि किन किताबों को रखना है, तो उन्हें छाँटने की प्रक्रिया में बहुत समय लग जाता है और आपकी सारी ऊर्जा खर्च हो जाती है। यह शोध पत्र ठीक इसी समस्या पर काम करता है: कैसे रोबोट की प्रतिभा को खोए बिना, किताबों को जल्दी और सस्ते में छाँटा जाए।
समस्या: "एक ही आकार सबके लिए" वाली गलती
शोधकर्ताओं ने एक लोकप्रिय विधि से शुरुआत की जिसे WANDA कहा जाता है। कल्पना कीजिए कि WANDA एक लाइब्रेरियन है जो यह तय करती है कि कौन सी किताबें फेंक दी जानी चाहिए। WANDA दो चीजों को देखती है: एक किताब कितनी "तेज़" है (उसका वेट/भार) और लोग उसे कितनी बार पढ़ते हैं (इनपुट एक्टिवेशन)। यदि कोई किताब शांत है और शायद ही कभी पढ़ी जाती है, तो Wकी WANDA उसे फेंक देती है।
समस्या यह है कि WANDA एक समान दृष्टिकोण अपनाती है। यह पुस्तकालय के हर शेल्फ (अलमारी) के साथ बिल्कुल एक जैसा व्यवहार करती है। वह निर्णय लेती है, "ठीक है, मैं हर शेल्फ से 50% किताबें फेंक दूँगी।" लेकिन समस्या यह है: कुछ शेल्फ रोबोट के सबसे महत्वपूर्ण तथ्यों (जैसे "पेरिस फ्रांस की राजधानी है") से भरे होते हैं, जबकि अन्य शेल्फ उबाऊ और दोहराव वाली चीजों से भरे होते हैं। केवल एक शेल्फ होने के कारण "पेरिस" वाले शेल्फ से 50% किताबें फेंक देने से, WANDA अनजाने में रोबोट का ज्ञान मिटा देती है।
एक अन्य विधि, जिसे SPARSEGPT कहा जाता है, बहुत अधिक सावधान रहने की कोशिश करती है। यह हर एक किताब को देखती है, गणना करती है कि यदि उसे हटा दिया गया तो रोबोट के मस्तिष्क को कितना दर्द होगा, और फिर शेष किताबों को ठीक करने के लिए उन्हें सावधानीपूर्वक संपादित करती है। यह रोबोट को स्मार्ट बनाए रखने के लिए बहुत अच्छा काम करता है, लेकिन यह पुस्तकालय को छाँटने के लिए पीएचडी विशेषज्ञों की एक टीम को काम पर रखने जैसा है। इसमें बहुत अधिक समय और ऊर्जा लगती है—इतनी कि अक्सर यह करना सार्थक नहीं होता।
समाधान: F-WANDA (स्मार्ट लाइब्रेरियन)
इस शोध पत्र के लेखक ने एक चतुर अपग्रेड पेश किया है जिसे F-WANDA कहा जाता है। उन्होंने महसूस किया कि केवल यह देखने के बजाय कि एक किताब कितनी तेज़ है, उन्हें यह भी पूछना चाहिए: "रोबोट का मस्तिष्क इस विशिष्ट शेल्फ के बारे में कितना परवाह करता है?"
यह जानने के लिए, F-WANDA एक अतिरिक्त त्वरित जाँच करता है। यह रोबोट के मस्तिष्क को एक छोटे परीक्षण (एक "बैकवर्ड पास") के माध्यम से चलाता है ताकि यह देखा जा सके कि कौन से शेल्फ वास्तव में रोबोट के उत्तरों को संचालित कर रहे हैं। यदि कोई शेल्फ सही उत्तर प्राप्त करने के लिए महत्वपूर्ण है, तो रोबोट का मस्तिष्क एक मजबूत संकेत (जिसे फिशर इंफॉर्मेशन कहा जाता है) दिखाएगा। यदि कोई शेल्फ केवल शोर (noise) है, तो संकेत कमजोर होगा।
यही जादू का मंत्र है: F-WANDA इस संकेत का उपयोग नियमों को बदलने के लिए करता है।
- "पेरिस" शेल्फ पर (उच्च संकेत): रोबोट बहुत परवाह करता है। F-WANDA कहता है, "इन किताबों को 50% मत फेंको! केवल 20% फेंको। हमें अधिकांश को रखना चाहिए।"
- "उबाऊ" शेल्फ पर (कम संकेत): रोबोट परवाह नहीं करता। F-WANDA कहता है, "जाओ, इन किताबों में से 80% फेंक दो। हमें इनकी ज़रूरत नहीं है।"
इस प्रकार, रोबोट अपने सबसे महत्वपूर्ण तथ्यों को सुरक्षित रखता है और फिर भी बहुत छोटा हो जाता है। और सबसे अच्छी बात? F-WANDA को रोबोट को फिर से प्रशिक्षित करने या किसी भी वेट (weights) को अपडेट करने की आवश्यकता नहीं है। यह बस एक त्वरित जाँच करता है और फिर प्रूनिंग शुरू कर देता है।
उन्होंने क्या पाया
टीम ने इसका परीक्षण LLAMA-2 पर किया, जो बड़े भाषा मॉडलों का एक प्रसिद्ध परिवार है (विशेष रूप से 7-बिलियन और 13-बिलियन पैरामीटर वाले संस्करण)। वे देखना चाहते थे कि क्या F-WANDA प्रतिस्पर्धा को हरा सकता है।
- बुद्धिमत्ता: जब उन्होंने मॉडलों को 50% अनस्ट्रक्चर्ड स्पर्सिटी (यानी आधे कनेक्शन हटा दिए गए) तक काट दिया, तो F-WANDA ने मूल WANDA की तुलना में रोबोट को बहुत अधिक स्मार्ट बनाए रखा। MMLU (जो सामान्य ज्ञान को मापता है) नामक एक परीक्षण पर, F-WANDA ने 7B मॉडल पर 1.6 प्रतिशत अंक और 13B मॉडल पर 1.4 प्रतिशत अंक का सुधार किया। इसने अत्यधिक सावधानी बरतने वाले SPARSEGPT को भी पीछे छोड़ दिया।
- प्रवाह (Fluency): रोबोट अभी भी स्वाभाविक लगा। WikiText-2 नामक एक परीक्षण पर, F-WANA को 7B मॉडल के लिए 6.85 का पर्प्लेक्सिटी स्कोर मिला, जो मूल WANDA के लगभग समान है। इसका मतलब है कि रोबोट रोबोटिक या भ्रमित नहीं हुआ।
- ऊर्जा और गति: यहाँ F-WANDA वास्तव में चमकता है। अत्यधिक सावधानी बरतने वाला SPARSEGPT मॉडल को प्रून करने में बहुत समय और ऊर्जा लगी। F-WANDA बहुत तेज़ और सस्ता था। वास्तव में, F-WANDA ने SPARSEGPT द्वारा उपयोग की गई ऊर्जा और समय का केवल एक-तिहाई हिस्सा इस्तेमाल किया। इसने एक शक्तिशाली H100 GPU पर 7B मॉडल को प्रून करने में लगभग 12 मिनट का समय लिया और 4.3 kJ ऊर्जा का उपयोग किया, जबकि SPARSEGPT को 35 मिनट और 12.6 kJ लगे।
समझौते और सीमाएँ
लेखक सावधानी से यह बताते हैं कि F-WANDA हर स्थिति के लिए जादू की छड़ी नहीं है।
- हार्डवेयर नियम: यदि कंप्यूटर चिप को कनेक्शन रखने और हटाने के एक सख्त पैटर्न (जैसे कि एक ब्लॉक में से ठीक 2 को रखना) की आवश्यकता होती है, तो F-WANDA अपना स्मार्ट बजट नहीं बना सकता। उन विशिष्ट मामलों में, यह मूल WANDA की तरह ही कार्य करता है।
- मेमोरी: क्योंकि F-WANDA एक अतिरिक्त त्वरित जाँच करता है, इसलिए इसे काम करते समय अधिक कंप्यूटर मेमोरी (WANDA की तुलना में लगभग दोगुनी) की आवश्यकता होती है। बहुत बड़े मॉडलों (जैसे 70 बिलियन पैरामीटर) के लिए, इसे मेमोरी में फिट करने के लिए विशेष युक्तियों की आवश्यकता हो सकती है।
- सामान्यीकरण (Generalization): उन्होंने केवल LLAMA-2 परिवार पर इसका परीक्षण किया है। उन्हें अभी तक यकीन नहीं है कि क्या यह अन्य प्रकार के रोबोट मस्तिष्क (जैसे LLaMA-3 या Mistral) पर भी इसी तरह काम करेगा, हालांकि उन्हें संदेह है कि ऐसा ही होगा।
यह क्यों महत्वपूर्ण है
बड़ी बात यह है कि F-WANDA "पारेटो फ्रंटियर" (Pareto frontier) पर स्थित है। यह एक फैंसी तरीका है यह कहने का कि यह सबसे अच्छा सौदा है जो आप प्राप्त कर सकते हैं: आपको उच्चतम गुणवत्ता (सबसे स्मार्ट रोबोट) मिलती है और सबसे कम लागत (सबसे कम ऊर्जा और समय) पर।
केवल एक त्वरित जाँच जोड़कर यह देखने के लिए कि कौन से हिस्से वास्तव में कड़ी मेहनत कर रहे हैं, शोधकर्ताओं ने ऊर्जा की भारी बचत की और रोबोट को स्मार्ट भी बनाया। यह एक याद दिलाता है कि कभी-कभी, पुस्तकालय को बेहतर बनाने के लिए आपको उसे फिर से बनाने की आवश्यकता नहीं होती; आपको बस इस बारे में अधिक स्मार्ट होने की आवश्यकता है कि आप किन किताबों को फेंक रहे हैं। यह इन शक्तिशाली AI मॉडलों को वास्तविक दुनिया में चलाना बहुत आसान और सस्ता बनाता है, जिससे AI को सभी के लिए अधिक टिकाऊ बनाने में मदद मिलती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।