GRASPrune: Global Gating for Budgeted Structured Pruning of Large Language Models
GRASPrune एक स्ट्रक्चर्ड प्रूनिंग फ्रेमवर्क है जो एक वैश्विक बजट के तहत हल्के गेट स्कोर को सीखने के लिए एक प्रोजेक्टेड स्ट्रेट-थ्रू एस्टीमेटर का उपयोग करके हार्ड मास्क को लागू करता है, जिसके माध्यम से बड़े भाषा मॉडलों में FFN चैनल्स और KV हेड ग्रुप्स को संयुक्त रूप से कम किया जाता है, और इसके बाद पूर्ण मॉडल फाइन-ट्यूनिंग के बिना छोटे, कुशल डेंस चेकपॉइंट्स उत्पन्न करने के लिए स्केलिंग कैलिब्रेशन किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक विशाल, अति-बुद्धिमान पुस्तकालय है (एक Large Language Model जैसे LLaMA)। यह पुस्तकालय अविश्वसनीय रूप से स्मार्ट है, लेकिन यह बहुत विशाल भी है। इसे एक विशाल गोदाम (मेमोरी) घेरने के लिए जगह चाहिए, और जब आप इससे कोई सवाल पूछते हैं, तो उत्तर खोजने के लिए इसे हजारों गलियारों से गुजरना पड़ता है, जिसमें बहुत समय लगता है (लेटेंसी)।
इस पुस्तकालय को चलाना महंगा है। लाइट चालू रखने के लिए भी आपको शक्तिशाली, महंगे कंप्यूटरों की आवश्यकता होती है।
समस्या:
आप पुस्तकालय को छोटा करना चाहते हैं ताकि इसे चलाना सस्ता और तेज़ बनाया जा सके। लेकिन यदि आप बस बेतरतीब ढंग से किताबें (पैरामीटर्स) फेंक देते हैं, तो पुस्तकालय अर्थहीन हो जाता है। वह एक भ्रमित ढेर बन जाता है।
पुस्तकालय को छोटा करने के मौजूदा तरीके आमतौर पर दो में से एक काम करते हैं:
- "लेयर-दर-लेयर" (Layer-by-Layer) दृष्टिकोण: वे पुस्तकालय के प्रत्येक तल (floor) को देखते हैं और निर्णय लेते हैं, "ठीक है, हम इस तल से 10% किताबें हटा देंगे, उस तल से 10% किताबें हटा देंगे।" लेकिन यह बहुत कठोर है। हो सकता है कि तीसरी मंजिल बेकार कचरे से भरी हो, जबकि चौथी मंजिल सबसे महत्वपूर्ण रहस्य रखती हो। समान रूप से काटना एक बुरा विचार है।
- "पहले स्कोर, फिर कटिंग" (Score First, Cut Later) दृष्टिकोण: वे हर किताब को इस आधार पर ग्रेड देते हैं कि वह कितनी महत्वपूर्ण है, फिर वे सबसे अच्छी किताबों को एक छोटे बॉक्स में फिट करने की कोशिश करते हैं। लेकिन जब तक वे उन्हें फिट करने की कोशिश करते हैं, उन्हें एहसास होता है कि उन्होंने बहुत अधिक भारी किताबें चुन ली हैं और पर्याप्त हल्की किताबें नहीं चुनीं, या उन्होंने गलत चीजों को काट दिया है। उन्हें सब कुछ फिर से व्यवस्थित करने के लिए वापस जाना पड़ता है, जिसमें बहुत समय लगता है।
समाधान: GRASPrune
लेखकों ने यह नया तरीका बनाया है जिसे GRASPrune कहा जाता है। इसे एक स्मार्ट, ग्लोबल बजट मैनेजर के रूप में सोचें जो आपके पुस्तकालय का प्रबंधन करता है।
यह कैसे काम करता है, इन सरल उपमाओं का उपयोग करते हुए:
1. "ग्लोबल बजट" (द वॉलेट)
प्रत्येक तल को एक निश्चित बजट देने के बजाय, GRASPrune पूरे पुस्तकालय को एक ही एकल वॉलेट (बटुआ) देता है।
- कुछ किताबें भारी होती हैं (जैसे FFN चैनल्स—मॉडल के "सोचने वाले" हिस्से)।
- कुछ किताबें हल्की होती हैं लेकिन शेल्फ की जगह लेती हैं (जैसे KV हेड्स—मॉडल के "याददाश्त" वाले हिस्से)।
- लक्ष्य यह है कि कुल वजन की सीमा के भीतर रहते हुए पुस्तकालय को यथासंभव स्मार्ट बनाए रखा जाए।
2. "स्मार्ट गेटकीपर" (The Projected STE)
यह असली जादू है।
- पुराना तरीका: आप हर किताब से पूछते हैं, "आप कितने महत्वपूर्ण हैं?" और एक स्कोर लिख लेते हैं। फिर आप सबसे अच्छी किताबें चुनने की कोशिश करते हैं।
- GRASPrune का तरीका: यह दरवाजे पर एक गेटकीपर (द्वारपाल) लगा देता है। जैसे-जैसे पुस्तकालय यह सीखता है कि कौन सी किताबें महत्वपूर्ण हैं, गेटकीपर तुरंत वॉलेट की जांच करता है।
- यदि एक भारी किताब चुनना बजट को तोड़ देगा, तो गेटकीपर कहता है, "नहीं, तुम अभी अंदर नहीं जा सकते," भले ही वह किताब महत्वपूर्ण क्यों न हो।
- यह पुस्तकालय को बजट का सम्मान करते हुए सीखने के लिए मजबूर करता है। यह एक धावक को भारी बैकपैक पहनकर दौड़ने के लिए प्रशिक्षित करने जैसा है; वे वजन उतारने के बाद नहीं, बल्कि वजन के साथ कुशलता से दौड़ना सीखते हैं।
3. "ट्यूनिंग नॉब" (Scaling Calibration)
एक बार जब गेटकीपर यह तय कर लेता है कि कौन सी किताबें रुकेंगी और कौन सी जाएंगी, तो पुस्तकालय थोड़ा "अजीब" महसूस कर सकता है। बची हुई किताबें मूल सेटअप की तुलना में बहुत तेज़ चिल्ला सकती हैं या बहुत धीमी हो सकती हैं।
- GRASPrane जो किताबें बच गई हैं, उनके लिए एक छोटा सा वॉल्यूम नॉब (स्केलिंग फैक्टर) जोड़ता है।
- यह वॉल्यूम को बस इतना कम या ज्यादा करता है जिससे बची हुई किताबें आपस में पूरी तरह से तालमेल बिठा सकें।
- महत्वपूर्ण बात: इसके बाद यह उन वॉल्यूम नॉब्स को किताबों के अंदर ही फोल्ड (समाहित) कर देता है। इसलिए, जब आप बाद में पुस्तकालय का उपयोग करते हैं, तो आपको नॉब्स की आवश्यकता नहीं होती। आपके पास बस एक छोटा, पूरी तरह से ट्यून किया गया पुस्तकालय होता है जिसमें कोई अतिरिक्त बोझ नहीं होता।
यह एक बड़ी बात क्यों है?
- यह तेज़ है: इसे पूरी लाइब्रेरी को फिर से पढ़ने या एक नया शिक्षक प्रशिक्षित करने की आवश्यकता नहीं है। यह केवल टेक्स्ट के एक छोटे नमूने पर एक त्वरित "गेटकीपर" चेक करता है (एक शक्तिशाली कंप्यूटर पर लगभग 6 मिनट)।
- यह संतुलित है: यह केवल "सोचने वाले" हिस्सों या "याददाश्त" वाले हिस्सों को नहीं काटता है। यह कम से कम बुद्धिमत्ता खोकर सबसे अधिक स्थान बचाने के लिए दोनों का सही मिश्रण काटता है।
- यह काम करता है: जब उन्होंने एक 7-बिलियन-पैरामीटर मॉडल (LLaMA-2-7B) पर इसका परीक्षण किया, तो उन्होंने आकार को 50% कम कर दिया (आधी किताबें हटा दीं!) और पुस्तकालय अभी भी मूल के लगभग उतना ही स्मार्ट था। यह अभी भी कहानियाँ लिख सकता था, सवालों के जवाब दे सकता था और पहेलियाँ सुलझा सकता था, ठीक वैसे ही जैसे विशाल संस्करण कर सकता था।
संक्षेप में:
GRASPrune एक अत्यंत कुशल लाइब्रेरियन को नियुक्त करने जैसा है जो केवल बेतरतीब ढंग से किताबें नहीं फेंकता। इसके बजाय, वे पूरे भवन को देखते हैं, एक सख्त बजट का प्रबंधन करते हैं, और यह तय करते हैं कि कौन सी किताबें रखनी हैं और कौन सी फेंकनी हैं, यह सुनिश्चित करते हुए कि पुस्तकालय छोटा, तेज़ और सस्ता बना रहे, बिना अपनी प्रतिभा खोए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।