Compressing What Matters: Neuron Importance Meets Data-Aware Low Rank Approximation for Language Model Compression
यह शोध पत्र एक नवीन भाषा मॉडल संपीड़न ढांचा प्रस्तावित करता है जो न्यूरॉन महत्व को डेटा-जागरूक लो-रैंक सन्निकटन (low-rank approximation) के साथ एकीकृत करता है और गतिशील संपीड़न दर आवंटन के लिए एक कुशल एल्गोरिदम पेश करता है, जिससे विशेष रूप से उच्च संपीड़न अनुपातों के तहत अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया की कल्पना एक विशाल, हलचल भरी लाइब्रेरी के रूप में करें जहाँ विशाल, सुपर-स्मार्ट रोबोटों द्वारा किताबें लिखी जा रही हैं। ये रोबोट, जिन्हें लार्ज लैंग्वेज मॉडल्स (LLMs) कहा जाता है, मानव भाषा को समझने, कहानियाँ लिखने और समस्याओं को हल करने में अविश्वसनीय हैं। लेकिन इसमें एक पेंच है: इतना स्मार्ट होने के लिए, इन रोबोटों की जेबों में अरबों छोटी-छोटी टिप्पणियाँ (notes) होती हैं, जो उन्हें अविश्वसनीय रूप से भारी बनाती हैं। इन भारी रोबोटों को स्मार्टफोन या स्मार्टवॉच जैसे छोटे डिवाइस पर चलाना, एक पूरे पुस्तकालय को अपने बैकपैक में ले जाने जैसा है; यह बहुत अधिक वजन है और इससे बैटरी तुरंत खत्म हो जाएगी। वैज्ञानिक इन रोबलों को बिना कुछ भुलाए छोटा करने का तरीका खोजने की कोशिश कर रहे हैं।
इसे करने के लिए, शोधकर्ता "सिंगुलर वैल्यू डिकंपोजिशन" (SVD) नामक एक गणितीय ट्रिक का उपयोग करते हैं। SVD को एक विशाल, बिखरी हुई नोट्स के ढेर को व्यवस्थित करके एक छोटा, सुव्यवस्थित ढेर बनाने के रूप में समझें जो अभी भी वही कहानी बताता है। यह एक 500 पन्नों के उपन्यास को 50 पन्नों की रूपरेखा में संक्षिप्त करने जैसा है जिसमें सभी महत्वपूर्ण कथानक बिंदु सुरक्षित रहते हैं। एक अन्य विचार है "न्यूरॉन महत्व" (neuron importance), जो यह पूछने जैसा है कि, "इस ढेर में कौन सी टिप्पणियाँ वास्तव में कहानी के लिए मायने रखती हैं, और हम किसे फेंक सकते हैं?" इसके अलावा, सवाल यह भी है कि रोबोट के विभिन्न हिस्सों को कैसे छोटा किया जाए। क्या हमें हर हिस्से को समान मात्रा में छोटा करना चाहिए, या हमें अधिक स्मार्ट होकर उन हिस्सों को अधिक आक्रामक रूप से छोटा करना चाहिए जो कम महत्वपूर्ण हैं?
यह पेपर NIDA-SVD नामक एक नई विधि पेश करता है जो एक परम लाइब्रेरियन बनने की कोशिश करती है। केवल नोट्स का सारांश निकालने या केवल "अमहत्वपूर्ण" चीजों को फेंकने के बजाय, यह दोनों विचारों को एक चतुर तरीके से जोड़ती है। शोधकर्ताओं ने पाया कि केवल पुराने तरीकों को मिलाने से काम नहीं बना, बल्कि मॉडल के "मस्तिष्क कोशिकाओं" (न्यूरॉन्स) के कहानी के प्रति व्यवहार को देखकर, वे मॉडल को बहुत अधिक प्रभावी ढंग से छोटा कर सकते हैं। उन्होंने यह भी खोजा कि मशीन की गहराई के आधार पर मॉडल को परत-दर-परत (layer-by-layer) छोटा करना, भागों को उनके काम के आधार पर समूहबद्ध करने की तुलना में बेहतर काम करता है। जब उन्होंने BERT, DistilBERT और TinyBERT जैसे मॉडल्स पर इसका परीक्षण किया, तो उनकी नई विधि ने मॉडल की बुद्धिमत्ता को लगभग बरकरार रखते हुए उसे आधा या उससे भी अधिक छोटा कर दिया, जो पिछले तरीकों से बेहतर प्रदर्शन करती है।
भारी बैकपैक की समस्या
लार्ज लैंग्वेज मॉडल्स आधुनिक AI के सितारे हैं, जो हमसे बातचीत करने और हमारी दुनिया को समझने में सक्षम हैं। लेकिन इतना स्मार्ट होने के लिए, वे अरबों पैरामीटर्स के साथ बनाए जाते हैं—इन्हें एक विशाल दीवार में व्यक्तिगत ईंटों के रूप में समझें। समस्या यह है कि यह दीवार इतनी भारी है कि यह फोन या लैपटॉप जैसे छोटे उपकरणों में फिट नहीं हो सकती। वैज्ञानिक इन मॉडल्स को कंप्रेस (छोटा) करना चाहते हैं, जिससे उनकी बुद्धिमत्ता खोए बिना उन्हें छोटा और तेज़ बनाया जा सके।
पुराने उपकरण: सारांश और छँटाई
इन मॉडल्स को छोटा करने के लिए, शोधकर्ताओं ने दो मुख्य उपकरणों का उपयोग किया है। पहला है SVD, जो एक गणितीय विधि है जो एक सुपर-एफिशिएंट समराइज़र (सारांश देने वाला) के रूप में कार्य करती है। यह एक विशाल मैट्रिक्स (संख्याओं का ग्रिड) लेता है और इसे एक छोटे संस्करण में तोड़ देता है जो अभी भी सबसे महत्वपूर्ण जानकारी रखता है, बाकी को हटा देता है। दूसरा उपकरण है न्यूरॉन महत्व, जो यह पता लगाने की कोशिश करता है कि ग्रिड में कौन सी विशिष्ट संख्याएँ शो की "स्टार" हैं। यदि कोई संख्या अंतिम उत्तर में बहुत कम योगदान देती है, तो वह हटाने के लिए एक उम्मीदवार है।
पहले, वैज्ञानिकों ने इन उपकरणों का अलग-अलग उपयोग किया। कुछ ने डेटा के आधार पर डेटा को संक्षिप्त करने (data-aware) पर ध्यान केंद्रित किया, जबकि अन्य ने इस पर ध्यान केंद्रित किया कि अंतिम परिणाम के लिए प्रत्येक विशिष्ट संख्या कितनी महत्वपूर्ण थी (parameter importance)। हालाँकि, इस पेपर के लेखकों ने देखा कि केवल इन दो पुराने तरीकों को मिलाने से काम नहीं बना; वास्तव में इसने मॉडल्स को कम बुद्धिमान बना दिया।
नया समाधान: NIDA-SVD
लेखक NIDA-SVD (न्यूरॉन इम्पॉर्टेंस ड्रिवन डेटा-अवेयर SVD) नामक एक नया दृष्टिकोण प्रस्तावित करते हैं। व्यक्तिगत संख्याओं को यह तय करने के लिए देखने के बजाय कि क्या रखना है, वे न्यूरॉन्स (संख्याओं के कार्यात्मक समूह) को देखते हैं और पूछते हैं: "इस न्यूरॉन का आउटपुट अंतिम कार्य के लिए कितना महत्वपूर्ण है?"
कल्प hãng करें कि आप एक फिल्म एडिट कर रहे हैं। पुराना तरीका हर एक फ्रेम को देखना और यह तय करना था कि क्या महत्वपूर्ण है। नया तरीका दृश्यों को देखना और पूछना है, "क्या यह दृश्य कथानक को आगे बढ़ाता है?" यदि कोई दृश्य महत्वपूर्ण है, तो आप उसे विस्तृत रखते हैं; यदि वह केवल फालतू है, तो आप उसे काट देते हैं। केवल कच्चे नंबरों के बजाय न्यूरॉन के आउटपुट के महत्व पर ध्यान केंद्रित करके, यह नई विधि मॉडल के आकार को भारी रूप से कम करने के बावजूद प्रदर्शन को उच्च बनाए रखती है।
स्मार्ट श्रिंक: डायनेमिक रैंक एलोकेशन
यह पेपर दूसरी समस्या का भी समाधान करता है: यह कैसे तय किया जाए कि मॉडल के प्रत्येक भाग को कितना छोटा किया जाए। अतीत में, लोग अक्सर हर भाग को समान मात्रा में छोटा करते थे (यूनिफॉर्म एलोकेशन) या भागों को उनके काम के आधार पर समूहबद्ध करते थे (जैसे सभी "अटेंशन" भाग एक साथ)। लेखक तर्क देते हैं कि यह बहुत कठोर है।
उन्होंने पाया कि मॉडल के विभिन्न परतों (layers) की अलग-अलग ज़रूरतें होती हैं। कुछ परतें एक इमारत की नींव की तरह होती हैं; यदि आप उन्हें बहुत अधिक छोटा करते हैं, तो पूरी संरचना ढह जाती है। अन्य दीवारों पर पेंट की तरह होती हैं; उन्हें घर को खराब किए बिना अधिक सरल बनाया जा सकता है। लेखकों ने एक डायनेमिक रैंक एलोकेशन एल्गोरिदम विकसित किया जो मॉडल को उसकी गहराई सूचकांक (depth index) के आधार पर परत-दर-परत देखता है और प्रत्येक को एक विशिष्ट "श्रिंकेज लिमिट" आवंटित करता है। यह सुनिश्चित करता है कि सबसे संवेदनशील परतों को अधिक स्थान मिले, जबकि कम संवेदनशील परतों को अधिक दबाया जाए।
परिणाम: छोटे, तेज़ और स्मार्ट
शोधकर्ताओं ने BERT, DistilBERT, MobileBERT और TinyBERT सहित कई लोकप्रिय मॉडल्स पर अपने तरीके का परीक्षण किया। उन्होंने विभिन्न कार्यों जैसे वाक्यों को समझने और प्रश्नों के उत्तर देने के लिए NIDA-SVD की तुलना वर्तमान सर्वोत्तम तरीकों (जैसे SVD-LLMv2) से की।
परिणाम प्रभावशाली थे। मानक BERT मॉडल पर किए गए परीक्षणों में से 87.5% में, NIDA-SVD ने पिछले स्टेट-ऑफ-द-आर्ट से बेहतर प्रदर्शन किया। उच्च कंप्रेशन दरों (जब मॉडल को बहुत छोटा किया जाता है) पर अंतर और भी नाटकीय था। उदाहरण के लिए, मॉडल को 50% कंप्रेस करने पर (केवल आधे पैरामीटर्स रखने पर), NIDA-SVD ने पुराने तरीकों की तुलना में कुछ कार्यों पर प्रदर्शन में 6.41% तक सुधार किया।
TinyBERT जैसे सबसे छोटे मॉडल्स पर भी, जो पहले से ही बहुत कॉम्पैक्ट है, नए तरीके ने अपनी पकड़ बनाए रखी। चूंकि TinyBERT इतना छोटा है कि उसे और छोटा करने से वह आमतौर पर विफल हो जाता है, NIDA-SVD ने इसे 30% (14.3 मिलियन पैरामीटर्स से 10.0 मिलियन तक) कंप्रेस करने में सफलता प्राप्त की और फिर भी मजबूत प्रदर्शन बनाए रखा। वास्तव में, TinyBERT के लिए 94% परीक्षणों में, नया तरीका श्रेष्ठ था।
लागत के बिना दक्षता
कोई यह चिंता कर सकता है कि इतना स्मार्ट होने के लिए अतिरिक्त कंप्यूटिंग पावर की आवश्यकता होगी। हालाँकि, लेखक दिखाते हैं कि उनका तरीका दूसरों के समान ही तेज़ है। क्योंकि कुल पैरामीटर्स की संख्या समान है (क्योंकि वे एक ही कंप्रेशन अनुपात का लक्ष्य रख रहे हैं), कम्प्यूटेशनल लागत (MFLOPS/token में मापी गई) लगभग समान है। "जादू" अधिक काम करने में नहीं है; यह काम को स्मार्ट तरीके से वितरित करने में है।
उदाहरण के लिए, एक DistilBERT मॉडल पर, 50% कंप्रेस करने से कम्प्यूटेशनल लागत 86 MFLOPS/token से घटकर लगभग 19 MFLOPS/token हो गई। TinyBERT पर, आकार में 30% की कमी से कम्प्यूटेशनल लागत में 90% की भारी गिरावट आई, जो घटकर 1 MFLOP/token से भी कम हो गई।
निष्कर्ष
संक्षेप में, यह पेपर सुझाव देता है कि AI मॉडल्स को प्रभावी ढंग से छोटा करने के लिए, हमें केवल कच्चे नंबरों को नहीं देखना चाहिए या मॉडल के हर हिस्से के साथ एक जैसा व्यवहार नहीं करना चाहिए। इसके बजाय, हमें यह समझना चाहिए कि कौन सी "मस्तिष्क कोशिकाएं" भारी काम कर रही हैं और मॉडल को परत-दर-परत इस आधार पर छोटा करना चाहिए कि प्रत्येक परत कितना भार संभाल सकती है। लेखकों की नई विधि, NIDA-SVD, यह सिद्ध करती है कि यह दृष्टिकोण हमें इन विशाल, स्मार्ट रोबोटों को उनके सबक भुलाए बिना छोटे बैकपैक में फिट करने की अनुमति देता है, जिससे हमारे रोजमर्रा के उपकरणों पर शक्तिशाली AI के लिए मार्ग प्रशस्त होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।