Generalized Fisher-Weighted SVD: Scalable Kronecker-Factored Fisher Approximation for Compressing Large Language Models
यह शोध पत्र जेनेरालाइज्ड फिशर-वेटेड एसवीडी (GFWSVD) का प्रस्ताव करता है, जो बड़े भाषा मॉडलों के लिए एक स्केलेबल पोस्ट-ट्रेनिंग कंप्रेशन विधि है जो पैरामीटर सहसंबंधों को पकड़ने के लिए पूर्ण फिशर सूचना मैट्रिक्स के क्रोनेकर-फैक्टर्ड सन्निकटन (Kronecker-factored approximation) का उपयोग करती है और मौजूदा डायगोनल-आधारित कंप्रेशन तकनीकों से काफी बेहतर प्रदर्शन करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, जटिल पुस्तकालय को एक बैकपैक में फिट होने के लिए सिकोड़ने की कोशिश कर रहे हैं, बिना उसके भीतर की कहानियों को खोए। यह उन वैज्ञानिकों के लिए दैनिक चुनौती है जो आर्टिफिशियल इंटेलिजेंस (AI) के क्षेत्र में काम कर रहे हैं, विशेष रूप से "न्यूरल नेटवर्क" के साथ—जो कि मस्तिष्क की तरह सीखने के लिए डिज़ाइन किए गए कंप्यूटर प्रोग्राम हैं। ये प्रोग्राम लाखों छोटे स्विचों से बने होते हैं जिन्हें "पैरामीटर्स" कहा जाता है। इन प्रोग्रामों को छोटे उपकरणों पर तेज़ी से चलाने के लिए, शोधकर्ता उन स्विचों को हटा देते हैं जो बहुत अधिक काम नहीं कर रहे होते हैं। लेकिन पेच यह है कि ये स्विच अकेले काम नहीं करते। वे एक जटिल नृत्य दल (डांस ट्रूप) की तरह हैं; यदि आप एक नर्तक को बाहर निकालते हैं, तो पूरा प्रदर्शन ढह सकता है क्योंकि वह नर्तक किसी और का हाथ थामे हुए था।
वर्षों तक, यह तय करने का मानक तरीका यह था कि प्रत्येक को व्यक्तिगत रूप से देखा जाए, यह नज़रअंदाज़ करते हुए कि वे एक-दूसरे का हाथ थामे हुए हैं। यह एक नर्तक को थका हुआ देखने जैसा था बिना यह देखे कि वह अपने साथी को सहारा दे रहा है। यह तरीका तेज़ था, लेकिन इसने अक्सर प्रदर्शन को बिगाड़ दिया। जिस शोध पत्र को आप पढ़ने जा रहे हैं, वह इस समस्या को हल करने के लिए पैरामीटर्स के "नृत्य" को देखने का एक नया तरीका पेश करके इस समस्या को हल करता है। यह "फिशर इंफॉर्मेशन मैट्रिक्स" नामक एक गणितीय उपकरण का उपयोग करता है, जो एक मानचित्र की तरह कार्य करता है जो दिखाता है कि प्रत्येक स्विच दूसरे के साथ कैसे जुड़ा हुआ है। लक्ष्य इस लाइब्रेरी (AI मॉडल) को सिकोड़ना है जबकि इसकी कहानियों (बुद्धिमत्ता) को पूरी तरह से बरकरार रखा जा सके।
मुख्य विचार: पूरे नृत्य को देखना, केवल नर्तकों को नहीं
इस शोध पत्र के लेखक, विक्टोरिया चेकालिना और उनकी टीम ने महसूस किया कि पुराने मानचित्र बहुत धुंधले थे। वे एक ऐसा मानचित्र चाहते थे जो न केवल यह दिखाए कि कौन से नर्तक महत्वपूर्ण हैं, बल्कि यह भी दिखाए कि वे आपस में कैसे जुड़े हुए हैं। ऐसा करने के लिए, उन्होंने मैट्रिक्स-फ्री फिशर फैक्टराइजेशन (MFF) नामक एक नया एल्गोरिदम बनाया।
फिशर इंफॉर्मेशन मैट्रिक्स को पूरे डांस फ्लोर पर फैली एक विशाल, घनी धुंध की तरह समझें। अतीत में, इस धुंध के माध्यम से कनेक्शन खोजने की कोशिश करना असंभव था क्योंकि धुंध बहुत घनी थी और डांस फ्लोर बहुत बड़ा था। पुराने तरीकों ने अनुमान लगाया कि कनेक्शन सरल हैं (जैसे एक सीधी रेखा), जिससे वास्तविक नृत्य के जटिल घुमाव छूट गए।
टीम की नई तरकीब, MFF, एक विशेष चश्मे के पास होने जैसा है जो आपको पूरे धुंध को हटाने के बिना उसकी संरचना देखने की अनुमति देता है। हर एक कनेक्शन को लिखने की कोशिश करने के बजाय (जिसके लिए बहुत अधिक मेमोरी की आवश्यकता होगी), उनका एल्गोरिदम ऑन-द-फ्लाई (तुरंत) कनेक्शनों की गणना करता है, और केवल नृत्य की विशिष्ट "परतों" पर ध्यान केंद्रित करता है। यह एक "मैट्रिक्स-फ्री" दृष्टिकोण है, जिसका अर्थ है कि यह कभी भी विशाल, भारी मानचित्र का निर्माण नहीं करता है; यह केवल कट लगाने के लिए मानचित्र के आकार का उपयोग करता है।
समाधान: मॉडल को सिकोड़ने का एक नया तरीका
कनेक्शनों को देखने के इस नए तरीके का उपयोग करते हुए, टीम ने GFWSVD (जनरलाइज्ड फिशर-वेटेड SVD) नामक एक विधि विकसित की। यदि आप AI मॉडल को मिट्टी के एक ब्लॉक के रूप में कल्पना करें, तो मानक तरीके शायद इसके किनारों को काट देंगे। हालाँकि, GFWSVD मिट्टी के आंतरिक दाने (ग्रेन) को समझता है। यह जानता है कि मिट्टी के कुछ हिस्से आपस में कसकर बुने हुए हैं और आकार बनाए रखने के लिए उन्हें एक विशिष्ट तरीके से काटा जाना चाहिए।
यह शोध पत्र सिद्ध करता है कि कुछ गणितीय स्थितियों के तहत (विशेष रूप से, यदि कनेक्शन "मैट्रिक्स-वेरिएट नॉर्मल डिस्ट्रीब्यूशन" नामक पैटर्न का पालन करते हैं), उनकी विधि मॉडल को सिकोड़ने का एकमात्र, इष्टतम तरीका है। यह केवल एक अनुमान नहीं है; यह मॉडल के प्रदर्शन को कम से कम नुकसान पहुँचाने का गणितीय रूप से पूर्ण तरीका है।
उन्होंने क्या पाया: मॉडल का आधा हिस्सा हटाना
टीम ने अपने नए तरीके का परीक्षण कुछ सबसे प्रसिद्ध AI मॉडलों पर किया, जिनमें Llama 2 और Llama 3.1 शामिल हैं, जो कोड लिखने से लेकर चैट करने तक सब कुछ करने के लिए उपयोग किए जाने वाले विशाल भाषा मॉडल हैं। उन्होंने BERT का भी परीक्षण किया, जो टेक्स्ट को समझने के लिए उपयोग किया जाने वाला एक मॉडल है।
यहाँ उनका निष्कर्ष है:
- कंप्रेशन की शक्ति: वे इन विशाल मॉडलों को 50% तक सिकोड़ने में सक्षम रहे। इसका मतलब है कि पैरामीटर्स की संख्या को आधा करना।
- प्रदर्शन: आधे आकार के बावजूद, मॉडल मूल संस्करणों के समान या कभी-कभी उनसे भी बेहतर प्रदर्शन करते हैं। कई परीक्षणों में, GFWSVD ने वर्तमान सर्वोत्तम तरीकों (जैसे डायगोनल एप्रोक्सिमेशन और एक्टिवेशन-आधारित विधियों) को हर मामले में पीछे छोड़ दिया।
- ढहने से बचना: जब उन्होंने मॉडलों को 40% तक कंप्रेस करने की कोशिश की, तो मानक तरीके विफल होने लगे, जिससे AI की तर्क करने या उत्तर देने की क्षमता कम हो गई। हालाँकि, GFWSVD मजबूत और विश्वसनीय बना रहा।
- गति: क्योंकि मॉडल छोटे हैं, वे तेज़ी से चलते हैं। एक शक्तिशाली कंप्यूटर चिप (NVIDIA A100) पर, कंप्रेस्ड मॉडलों ने मूल, अनकंप्रेस्ड मॉडलों की तुलना में 1.34 गुना तेज़ी से टेक्स्ट प्रोसेस किया।
यह क्यों मायने रखता है
लेखकों ने दिखाया कि पैरामीटर्स के बीच छिपे हुए कनेक्शनों (ऑफ-डायगोनल तत्वों) पर ध्यान देकर, आप AI मॉडलों को बिना उन्हें तोड़े बहुत अधिक आक्रामक तरीके से सिकोड़ सकते हैं। उन्होंने सिद्ध किया कि इन कनेक्शनों को अनदेखा करना, जैसा कि अन्य अधिकांश तरीके करते हैं, प्रदर्शन की बहुत सी क्षमता को छोड़ देता है।
उन्होंने यह भी दिखाया कि यह विधि अन्य प्रशिक्षण प्रक्रियाओं के लिए एक बेहतरीन "स्टार्टर" के रूप में काम करती है। यदि आप पहले मॉडल को सिकोड़ने के लिए GFWSDT का उपयोग करते हैं, और फिर मॉडल को थोड़ा और सीखने (फाइन-ट्यून) देते हैं, तो यह मानक सिकोड़ने के तरीकों की तुलना में अपनी सटीकता को बहुत बेहतर तरीके से बनाए रखता है।
संक्षेप में, यह शोध पत्र विशाल AI मॉडलों को काटने के लिए एक नए, गणितीय रूप से सुदृढ़ "कैंची" प्रदान करता है। यह हमें बुद्धिमत्ता को बनाए रखते हुए अतिरिक्त भार को हटाने की अनुमति देता है, जिससे शक्तिशाली AI छोटे उपकरणों पर सुलभ और चलाने में सस्ता बनता है, और वह भी मूल मॉडल के जादू को खोए बिना।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।