Compression Trinity: Exploring Sparsity, Quantization, and Low-Rank Approximations for LLM Compression
यह शोध पत्र "कंप्रेशन ट्रिनिटी" (Compression Trinity) को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो पारंपरिक LLM कंप्रेशन के सटीकता-दक्षता ट्रेड-ऑफ को दूर करने के लिए स्पर्सिटी (sparsity), क्वांटाइजेशन (quantization) और लो-रैंक एप्रोक्सिमेशन (low-rank approximations) का संयुक्त रूप से लाभ उठाता है, जिससे MKOR, SLoPe, OPTIMA, PATCH और SLiM जैसी नवीन विधियों के माध्यम से प्रीट्रेनिंग और पोस्ट-ट्रेनिंग दोनों चरणों में महत्वपूर्ण गति वृद्धि और सटीकता सुधार प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
लार्ज लैंग्वेज मॉडल्स (बड़े भाषा मॉडल) कृत्रिम बुद्धिमत्ता की एक नई पीढ़ी के इंजन हैं, जो कहानियाँ लिखने, जटिल समस्याओं को हल करने और मानवीय संवेदनाओं के साथ बातचीत करने में सक्षम हैं। फिर भी, इन डिजिटल मस्तिष्कों की एक भारी कीमत है। उन्हें प्रशिक्षित करने के लिए, शोधकर्ताओं को उन्हें डेटा की विशाल मात्रा खिलानी पड़ती है, एक ऐसी प्रक्रिया जो अत्यधिक बिजली की खपत करती है और लाखों डॉलर की लागत वाले शक्तिशाली कंप्यूटरों के समूहों की आवश्यकता होती है। प्रशिक्षण के बाद भी, एक एकल प्रश्न का उत्तर देने के लिए इन मॉडल्स को चलाने के लिए भारी मेमोरी और प्रोसेसिंग पावर की आवश्यकता होती है, जो अक्सर उनके उपयोग को व्यक्तिगत उपकरणों के बजाय बड़े डेटा केंद्रों तक ही सीमित कर देती है। वर्षों से, वैज्ञानिक इन मॉडल्स को छोटा और तेज़ बनाने के लिए तीन मुख्य तरकीबों का उपयोग करने की कोशिश कर रहे हैं: अनावश्यक कनेक्शनों को हटाना, उनके द्वारा उपयोग किए जाने वाले नंबरों की सटीकता (precision) को कम करना, और उनकी आंतरिक संरचना को सरल बनाना। हालाँकि, इन तरकीबों को एक समय में लागू करने की कोशिश करने पर एक दीवार आ गई। जब शोधकर्ताओं ने बहुत अधिक कनेक्शन हटाने की कोशिश की, तो मॉडल भ्रमित हो गया और उसकी बुद्धिमत्ता खो दी। जब उन्होंने नंबरों की सटीकता को बहुत अधिक कम किया, तो नंबर इतने खुरदरे हो गए कि वे मॉडल के ज्ञान को धारण नहीं कर सके। प्रत्येक विधि अकेले में तो अच्छी तरह काम करती थी लेकिन चरम सीमा तक पहुँचने पर विफल रही, जिससे उद्योग के सामने एक कठिन विकल्प खड़ा हो गया: या तो एक विशाल, धीमा मॉडल या एक छोटा, टूटा हुआ मॉडल।
टोरंटो विश्वविद्यालय के एक शोधकर्ता ने, मोहम्मद मोज़ाफ़ारी के नेतृत्व में, एक नया रास्ता प्रस्तावित किया है जो इन तीन विधियों को अलग-अलग विकल्पों के रूप में नहीं, बल्कि एक एकीकृत टूलकिट के रूप में देखता है। वे इस दृष्टिकोण को "कंप्रेशन ट्रिनिटी" (Compression Trinity) कहते हैं। कनेक्शन हटाने, नंबरों को सरल बनाने या संरचना को बदलने के बीच चुनाव करने के बजाय, उनका कार्य यह प्रदर्शित करता है कि ये तीन तकनीकें वास्तव में एक साथ मिलकर सबसे अच्छा काम करती हैं। मूल विचार यह है कि प्रत्येक विधि दूसरी विधि की कमजोरियों को ढक लेती है। कनेक्शनों को हटाना कंप्यूटर द्वारा किए जाने वाले काम को कम करता है, जबकि नंबरों को सरल बनाना उस डेटा की मात्रा को कम करता है जिसे इधर-उधर ले जाने की आवश्यकता होती है। तीसरी तकनीक, जिसमें अतिरिक्त जानकारी की एक छोटी, लचीली परत जोड़ी जाती है, एक सुरक्षा जाल (safety net) के रूप में कार्य करती है, जो उस बुद्धिमत्ता को वापस लाती है जो अन्य दो विधियों को लागू करने के दौरान खो गई थी। उन्हें मिलाकर, शोधकर्ताओं ने पाया कि वे मॉडल्स को बिना तोड़े काफी छोटा कर सकते हैं, और कुछ मामलों में, उन्हें उनके बड़े, अनकंप्रेस्ड संस्करणों से भी अधिक स्मार्ट बना सकते हैं।
इस खोज की यात्रा इन मॉडल्स के प्रशिक्षण को देखकर शुरू हुई। प्रशिक्षण सबसे महंगा चरण है, जिसमें कंप्यूटर को डेटा से सीखने के लिए अरबों नंबरों को समायोजित करने की आवश्यकता होती है। शोधकर्ताओं ने महसूस किया कि इस सीखने की प्रक्रिया को निर्देशित करने के लिए उपयोग किए जाने वाले मानक उपकरण बहुत भारी और धीमे थे। उन्होंने एक नई विधि विकसित की जो इस 'ट्रिनिटी' को सीधे प्रशिक्षण प्रक्रिया पर लागू करती है। कंप्यूटर द्वारा अपने अगले कदम की गणना करने के तरीके को सरल बनाकर, वे मौजूदा सर्वोत्तम विधियों की तुलना में बड़े मॉडल्स के प्रशिक्षण को लगभग दोगुना तेज करने में सक्षम रहे। उन्होंने इसे स्पार्स (sparse) गणनाओं, सरल नंबरों और एक लो-रैंक एप्रोक्सिमेशन (low-rank approximation) के मिश्रण का उपयोग करके हासिल किया, जिसने कंप्यूटर को सही समाधान तक पहुँचने के लिए अनावश्यक काम को छोड़ने की अनुमति दी। इसका मतलब था कि इन शक्तिशाली मॉडल्स को बनाने के लिए आवश्यक समय और ऊर्जा को नाटकीय रूप से कम किया जा सकता था।
एक बार मॉडल प्रशिक्षित हो जाने के बाद, इसे वास्तविक दुनिया के उपयोग के लिए कंप्रेस किया जाना चाहिए, जहाँ मेमोरी और गति और भी महत्वपूर्ण हो जाती है। यहाँ, शोधकर्ताओं ने "कंपाउंड एरर" (compounded error) की समस्या का सामना किया। जब आप केवल एक विधि का उपयोग करके एक मॉडल को कंप्रेस करने की कोशिश करते हैं, तो त्रुटियाँ जमा होने लगती हैं और मॉडल काम करना बंद कर देता है। टीम ने दिखाया कि ट्रिनिटी को एक विशिष्ट क्रम में लागू करके, वे इस पतन को रोक सकते हैं। सबसे पहले, उन्होंने एक गणितीय तकनीक का उपयोग करके मॉडल के आधे कनेक्शनों को हटाने का सबसे अच्छा तरीका खोजा जिससे उसके प्रदर्शन को नुकसान न पहुँचे। इसने एक स्थिर, स्पार्स आधार बनाया। फिर, उन्होंने स्थान बचाने के लिए शेष नंबरों की सटीकता को कम किया। अंत में, उन्होंने गलतियों को ठीक करने के लिए गणितीय रूप से व्युत्पन्न अतिरिक्त जानकारी की एक छोटी परत जोड़ी। यह अंतिम चरण महत्वपूर्ण था; इसने एक मरम्मत दल (repair crew) की तरह कार्य किया, जो कंप्रेशन के कारण छोड़े गए अंतराल को भरता है ताकि मॉडल तर्क करने और समझने की अपनी क्षमता बनाए रख सके।
इसके परिणाम चौंकाने वाले थे। अरबों पैरामीटर्स वाले मॉडल्स पर परीक्षण करने पर, संयुक्त विधि ने मूल से आठ गुना छोटे मॉडल तैयार किए, लेकिन वे विभिन्न कार्यों पर समान या कभी-कभी बेहतर प्रदर्शन करते रहे। प्रत्यक्ष तुलना में, इन कंप्रेस्ड मॉडल्स ने अन्य अत्याधुनिक कंप्रेशन तकनीकों को महत्वपूर्ण अंतर से पीछे छोड़ दिया, और कुछ मामलों में सटीकता में लगभग छह प्रतिशत तक सुधार किया। शायद सबसे आश्चर्यजनक बात यह थी कि जब शोधकर्ताओं ने अपने कंप्रेस्ड मॉडल्स की तुलना समान आकार के अनकंप्रेस्ड मॉडल्स से की, तो कंप्रेस्ड संस्करण वास्तव में अधिक सटीक थे। यह सुझाव देता है कि मॉडल के अनावश्यक हिस्सों को सावधानीपूर्वक हटाने और उन्हें एक स्मार्ट, लो-रंक सुधार के साथ बदलने की प्रक्रिया वास्तव में मॉडल को सबसे महत्वपूर्ण चीजों पर ध्यान केंद्रित करने में मदद करती है।
शोधकर्ताओं ने यह भी पता लगाया कि इन तकनीकों को विभिन्न प्रकार के हार्डवेयर के लिए कैसे अनुकूलित किया जा सकता है। उन्होंने पाया कि मॉडल को एक लचीले पैटर्न में कुछ हिस्सों को 'डेंस' (dense) और अन्य को 'स्पार्स' (sparse) रखने की अनुमति देकर, वे गति और सटीकता के बीच एक निरंतर संतुलन प्राप्त कर सकते हैं। इस लचीलेपन का अर्थ था कि मॉडल्स को शक्तिशाली डेटा सेंटर सर्वर से लेकर उपभोक्ता-ग्रेड ग्राफिक्स कार्ड तक सब कुछ चलाने के लिए कुशलतापूर्वक ट्यून किया जा सकता था। इस कार्य में एक नया तरीका भी शामिल था जिससे पहले से ही स्पार्स मॉडल्स को प्रशिक्षित किया जा सके, यह सुनिश्चित करते हुए कि सीखने की प्रक्रिया स्वयं कुशल हो। इस दृष्टिकोण का अर्थ था कि मॉडल तेजी से स्पार्स कनेक्शन का उपयोग करके सीख सकता था और प्रशिक्षण के बिल्कुल अंत में केवल आवश्यक जटिलता जोड़ सकता था, जिससे पूरी प्रक्रिया के दौरान समय और ऊर्जा की बचत हुई।
हालाँकि परिणाम उत्साहजनक हैं, शोधकर्ता सावधानी बरतते हुए नोट करते हैं कि उनके तरीके वर्तमान में विशिष्ट प्रकार के कंप्यूटर चिप्स, विशेष रूप से NVIDIA द्वारा बनाए गए चिप्स के लिए अनुकूलित हैं जिनमें स्पार्स डेटा को संभालने के लिए विशेष हार्डवेयर होता है। वे स्वीकार करते हैं कि इन तकनीकों को अन्य प्रकार के हार्डवेयर या सामान्य-उद्देश्य वाले प्रोसेसरों में स्थानांतरित करने के लिए आगे के इंजीनियरिंग कार्य की आवश्यकता होगी। वे यह भी बताते हैं कि जबकि मॉडल मानक परीक्षणों पर अच्छा प्रदर्शन करते हैं, यह सुनिश्चित करने की आवश्यकता है कि कंप्रेशन प्रक्रिया अनजाने में विविध भाषाओं या सांस्कृतिक संदर्भों को समझने की मॉडल की क्षमता को नुकसान न पहुँचाए, क्योंकि मॉडल के हिस्सों को हटाने से अल्पसंख्यकों के ज्ञान पर असमान प्रभाव पड़ सकता है।
अंततः, यह कार्य सुझाव देता है कि कुशल कृत्रिम बुद्धिमत्ता का भविष्य एक विधि के बजाय दूसरी विधि को चुनने में नहीं, बल्कि उन्हें एक साथ बुनने में निहित है। "कंप्रेशन ट्रिनिटी" उन मॉडल्स के निर्माण के लिए एक ब्लूप्रिंट प्रदान करती है जो ज्ञान में सघन (dense) लेकिन गणना में विरल (sparse) हों। दक्षता को एक एकल अनुकूलन समस्या के बजाय एक बहु-आयामी संतुलन के रूप में मानकर, शोधकर्ताओं ने दिखाया है कि ऐसा कृत्रिम बुद्धिमत्ता बनाना संभव है जो शक्तिशाली और व्यावहारिक दोनों हो। उनके निष्कर्ष संकेत देते हैं कि इन मॉडल्स को रोजमर्रा के उपकरणों पर तैनात करने की बाधाएं भौतिकी या गणित की मौलिक सीमाएं नहीं हैं, बल्कि उपकरणों के सही संयोजन को खोजने का मामला है। जैसे-जैसे यह क्षेत्र आगे बढ़ता है, यह एकीकृत दृष्टिकोण बड़े भाषा मॉडल्स को सुलभ, टिकाऊ और वास्तविक दुनिया के लिए तैयार बनाने के लिए एक मानक बन सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।