SPQ: An Ensemble Technique for Large Language Model Compression
यह शोध पत्र SPQ को प्रस्तुत करता है, जो एक एन्सेम्बल कंप्रेशन तकनीक है जो LLaMA-2-7B जैसे बड़े भाषा मॉडलों के लिए मेमोरी में महत्वपूर्ण कमी और बेहतर इन्फरेंस गति प्राप्त करने के लिए SVD, एक्टिवेशन-आधारित प्रूनिंग और पोस्ट-ट्रेनिंग क्वांटाइजेशन को तालमेल के साथ जोड़ता है, जबकि मौजूदा बेसलाइन की तुलना में उनकी परप्लेक्सिटी और डाउनस्ट्रीम टास्क सटीकता को बनाए रखता है या बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से बुद्धिमान पुस्तकालय है (एक लार्ज लैंग्वेज मॉडल या LLM) जो कहानियाँ लिख सकता है, गणित की समस्याओं को हल कर सकता है और सवालों के जवाब दे सकता है। समस्या यह है कि यह पुस्तकालय इतना बड़ा है कि इसे रखने के लिए एक पूरा गोदाम चाहिए, और एक अकेली किताब को हिलाने के लिए भी एक विशाल क्रेन की जरूरत पड़ती है। आप इस पुस्तकालय को इतना छोटा करना चाहते हैं कि यह एक बैकपैक में फिट हो जाए और एक सामान्य लैपटॉप पर तेजी से पढ़ा जा सके, लेकिन आप नहीं चाहते कि इसके अंदर की बुद्धिमानी भरी कहानियाँ खो जाएँ।
यह पेपर SPQ (SVD-प्रूनिंग-क्वांटाइजेशन) नामक एक नई विधि पेश करता है जो ठीक यही करने के लिए है। केवल एक तरीके से पुस्तकालय को सिकोड़ने के बजाय, SPQ एक "तीन-तरफा हमला" (three-pronged attack) करता है, जो अलग-अलग हिस्सों पर अलग-अलग संकुचन रणनीतियों को लागू करता है जहाँ वे सबसे बेहतर काम करती हैं।
यहाँ SPQ के तीन भाग सरल उपमाओं (analogies) का उपयोग करके दिए गए हैं:
1. "फोकस फ़िल्टर" (अटेंशन लेयर्स पर SVD)
समस्या: पुस्तकालय का एक विशाल "अटेंशन" (Attention) अनुभाग है। यह वह जगह है जहाँ मॉडल एक वाक्य को देखता है और समझता है कि कौन से शब्द एक-दूसरे के लिए महत्वपूर्ण हैं। एक विशाल मॉडल में, यह अनुभाग हजारों दराजों वाले एक विशाल, अस्त-व्यस्त फाइलिंग कैबिनेट की तरह है, जिनमें से कई दराजें खाली हैं या उनमें डुप्लिकेट फाइलें हैं।
SPQ समाधान: SPQ SVD (सिंगुलर वैल्यू डिकम्पोजिशन) नामक तकनीक का उपयोग करता है। इसे एक सुपर-स्मार्ट लाइब्रेरियन के रूप में सोचें जो फाइलिंग कैबिनेट को देखता है और कहता है, "हमें इन सभी दराजों की आवश्यकता नहीं है। हम 100 दराजों की सामग्री को बिना किसी महत्वपूर्ण जानकारी को खोए, केवल 10 कॉम्पैक्ट बक्सों में मिला सकते हैं।"
- परिणाम: यह सबसे "जीवंत" या महत्वपूर्ण जानकारी (variance) को रखता है और अनावश्यक, कम ऊर्जा वाले शोर (noise) को हटा देता है। यह अटेंशन सेक्शन को महत्वपूर्ण कुछ भी भुलाए बिना काफी हद तक छोटा कर देता है।
2. "बगीचे की निराई" (MLP लेयर्स पर प्रूनिंग)
समस्या: पुस्तकालय में एक "तर्क" (Reasoning) अनुभाग भी है (जिसे MLP लेयर्स कहा जाता है), जहाँ मॉडल सोचने का भारी काम करता है। यह अनुभाग हजारों पौधों (न्यूरॉन्स) वाले एक बगीचे की तरह है। कुछ पौधे बहुत बड़े और खिले हुए हैं, लेकिन कई छोटे, कमजोर या मृत खरपतवार की तरह हैं जो जगह तो घेरते हैं लेकिन कोई काम नहीं करते।
SPQ समाधान: SPQ प्रूनिंग (Pruning) का उपयोग करता है। पूरे बगीचे को काटने के बजाय, यह देखता है कि प्रत्येक पौधे को कितनी "धूप" (activation) मिलती है। यदि कोई पौधा शायद ही कभी उपयोग किया जाता है, तो उसे पूरी तरह से काट दिया जाता है।
- परिणाम: यह बेकार के वजन को हटा देता है। केवल उन पौधों को रखकर जो वास्तव में बगीचे की सुंदरता में योगदान देते हैं, मॉडल बहुत छोटा और तेज़ हो जाता है, लेकिन बगीचा अभी भी वैसा ही दिखता और महकता रहता है।
3. "पेपरबैक रूपांतरण" (क्वांटाइजेशन)
समस्या: भले ही हमने दराजों को मिला दिया हो और खरपतवार काट दी हो, फिर भी किताबें अभी भी हाई-डेफिनिशन, भारी, सोने की परत वाली स्याही (32-बिट फ्लोटिंग पॉइंट नंबर) में लिखी गई हैं। वे सटीक हैं, लेकिन वे बहुत जगह लेती हैं।
SPQ समाधान: SPQ क्वांटाइजेशन (Quantization) का उपयोग करता है। कल्पना कीजिए कि उन भारी, सोने की परत वाली किताबों को लेकर उन्हें मानक, हल्के पेपरबैक (8-बिट इंटीजर्स) के रूप में फिर से छापा जा रहा है।
- परिणाम: आप थोड़ी सी "सोने की परत" वाली चमक खो देते हैं, लेकिन अधिकांश कहानियों के लिए, टेक्स्ट अभी भी पूरी तरह से पठनीय रहता है। यह कदम अकेले किताबों के आकार को लगभग 75% कम कर देता है।
तीनों को एक साथ क्यों मिलाएं? (एन्सेम्बल मैजिक)
यदि आप इनमें से केवल एक ही करते, तो आप मुसीबत में पड़ जाते:
- यदि आप केवल प्रूनिंग (खरपतवार काटते) करते, तो आप गलती से एक दुर्लभ फूल को काट सकते थे जो बस सो रहा था, और मॉडल भ्रमित हो जाता।
- यदि आप केवल फाइलों को कंप्रेस (SVD) करते, तो आप जटिल तर्क (reasoning) में बहुत अधिक विवरण खो देते।
- यदि आप केवल पेपरबैक के रूप में पुनर्मुद्रण (Quantization) करते, तो किताबें इतनी छोटी हो जातीं कि टेक्स्ट धुंधला और पढ़ने में कठिन हो जाता।
SPQ तीनों को एक साथ करने का जादू है।
यह एक भारी, ठसाठस भरे सूटकेस को लेने जैसा है।
- पहले आप कपड़ों को व्यवस्थित (SVD) करते हैं ताकि वे कसकर फिट हो सकें।
- आप उन मोजों को फेंक देते हैं जिन्हें आप कभी नहीं पहनते (Pruning)।
- आप जगह बचाने के लिए सब कुछ रोल कर देते हैं (Quantization)।
परिणाम? सूटकेस अब 75% छोटा है, लेकिन आप अभी भी अपनी पसंदीदा शर्ट तुरंत ढूंढ सकते हैं।
वास्तविक दुनिया की जीत
इस पेपर ने एक प्रसिद्ध मॉडल LLaMA-2-7B पर इसका परीक्षण किया।
- पहले: इसका वजन लगभग 27 GB था (ज्यादातर फोन या छोटे लैपटॉप के लिए बहुत बड़ा)।
- बाद में: SPQ के बाद इसका वजन केवल 6.86 GB रह गया।
- गति: यह केवल बैकपैक में फिट ही नहीं होता; यह अन्य लोकप्रिय संकुचन विधियों (जैसे GPTQ) की तुलना में 1.9 गुना तेज़ चलता है।
मुख्य बात (Bottom Line):
SPQ साबित करता है कि आपको एक छोटे मॉडल और एक स्मार्ट मॉडल के बीच चुनाव करने की आवश्यकता नहीं है। यह समझकर कि प्रत्येक संकुचन तकनीक को कहाँ लागू किया जाना चाहिए, आप एक विशाल मस्तिष्क को एक बैकपैक में फिट कर सकते हैं और इसे पहले से कहीं अधिक तेज़ बना सकते हैं। यह शक्तिशाली AI को केवल विशाल डेटा केंद्रों के लिए ही नहीं, बल्कि आम लोगों के लिए उनके सामान्य कंप्यूटरों पर भी सुलभ बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।