Channel-Wise Mixed-Precision Quantization for Large Language Models
यह शोध पत्र चैनल-वाइज मिक्स्ड-प्रिसिजन क्वांटाइजेशन (CMPQ) प्रस्तुत करता है, जो एक नवीन विधि है जो एक्टिवेशन वितरण के आधार पर वेट चैनल्स को मनमाने प्रिसिजन स्तरों को गतिशील रूप से आवंटित करती है और एज डिवाइसेस पर लार्ज लैंग्वेज मॉडल्स के लिए उच्च प्रदर्शन बनाए रखते हुए मेमोरी उपयोग को महत्वपूर्ण रूप से कम करने के लिए आउटलियर एक्सट्रैक्शन के साथ नॉन-यूनिफॉर्म क्वांटाइजेशन का उपयोग करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास ज्ञान का एक विशाल, अविश्वसनीय रूप से विस्तृत पुस्तकालय है (एक लार्ज लैंग्वेज मॉडल, या LLM)। यह पुस्तकालय इतना बड़ा है कि यह एक सामान्य बुकशेल्फ़ पर नहीं समा सकता; इसे रखने के लिए एक फुटबॉल के मैदान के आकार के गोदाम की आवश्यकता है। आप इस पुस्तकालय को छोटा करना चाहते हैं ताकि यह एक छोटे, पोर्टेबल बुकशेल्फ़ (जैसे कि फोन या लैपटॉप) पर आ सके, लेकिन आप महत्वपूर्ण कहानियों को फेंक नहीं सकते, अन्यथा पुस्तकालय का कोई अर्थ नहीं रह जाएगा।
यह शोध पत्र इन डिजिटल पुस्तकालयों को छोटा करने का एक नया तरीका पेश करता है जिसे CMPQ (चैनल-वाइज मिक्स्ड-प्रिसिजन क्वांटाइजेशन) कहा जाता है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:
समस्या: "एक ही आकार का सूट" (One-Size-Fits-All)
वर्तमान में, अधिकांश विधियाँ पुस्तकालय को छोटा करने के लिए हर एक किताब को बिल्कुल एक ही आकार के डिब्बे में डालने की कोशिश करती हैं।
- पुराना तरीका: यदि आप निर्णय लेते हैं कि आप "3-बिट" के डिब्बे (एक विशिष्ट छोटा आकार) का उपयोग करेंगे, तो हर किताब को 3-बिट के डिब्बे में जबरदस्ती डाला जाएगा।
- समस्या: कुछ किताबें मोटी और जटिल होती हैं (उन्हें एक बड़े डिब्बे की आवश्यकता होती), जबकि अन्य किताबें पतली और सरल होती हैं (वे एक बहुत छोटे डिब्बे में फिट हो जाती हैं)। यदि आप एक मोटी किताब को छोटे डिब्बे में जबरदस्ती डालते हैं, तो उसके पन्ने कुचल जाते हैं (AI गलतियाँ करता है)। यदि आप एक पतली किताब को बहुत बड़े डिब्बे में रखते हैं, तो आप स्थान बर्बाद कर रहे हैं।
- सीमा: मौजूदा विधियाँ कठोर हैं। वे केवल पूर्ण-संख्या वाले आकारों (जैसे 2-बिट, 3-बिट या 4-बिट) का ही उपयोग कर सकती हैं। यदि आपके डिवाइस में आपके पास 2-बिट बॉक्स से थोड़ा सा अधिक स्थान है, लेकिन 3-बिट बॉक्स के लिए पर्याप्त नहीं है, तो वर्तमान विधियाँ उस अतिरिक्त स्थान का प्रभावी ढंग से उपयोग नहीं कर सकतीं।
समाधान: CMPQ की "स्मार्ट पैकिंग"
CMPQ एक सुपर-स्मार्ट पैकिंग सेवा की तरह है जो हर एक किताब को व्यक्तिगत रूप से देखती है और यह तय करती है कि उस किताब के लिए सही डिब्बे का आकार क्या होगा, इस आधार पर कि वह किताब कितनी महत्वपूर्ण है।
1. "चैनल" की अवधारणा (किताबों के शेल्फ)
AI के मस्तिष्क को हजारों अलग-अलग "चैनलों" या बुकशेल्फ़ के रूप में सोचें। शोध में पाया गया कि सभी शेल्फ समान रूप से महत्वपूर्ण नहीं हैं। कुछ शेल्फ सबसे महत्वपूर्ण कहानियाँ रखते हैं (उच्च सक्रियता/high activation), जबकि अन्य केवल भरने वाली सामग्री रखते हैं।
- CMPQ का कदम: पूरे पुस्तकालय के साथ एक जैसा व्यवहार करने के बजाय, यह प्रत्येक शेल्फ को देखता है। यदि किसी शेल्फ में बहुत महत्वपूर्ण कहानियाँ हैं, तो यह उन किताबों को एक बड़ा, उच्च-गुणवत्ता वाला डिब्बा देता है (अधिक प्रिसिजन, जैसे 4-बिट)। यदि किसी शेल्फ में कम महत्वपूर्ण कहानियाँ हैं, तो यह उन्हें एक छोटा, तंग डिब्बा देता है (कम प्रिसिजन, जैसे 2-बिट)।
2. "फ्रैक्शनल" जादू (कस्टम फिट)
यही CMPQ की सबसे बड़ी चाल है। क्योंकि CMPQ बड़े और छोटे डिब्बों को आपस में मिलाता है, इसलिए यह एक ऐसा औसत आकार बना सकता है जो पूर्ण संख्या (whole number) नहीं है।
- उपमा: कल्पना कीजिए कि आपके पास एक बजट है जो ठीक 2.5 डिब्बों के बराबर है।
- पुरानी विधियाँ कहती हैं: "हम केवल 2-डिब्बे या 3-डिब्बे का उपयोग कर सकते हैं। हम 2.5 नहीं कर सकते।"
- CMPQ कहता है: "कोई समस्या नहीं! हम 50% किताबों को 2-डिब्बों में और 50% किताबों को 3-डिब्बों में फिट करेंगे। औसत 2.5 है, और हम आपके स्थान के हर इंच का पूरी तरह से उपयोग करते हैं।"
- परिणाम: आप पुस्तकालय को पहले की तुलना में थोड़े बड़े स्थान में सिकोड़ सकते हैं, और AI काफी स्मार्ट हो जाता है क्योंकि उसे महत्वपूर्ण किताबों को कुचलना नहीं पड़ा।
3. "आउटलेयर्स" की सुरक्षा (दुर्लभ रत्न)
कभी-कभी, एक किताब में कुछ पन्ने अविश्वसनीय रूप से अजीब या अद्वितीय होते हैं (जिन्हें "आउटलेयर्स" कहा जाता है)। यदि आप इन पन्नों को सिकोड़ने की कोशिश करते हैं, तो पूरी कहानी टूट जाती है।
- CMPQ की रणनीति: इसमें एक विशेष "आउटलेयर प्रोटेक्शन" सिस्टम है। यह पुस्तकालय को सिकोड़ने से पहले इन दुर्लभ, अजीब पन्नों की पहचान करता है। यह इन विशिष्ट पन्नों को उनके मूल, पूर्ण आकार के प्रारूप में रखता है (जैसे कि उन्हें कांच के केस में रखना) जबकि बाकी पुस्तकालय को सिकोड़ देता है। यह सुनिश्चित करता है कि अजीब, महत्वपूर्ण विवरण खो न जाएं।
इस शोध पत्र ने क्या पाया
लेखकों ने नौ अलग-अलग बड़े AI मॉडलों (जैसे OPT और LLaMA) पर इसका परीक्षण किया। यहाँ उन्होंने क्या पाया:
- बेहतर प्रदर्शन: CMPQ ने पिछले तरीकों की तुलना में AI को स्मार्ट बनाया, यहाँ तक कि बहुत छोटे डिब्बे के आकार (जैसे 3-बिट) का उपयोग करने पर भी।
- फ्रैक्शनल की जीत: जब उन्होंने AI को "बीच के" आकार (जैसे 2.2 बिट या 3.4 बिट) का उपयोग करने की अनुमति दी, तो पूर्ण संख्याओं में फंसी विधियों की तुलना में AI का प्रदर्शन काफी बढ़ गया।
- दक्षता: इसके लिए AI को शुरू से फिर से प्रशिक्षित (retraining) करने की आवश्यकता नहीं थी (जो महंगा और धीमा है)। इसने केवल मौजूदा किताबों को पुनर्व्यवस्थित किया।
- गति: यह पुराने तरीकों की तरह ही तेज़ चलता है, इसलिए सटीकता पाने के लिए आपको गति से समझौता नहीं करना पड़ता है।
संक्षेप में
CMPQ, AI मॉडलों को कंप्रेस करने का एक स्मार्ट तरीका है। AI के हर हिस्से को एक ही छोटे कंटेनर में डालने के बजाय, यह AI के विभिन्न हिस्सों के साथ अलग-अलग व्यवहार करता है। यह महत्वपूर्ण हिस्सों को अधिक जगह देता है और कम महत्वपूर्ण हिस्सों को कम जगह देता है। यह AI को अपनी "बौद्धिक क्षमता" खोए बिना छोटे उपकरणों में फिट होने की अनुमति देता है, और यह उन सूक्ष्म स्थानों का भी उपयोग कर सकता है जिन्हें अन्य विधियाँ अनदेखा कर देती हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।