MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference
MXSens एक प्रशिक्षण-मुक्त, संवेदनशीलता-जागरूक मिश्रित-परिशुद्धता क्वांटाइजेशन विधि है जो कॉलम- और लेयर-वार संवेदनशीलता के आधार पर LLM वेट्स को परिवर्तनीय मेंटिसा बिटविड्थ (4/6/8) आवंटित करती है, जो प्रभावी रूप से आउटलायर-प्रेरित सटीकता गिरावट को कम करती है और मौजूदा स्टेट-ऑफ-द-आर्ट बेसलाइन से बेहतर प्रदर्शन करने के लिए हार्डवेयर-कुशल माइक्रोस्केलिंग फॉर्मेट का लाभ उठाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप ज्ञान के एक विशाल, जटिल पुस्तकालय को एक छोटे, पोर्टेबल बैकपैक में फिट करने की कोशिश कर रहे हैं। यह लार्ज लैंग्वेज मॉडल्स (LLMs) नामक सुपर-स्मार्ट कंप्यूटर दिमागों के लिए दैनिक चुनौती है। ये मॉडल कहानियाँ लिखने, पहेलियाँ सुलझाने और हमसे बातें करने में बहुत कुशल हैं, लेकिन ये अविश्वसनीय रूप से भारी होते हैं, जिन्हें चलाने के लिए भारी मात्रा में मेमोरी और ऊर्जा की आवश्यकता होती है। इन्हें ले जाने के लिए पर्याप्त हल्का बनाने के लिए, वैज्ञानिक "क्वांटाइजेशन" (quantization) नामक एक तरकीब का उपयोग करते हैं। इसे एक हाई-डेफिनिशन मूवी को छोटी फ़ाइल आकार में कंप्रेस करने जैसा समझें। हर एक सटीक रंग या शेड को स्टोर करने के बजाय, आप उन्हें सीमित पैलेट पर उपलब्ध निकटतम रंग तक राउंड ऑफ (गोल) कर देते हैं। यह फ़ाइल को छोटा और तेज़ी से चलाने योग्य बनाता है, लेकिन यदि आप बहुत अधिक राउंड ऑफ कर देते हैं, तो तस्वीर धुंधली हो जाती है और विवरण खो जाते हैं।
समस्या यह है कि इन कंप्यूटर दिमागों में कुछ ऐसी "तेज़" आवाज़ें होती हैं जो बाकी सभी से कहीं अधिक ज़ोर से चिल्लाती हैं। संख्याओं की दुनिया में, इन्हें "आउटलेयर्स" (outliers) कहा जाता है। ये दुर्लभ, चरम मान (extreme values) हैं जो पूरे सिस्टम को बिगाड़ देते हैं, जिससे कंप्रेशन अव्यवरेज हो जाता है और मॉडल मूर्खतापूर्ण गलतियाँ करने लगता है। कुछ समय के लिए, शोधकर्ताओं ने डेटा को इधर-उधर घुमाकर (जैसे किसी पहेली को घुमाना) या बड़े और छोटे फ़ाइल आकारों के मिश्रण का उपयोग करके इसे ठीक करने की कोशिश की। लेकिन ये तरीके अक्सर बोझिल थे, जिनमें कंप्यूटर को संख्याओं को वापस अनुवाद करने के लिए लगातार रुकना पड़ता था, जिससे सब कुछ धीमा हो जाता था। अब, शोधकर्ताओं की एक नई टीम ने बैकपैक पैक करने का एक स्मार्ट तरीका प्रस्तावित किया है, जो यात्रा को धीमा किए बिना सूचना के हर एक टुकड़े की विशिष्ट आवश्यकताओं को सुनता है।
यह पेपर MXSens नामक एक नए तरीके का परिचय देता है, जो एक बहुत ही ध्यान देने वाले लाइब्रेरियन की तरह कार्य करता है। पुस्तकालय की हर किताब के साथ एक जैसा व्यवहार करने के बजाय, MXSens पहले यह देखने के लिए एक त्वरित नज़र डालता है कि कौन सी किताबें सबसे नाजुक या महत्वपूर्ण हैं। इसने पाया कि सभी "तेज़" आवाज़ें एक समान नहीं होतीं। कुछ दुर्लभ, चिल्लाने वाले चरम स्तर होते हैं जिन्हें स्पष्ट रूप से समझे जाने के लिए बहुत अधिक स्थान की आवश्यकता होती है, जबकि अन्य केवल भीड़ से थोड़े अधिक तेज़ होते हैं और कम जगह में भी काम चला सकते हैं।
MXSens इन चीजों को संभालने के लिए एक चतुर तीन-स्तरीय प्रणाली का उपयोग करता है। यह मॉडल के सबसे संवेदनशील, चरम हिस्सों को एक उदार 8-बिट स्थान (एक बड़े, मज़बूत बॉक्स की तरह) आवंटित करता है, मध्यम रूप से संवेदनशील हिस्सों को एक मध्यम 6-बिट स्थान (एक मध्यम बॉक्स) देता है, और शांत, चुप हिस्सों को एक तंग, कुशल 4-बिट स्थान (एक छोटा, प्रभावी पाउच) प्रदान करता है। यह मॉडल को फिर से प्रशिक्षित (retrain) किए या उसके मस्तिष्क की संरचना को बदले बिना होता है; यह बस इस आधार पर डेटा को पुनर्व्यवस्थित करता है कि प्रत्येक भाग दबने (squish होने) के प्रति कितना संवेदनशील है। शोधकर्ताओं ने पाया कि यह दृष्टिकोण MXINT नामक एक नए हार्डवेयर-अनुकूल प्रारूप के साथ खूबसूरती से काम करता है, जो आधुनिक कंप्यूटर चिप्स द्वारा पहले से ही समर्थित है।
इसके परिणाम काफी प्रभावशाली हैं। LLaMA-2-70B और LLaMA-3-8B जैसे विशाल मॉडल्स पर परीक्षण करते समय, MXSens ने बहुत कम स्थान का उपयोग करते हुए मॉडल की "आवाज़" को स्पष्ट और सटीक बनाए रखा। विशेष रूप से, एक सख्त W4A4KV4 सेटिंग (जिसका अर्थ है कि वेट्स, एक्टिवेशन्स और की-वैल्यू कैश सभी क्वांटाइज़ किए गए हैं) के तहत, इसने WikiText-2 डेटासेट पर LLaMA-2-70B के लिए 3.77 और LLaMA-3-8B के लिए 7.63 का पर्प्लेक्सिटी (perplexity) स्कोर प्राप्त किया। पर्प्लेक्सिटी भ्रम का एक माप है; यह जितना कम हो, उतना बेहतर है। ये स्कोर अन्य शीर्ष तरीकों की तुलना में काफी बेहतर थे, जो यह सिद्ध करते हैं कि मॉडल के विभिन्न हिस्सों की संवेदनशीलता पर ध्यान देकर, आप दोनों तरफ का सर्वश्रेष्ठ लाभ उठा सकते हैं: एक छोटा, तेज़ मॉडल जो फिर भी स्पष्ट रूप से सोचता है।
लेखक सुझाव देते हैं कि यह विधि एक बड़ा कदम है क्योंकि यह भारी ओवरहेड से बचती है जो लगातार संख्याओं को अनुवाद करने की प्रक्रिया से होता है, जिसने अन्य समान तकनीकों को धीमा कर दिया था। नए हार्डवेयर प्रारूपों की प्राकृतिक ब्लॉक संरचना का उपयोग करके, MXSens इन विभिन्न परिशुद्धता स्तरों (4, 6 और 8 बिट्स) को सहजता से मिला सकता है। अध्ययन दिखाता है कि यह संवेदनशीलता-निर्देशित दृष्टिकोण स्थान बचाने और मॉडल को स्मार्ट बनाए रखने के बीच एक बेहतर संतुलन की अनुमति देता है, जिससे शक्तिशाली AI उन उपकरणों पर भी सुलभ हो सकता है जिनमें विशाल मेमोरी बैंक नहीं होते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।