← नवीनतम पेपर
🤖 machine learning

MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference

MXSens एक प्रशिक्षण-मुक्त, संवेदनशीलता-जागरूक मिश्रित-परिशुद्धता क्वांटाइजेशन विधि है जो कॉलम- और लेयर-वार संवेदनशीलता के आधार पर LLM वेट्स को परिवर्तनीय मेंटिसा बिटविड्थ (4/6/8) आवंटित करती है, जो प्रभावी रूप से आउटलायर-प्रेरित सटीकता गिरावट को कम करती है और मौजूदा स्टेट-ऑफ-द-आर्ट बेसलाइन से बेहतर प्रदर्शन करने के लिए हार्डवेयर-कुशल माइक्रोस्केलिंग फॉर्मेट का लाभ उठाती है।

मूल लेखक: Simla Burcu Harma, Danila Mishin, Zhengyuan Su, Ayan Chakraborty, Elizaveta Kostenok, Dongho Ha, Babak Falsafi, Martin Jaggi, Yunho Oh, Amir Yazdanbakhsh

प्रकाशित 2026-07-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Simla Burcu Harma, Danila Mishin, Zhengyuan Su, Ayan Chakraborty, Elizaveta Kostenok, Dongho Ha, Babak Falsafi, Martin Jaggi, Yunho Oh, Amir Yazdanbakhsh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप ज्ञान के एक विशाल, जटिल पुस्तकालय को एक छोटे, पोर्टेबल बैकपैक में फिट करने की कोशिश कर रहे हैं। यह लार्ज लैंग्वेज मॉडल्स (LLMs) नामक सुपर-स्मार्ट कंप्यूटर दिमागों के लिए दैनिक चुनौती है। ये मॉडल कहानियाँ लिखने, पहेलियाँ सुलझाने और हमसे बातें करने में बहुत कुशल हैं, लेकिन ये अविश्वसनीय रूप से भारी होते हैं, जिन्हें चलाने के लिए भारी मात्रा में मेमोरी और ऊर्जा की आवश्यकता होती है। इन्हें ले जाने के लिए पर्याप्त हल्का बनाने के लिए, वैज्ञानिक "क्वांटाइजेशन" (quantization) नामक एक तरकीब का उपयोग करते हैं। इसे एक हाई-डेफिनिशन मूवी को छोटी फ़ाइल आकार में कंप्रेस करने जैसा समझें। हर एक सटीक रंग या शेड को स्टोर करने के बजाय, आप उन्हें सीमित पैलेट पर उपलब्ध निकटतम रंग तक राउंड ऑफ (गोल) कर देते हैं। यह फ़ाइल को छोटा और तेज़ी से चलाने योग्य बनाता है, लेकिन यदि आप बहुत अधिक राउंड ऑफ कर देते हैं, तो तस्वीर धुंधली हो जाती है और विवरण खो जाते हैं।

समस्या यह है कि इन कंप्यूटर दिमागों में कुछ ऐसी "तेज़" आवाज़ें होती हैं जो बाकी सभी से कहीं अधिक ज़ोर से चिल्लाती हैं। संख्याओं की दुनिया में, इन्हें "आउटलेयर्स" (outliers) कहा जाता है। ये दुर्लभ, चरम मान (extreme values) हैं जो पूरे सिस्टम को बिगाड़ देते हैं, जिससे कंप्रेशन अव्यवरेज हो जाता है और मॉडल मूर्खतापूर्ण गलतियाँ करने लगता है। कुछ समय के लिए, शोधकर्ताओं ने डेटा को इधर-उधर घुमाकर (जैसे किसी पहेली को घुमाना) या बड़े और छोटे फ़ाइल आकारों के मिश्रण का उपयोग करके इसे ठीक करने की कोशिश की। लेकिन ये तरीके अक्सर बोझिल थे, जिनमें कंप्यूटर को संख्याओं को वापस अनुवाद करने के लिए लगातार रुकना पड़ता था, जिससे सब कुछ धीमा हो जाता था। अब, शोधकर्ताओं की एक नई टीम ने बैकपैक पैक करने का एक स्मार्ट तरीका प्रस्तावित किया है, जो यात्रा को धीमा किए बिना सूचना के हर एक टुकड़े की विशिष्ट आवश्यकताओं को सुनता है।

यह पेपर MXSens नामक एक नए तरीके का परिचय देता है, जो एक बहुत ही ध्यान देने वाले लाइब्रेरियन की तरह कार्य करता है। पुस्तकालय की हर किताब के साथ एक जैसा व्यवहार करने के बजाय, MXSens पहले यह देखने के लिए एक त्वरित नज़र डालता है कि कौन सी किताबें सबसे नाजुक या महत्वपूर्ण हैं। इसने पाया कि सभी "तेज़" आवाज़ें एक समान नहीं होतीं। कुछ दुर्लभ, चिल्लाने वाले चरम स्तर होते हैं जिन्हें स्पष्ट रूप से समझे जाने के लिए बहुत अधिक स्थान की आवश्यकता होती है, जबकि अन्य केवल भीड़ से थोड़े अधिक तेज़ होते हैं और कम जगह में भी काम चला सकते हैं।

MXSens इन चीजों को संभालने के लिए एक चतुर तीन-स्तरीय प्रणाली का उपयोग करता है। यह मॉडल के सबसे संवेदनशील, चरम हिस्सों को एक उदार 8-बिट स्थान (एक बड़े, मज़बूत बॉक्स की तरह) आवंटित करता है, मध्यम रूप से संवेदनशील हिस्सों को एक मध्यम 6-बिट स्थान (एक मध्यम बॉक्स) देता है, और शांत, चुप हिस्सों को एक तंग, कुशल 4-बिट स्थान (एक छोटा, प्रभावी पाउच) प्रदान करता है। यह मॉडल को फिर से प्रशिक्षित (retrain) किए या उसके मस्तिष्क की संरचना को बदले बिना होता है; यह बस इस आधार पर डेटा को पुनर्व्यवस्थित करता है कि प्रत्येक भाग दबने (squish होने) के प्रति कितना संवेदनशील है। शोधकर्ताओं ने पाया कि यह दृष्टिकोण MXINT नामक एक नए हार्डवेयर-अनुकूल प्रारूप के साथ खूबसूरती से काम करता है, जो आधुनिक कंप्यूटर चिप्स द्वारा पहले से ही समर्थित है।

इसके परिणाम काफी प्रभावशाली हैं। LLaMA-2-70B और LLaMA-3-8B जैसे विशाल मॉडल्स पर परीक्षण करते समय, MXSens ने बहुत कम स्थान का उपयोग करते हुए मॉडल की "आवाज़" को स्पष्ट और सटीक बनाए रखा। विशेष रूप से, एक सख्त W4A4KV4 सेटिंग (जिसका अर्थ है कि वेट्स, एक्टिवेशन्स और की-वैल्यू कैश सभी क्वांटाइज़ किए गए हैं) के तहत, इसने WikiText-2 डेटासेट पर LLaMA-2-70B के लिए 3.77 और LLaMA-3-8B के लिए 7.63 का पर्प्लेक्सिटी (perplexity) स्कोर प्राप्त किया। पर्प्लेक्सिटी भ्रम का एक माप है; यह जितना कम हो, उतना बेहतर है। ये स्कोर अन्य शीर्ष तरीकों की तुलना में काफी बेहतर थे, जो यह सिद्ध करते हैं कि मॉडल के विभिन्न हिस्सों की संवेदनशीलता पर ध्यान देकर, आप दोनों तरफ का सर्वश्रेष्ठ लाभ उठा सकते हैं: एक छोटा, तेज़ मॉडल जो फिर भी स्पष्ट रूप से सोचता है।

लेखक सुझाव देते हैं कि यह विधि एक बड़ा कदम है क्योंकि यह भारी ओवरहेड से बचती है जो लगातार संख्याओं को अनुवाद करने की प्रक्रिया से होता है, जिसने अन्य समान तकनीकों को धीमा कर दिया था। नए हार्डवेयर प्रारूपों की प्राकृतिक ब्लॉक संरचना का उपयोग करके, MXSens इन विभिन्न परिशुद्धता स्तरों (4, 6 और 8 बिट्स) को सहजता से मिला सकता है। अध्ययन दिखाता है कि यह संवेदनशीलता-निर्देशित दृष्टिकोण स्थान बचाने और मॉडल को स्मार्ट बनाए रखने के बीच एक बेहतर संतुलन की अनुमति देता है, जिससे शक्तिशाली AI उन उपकरणों पर भी सुलभ हो सकता है जिनमें विशाल मेमोरी बैंक नहीं होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →