← नवीनतम पेपर
🤖 machine learning

MosaicQuant: Inlier-Outlier Disaggregation for Unified 4-Bit LLM Quantization

मोज़ेकक्वांट (MosaicQuant) एक एकीकृत 4-बिट एलएलएम (LLM) क्वांटाइजेशन फ्रेमवर्क पेश करता है जो सटीकता बनाए रखने के लिए वेट्स (weights) को एक डेंस बेस (dense base) और एक स्पार्स रेसिडुअल (sparse residual) में अलग करता है, जबकि इसका जिपरइंजन (ZipperEngine) घटक उनके निष्पादन को एक एकल लो-बिट पाइपलाइन में फ्यूज करता है ताकि बेसलाइन्स की तुलना में 1.24× तक की स्पीडअप के साथ लगभग FP16 प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Yangjia Hu, Haodong Wang, Zicong Hong, Qianli Liu, Quanxin Shou, Jian Lin, Song Guo, Xiaowei Shen, Xiangjun Huang, Dian Wang, Jian Yang

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yangjia Hu, Haodong Wang, Zicong Hong, Qianli Liu, Quanxin Shou, Jian Lin, Song Guo, Xiaowei Shen, Xiangjun Huang, Dian Wang, Jian Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास किताबों का एक विशाल पुस्तकालय (लार्ज लैंग्वेज मॉडल्स, या LLMs) है जिसे आप अपने बैकपैक में ले जाना चाहते हैं। समस्या यह है कि किताबें इतनी भारी और मोटी हैं कि आपका बैकपैक उन्हें नहीं उठा सकता, और उन्हें पढ़ने में बहुत समय लगता है।

इसे हल करने के लिए, आप किताबों को सिकोड़ने का निर्णय लेते हैं। आप उन्हें छोटे, 4-बिट "पॉकेट एडिशन" (क्वांटाइजेशन) में बदलना चाहते हैं। इससे वे हल्के और पढ़ने में तेज़ हो जाते हैं। हालाँकि, एक पेच है: जब आप किताबों को बहुत अधिक सिकोड़ देते हैं, तो आप महत्वपूर्ण विवरण खो देते हैं।

अधिकांश किताबों में बहुत सारे सामान्य, उबाऊ शब्द होते हैं (जैसे "the," "is," "and") जिन्हें सिकोड़ना आसान है। लेकिन कभी-कभार एक दुर्लभ, जटिल शब्द या एक नाटकीय मोड़ (एक "आउटलियर") आता है जो कहानी के लिए महत्वपूर्ण होता है। यदि आप उन दुर्लभ शब्दों को भी सामान्य शब्दों की तरह ही बहुत छोटे आकार में सिकोड़ने की कोशिश करते हैं, तो कहानी बिखर जाती है और AI गलतियाँ करने लगता है।

पुराना तरीका: "वीआईपी सेक्शन" की समस्या

पिछले तरीकों ने इसे ठीक करने के लिए यह कहा: "ठीक है, आइए दुर्लभ, महत्वपूर्ण शब्दों को उनके मूल, भारी प्रारूप (उच्च परिशुद्धता) में रखें और केवल उबाऊ शब्दों को सिकोड़ें।"

हालांकि इसने कहानी को सटीक रखा, लेकिन इसने एक नई समस्या पैदा कर दी। कल्पना कीजिए कि एक बस है जहाँ अधिकांश यात्री छोटी फोल्डिंग स्टूल (छोटा, संकुचित डेटा) पर बैठे हैं, लेकिन कुछ वीआईपी बड़े, भारी आर्मचेयर (उच्च-परिशुद्धता डेटा) पर बैठे हैं।

  • समस्या: बस ड्राइवर (कंप्यूटर चिप) को अलग-अलग सीटों को संभालने के लिए लगातार गियर बदलने पड़ते हैं। उसे रुकना पड़ता है, भारी कुर्सियों को हटाना पड़ता है और उन्हें वापस बदलना पड़ता है। यह स्विचिंग बस को धीमा कर देती है, जिससे वह गति खत्म हो जाती है जो आपने अन्य यात्रियों को सिकोड़कर प्राप्त की थी।

नया तरीका: MosaicQuant

लेखकों ने इस शोध पत्र में MosaicQuant नामक एक नया सिस्टम प्रस्तावित किया है। वीआईपी को बड़ी कुर्सियों में रखने के बजाय, वे सभी को एक ही छोटी फोल्डिंग स्टूल (एकीकृत 4-बिट) पर रखते हैं। लेकिन, कठिन शब्दों को संभालने के लिए वे एक चतुर मोड़ जोड़ते हैं।

यह कैसे काम करता है, एक "मोज़ेक" (Mosaic) सादृश्य का उपयोग करते हुए:

1. बेस लेयर (सघन 4-बिट)
वे पूरी किताब को लेते हैं और उसे एक समान 4-बिट आकार में सिकोड़ देते हैं। यह सभी सामान्य शब्दों को पूरी तरह से कैप्चर करता है। हालाँकि, दुर्लभ, जटिल शब्द थोड़े धुंधले या विकृत हो जाते हैं क्योंकि उन्हें छोटे प्रारूप में मजबूर किया गया था।

2. "स्टिच" लेयर (स्पार्स रेसिड्यूल)
दुर्लभ शब्दों को एक नई बड़ी कुर्सी देने के बजाय, वे कहानी के उन विशिष्ट हिस्सों के लिए एक छोटा, अदृश्य "पैच" या "स्टिच" (टांका) बनाते हैं जहाँ विकृति सबसे अधिक है।

  • वे पूरी किताब को पैच नहीं करते हैं। वे केवल उन विशिष्ट पृष्ठों को पैच करते हैं जहाँ विकृति सबसे खराब है।
  • यह पैच भी 4-बिट है, इसलिए यह उसी छोटी स्टूल पर फिट बैठता है।
  • क्योंकि वे केवल किताब के कुछ विशिष्ट स्थानों (लगभग 10%) को पैच करते हैं, इसलिए यह बहुत हल्का है और आपके बैकपैक का वजन नहीं बढ़ाता है।

3. "ज़िपर" इंजन (ZipperEngine)
यही असली जादू है जो इसे तेज़ बनाता है। पुराने "वीआईपी" तरीके में, कंप्यूटर को भारी कुर्सियों और छोटी स्टूल के बीच स्विच करने के लिए रुकना पड़ता था।

  • MosaicQuant का ZipperEngine एक मास्टर दर्जी की तरह कार्य करता है। यह मुख्य किताब (सघन बेस) और छोटे पैच (स्पार्स रेसिड्यूल्स) को लेता है और उन्हें चलते हुए बस के साथ ही सिल देता है।
  • यह गियर बदलने के लिए नहीं रुकता। यह मुख्य टेक्स्ट और पैच को एक ही सुचारू गति में एक साथ प्रोसेस करता है। इसका मतलब है कि कंप्यूटर चिप को कभी भी डेटा को "कन्वर्ट" करने के लिए रुकने की आवश्यकता नहीं होती, जिससे इसकी गति उच्च बनी रहती है।

यह क्यों महत्वपूर्ण है

लेखकों ने शक्तिशाली AI मॉडल (जैसे LLaMA और Qwen) पर इसका परीक्षण किया और दो मुख्य परिणाम पाए:

  1. सटीकता (Accuracy): कहानियाँ (AI आउटपुट) मूल भारी किताबों जितनी ही लगभग पूर्ण रहीं। "पैच" ने धुंधले हिस्सों को इतनी अच्छी तरह से ठीक कर दिया कि AI अपनी बुद्धिमत्ता नहीं खो सका।
  2. गति (Speed): क्योंकि उन्हें विभिन्न प्रारूपों के बीच स्विच करने की आवश्यकता नहीं थी, इसलिए AI मानक 16-बिट संस्करण की तुलना में 1.24 गुना तेज़ चला, और उन अन्य तरीकों की तुलना में बहुत तेज़ था जिन्होंने उच्च और निम्न परिशुद्धता को मिलाने की कोशिश की थी।

संक्षेप में: MosaicQuant एक पूरे पुस्तकालय को पॉकेट साइज में सिकोड़ने जैसा है, लेकिन महत्वपूर्ण हिस्सों को बाहर छोड़ने या उन्हें भारी बनाने के बजाय, यह त्रुटियों को ठीक करने के लिए छोटे, हल्के "पैच" जोड़ता है, और यह सब एक सुचारू और तेज़ प्रक्रिया को बनाए रखते हुए करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →