← नवीनतम पेपर
🤖 AI

ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs

ARCQuant एक नवीन फ्रेमवर्क है जो संवर्धित अवशिष्ट चैनलों (augmented residual channels) के माध्यम से NVFP4 क्वांटाइजेशन को बढ़ाकर लार्ज लैंग्वेज मॉडल्स के लिए अत्याधुनिक सटीकता और महत्वपूर्ण इन्फरेंस स्पीडअप प्राप्त करता है, जो हार्डवेयर-एकीकृत परिशुद्धता बनाए रखते हुए और मानक GEMM कर्नेल का उपयोग करते हुए क्वांटाइजेशन त्रुटियों की प्रभावी ढंग से क्षतिपूर्ति करता है।

मूल लेखक: Haoqian Meng, Yilun Luo, Yafei Zhao, Wenyuan Liu, Peng Zhang, Xindian Ma

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoqian Meng, Yilun Luo, Yafei Zhao, Wenyuan Liu, Peng Zhang, Xindian Ma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास ज्ञान का एक विशाल, अविश्वसनीय रूप से विस्तृत पुस्तकालय है (एक लार्ज लैंग्वेज मॉडल, या LLM)। इस पुस्तकालय को अपने छोटे से बैकपैक (आपके कंप्यूटर की मेमोरी) में फिट करने और इसे तेज़ी से चलाने के लिए, आपको किताबों को सिकोड़ना होगा। इस प्रक्रिया को क्वांटाइजेशन (quantization) कहा जाता है।

आमतौर पर, आप अपनी किताबों को 8-बिट "पेपरबैक" में सारांशित करके छोटा कर सकते हैं। लेकिन और भी छोटा और तेज़ होने के लिए, शोधकर्ता उन्हें नन्हे 4-बिट "पोस्टकार्ड" में सिकोड़ने की कोशिश कर रहे हैं।

हालाँकि, एक समस्या है: इस पुस्तकालय के कुछ पन्नों में बहुत बड़े, नाटकीय पैराग्राफ (जिन्हें आउटलेयर्स/outliers कहा जाता है) हैं जो एक छोटे से पोस्टकार्ड पर ठीक से फिट नहीं होते। यदि आप उन्हें दबाने की कोशिश करते हैं, तो पूरा पन्ना विकृत हो जाता है और कहानी समझ में नहीं आती।

वर्तमान समाधानों के साथ समस्या

वैज्ञानिकों ने इसे ठीक करने के दो मुख्य तरीके आज़माए हैं, लेकिन दोनों में कमियाँ हैं:

  1. "शफल" (Shuffle) विधि: कल्पना कीजिए कि आप सारा फर्नीचर इधर-उधर खिसकाकर एक अव्यवस्थित कमरे को ठीक करने की कोशिश कर रहे हैं ताकि एक बड़ा सोफा छोटे कोने में फिट हो सके। हालाँकि सोफा फिट हो जाता है, लेकिन अब आपने पूरे कमरे को अराजक बना दिया है। AI के संदर्भ में, यह "रोटेशन" बड़े नंबरों को चारों ओर फैला देता है, जिससे वे व्यवस्थित ब्लॉक नष्ट हो जाते हैं जिन पर नए कंप्यूटर चिप्स (NVIDIA का ब्लैकवेल आर्किटेक्चर) तेज़ी से काम करने के लिए निर्भर करते हैं।

  2. "मिश्रित-आकार" (Mixed-Size) विधि: कल्पना कीजिए कि आप एक बड़े सोफे को एक बड़े बक्से (उच्च परिशुद्धता/high precision) में रखते हैं और छोटी कुर्सियों को छोटे बक्सों (कम परिशुद्धता/low precision) में रखते हैं। समस्या यह है कि आपका डिलीवरी ट्रक (कंप्यूटर हार्डवेयर) एक समय में केवल एक ही आकार के बक्से ले जाने के लिए डिज़ाइन किया गया है। मिश्रित आकार रखने से ट्रक को बार-बार रुकना और गियर बदलना पड़ता है, जिससे गति धीमी हो जाती है।

समाधान: ARCQuant (द "रेसिड्यूअल बैकपैक")

इस पेपर के लेखक, जो तियानजिन यूनिवर्सिटी से हैं, एक नया तरीका प्रस्तावित करते हैं जिसे ARCQuant कहा जाता है। फर्नीचर को इधर-उधर करने या मिश्रित बक्से उपयोग करने के बजाय, वे एक चतुर तरकीब का उपयोग करते हैं: द ऑगमेंटेड रेसिड्यूअल चैनल (The Augmented Residual Channel)

यहाँ इसका सादृश्य (analogy) दिया गया है:

कल्पना कीजिए कि आप यात्रा के लिए एक सूटकेस (डेटा) पैक कर रहे हैं।

  • मुख्य वस्तु: आपके पास एक बड़ा, भारी विंटर कोट (आउटलेयर डेटा) है।
  • समस्या: सूटकेस कोट को सपाट रखने के लिए बहुत छोटा है।
  • पुराना तरीका: आप उसे अंदर डालने की कोशिश करते हैं, कोट को कुचल देते हैं (सटीकता खो देते हैं), या आप एक दूसरा, अलग आकार का सूटकेस खरीदते हैं (मिश्रित परिशुद्धता), जिसे एयरलाइन कुशलता से चेक-इन करने की अनुमति नहीं देती है।
  • ARCQuant का तरीका: आप कोट को लेते हैं, उसे कसकर मोड़ते हैं, और उसे सूटकेस के किनारे से जुड़े एक विशेष, पतले "रेसिड्यूअल" पॉकेट में रखते हैं।
    • मुख्य सूटकेस आपके बाकी कपड़ों को पूरी तरह से रखता है।
    • पतला पॉकेट उन विशिष्ट विवरणों को रखता है जो कोट को कुचलने से खो गए थे।
    • महत्वपूर्ण बात: एयरलाइन (कंप्यूटर हार्डवेयर) इसे एक एकल, एकीकृत सूटकेस के रूप में देखती है। उन्हें रुकने और गियर बदलने की ज़रूरत नहीं पड़ती। वे बस पूरी चीज़ को एक इकाई के रूप में प्रोसेस करते हैं।

यह सरल शब्दों में कैसे काम करता है

  1. परेशानी की पहचान: सिस्टम डेटा को स्कैन करता है ताकि "भारी कोट" (वे आउटलेयर नंबर जो 4-बिट के लिए बहुत बड़े हैं) को खोजा जा सके।
  2. अलग करना और सुरक्षित करना: यह उन बड़े नंबरों को लेता है, गणना करता है कि उन्हें सिकोड़ने से क्या नुकसान होगा, और उस "खोए हुए अंतर" (रेसिड्यूअल) को एक विशेष अतिरिक्त कॉलम में सुरक्षित करता है।
  3. एकीकृत पैकिंग: यह मुख्य डेटा और "अंतर" वाले डेटा को एक साथ एक मानक प्रारूप में पैक करता है जिसे कंप्यूटर चिप पूरी तरह से समझता है।
  4. जादुई गणित: जब कंप्यूटर सूटकेस को पढ़ता है, तो वह मुख्य भाग और "अंतर" वाले भाग को तुरंत वापस जोड़ देता है। क्योंकि यह सब एक ही बार में होता है, इसलिए यह अविश्वसनीय रूप से तेज़ है।

शोध पत्र क्या दावा करता है

शोधकर्ताओं ने लोकप्रिय AI मॉडल्स (जैसे LLaMA और Qwen) पर नवीनतम NVIDIA ग्राफिक्स कार्ड्स (RTX 5090 और PRO 6000) का उपयोग करके इसका परीक्षण किया।

  • सटीकता (Accuracy): उनका तरीका इतना अच्छा है कि AI लगभग उतना ही अच्छा प्रदर्शन करता है जितना कि पूर्ण-आकार वाला, बिना कंप्रेस्ड वर्शन। यह वर्तमान में उपलब्ध सभी 4-बिट विधियों को पछाड़ देता है।
  • गति (Speed): क्योंकि यह कंप्यूटर को अलग-अलग डेटा फॉर्मेट के बीच स्विच करने के लिए मजबूर नहीं करता है, यह मानक उच्च-परिशुद्धता वाले वर्शन की तुलना में 3 गुना तक तेज़ चलता है।
  • दक्षता (Efficiency): यह कम मेमोरी का उपयोग करता है और कंप्यूटर को धीमा नहीं करता है, भले ही यह "भारी कोट" को ठीक करने के लिए अतिरिक्त गणित कर रहा हो।

संक्षेप में

ARCQuant AI के लिए एक स्मार्ट पैकिंग सिस्टम की तरह है। यह उन वस्तुओं को ढूंढता है जो एक छोटे बॉक्स के लिए बहुत बड़ी हैं, उन्हें एक विशेष पतली परत में लपेटता है, और उन्हें मुख्य बॉक्स के साथ जोड़ देता है। इस तरह, AI स्मार्ट और सटीक रहता है, लेकिन एक छोटे, तेज़ पैकेज में फिट हो जाता है जिसे कंप्यूटर का हार्डवेयर बिना किसी रुकावट के संभाल सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →