← नवीनतम पेपर
💬 NLP

RaZeR: Pushing the Limits of NVFP4 Quantization with Redundant Zero Remapping

यह शोध पत्र RaZeR का प्रस्ताव करता है, जो एक उन्नत संख्यात्मक प्रारूप (numerical format) है जो अतिरिक्त क्वांटाइजेशन मानों (quantization values) को सहारा देने के लिए FP4 ज़ीरो रिप्रेजेंटेशन और FP8 ब्लॉक स्केलिंग फैक्टर से रेडंडेंट बिट्स का पुनरुद्देश्य (repurposing) करके 4-बिट LLM क्वांटाइजेशन सटीकता में सुधार करता है, जिससे नेटिव NVFP4 की तुलना में महत्वपूर्ण परप्लेक्सिटी (perplexity) में कमी आती है।

मूल लेखक: Yuzong Chen, Xilai Dai, Jake Hyun, Chi-Chih Chang, Wonsuk Jang, Yuheng Wu, Thierry Tambe, Jae-sun Seo, Mohamed S. Abdelfattah

प्रकाशित 2026-02-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuzong Chen, Xilai Dai, Jake Hyun, Chi-Chih Chang, Wonsuk Jang, Yuheng Wu, Thierry Tambe, Jae-sun Seo, Mohamed S. Abdelfattah

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: सूटकेस पैक करना

कल्पना कीजिए कि आप एक विशाल वॉर्डरोब (एक लार्ज लैंग्वेज मॉडल, या LLM) को एक छोटे से कैरी-ऑन सूटकेस (कंप्यूटर चिप की सीमित मेमोरी) में फिट करने की कोशिश कर रहे हैं। इसे फिट करने के लिए, आपको कपड़ों को कंप्रेस (छोटा) करना होगा। इसे क्वांटाइजेशन (quantization) कहा जाता है।

हाल ही में, पैकिंग का एक नया तरीका पेश किया गया जिसे NVFP4 कहा जाता है। यह एक बहुत ही कुशल फोल्डिंग तकनीक की तरह है जो बहुत जगह बचाती है और कपड़ों को जल्दी से निकालने में आसान बनाती है। हालाँकि, इस पेपर के पीछे के शोधकर्ताओं ने देखा कि इस कुशल तरीके में भी सूटकेस के अंदर कुछ "खाली जेबें" थीं जिनका उपयोग नहीं किया जा रहा था।

RaZeR एक नई तकनीक है जो उन खाली जेबों को ढूंढती है, उन्हें उपयोगी चीज़ों से भर देती है, और सूटकेस को बिना बड़ा किए उसमें और भी अधिक जानकारी रखने में सक्षम बनाती है।


समस्या: दो "खाली जेबें"

शोधकर्ताओं ने वर्तमान NVFP4 सिस्टम में बर्बाद हुई जगह के दो विशिष्ट प्रकारों का पता लगाया:

  1. "डबल ज़ीरो" की गलती:
    वर्तमान सिस्टम में, संख्या "शून्य" (zero) को दो बार लिखा जाता है: एक बार "पॉजिटिव ज़ीरो" के रूप में और एक बार "नेगेटिव ज़ीरो" के रूप में।

    • उपमा: कल्पना कीजिए कि आप एक सूटकेस पैक कर रहे हैं और आपके पास दो समान टैग हैं जिन पर दोनों लिखा है "खाली जगह"। आपको "कुछ नहीं है" का अर्थ बताने के लिए केवल एक टैग की आवश्यकता है। दो टैग होना बर्बादी है। गणित में, पॉजिटिव और नेगेटिव ज़ीरो का होना अनावश्यक है क्योंकि वे बिल्कुल एक ही चीज़ का अर्थ देते हैं।
  2. स्केल पर "अनयूज्ड साइन" (Unused Sign):
    NVFP4 संख्याओं के समूहों को मापने के लिए एक "स्केलिंग फैक्टर" (रूलर/पैमाना) का उपयोग करता है। यह रूलर एक ऐसे फॉर्मेट में स्टोर किया जाता है जो ऋणात्मक (negative) संख्याओं की अनुमति देता है। हालाँकि, इस विशिष्ट संदर्भ में रूलर हमेशा धनात्मक (positive) होता है, इसलिए स्टोरेज का "नेगेटिव" हिस्सा बस खाली बैठा रहता है और कुछ नहीं कर रहा होता है।

    • उपमा: यह एक थर्मामीटर का उपयोग करने जैसा है जो गर्म और ठंडे दोनों को माप सकता है, लेकिन आप केवल गर्म सूप ही माप रहे हैं। थर्मामीटर का "ठंडा" वाला हिस्सा केवल बेकार वजन है।

समाधान: RaZeR (रेडंडेंट ज़ीरो रीमैपिंग)

Yuzong Chen और सहयोगियों के नेतृत्व वाली टीम ने इन समस्याओं को ठीक करने के लिए RaZeR बनाया। उन्होंने इसे इस प्रकार किया:

  • चरण 1: जगह को पुनः प्राप्त करना। उन्होंने "डबल ज़ीरो" और रूलर पर अनयूज्ड साइन बिट से "अतिरिक्त" जगह ली।
  • चरण 2: एक "विशेष मान" (Special Value) बनाना। उस खाली जगह को बर्बाद करने के बजाय, उन्होंने इसका उपयोग एक नया, विशेष नंबर बनाने के लिए किया जिसे अब सिस्टम प्रदर्शित कर सकता है।
    • उपमा: कल्पना कीजिए कि आपके सूटकेस में एक गुप्त कंपार्टमेंट है जिसके बारे में आप नहीं जानते थे। RaZeR उस कंपार्टमेंट को खोलता है और उसके अंदर एक "जादुई उपकरण" रखता है। यह उपकरण उन वस्तुओं को पैक करने में मदद करता है जो पहले फिट होने में बहुत कठिन थे।
  • चरण 3: स्मार्ट चयन। उन्होंने सटीक रूप से पता लगाया कि कौन सा विशेष नंबर सबसे अच्छा काम करता है। उन्होंने पाया कि उपलब्ध नंबरों की सूची में संख्या 5 (और -5) को जोड़ने से सिस्टम के बीच का अंतर भर जाता है, जिससे "कपड़ों" (AI मॉडल के डेटा) की पैकिंग बहुत अधिक सटीक हो जाती है।

परिणाम: स्मार्ट पैकिंग, वही आकार

पेपर का दावा है कि RaZeR का उपयोग करके:

  • सटीकता में सुधार हुआ: AI मॉडल गलतियाँ कम करता है। तकनीकी शब्दों में, "परप्लेक्सिटी" (भ्रम का एक माप) काफी कम हो गई। मानक NVFP4 विधि की तुलना में, RaZeR ने त्रुटियों को लगभग 30-35% कम कर दिया।
  • अतिरिक्त स्थान की आवश्यकता नहीं: सूटकेस का आकार बिल्कुल वही है। उन्होंने अधिक मेमोरी नहीं जोड़ी; उन्होंने बस जो पहले से मौजूद था उसे अधिक कुशल बनाने के लिए पुनर्गठित किया।
  • गति: उन्होंने विशेष कंप्यूटर प्रोग्राम (जिन्हें "कर्नेल्स" कहा जाता है) बनाए और यहाँ तक कि भविष्य के कंप्यूटर चिप्स (टेन्सर कोर्स) के लिए एक ब्लूप्रिंट भी डिज़ाइन किया जो इस नए तरीके का उपयोग पुराने तरीके जितनी ही तेज़ी से कर सकते हैं।

यह क्यों महत्वपूर्ण है

वर्तमान AI मॉडलों को विशाल पुस्तकालयों के रूप में सोचें। उन्हें तेज़ी से पढ़ने के लिए, आपको किताबों को सिकोड़ना (shrink) होगा।

  • पुराना तरीका (NVFP4): आप किताबों को सिकोड़ते हैं, लेकिन आप गलती से कुछ पन्ने खो देते हैं क्योंकि फोल्डिंग का तरीका परफेक्ट नहीं था।
  • RaZeR का तरीका: आप उसी फोल्डिंग तरीके का उपयोग करते हैं, लेकिन आपको एहसास होता है कि आप एक पन्ना उल्टा पकड़ रहे थे। आप उसे सीधा करते हैं, और अचानक, आपके पास सभी पन्ने वापस आ जाते हैं, और किताब का आकार भी वही रहता है।

पेपर निष्कर्ष निकालता है कि RaZeR AI मॉडलों को वर्तमान और भविष्य के कंप्यूटर चिप्स पर अधिक तेज़ी से और अधिक सटीकता से चलने की अनुमति देता है, बिना किसी बड़े या महंगे हार्डवेयर की आवश्यकता के। यह अनिवार्य रूप से मौजूदा तकनीक से "अधिक लाभ" (more bang for the buck) प्राप्त करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →