Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling
यह शोध पत्र "फोर ओवर सिक्स" (4/6) को प्रस्तुत करता है, जो NVFP4 क्वांटाइजेशन के लिए एक एडेप्टिव ब्लॉक-स्केलिंग तकनीक है जो बड़े मानों को बेहतर ढंग से संभालने के लिए ब्लॉक स्केल्स को गतिशील रूप से समायोजित करके क्वांटाइजेशन त्रुटि को कम करती है, जिससे न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ BF16 के करीब प्रशिक्षण और अनुमान प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल पुस्तकालय की किताबों को एक छोटे, पोर्टेबल सूटकेस में पैक करने की कोशिश कर रहे हैं। किताबें एक लार्ज लैंग्वेज मॉडल (AI) के "मस्तिष्क" का प्रतिनिधित्व करती हैं, और सूटकेस कंप्यूटर की मेमोरी का प्रतिनिधित्व करता है। सब कुछ फिट करने के लिए, आपको किताबों को सिकोड़ना होगा।
लंबे समय से, हम BF16 (एक मानक, उच्च-परिशुद्धता प्रारूप) नामक एक विधि का उपयोग कर रहे हैं, जो मज़बूत, भारी बक्सों में किताबें पैक करने जैसा है। यह सटीक है, लेकिन इससे सूटकेस जल्दी भर जाता है। हाल ही में, इंजीनियरों ने NVFP4 में स्विच करने की कोशिश की, जो एक बहुत छोटा प्रारूप है। सोचिए कि NVFP4 ओरिगामी (origami) के छोटे, हल्के बक्सों का एक सेट है। वे बहुत अधिक किताबों को आपके सूटकेस में फिट कर देते हैं और AI को तेज़ चलाते हैं, लेकिन इसमें एक पेंच है: क्योंकि बक्से बहुत छोटे हैं, इसलिए कुछ "बड़ी" किताबें कुचल जाती हैं, मुड़ जाती हैं, या उनके पन्ने खो जाते हैं। इस "कुचलने" को क्वांटाइजेशन एरर (quantization error) कहा जाता है, और यह AI को गलतियाँ करने पर मजबूर करता है।
समस्या: छोटे बक्सों का "खुरदरा किनारा" (Rough Edge)
पेपर बताता है कि NVFP4 की एक अजीब सी खूबी है। इसके पास विशिष्ट आकार हैं जिन्हें यह रख सकता है: 0.5, 1, 1.5, 2, 3, 4, और 6।
- यदि कोई किताब ठीक आकार 4 की है, तो वह पूरी तरह फिट बैठती है।
- यदि कोई किताब आकार 5 की है, तो वह फिट नहीं होती। आपको उसे आकार 4 के बॉक्स में या आकार 6 के बॉक्स में जबरन डालना होगा।
- यदि आप आकार 5 की किताब को आकार 4 के बॉक्स में डालते हैं, तो आप बहुत सारी जानकारी खो देते हैं (वह कुचल जाती है)। यदि आप उसे आकार 6 के बॉक्स में डालते हैं, तो आप बहुत सारी जगह बर्बाद करते हैं (वह अंदर हिलती-डुलती रहती है)।
लेखकों ने पाया कि "कुचलना" सबसे अधिक बार उन किताबों के साथ होता है जो सबसे बड़े बॉक्स के लगभग जितने बड़े होते हैं ("नियर-मैक्सिमल" मान)। मानक विधि में, सूटकेस को सबसे बड़ी संभव किताब (आकार 6) को रखने के लिए बनाया जाता है। लेकिन यह एक बड़ा अंतर छोड़ देता है जहाँ आकार 5 की किताबें बुरी तरह कुचल जाती हैं।
समाधान: "फोर ओवर सिक्स" (4/6)
लेखकों, जैक कुक और उनकी टीम ने एक चतुर तरकीब निकाली जिसे फोर ओवर सिक्स (4/6) कहा जाता है।
कल्पना कीजिए कि आप एक सूटकेस पैक कर रहे हैं। हर चीज़ को "आकार 6" के बॉक्स में डालने के बजाय, आप वस्तुओं के प्रत्येक समूह को देखते हैं।
- पुराना तरीका: आप मान लेते हैं कि हर समूह को "आकार 6" के बॉक्स की आवश्यकता है। यदि किसी समूह में आकार 5 की एक किताब है, तो आप उसे कुचल देते हैं।
- 4/6 वाला तरीका: आप समूह की जाँच करते हैं। यदि उस विशिष्ट समूह में सबसे बड़ी किताब केवल आकार 5 की है, तो आप कहते हैं, "ठीक है, हमें इस समूह के लिए आकार 6 के बॉक्स की आवश्यकता नहीं है। आइए एक आकार 4 का बॉक्स उपयोग करें।"
इस विशिष्ट समूह के लिए छोटे "आकार 4" के बॉक्स में स्विच करके, "आकार 5" की किताब (जो अब बॉक्स की सीमा के सापेक्ष काफी छोटी है) बहुत अधिक सहजता से फिट हो जाती है। अब यह किनारे पर कुचल नहीं रही है।
उपमा (Analogy):
इसे एक वीडियो गेम कैरेक्टर के कूदने की तरह सोचें।
- मानक NVFP4: गेम मान लेता है कि कैरेक्टर 10 फीट तक कूद सकता है। यदि वे 9 फीट कूदने की कोशिश करते हैं, तो गेम उन्हें 8 फीट तक राउंड डाउन कर देता है (एक बड़ी गिरावट)।
- 4/6 विधि: गेम विशिष्ट स्तर की जाँच करता है। यदि उच्चतम प्लेटफॉर्म केवल 6 फीट ऊँचा है, तो यह "जंप लिमिट" को 6 फीट पर बदल देता है। अब, 5 फीट की छलांग को 6 फीट (या 4 फीट) के रूप में बहुत अधिक सटीकता से राउंड किया जाता है। कैरेक्टर उतना नीचे नहीं गिरता।
यह व्यवहार में कैसे काम करता है
पेपर एक स्मार्ट एल्गोरिदम का वर्णन करता है जो डेटा के हर छोटे टुकड़े (जिसे "ब्लॉक" कहा जाता है) को पैक करने से पहले उसे देखता है:
- यह उस टुकड़े को "आकार 6" के बॉक्स में पैक करने की कोशिश करता है और गणना करता है कि कितनी जानकारी का नुकसान हुआ।
- यह उसी टुकड़े को "आकार 4" के बॉक्स में पैक करने की कोशिश करता है और नुकसान की गणना करता है।
- यह उस बॉक्स को चुनता है जिससे कम नुकसान (कम त्रुटि) होता है।
आमतौर पर, बहुत बड़ी संख्याओं वाले टुकड़ों के लिए, "आकार 4" वाला बॉक्स विजेता होता है क्योंकि यह "नियर-मैक्सिमल" नंबरों को बेहतर तरीके से फिट करता है।
परिणाम
टीम ने एक विशाल AI मॉडल नेमोट्रॉन 3 नैनो (Nemotron 3 Nano) (30 बिलियन पैरामीटर्स) पर इसका परीक्षण किया।
- ट्रेनिंग (प्रशिक्षण): जब उन्होंने 4/6 का उपयोग करके AI को प्रशिक्षित किया, तो AI ने बेहतर सीखा और मानक NVFP4 विधि की तुलना में कम गलतियाँ कीं। यह भारी, धीमे "BF16" विधि के प्रदर्शन के बहुत करीब पहुँच गया, लेकिन इसने NVFP4 के गति और आकार के लाभों को बनाए रखा।
- गति: उन्होंने दिखाया कि यह "स्मार्ट पैकिंग" कंप्यूटर को धीमा नहीं करती है। यह 15% से भी कम अतिरिक्त काम जोड़ती है, जो बहुत बेहतर सटीकता के लिए एक बहुत छोटी कीमत है।
- मौजूदा मॉडल: उन्होंने पहले से प्रशिक्षित मॉडलों (जैसे Llama और Qwen) पर भी इसे आजमाया। बिना पुन: प्रशिक्षण के भी, 4/6 का उपयोग करने से ये मॉडल समझ और तर्क जैसी परीक्षाओं में अधिक स्मार्ट और सटीक हो गए।
निचोड़ (Bottom Line)
पेपर का दावा है कि डेटा के विभिन्न समूहों के लिए कौन सा बॉक्स आकार उपयोग करना है—कभी-कभी "6" के बजाय "4" का उपयोग करना—यह जानकर, आप महत्वपूर्ण जानकारी के "कुचलने" को रोक सकते हैं। यह लो-प्रिसिजन AI (NVFP4) को बहुत अधिक सटीक बनाता है, जिससे हम अपने वर्तमान हार्डवेयर पर बड़े, तेज़ AI मॉडल चला सकते हैं बिना उनकी "मस्तिष्क शक्ति" खोए।
उन्होंने कोड (कर्नेल) भी जारी किया है ताकि अन्य लोग NVIDIA के नवीनतम ब्लैकवेल (Blackwell) GPU पर इस "स्मार्ट पैकिंग" विधि का उपयोग कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।