ScaleSweep: Accurate NVFP4 Post-Training Quantization of LLMs via Block Scale Initialization
यह शोध पत्र ScaleSweep का प्रस्ताव करता है, जो LLMs के लिए एक कुशल पोस्ट-ट्रेनिंग क्वांटाइजेशन विधि है जो सैद्धांतिक रूप से व्युत्पन्न उम्मीदवारों के न्यूनतम रेंज को स्वीप करके NVFP4 ब्लॉक स्केल्स को अनुकूलित करता है, जिससे मौजूदा इनिशियलाइजेशन तकनीकों की तुलना में फुल प्रिसिजन के प्रदर्शन अंतराल को काफी कम कर दिया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास ज्ञान का एक विशाल, अविश्वसनीय रूप से विस्तृत पुस्तकालय है (एक लार्ज लैंग्वेज मॉडल, या LLM)। इस पुस्तकालय को एक छोटे से बैकपैक में फिट करने के लिए ताकि आप इसे फोन या लैपटॉप पर ले जा सकें, आपको उन किताबों को सिकोड़ना होगा। इस प्रक्रिया को क्वांटाइजेशन (quantization) कहा जाता है।
आमतौर पर, जब आप एक किताब को सिकोड़ते हैं, तो आप कुछ विवरण खो देते हैं। यदि आप इसे बहुत अधिक सिकोड़ देते हैं, तो कहानी अर्थहीन हो जाती है। हाल ही में, एक प्रकार का नया "श्रिंक रैप" (shrink wrap) जिसे NVFP4 कहा जाता है, आविष्कार किया गया है। यह एक सुपर-कुशल पैकिंग सामग्री की तरह है जो आपको किताबों को 4 बिट्स (बहुत छोटा) तक सिकोड़ने की अनुमति देता है और साथ ही कहानी को काफी हद तक सुरक्षित रखता है।
हालाँकि, इसमें एक पेच है। इन किताबों को कुशलतापूर्वक पैक करने के लिए, आपको पृष्ठों के हर छोटे समूह के साथ एक छोटा सा "साइज टैग" (जिसे स्केल/scale कहा जाता है) लगाना होगा। यदि आप गलत साइज टैग चुनते हैं, तो पृष्ठ दब सकते या खिंच सकते हैं, और कहानी खराब हो सकती है।
समस्या: साइज टैग का अनुमान लगाना
साइज टैग चुनने की वर्तमान विधि केवल अंदर की सबसे बड़ी वस्तु को देखकर यह कहने जैसी है कि, "ठीक है, इस बॉक्स को उस एक वस्तु के लिए पर्याप्त बड़ा होना चाहिए।" इसे AbsMax कहा जाता है।
लेखकों ने पाया कि इस "अनुमान लगाने" वाली विधि में त्रुटि की बहुत गुंजाइश रहती है। यह सामान पैक करने जैसा है: यदि आप केवल अनुमान लगाते हैं, तो आप या तो बहुत खाली जगह छोड़ देंगे या अपने कपड़ों को कुचल देंगे। वे प्रत्येक पृष्ठों के समूह के लिए एकदम सही साइज टैग खोजने का एक तरीका चाहते थे ताकि कहानी यथासंभव स्पष्ट बनी रहे।
समाधान: "स्केलस्वीप" (ScaleSweep - द स्वीपिंग सर्च)
टीम ने ScaleSweep नामक एक नया तरीका आविष्कार किया।
कल्पना कीजिए कि आप एक पुराने रेडियो पर वॉल्यूम (आवाज़) की एकदम सही सेटिंग खोजने की कोशिश कर रहे हैं।
- पुराना तरीका (AbsMax): आप बस डायल को उस स्थान पर घुमा देते हैं जहाँ सबसे तेज़ गाना बज रहा है, और उम्मीद करते हैं कि बाकी गाने ठीक लगेंगे।
- ScaleSweep का तरीका: आप जानते हैं कि एकदम सही वॉल्यूम उस तेज़ गाने के पास ही कहीं है। अनुमान लगाने के बजाय, आप उस तेज़ गाने के आसपास की संख्याओं की एक बहुत छोटी, विशिष्ट रेंज में अपनी उंगली को तेज़ी से आगे-पीछे घुमाते हैं। आप उस रेंज में हर एक सूक्ष्म सेटिंग की जांच करते हैं और वह चुनते हैं जो पूरी प्लेलिस्ट को सबसे अच्छा बनाती है।
क्योंकि "डायल" (FP8 स्केल फॉर्मेट) में सीमित संख्या में सेटिंग्स हैं (जैसे कि केवल 126 बटनों वाला रेडियो), इसलिए यह "स्वीपिंग" वास्तव में बहुत तेज़ है और इसमें अतिरिक्त समय नहीं लगता है।
गुप्त नुस्खा: "मैथ मैप" (The Math Map)
आप पूछ सकते हैं, "वे रेडियो के हर संभव बटन की जांच क्यों नहीं कर लेते?" उत्तर यह है: वे कर सकते थे, लेकिन इसमें बहुत समय लगता।
लेखकों ने चालाकी से गणित का उपयोग करके एक मैप (नक्शा) बनाया। उन्होंने सिद्ध किया कि एकदम सही बटन हमेशा "सबसे बड़ी वस्तु" के अनुमान के ठीक बगल में एक छोटे से पड़ोस में स्थित होता है।
- उन्होंने एक लोअर बाउंड (Lower Bound) निकाला (आपको इस बटन से नीचे देखने की आवश्यकता नहीं है)।
- उन्होंने एक अपर बाउंड (Upper Bound) निकाला (आपको इस बटन से ऊपर देखने की आवश्यकता नहीं है)।
इसने एक ढेर में सुई खोजने की प्रक्रिया को एक एकल, बहुत छोटे बॉक्स में सुई खोजने में बदल दिया। यह इस प्रक्रिया को अविश्वसनीय रूप से तेज़ बनाता है, जिससे पैकिंग प्रक्रिया में लगभग कोई अतिरिक्त समय नहीं जुड़ता।
परिणाम: एक स्पष्ट कहानी
टीम ने लोकप्रिय AI मॉडलों (जैसे Llama और Qwen) पर इसका परीक्षण किया। उन्होंने मॉडलों को तीन अलग-अलग तरीकों से पैक करने का प्रयास किया:
- केवल "ज्ञान" (weights) को सिकोड़ना।
- ज्ञान और "वर्किंग मेमोरी" (KV cache) दोनों को सिकोड़ना।
- "प्रश्नों" (query states) सहित सब कुछ सिकोड़ना जो पूछे जा रहे हैं।
निष्कर्ष:
- बेहतर गुणवत्ता: लगभग हर परीक्षण में, ScaleSweep ने पुराने अनुमान लगाने वाले तरीकों की तुलना में AI को अधिक स्मार्ट और सटीक बनाए रखा।
- आक्रामक पैकिंग: यहाँ तक कि जब उन्होंने AI को जितना संभव हो सके उतना सिकोड़ने की कोशिश की (सब कुछ कंप्रेस किया), तब भी ScaleSweep मूल, पूर्ण आकार वाले AI की 93% से 95% बुद्धिमत्ता को बनाए रखने में सफल रहा।
- कोई अतिरिक्त लागत नहीं: क्योंकि उन्होंने अपनी "मैथ मैप" का उपयोग करके खोज को सीमित किया, इसलिए इस सुधार ने कंप्यूटर को बिल्कुल भी धीमा नहीं किया।
सारांश में
यह पेपर ScaleSweep को पेश करता है, जो AI मॉडलों को सिकोड़ने के लिए एकदम सही सेटिंग्स खोजने का एक स्मार्ट और तेज़ तरीका है। अनुमान लगाने के बजाय, यह गणितीय रूप से प्रमाणित एक बहुत छोटी रेंज के विकल्पों की तेज़ी से जांच करता है ताकि यह सुनिश्चित किया जा सके कि AI यथासंभव स्मार्ट बना रहे, भले ही उसे एक बहुत छोटी जगह में दबा दिया गया हो। यह अपने डिजिटल पुस्तकालय को पैक करने के लिए एक रफ गेस (rough guess) से एक प्रिसिजन टूल (precision tool) में अपग्रेड करने जैसा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।