ADMM-Q: An Improved Hessian-based Weight Quantizer for Post-Training Quantization of Large Language Models
ADMM-Q एक नवीन, मॉड्यूलर पोस्ट-ट्रेनिंग वेट क्वांटाइजेशन एल्गोरिदम है जो अल्टरनेटिंग डायरेक्शन मेथड ऑफ मल्टीप्लायर्स के एक कॉम्बिनेटोरियल वेरिएंट पर आधारित है, जो क्वांटाइजेशन बाधाओं को लागू करते हुए लेयर-वाइज रिकंस्ट्रक्शन एरर को न्यूनतम करके आक्रामक सब-4-बिट क्वांटाइजेशन स्तरों पर लार्ज लैंग्वेज मॉडल्स की उपयोगिता में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ ADMM-Q पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ हिंदी अनुवाद दिया गया है।
बड़ी तस्वीर: विशाल दिमागों को सिकोड़ना
Qwen या LLaMA जैसे लार्ज लैंग्वेज मॉडल्स (LLMs) की कल्पना एक विशाल, अत्यंत विस्तृत लाइब्रेरी के रूप में करें। इन लाइब्रेरी में अरबों किताबें (पैरामीटर्स) हैं जो AI को लिखने, तर्क करने और चैट करने में सक्षम बनाती हैं। हालाँकि, क्योंकि ये लाइब्रेरी बहुत बड़ी हैं, इन्हें ले जाना कठिन है (उच्च मेमोरी उपयोग) और इन्हें पढ़ने में बहुत समय लगता है (धीमी गणना)।
क्वांटाइजेशन (Quantization) इन लाइब्रेरीज़ को सिकोड़ने की प्रक्रिया है। हर किताब को हाई-डेफिनिशन, फुल-कलर इंक (32-बिट या 16-बिट प्रिसिजन) में रखने के बजाय, हम उन्हें कम रंगों या सरल प्रतीकों (4-बिट या यहाँ तक कि 2-बिट) का उपयोग करके फिर से लिखने की कोशिश करते हैं। लक्ष्य लाइब्रेरी को इतना छोटा बनाना है कि वह कहानी खोए बिना एक बैकपैक में फिट हो सके।
समस्या: "लालची" सिकोड़ने वाले (The "Greedy" Shrinkers)
इन मॉडल्स को सिकोड़ने के मौजूदा तरीके, जैसे कि GPTQ (वर्तमान उद्योग मानक), एक लालची संपादक (Greedy Editor) की तरह काम करते हैं।
- वे कैसे काम करते हैं: वे पहले वाक्य को देखते हैं, उसे सिकोड़ते हैं, और आगे बढ़ जाते हैं। फिर वे दूसरे वाक्य को देखते हैं, उसे सिकोड़ते हैं, और आगे बढ़ जाते हैं।
- दोष: जब संपादक पहले वाक्य को सिकोड़ता है, तो वह एक छोटी सी गलती कर सकता है। क्योंकि वे तुरंत आगे बढ़ जाते हैं, वे उस गलती को सुधारने के लिए कभी पीछे मुड़कर नहीं देखते। जब तक वे किताब के अंत तक पहुँचते हैं, वे छोटी-छोटी गलतियाँ जमा होकर कहानी को भ्रमित करने वाला या निरर्थक बना देती हैं। यह विशेष रूप से तब बुरा होता है जब किताबों को बहुत अधिक आक्रामक तरीके से (2 या 3 बिट तक) सिकोड़ने की कोशिश की जाती है।
समाधान: ADMM-Q (एक "टीम हडल" दृष्टिकोण)
लेखक ADMM-Q नामक एक नया तरीका प्रस्तावित करते हैं। एक अकेले काम करने वाले लालची संपादक के बजाय, कल्पना करें कि हर अध्याय के लिए संपादकों की एक टीम एक गोल मेज पर बैठक (Round-table meeting) कर रही है।
टीम हडल (संयुक्त अनुकूलन/Joint Optimization):
एक समय में एक वाक्य को ठीक करने के बजाय, टीम पूरे अध्याय को एक साथ देखती है। वे पूछते हैं, "यदि हम यहाँ एक शब्द बदलते हैं, तो इसका उस शब्द पर क्या प्रभाव पड़ेगा?" वे सभी शब्दों को एक साथ समायोजित करते हैं ताकि सबसे अच्छा संयोजन मिल सके जो कहानी को स्पष्ट बनाए रखे, भले ही बहुत कम रंगों का उपयोग किया जा रहा हो।"स्मूथ" बनाम "ब्लॉकी" नृत्य (ADMM):
इसके पीछे का गणित ADMM (अल्टरनेटिंग डायरेक्शन मेथड ऑफ मल्टीप्लायर्स) कहलाता है। इसे दो चरणों के बीच एक नृत्य के रूप में सोचें:
- चरण A (द स्मूथ स्लाइड): टीम कहानी के प्रवाह को बेहतर बनाने के लिए शब्दों में छोटे, निरंतर समायोजन करती है।
- चरण B (द स्नैप-टू-ग्रिड): अचानक, उन्हें उन शब्दों को विशिष्ट, अनुमत मानों (जैसे किसी लेगो ब्रिक को उसकी जगह पर फिट करना) के साथ जोड़ना पड़ता है।
- वे स्लाइड करने और स्नैप करने के बीच बारी-बारी से चलते रहते हैं। समय के साथ, यह प्रक्रिया शब्दों को सबसे अच्छे "लेगो पोजीशन" में सेट होने के लिए मजबूर करती है बिना कहानी को तोड़े।
- "आउटलियर" की समस्या (डायगोनल स्केलिंग):
इन मॉडल्स में, कुछ शब्द "तेज़" (outliers) होते हैं और कुछ "शांत"। यदि आप उन सभी को एक साथ सिकोड़ने की कोशिश करते हैं, तो तेज़ शब्द बातचीत पर हावी हो जाते हैं, और शांत शब्द खो जाते हैं।
- ADMM-Q का समाधान: वे डायगोनल स्केलिंग (Diagonal Scaling) नामक तकनीक का उपयोग करते हैं। कल्पना करें कि आप शांत शब्दों को एक माइक्रोफ़ोन दे रहे हैं और संपादन सत्र के लिए तेज़ शब्दों की आवाज़ कम कर रहे हैं। यह सुनिश्चित करता है कि प्रत्येक शब्द को अनुकूलित होने का उचित अवसर मिले, जिससे अंततः एक बहुत अधिक स्पष्ट कहानी मिले।
- अंतिम पॉलिश (लोकल सर्च):
एक बार जब टीम अपना हडल पूरा कर लेती है, तो वे एक त्वरित "स्पॉट चेक" करती है। वे शब्दों के उन जोड़ों को देखते हैं जिन्हें गलती से बदल दिया गया होगा और देखते हैं कि क्या उन्हें वापस बदलने से कहानी में सुधार होता है। यह अंतिम त्रुटियों को पकड़ने के लिए एक तेज़, अंतिम पॉलिश है।
यह क्यों महत्वपूर्ण है: परिणाम
इस पेपर ने कई मॉडल्स (Qwen और LLaMA) पर इस नए तरीके का परीक्षण किया और पाया कि:
- बेहतर कहानियाँ: जब उन्होंने मॉडल्स को बहुत छोटे आकार (जैसे 3-बिट या 2-बिट) में सिकोड़ा, तो पुराने "लालची" तरीकों (GPTQ) ने भ्रमित करने वाले या बेतुके उत्तर दिए। ADMM-Q ने मॉडल्स को स्मार्ट और सुसंगत बनाए रखा।
- उदाहरण: "WikiText-2" नामक एक परीक्षण पर, पुराने तरीके का स्कोर 12.85 (उच्च स्कोर खराब है) था, जबकि ADMM-Q ने इसे घटाकर 10.06 कर दिया। यह स्पष्टता में एक बड़ा सुधार है।
- अन्य टूल्स के साथ काम करता है: ADMM-Q सब कुछ बदलने के लिए नहीं है; यह "सिकोड़ने वाले" हिस्से के लिए एक ड्रॉप-इन रिप्लेसमेंट है। यह अन्य ट्रिक्स के साथ पूरी तरह से काम करता है, जैसे कि डेटा को घुमाना (rotate) या स्केल करना।
- वही गति: एक बार मॉडल सिकुड़ जाने के बाद, यह पुराने तरीकों की तरह ही तेज़ी से चलता है। ADMM-Q द्वारा लिया गया अतिरिक्त समय केवल "ऑफलाइन" सिकुड़ने की प्रक्रिया (जैसे प्रकाशित करने से पहले किताब को एडिट करना) के दौरान होता है, न कि जब आप वास्तव में AI का उपयोग कर रहे हों।
कमी (सीमाएँ)
- इसे एडिट करने में अधिक समय लगता है: क्योंकि ADMM-Q हर लेयर के लिए एक जटिल "टीम हडल" करता है, इसलिए सरल लालची तरीकों की तुलना में मॉडल को शुरू में सिकोड़ने में अधिक कंप्यूटर समय लगता है। हालाँकि, लेखकों का कहना है कि बेहतर गुणवत्ता के लिए यह एक बार का इंतज़ार सार्थक है।
- इसे एक सैंपल की आवश्यकता होती है: इन सभी तरीकों की तरह, इसे भी यह समझने के लिए कि मॉडल क्या कहने की कोशिश कर रहा है, टेक्स्ट के एक छोटे नमूने (कैलिब्रेशन डेटा) की आवश्यकता होती है।
सारांश
ADMM-Q AI मॉडल्स को कंप्रेस करने का एक स्मार्ट तरीका है। स्टेप-बाय-स्टेप कंप्रेस करके और रास्ते में गलतियाँ करने के बजाय, यह एक समग्र, गणितीय दृष्टिकोण अपनाता है ताकि मॉडल के सभी हिस्सों को एक साथ समायोजित किया जा सके। परिणाम एक बहुत छोटा AI है जो अभी भी स्पष्ट रूप से सोचना जानता है, भले ही उसे बहुत कम जगह में दबा दिया गया हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।