QAM-W: Joint 2D Codebook Quantization for LLM Weights via Hadamard Rotation and Activation-Aware Scaling
QAM-W एक संयुक्त 2D कोडबुक क्वांटाइजेशन विधि पेश करता है जो LLM वेट्स के लिए है और जो पेयरवाइज कोऑर्डिनेट संरचनाओं को संरक्षित करने के लिए हैडामार्ड रोटेशन और एक्टिवेशन-अवेयर स्केलिंग का उपयोग करता है, जिससे लगभग 5.5 बिट्स प्रति वेट पर नियर-BF16 परप्लेक्सिटी प्राप्त होती है और पोलर कोडिंग से बेहतर प्रदर्शन करते हुए काफी कम वेट बिट्स के साथ स्मूथक्वांट (SmoothQuant) की गुणवत्ता से मेल खाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास किताबों का एक विशाल पुस्तकालय है (एक लार्ज लैंग्वेज मॉडल, या LLM) जो अविश्वसनीय रूप से स्मार्ट है लेकिन बहुत अधिक जगह घेरता है। इसे आसानी से ले जाने के लिए, आप इन किताबों को सिकोड़ना चाहते हैं। इस प्रक्रिया को क्वांटाइजेशन (quantization) कहा जाता है।
किताबों को सिकोड़ने के अधिकांश वर्तमान तरीके ऐसे हैं जैसे किसी शब्दकोश से हर एक शब्द को एक छोटे नंबर कोड से बदलना, एक-एक करके। यह सरल है, लेकिन यह इस बात को अनदेखा करता है कि शब्द अक्सर जोड़ों या समूहों में आते हैं जिनका एक विशिष्ट संबंध होता है। यदि आप उन्हें अलग-थलग व्यक्तियों के रूप में देखते हैं, तो आप कहानी की बारीकियों को खो देते हैं।
यह शोध पत्र एक नई विधि पेश करता है जिसे QAM-W (वेट्स के लिए क्वाड्रैचर एम्प्लीट्यूड मॉड्यूलेशन) कहा जाता है। सोचिए कि यह किताबों को पैक करने का एक स्मार्ट और अधिक कुशल तरीका है।
यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए यहाँ दिया गया है:
1. समस्या: "सोलो डांसर" बनाम "डुएट"
कल्पना कीजिए कि एक AI मॉडल में वेट्स (weights) डांसर हैं।
- पुरानी विधि (स्केलर क्वांटाइजेशन): पुराना तरीका हर डांसर के साथ ऐसे व्यवहार करता है जैसे वह सोलो (अकेले) प्रदर्शन कर रहा हो। यह प्रत्येक डांसर को व्यक्तिगत रूप से देखता है और कहता है, "आप एक '3' हैं, आप एक '7' हैं।" यह इस बात को अनदेखा करता है कि दो डांसर हाथ पकड़कर या तालमेल में नाच रहे हो सकते हैं।
- QAM-W की अंतर्दृष्टि: लेखकों ने महसूस किया कि डेटा की एक पंक्ति के भीतर, ये "डांसर" वास्तव में जोड़ों में नाच रहे हैं। वे आपस में जुड़े हुए (correlated) हैं। उन्हें दो अलग-अलग सोलो कलाकारों के रूप में कोड करने के बजाय, QAM-W उन्हें एक डुएट (जोड़ी) के रूप में मानता है।
2. समाधान: "मैजिक स्पिन" और "पेयरिंग"
QAM-W बिना कहानी खोए मॉडल को सिकोड़ने के लिए तीन-चरणीय प्रक्रिया का उपयोग करता है:
चरण A: मैजिक स्पिन (हैडामार्ड रोटेशन):
कल्पना कीजिए कि डांसर एक अव्यवस्थित, भीड़भाड़ वाले कमरे में खड़े हैं। QAM-W एक "मैजिक स्पिन" (एक गणितीय रोटेशन) लागू करता है जो उन्हें पुनर्व्यवस्थित करता है। अचानक, जो डांसर बेतरतीब ढंग से घूम रहे थे, वे अब जोड़े में एकदम सटीक रूप से व्यवस्थित हो जाते हैं, जो एक सुचारू, गोलाकार पैटर्न में चलते हैं। यह उन्हें गणितीय रूप से वर्णित करना बहुत आसान बना देता है।चरण B: "डुएट" कोडबुक:
प्रत्येक डांसर को एक अलग नंबर देने के बजाय, QAM-W उस जोड़े को एक मानचित्र पर एक एकल बिंदु के रूप में देखता है। यह एक पहले से बने "मानचित्र" (कोडबुक) का उपयोग करता है, जिसे इस बात पर प्रशिक्षित किया गया है कि ये जोड़े आमतौर पर कैसे व्यवहार करते हैं। यह जोड़ों के लिए मानक नृत्य चालों की एक लाइब्रेरी होने जैसा है। दो अलग-अलग कदमों का वर्णन करने के बजाय, आप बस कहते हैं, "उन्होंने 'वाल्ट्ज #42' की चाल की।" यह दो संख्याओं के बीच के संबंध को पकड़ लेता है, जिससे जगह बचती है।चरण C: "वॉल्यूम नॉब" (एक्टिवेशन-अवेयर स्केलिंग):
कभी-कभी, मॉडल के कुछ हिस्से बहुत तेज़ (अत्यधिक सक्रिय) होते हैं और अन्य शांत होते हैं। यदि आप तेज़ हिस्सों को बहुत अधिक सिकोड़ देते हैं, तो संगीत विकृत हो जाता है। QAM-W सिकोड़ने से पहले प्रत्येक चैनल के "वॉल्यूम" को सुनता है। यह तेज़ चैनलों की आवाज़ को थोड़ा कम कर देता है ताकि वे छोटे स्थान में बेहतर तरीके से फिट हो सकें, जिससे यह सुनिश्चित होता है कि महत्वपूर्ण जानकारी दब न जाए।
3. परिणाम: छोटा आकार, वही गुणवत्ता
इस शोध पत्र ने पांच अलग-अलग AI मॉडलों (छोटे से मध्यम-बड़े तक) पर इस नई विधि का परीक्षण किया।
- "स्वीट स्पॉट": एक विशिष्ट संपीड़न स्तर (लगभग 5.5 बिट्स प्रति वेट) पर, QAM-W ने परिणाम प्राप्त किए जो मूल, बिना संपीड़ित मॉडल के लगभग समान थे।
- तुलना: एक लोकप्रिय प्रतिस्पर्धी विधि जिसे SmoothQuant कहा जाता है, को समान गुणवत्ता प्राप्त करने के लिए लगभग 8.1 बिट्स का उपयोग करने की आवश्यकता थी। QAM-W ने उसी परिणाम के लिए 32% कम बिट्स का उपयोग किया।
- उपमा: यह एक सूटकेस पैक करने जैसा है। SmoothQuant को अपने सभी कपड़ों को करीने से रखने के लिए एक बड़े सूटकेस की आवश्यकता होती है। QAM-W कपड़ों को इतनी कुशलता से फोल्ड करता है कि आप बिल्कुल उतनी ही मात्रा में चीज़ें एक बहुत छोटे बैग में फिट कर सकते हैं।
4. यह क्या नहीं करता (सीमाएं)
शोध पत्र बहुत विशिष्ट है कि यह क्या दावा नहीं करता है:
- सबसे छोटा नहीं: यदि आप मॉडल को और भी अधिक सिकोड़ने की कोशिश करते हैं (4 बिट्स तक), तो QTIP नामक एक अन्य विधि बेहतर प्रदर्शन करती है। Q-A-M-W "मध्यम-छोटे" रेंज (5-6 बिट्स) में चैंपियन है, "बहुत छोटे" रेंज में नहीं।
- स्टोरेज बनाम गति: शोध पत्र यह मापता है कि मॉडल हार्ड ड्राइव या मेमोरी में कितनी जगह लेता है। यह अभी तक यह दावा नहीं करता है कि यह कंप्यूटर चिप पर मॉडल को तेज़ चलाता है, क्योंकि इन संपीड़ित नंबरों का वास्तविक समय में उपयोग करने के लिए सॉफ्टवेयर अभी भी बनाया जा रहा है।
सारांश
QAM-W AI मॉडलों के लिए एक नया "पैकिंग तकनीक" है। यह पहचानकर कि डेटा जोड़ों में आता है, उन्हें एक बेहतर आकार में घुमाकर, और वॉल्यूम के अनुसार तालमेल बिठाकर, यह AI मॉडलों को लगभग एक तिहाई तक सिकोड़ सकता है बिना उन्हें कम स्मार्ट बनाए। यह एक विशेष उपकरण है जो एक विशिष्ट आकार सीमा में सबसे अच्छा काम करता है, जो वर्तमान तरीकों की तुलना में स्टोरेज स्पेस में महत्वपूर्ण बचत प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।