OffQ: Taming Structured Outliers in LLM Quantization by Offsetting
OffQ एक नवीन लो-बिट क्वांटाइजेशन विधि है जो टॉप-1 PCA के माध्यम से एक लो-डायमेंशनल आउटलायर सबस्पेस की पहचान करके, उच्च-परिमाण वाले एक्टिवेशन्स को एक एकल चैनल में रोटेट करके, और उनकी परिमाण को एक साझा ऑफसेट में परिवर्तित करके लार्ज लैंग्वेज मॉडल्स में एक्टिवेशन आउटलायर्स को कम करती है ताकि कुशल और सटीक W4A4KV4 क्वांटाइजेशन सक्षम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास ज्ञान का एक विशाल, अविश्वसनीय रूप से विस्तृत पुस्तकालय है (एक लार्ज लैंग्वेज मॉडल, या LLM)। इस पुस्तकालय को अपने फोन या लैपटॉप पर ले जाने के लिए इसे एक छोटे बैकपैक में फिट करने के लिए, आपको किताबों को सिकोड़ना (shrink) होगा। इस प्रक्रिया को क्वांटाइजेशन (quantization) कहा जाता है।
आमतौर पर, आप किताबों को बारीक विवरणों को हटाकर सिकोड़ते हैं, जटिल संख्याओं को सरल, पूर्ण संख्याओं में बदलकर (जैसे 4.99 को 5 में बदलना)। इससे बहुत अधिक जगह बचती है।
समस्या: "स्क्रीमर्स" (Screamers)
हालाँकि, इसमें एक पेंच है: इन पुस्तकालयों में, अधिकांश पन्ने शांत और सुस्त होते हैं, लेकिन कुछ पन्नों में "स्क्रीमर्स" होते हैं—अत्यधिक तेज़, अराजक संख्याएँ जो बाकी सब से बहुत बड़ी होती हैं।
- यदि आप पूरे पुस्तकालय को एक छोटे बॉक्स में फिट करने की कोशिश करते हैं, तो ये "स्क्रीमर्स" आपको एक बहुत ही मोटा ग्रिड (coarse grid) इस्तेमाल करने के लिए मजबूर कर देते हैं।
- यह एक हाथी और एक नन्हे चूहे को एक ही छोटे क्रेट में फिट करने की कोशिश करने जैसा है। हाथी को फिट करने के लिए, आपको चूहे को एक छोटे, अपरिचित ढेर में कुचलना पड़ेगा।
- तकनीकी शब्दों में, ये "स्क्रीमर्स" (एक्टिवेशन आउटलेयर्स) मॉडल की सटीकता को खराब कर देते हैं क्योंकि डेटा के शांत हिस्सों के लिए राउंडिंग एरर (rounding errors) बहुत बड़े हो जाते हैं।
पुराने समाधान
"हाथी और चूहे" की समस्या को हल करने के पिछले प्रयास कुछ इस प्रकार थे:
- सिकोड़ने का नया तरीका सीखना: मॉडल को बेहतर तरीके से सिकुड़ने के लिए फिर से प्रशिक्षित करना (जो महंगा और धीमा है)।
- अलग-अलग आकार के क्रेट का उपयोग करना: हाथी को एक बड़े बॉक्स में और चूहे को एक छोटे बॉक्स में रखना (मिक्स्ड प्रिसिजन)। यह काम करता है लेकिन पैकिंग की प्रक्रिया को जटिल और धीमा बना देता है।
- अजीब, कस्टम बॉक्स का उपयोग करना: ऐसे विशेष बॉक्स जो मानक शेल्फ में फिट नहीं होते (नॉन-यूनिफॉर्म क्वांटाइजेशन), जिन्हें अधिकांश कंप्यूटर आसानी से हैंडल नहीं कर पाते।
नया समाधान: OffQ
यह पेपर एक नई विधि पेश करता है जिसे OffQ कहा जाता है। "स्क्रीमर्स" से लड़ने या अलग-अलग बॉक्स का उपयोग करने के बजाय, OffQ "स्क्रीमर्स" को "कैंसिल आउट" करने के लिए एक चतुर ट्रिक का उपयोग करता है।
यहाँ बताया गया है कि एक सरल उपमा (analogy) का उपयोग करके OffQ कैसे काम करता है:
1. "स्क्रीमर्स" को खोजना (Top-1 PCA)
सबसे पहले, OffQ डेटा को देखता है ताकि यह पता चल सके कि "स्क्रीमर्स" कहाँ छिपे हैं।
- उपमा: एक भीड़ भरे कमरे की कल्पना करें जहाँ हर कोई फुसफुसा रहा है, सिवाय एक व्यक्ति के जो कोने में चिल्ला रहा है। मानक तरीके फुसफुसाहट से भ्रमित हो सकते हैं। OffQ एक विशेष "Top-1" रडार का उपयोग करता है जो फुसफुसाहट को अनदेखा करता है और केवल सबसे तेज़ चीख पर ज़ूम करता है।
- परिणाम: यह पहचानता है कि ये स्क्रीमर्स एक विशिष्ट पैटर्न का पालन करते हैं और उन्हें एक एकल "लौड चैनल" (loud channel) में समूहबद्ध किया जा सकता है।
2. "स्क्रीमर्स" को एक स्थान पर ले जाना (Rotation)
एक बार मिल जाने के बाद, OffQ डेटा को इस तरह घुमाता (rotate) है कि सारी चिल्लाने वाली ऊर्जा केवल एक ही चैनल में केंद्रित हो जाती है (जैसे सभी चिल्लाने वाले लोगों को थिएटर की एक विशिष्ट सीट में ले जाना)।
- उपमा: कुछ लोगों के अलग-अलग पंक्तियों में चिल्लाने के बजाय, आप उन्हें सभी को पहली पंक्ति, सीट नंबर 1 में ले जाते हैं। अब, बाकी थिएटर पूरी तरह से शांत है।
3. "ऑफसेट" का जादू (Hadamard Rotation)
यही मुख्य नवाचार है। OffQ उस एक "लौड सीट" को लेता है और उस शोर को थिएटर की हर सीट पर समान रूप से फैलाने के लिए एक गणितीय रोटेशन (जिसे हैडामार्ड रोटेशन कहा जाता है) का उपयोग करता है।
- उपमा: कल्पना करें कि सीट 1 से आने वाला तेज़ शोर वास्तव में एक विशाल, भारी कंबल है। सीट 1 पर उसे छोड़ने के बजाय (जहाँ वह दृश्य को रोकता है), OffQ उस कंबल को छोटे, समान टुकड़ों में काटता है और कमरे की हर सीट पर एक छोटा सा टुकड़ा डाल देता है।
- परिणाम: अब कोई भी सीट अत्यधिक बोझिल नहीं है। "शोर" अब एक छोटा, निरंतर बैकग्राउंड हम (hum) बन गया है जो सबके लिए एक जैसा है।
4. शोर को सोखना (Quantization)
चूंकि शोर अब पूरे कमरे में एक स्थिर, समान हम (hum) है, इसलिए क्वांटाइजेशन प्रक्रिया (सिकुड़ने की प्रक्रिया) बस यह कह सकती है, "ठीक है, हम जानते हैं कि हर जगह एक हल्का सा हम है। आइए इसे हमारे ज़ीरो-पॉइंट (zero-point) को एडजस्ट करके अनदेखा कर दें।"
- उपमा: यह लाइब्रेरियन को बताने जैसा है, "हम जानते हैं कि कमरे में थोड़ी धूल है। बस हर किताब के वजन से थोड़ी सी धूल घटा दें, और अब वे सभी छोटे बैकपैक में पूरी तरह फिट हो जाएंगे।"
- परिणाम: "स्क्रीमर्स" प्रभावी रूप से बेअसर हो जाते हैं। मॉडल अब अपनी भाषा समझने की क्षमता खोए बिना 4-बिट (बहुत छोटा) तक सिकुड़ने में सक्षम है।
यह क्यों मायने रखता है
- किसी विशेष हार्डवेयर की आवश्यकता नहीं: अन्य तरीकों के विपरीत जिन्हें कस्टम, जटिल कंप्यूटर चिप्स की आवश्यकता होती है, OffQ मानक, यूनिफॉर्म बॉक्स के साथ काम करता है। यह कस्टम-निर्मित क्रेट के बजाय मानक शिपिंग कंटेनरों का उपयोग करने जैसा है।
- बेहतर सटीकता: पेपर दिखाता है कि OffQ मॉडल के ज्ञान को बहुत अधिक सटीक बनाए रखता है, भले ही इसे सबसे छोटे आकार (वेट्स, एक्टिवेशन और मेमोरी के लिए 4-बिट) तक सिकोड़ा गया हो।
- दक्षता (Efficiency): इसके लिए मॉडल को फिर से प्रशिक्षित करने या अलग-अलग आकार के बक्सों के लिए अतिरिक्त मेमोरी की आवश्यकता नहीं होती है। यह बस डेटा को पुनर्व्यवस्थित करता है और "ज़ीरो पॉइंट" को एडजस्ट करता है।
सारांश में
OffQ एक चतुर पैकेजिंग ट्रिक है। कुछ "तेज़" संख्याओं को पूरे शिपमेंट को खराब करने देने के बजाय, यह उन्हें अलग करता है, उनके प्रभाव को पूरे पैकेज में समान रूप से फैलाता है, और फिर स्केल को एडजस्ट करता है ताकि पैकेज बिना सामग्री को तोड़े, एक छोटे, कुशल बॉक्स में पूरी तरह फिट हो सके। यह रोज़मर्रा के उपकरणों पर शक्तिशाली AI मॉडल चलाना बहुत अधिक व्यवहार्य बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।