HARP: Hadamard-Preconditioned Adaptive Rotation Processor for Extreme LLM Quantization
HARP एक सीखने योग्य, संरचित दो-तरफा ऑर्थोगोनल प्रोसेसर पेश करता है जो विशिष्ट परतों और कैलिब्रेशन डेटा के अनुकूल क्वांटाइजेशन आधार को अनुकूलित करता है, जो फिक्स्ड हैडामार्ड विधियों की तुलना में अत्यधिक कम-बिट (2-4 बिट) LLM क्वांटाइजेशन की सटीकता में महत्वपूर्ण सुधार करता है और साथ ही परिनियोजन दक्षता को बनाए रखता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से विस्तृत लाइब्रेरी है (एक लार्ज लैंग्वेज मॉडल) जिसे आप अपनी जेब में ले जाना चाहते हैं। समस्या यह है कि किताबें बहुत भारी हैं और अलमारियाँ बहुत चौड़ी हैं ताकि एक छोटे बैग में फिट हो सकें। इसे पोर्टेबल बनाने के लिए, आप किताबों को छोटे, संकुचित नोट्स में सिकोड़ने का निर्णय लेते हैं। इसे क्वांटाइजेशन (quantization) कहा जाता है।
हालाँकि, यदि आप इन किताबों को बहुत अधिक सिकोड़ देते हैं (केवल 2 या 3 बिट जानकारी तक), तो कुछ पन्ने मुड़ जाते हैं या खो जाते हैं। ये "मुड़े हुए पन्ने" आउटलायर्स (outliers) कहलाते हैं—अत्यधिक महत्वपूर्ण संख्याएँ जो बाकी संख्याओं की तुलना में बहुत बड़ी होती हैं। यदि आप पूरी किताब को एक मानक विधि का उपयोग करके कंप्रेस करने का प्रयास करते हैं, तो ये आउटलायर्स कंप्रेशन को खराब कर देते हैं, जिससे नोट्स को पढ़ना कठिन हो जाता है।
पुराना तरीका: "रैंडम शफल" (The "Random Shuffle")
पहले, वैज्ञानिक एक ट्रिक का उपयोग करते थे जिसे RHT (रैंडमाइज्ड हैडामार्ड ट्रांसफॉर्म) कहा जाता था। इसे ऐसे समझें कि आप अपनी किताब के सभी पन्नों को लेते हैं, उन्हें बेतरतीब ढंग से (randomly) मिलाते हैं, और फिर उन्हें कंप्रेस करते हैं।
- अच्छी बात: यह तेज़ है और मुड़े हुए पन्नों को फैला देता है ताकि वे एक ही जगह पर दब न जाएं।
- बुरी बात: यह एक फिक्स्ड शफल है। यह एक ही रैंडम शफल पैटर्न का उपयोग करने जैसा है, चाहे आपकी किताब कुकरी (cookbook) हो, कोई उपन्यास हो, या डिक्शनरी—चाहे वह कुछ भी हो। यह डेटा के विशिष्ट विवरण के अनुसार खुद को ढालता नहीं है।
नया तरीका: HARP (द "स्मार्ट टेलर")
इस पेपर के लेखक HARP (हैडामार्ड-प्रीकंडीशन्ड एडेप्टिव रोटेशन प्रोसेसर) पेश करते हैं। HARP को एक स्मार्ट टेलर (दर्जी) के रूप में सोचें जो केवल एक सामान्य शफल का उपयोग नहीं करता है।
- यह फिट को सीखता है: एक रैंडम शफल के बजाय, HARP मॉडल के प्रत्येक लेयर में डेटा के विशिष्ट "आकार" (जैसे शर्ट के विशिष्ट कपड़े को देखना) को देखता है। यह संख्याओं को पुनर्व्यवस्थित करने का परफेक्ट तरीका सीखता है ताकि वे महत्वपूर्ण विवरण खोए बिना उस छोटे संकुचित स्थान में फिट हो सकें।
- यह एक ड्रॉप-इन अपग्रेड है: सबसे अच्छी बात यह है कि HARP शुरुआत में पुराने "रैंडम शफल" (RHT) जैसा ही दिखता है। यह एक ऐसे सूट की तरह है जो शुरू में एक स्टैंडर्ड ऑफ-द-रैक साइज का होता है लेकिन इसमें छिपे हुए ज़िप और एडजस्टेबल सीम होते हैं। एक बार जब आप इसे पहन लेते हैं, तो दर्जी (कैलिब्रेशन प्रक्रिया) आपके लिए एकदम सही फिट होने के लिए इसे जल्दी से एडजस्ट कर देता है। इसका मतलब है कि आप पूरे सिस्टम को फिर से बनाए बिना पुराने तरीके को HARP से बदल सकते हैं।
- यह स्ट्रक्चर्ड और तेज़ है: HARP केवल एक अव्यवस्थित, जटिल पुनर्व्यवस्था नहीं करता है। यह एक "बटरफ्लाई" पैटर्न (चीजों को मिलाने का एक विशिष्ट, कुशल तरीका) का उपयोग करता है जो गणितीय रूप से रिवर्स करने योग्य और तेज़ होने की गारंटी देता है। यह लाइब्रेरी को व्यवस्थित करने जैसा है—किताबों को कहीं भी फेंकने के बजाय, एक अत्यधिक कुशल, पूर्व-नियोजित सॉर्टिंग सिस्टम का उपयोग करना।
जब आप इसका उपयोग करते हैं तो क्या होता है?
उन्होंने 1 बिलियन से लेकर 70 बिलियन पैरामीटर्स वाले मॉडल्स पर इसका परीक्षण किया।
- बेहतर गुणवत्ता: जब उन्होंने मॉडल्स को अत्यधिक आकार (2 से 4 बिट्स) तक कंप्रेस किया, तो HARP ने पुराने रैंडम शफल मेथड की तुलना में मॉडल्स को "स्मार्टर" (कम परप्लेक्सिटी, उच्च सटीकता) बनाया। यह उन "मुड़े हुए पन्नों" (आउटलायर्स) को बचाने में विशेष रूप से अच्छा था जो आमतौर पर खो जाते हैं।
- अभी भी तेज़: भले ही HARP एक कस्टम फिट सीखता है, यह मॉडल को धीमा नहीं करता है। वास्तव में, HARP के साथ कंप्रेस किए गए मॉडल्स मूल, अनकंप्रेस्ड मॉडल्स (61 टोकन प्रति सेकंड) की तुलना में बहुत तेज़ (128 टोकन प्रति सेकंड) थे।
- बहुमुखी (Versatile): उन्होंने दिखाया कि HARP न केवल एक विशिष्ट कंप्रेशन टूल के साथ काम करता है, बल्कि इसे विभिन्न कंप्रेशन सिस्टम (जैसे QTIP) में बदला जा सकता है और फिर भी इसमें सुधार किया जा सकता है।
निचोड़ (The Bottom Line)
HARP एक ऐसा टूल है जो AI कंप्रेशन में उपयोग किए जाने वाले "वन-साइज़-फिट्स-ऑल" रैंडम शफल को एक कस्टम-टेलर फिट में बदल देता है। यह डेटा के एक छोटे नमूने से सीखता है कि संख्याओं को कंप्रेस करने से पहले उन्हें पुनर्व्यवस्थित करने का सही तरीका क्या है। परिणाम एक छोटा, तेज़ AI मॉडल है जो बेहतर पढ़ता है और कम गलतियाँ करता है, और यह पूरे मॉडल को फिर से ट्रेन किए बिना संभव होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।