Float8@2bits: Entropy Coding Enables Data-Free Model Compression
यह शोध पत्र EntQuant को प्रस्तुत करता है, जो एक डेटा-मुक्त पोस्ट-ट्रेनिंग संपीड़न ढांचा है जो एंट्रॉपी कोडिंग का लाभ उठाकर 70B पैरामीटर्स जैसे बड़े मॉडलों के लिए 10 मिनट से कम समय में स्टेट-ऑफ-द-आर्ट एक्सट्रीम बिट-रेट कंप्रेशन (4 बिट से नीचे) प्राप्त करता है, और सफलतापूर्वक डेटा-मुक्त विधियों की गति और सार्वभौमिकता को उस उच्च निष्ठा (fidelity) के साथ एकीकृत करता है जिसके लिए आमतौर पर कैलिब्रेशन डेटा की आवश्यकता होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास किताबों की एक विशाल, अविश्वसनीय रूप से विस्तृत लाइब्रेरी है (एक Large Language Model)। स्मार्टफोन जैसे छोटे डिवाइस पर इन किताबों को पढ़ने के लिए, आपको उन्हें सिकोड़ना (shrink) होगा। आमतौर पर, इसके दो तरीके हैं:
- "तेज़ और घटिया" तरीका: आप किताबों की छोटी इंडेक्स कार्ड्स पर जल्दी से फोटोकॉपी कर लेते हैं। यह तेज़ है और इसमें किसी अतिरिक्त शोध की आवश्यकता नहीं होती, लेकिन यदि आप उन्हें बहुत अधिक सिकोड़ देते हैं (4 बिट्स से नीचे), तो शब्द अर्थहीन हो जाते हैं और कहानी बिखर जाती है।
- "धीमा और सटीक" तरीका: आप हर वाक्य को सावधानीपूर्वक फिर से लिखने के लिए संपादकों की एक टीम को काम पर रखते हैं, ताकि यह सुनिश्चित हो सके कि अर्थ एकदम सही रहे। यह बहुत अच्छा काम करता है, लेकिन इसमें कई दिन लग जाते हैं, इसके लिए महंगे कंप्यूटरों की आवश्यकता होती है, और आपको मूल संदर्भ पुस्तकों (जो अक्सर मौजूद नहीं होतीं या निजी होती हैं) तक पहुंच की आवश्यकता होती है।
EntQuant से मिलिए: यह पेपर एक नई विधि जिसे EntQuant कहा जाता है, पेश करता है जो दोनों दुनियाओं का सबसे अच्छा हिस्सा है। यह तेज़ है, इसे किसी संदर्भ पुस्तक की आवश्यकता नहीं है, और यह मॉडल को अत्यधिक आकार तक सिकोड़ने पर भी कहानी को बरकरार रखता है।
यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करके यहाँ दिया गया है:
1. समस्या: "फिक्स्ड बॉक्स" का जाल
वर्तमान विधियाँ लाइब्रेरी के शब्दों को निश्चित आकार के बक्सों में डालने के लिए मजबूर करती हैं।
- यदि आप जगह बचाना चाहते हैं, तो आपको छोटे बक्सों (कम बिट्स) का उपयोग करना होगा।
- लेकिन छोटे बक्से केवल कुछ विशिष्ट शब्दों को ही रख सकते हैं। यदि लाइब्रेरी को एक जटिल विचार व्यक्त करने की आवश्यकता है, तो वह फंस जाती है क्योंकि बक्सा बहुत छोटा होता है। यही कारण है कि वर्तमान विधियाँ तब विफल हो जाती हैं जब वे मॉडल को 4 बिट्स से नीचे सिकोड़ने की कोशिश करती हैं; उनके पास "अभिव्यक्ति शक्ति" (expressive power) खत्म हो जाती है।
2. समाधान: "स्मार्ट फाइलिंग सिस्टम"
EntQuant नियमों को बदल देता है। शब्दों को छोटे बक्सों में डालने के बजाय, यह उन्हें मानक, उच्च-गुणवत्ता वाले बक्सों (जैसे Float8 या Int8) में रखता है, लेकिन उन्हें इतनी चतुराई से व्यवस्थित करता है कि वे लगभग कोई जगह नहीं लेते।
इसे शिफ्टिंग (move) के लिए पैकिंग सेवा की तरह समझें:
- पुराना तरीका: आपको अपने फर्नीचर को पूर्व-निर्धारित आकार के क्रेट्स में फिट करना पड़ता है। यदि आपके पास एक विशाल सोफा है, तो आपको उसे छोटे क्रेट में फिट करने के लिए काटना पड़ेगा।
- EntQuant का तरीका: आप फर्नीचर को पूरा (उच्च सटीकता) रखते हैं, लेकिन आप इसे इतनी कुशलता से व्यवस्थित करते हैं कि ट्रक लगभग खाली रहता है। आप एक "स्मार्ट एल्गोरिदम" का उपयोग करते हैं ताकि वस्तुओं को इतनी कुशलता से पैक किया जा सके कि ट्रक 90% हवा से भरा हो, फिर भी वस्तुएं पूरी तरह से सुरक्षित रहें।
3. गुप्त नुस्खा: "एंट्रॉपी कोडिंग" (Entropy Coding)
पेपर एक तकनीक का उपयोग करता है जिसे एंट्रॉपी कोडिंग (विशेष रूप से ANS नामक चीज़) कहा जाता है।
- कल्पना कीजिए कि आप एक गुप्त कोड लिख रहे हैं। यदि अक्षर "E" 50% बार आता है, तो आप उसे एक बहुत छोटा कोड (जैसे "1") देते हैं। यदि "Z" दुर्लभ रूप से आता है, तो आप उसे एक लंबा कोड (जैसे "11010") देते हैं।
- EntQuant पहले मॉडल को इस तरह से "ट्रेन" करता है कि वह कुछ संख्याओं का अधिक बार उपयोग करे (डेटा को "लो एंट्रॉपी" बनाना)।
- फिर, यह डेटा को कंप्रेस करने के लिए इस स्मार्ट कोडिंग का उपयोग करता है। क्योंकि संख्याएँ अनुमानित (predictable) हैं, इसलिए कंप्यूटर उन्हें कम से कम प्रति पैरामीटर 2 बिट्स से भी कम का उपयोग करके स्टोर कर सकता है, भले ही वे संख्याएँ स्वयं उच्च-सटीकता वाले फॉर्मेट में संग्रहीत हों।
4. यह एक बड़ी बात क्यों है
- किसी "कैलिब्रेशन" की आवश्यकता नहीं: अधिकांश उच्च-गुणवत्ता वाली संपीड़न (compression) विधियों को मॉडल को ट्यून करने के लिए एक डेटासेट का उपयोग करके "टेस्ट ड्राइव" की आवश्यकता होती है। EntQuant डेटा-मुक्त (data-free) है। आप एक मॉडल ले सकते हैं, उसे 10 मिनट से कम समय में कंप्रेस कर सकते हैं, और यह बस काम कर जाता है। यह उन निजी या विशेष मॉडलों के लिए महत्वपूर्ण है जहाँ आपके पास प्रशिक्षण डेटा नहीं है।
- अत्यधिक संपीड़न (Extreme Compression): यह बड़े मॉडलों (जैसे 70-बिलियन-पैरामीटर मॉडल) को सफलतापूर्वक एक उपभोक्ता ग्राफिक्स कार्ड के आकार तक सिकोड़ देता है, जबकि मॉडल को जटिल निर्देशों का पालन करने और गणित की समस्याओं को हल करने के लिए पर्याप्त स्मार्ट बनाए रखता है।
- गति: हालांकि इसे पढ़ते समय डेटा को थोड़ा "अनपैक" (unpack) करना पड़ता है, पेपर दिखाता है कि आधुनिक कंप्यूटरों पर यह इतना तेज़ होता है कि धीमापन नगण्य है (मूल से लगभग 1.5 से 2 गुना धीमा, जो कि अभी भी बहुत तेज़ है)।
निचोड़
लेखकों ने, पैट्रिक पुत्स्की और मार्टिन गेन्ज़ल (और मेरान्टिक्स मोमेंटम में उनकी टीम) ने एक ऐसा टूल बनाया है जो आपको विशाल AI मॉडलों को एक छोटे सूटकेस के आकार में सिकोड़ने की अनुमति देता है बिना उनकी बुद्धिमत्ता खोए, और आप इसे बिना किसी अतिरिक्त डेटा के तुरंत कर सकते हैं। यह एक 70-फुट की नौका को उसके टूटे बिना एक बैकपैक में फिट करने में सक्षम होने जैसा है।
मुख्य बात: उन्होंने उस नियम को तोड़ दिया कि "जगह बचाने के लिए, आपको गुणवत्ता खोनी होगी।" डेटा को काटने के बजाय एक स्मार्ट फाइलिंग सिस्टम (एंट्रॉपी कोडिंग) का उपयोग करके, उन्होंने अत्यधिक आकार में कमी हासिल करते हुए गुणवत्ता को उच्च रखा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।