PATCH: Learnable Tile-level Hybrid Sparsity for LLMs
PATCH एक हाइब्रिड स्पर्सिटी फ्रेमवर्क है जो LLM वेट मैट्रिसेस को सीखने योग्य डेंस या 2:4 स्पार्स मैपिंग वाले टाइल्स में विभाजित करता है ताकि 0% और 50% के बीच निरंतर स्पर्सिटी रेश्यो सक्षम किया जा सके, जिससे मौजूदा अनस्ट्रक्चर्ड या रिजिड सेमी-स्ट्रक्चर्ड प्रूनिंग विधियों की तुलना में बेहतर सटीकता और व्यावहारिक GPU स्पीडअप प्राप्त किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक विशाल, अत्यधिक व्यवस्थित पुस्तकालय के रूप में करें जिसमें अरबों पुस्तकें (पैरामीटर्स) हैं। इस पुस्तकालय को एक मानक कंप्यूटर पर तेज़ी से चलाने के लिए, आपको कुछ पुस्तकें हटानी होंगी। हालाँकि, आपके सामने एक कठिन दुविधा है:
"अव्यवस्थित" दृष्टिकोण (Unstructured Sparsity): आप हर शेल्फ से बेतरतीब ढंग से पुस्तकें फेंक देते हैं। यह पुस्तकालय के ज्ञान को बहुत सटीक रूप से सुरक्षित रखता है क्योंकि आप बहुत चयनात्मक हो सकते हैं, लेकिन यह एक अराजक अव्यवस्था पैदा करता है। एक लाइब्रेरियन (कंप्यूटर का GPU) को पुस्तकें खोजने के लिए हर जगह इधर-उधर कूदना पड़ता है, जिससे प्रक्रिया धीमी और अक्षम हो जाती है।
"सख्त" दृष्टिकोण (2:4 Sparsity): आप एक सख्त नियम का पालन करने का निर्णय लेते हैं: "प्रत्येक चार पुस्तकों के समूह में, आपको ठीक दो पुस्तकें हटानी होंगी।" यह नियम लाइब्रेरियन के काम को सरल और तेज़ बनाता है क्योंकि पैटर्न अनुमानित है। हालाँकि, यह नियम बहुत कठोर है। कभी-कभी वे दो पुस्तकें जिन्हें आपको हटाना ही होगा, वास्तव में सबसे महत्वपूर्ण होती हैं, जिससे पुस्तकालय अपनी बुद्धिमत्ता और सटीकता खो देता है।
यहाँ PATCH काम आता है: "इंटेलिजेंट टाइल" लाइब्रेरियन
यह कार्य PATCH नामक एक नई विधि पेश करता है (Pruning with a Learnable Tile-level Configuration for Hybrid Sparsity)। "अव्यवस्थित" और "सख्त" दृष्टिकोणों के बीच चयन करने के बजाय, PATCH एक बुद्धिमान लाइब्रेरियन की तरह कार्य करता है जो पुस्तकालय को टाइल्स (छोटे, प्रबंधनीय शेल्फ खंडों) में विभाजित करता है।
यह इस प्रकार कार्य करता है, एक सरल उपमा का उपयोग करते हुए:
- टाइल सिस्टम: कल्पना करें कि पुस्तकालय को एक मोज़ेक की तरह वर्गाकार टाइल्स में विभाजित किया गया है।
- निर्णय: प्रत्येक टाइल के लिए, PATCH सिस्टम एक निर्णय लेने के लिए सीखता है:
- विकल्प A (Dense): इस टाइल को पूरी तरह से पुस्तकों से भरा रखें। यह पुस्तकालय के उन "महत्वपूर्ण" क्षेत्रों के लिए है जहाँ सटीकता सबसे महत्वपूर्ण है।
- विकल्प B (2:4 Sparsity): इस टाइल के लिए "चार में से दो हटाएँ" का सख्त नियम लागू करें। यह उन क्षेत्रों के लिए है जहाँ पुस्तकालय के पास अतिरिक्त, अनावश्यक पुस्तकें हैं जिन्हें स्थान बचाने और गति बढ़ाने के लिए सुरक्षित रूप से हटाया जा सकता है।
- सीखने की प्रक्रिया: सिस्टम अनुमान नहीं लगाता है। यह खुद को "प्रशिक्षित" करता है ताकि यह पता चल सके कि कौन सी टाइल्स भरी होनी चाहिए और कौन सी स्पार्स (विरल) होनी चाहिए। यह सीखता है कि महत्वपूर्ण हिस्सों को घना (dense) कैसे रखा जाए और अनावश्यक हिस्सों को स्पार्स कैसे किया जाए, और साथ ही हार्डवेयर-अनुकूल नियमों का पालन भी करता है।
यह एक बड़ी बात क्यों है?
- दोनों दुनियाओं का सर्वश्रेष्ठ: PATCH अंतर को पाटता है। यह पुस्तकालय को सटीक रखता है (अव्यवस्थित दृष्टिकोण की तरह) लेकिन इसे इस तरह व्यवस्थित करता है कि कंप्यूटर इसे तेज़ी से पढ़ सकें (सख्त दृष्टिकोण की तरह)।
- लचीली गति: आप PATCH को बता सकते हैं: "मैं चाहता हूँ कि पुस्तकालय 25% छोटा हो" या "50% छोटा हो।" यह एक निश्चित 50% कमी पर अटकने के बजाय, "पूर्ण टाइल्स" बनाम "स्पार्स टाइल्स" की संख्या को समायोजित करके आपके लक्ष्य को सटीक रूप से प्राप्त करता है।
- वास्तविक दुनिया के परिणाम: लेखकों ने छोटे से लेकर बहुत बड़े (13 बिलियन पैरामीटर्स तक) मॉडलों पर इसका परीक्षण किया।
- गति: एक मानक उपभोक्ता ग्राफिक्स कार्ड (A6000 GPU) पर, PATCH ने मूल, अन-प्रून किए गए मॉडलों की तुलना में मॉडलों को 1.18 से 1.38 गुना तेज़ बनाया।
- बुद्धिमत्ता: अन्य तरीकों के विपरीत जो मॉडल को तेज़ करते समय उसे "मूर्ख" बना देते हैं, PATCH ने मॉडलों को वर्तमान अत्याधुनिक सख्त विधि (MaskLLM) की तुलना में अधिक सटीक (0.37% से 2.96% तक) बनाया।
सारांश
PATCH को एक विशाल गोदाम की सफाई करने के तरीके के रूप में समझें। चीज़ों को बेतरतीब ढंग से फेंकने के बजाय (जिससे फोर्कलिफ्ट धीमे हो जाते हैं) या एक मूर्खतापूर्ण नियम का पालन करने के बजाय जो महत्वपूर्ण वस्तुओं को फेंक देता है, PATCH बुद्धिमानी से कुछ क्षेत्रों को भरा हुआ रखने और अन्य क्षेत्रों को एक पैटर्न के अनुसार खाली करने का कार्य सौंपता है जिसे फोर्कलिफ्ट पसंद करते हैं। परिणाम एक ऐसा गोदाम है जो नेविगेट करने में तेज़ है फिर भी इसमें सारा आवश्यक ज्ञान समाहित है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।