SHUFFLESPARSE: Learned Shuffles for Structured Sparse Networks
यह शोधपत्र SHUFFLESPARSE को प्रस्तुत करता है, जो एक एकल क्रमपरिवर्तन आव्यूह (permutation matrix) को सीखता है ताकि विभिन्न स्पर्सिटी पैटर्न और प्रशिक्षण प्रतिमानों में स्ट्रक्चर्ड और अनस्ट्रक्चर्ड स्पार्स नेटवर्क के बीच सटीकता के अंतर को न्यूनतम इन्फरेंस ओवरहेड बनाए रखते हुए महत्वपूर्ण रूप से कम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप सबसे तेज़ संभव रेस कार बनाने की कोशिश कर रहे हैं। आपके पास एक शक्तिशाली इंजन (एक डीप न्यूरल नेटवर्क) है जो जटिल समस्याओं को हल कर सकता है, लेकिन यह भारी है और बहुत अधिक ईंधन पीता है। इसे तेज़ बनाने के लिए, इंजीनियर अक्सर इंजन के उन हिस्सों को हटाने की कोशिश करते हैं जो अनिवार्य रूप से आवश्यक नहीं हैं—इस प्रक्रिया को "प्रूनिंग" (pruning) कहा जाता है। यदि आप बेतरतीब ढंग से बोल्ट और तार हटा देते हैं, तो कार खराब तरीके से चल सकती है क्योंकि बचे हुए हिस्से इस तरह से नहीं जुड़ते जो फैक्ट्री के औजारों के अनुकूल हों। हालाँकि, यदि आप हिस्सों को एक बहुत ही विशिष्ट, व्यवस्थित पैटर्न में हटाते हैं (जैसे कि एक साफ ग्रिड में हर दूसरा बोल्ट हटाना), तो फैक्ट्री की मशीनें बहुत तेज़ी से काम कर सकती हैं। यह "स्ट्रक्चर्ड स्पैरसिटी" (structured sparsity) की दुनिया है: एआई मॉडल को छोटा और तेज़ बनाने के लिए उन्हें एक साफ, अनुमानित पैटर्न का पालन करने के लिए मजबूर करना।
लेकिन यहाँ एक पेंच है: बहुत अधिक व्यवस्थित होना कार को अनाड़ी बना सकता है। यदि आप इंजन को एक कठोर ग्रिड का पालन करने के लिए मजबूर करते हैं, तो आप अनजाने में उस सटीक हिस्से को काट सकते हैं जिसकी आवश्यकता किसी विशेष मोड़ के लिए होती है, जिससे कार कठिन मोड़ों को संभालने में असमर्थ हो जाती है। यह वह समस्या है जिसका सामना शोधकर्ता करते हैं: स्ट्रक्चर्ड पैटर्न तेज़ होते हैं, लेकिन वे अक्सर "अनस्ट्रक्चर्ड" तरीकों की तुलना में सटीकता खो देते हैं जहाँ हिस्से कहीं भी हटाए जा सकते हैं। बड़ा सवाल यह है: क्या हम उस गति को बरकरार रख सकते हैं जो एक साफ ग्रिड प्रदान करता है, बिना उस लचीलेपन को खोए जो किसी भी मोड़ को संभालने के लिए चाहिए? यह शोध पत्र ठीक इसी पहेली में उतरता है, यह पता लगाता है कि क्या हम एआई को अपने आंतरिक कनेक्शनों को बस इतना पुनर्व्यवस्थित करने के लिए सिखा सकते हैं कि वे उन कठोर पैटर्नों को पूरी तरह से काम करने लायक बना दें।
इस अध्ययन के पीछे के शोधकर्ताओं ने, जो यूनिवर्सिटी ऑफ रोचेस्टर की एक टीम है, एक चतुर नया तरीका पेश किया है जिसे SHUFFLESPARSE कहा जाता है। एक न्यूरल नेटवर्क लेयर को लोगों (डेटा) से भरे एक विशाल कमरे के रूप में सोचें जो विशेषज्ञों (वेट्स) के एक समूह से बात करने की कोशिश कर रहे हैं। एक मानक "स्ट्रक्चर्ड" सेटअप में, विशेषज्ञ कठोर पंक्तियों और स्तंभों में व्यवस्थित होते हैं, जैसे परेड में सैनिक। इससे मैनेजर के लिए निर्देश जल्दी चिल्लाना आसान हो जाता है (तेज़ कंप्यूटिंग), लेकिन यह एक समस्या है यदि कमरे में मौजूद लोगों को उन विशेषज्ञों से बात करने की आवश्यकता है जो गलत पंक्ति में खड़े हैं।
आमतौर पर, समाधान यह होता है कि विशेषज्ञों को कहीं भी खड़े होने दिया जाए (अनस्ट्रक्टर्ड), लेकिन तब मैनेजर भ्रमित हो जाता है और काम धीमा हो जाता है। SHUFFLESPARSE एक बीच का रास्ता प्रदान करता है। यह बातचीत शुरू होने से पहले एक एकल, जादुई "शफल" (shuffle) चरण जोड़ता है। कल्पना करें कि एक डांस फ्लोर है जहाँ, संगीत शुरू होने से पहले, सभी को एक विशिष्ट, सीखी गई पद्धति के अनुसार अपनी सीटें बदलने के लिए कहा जाता है। यह शफल इस तरह से डिज़ाइन किया गया है कि जब लोग अंततः बैठते हैं और विशेषज्ञों से बात करते हैं, तो वे वास्तव में सही लोगों से बात कर रहे होते हैं, भले ही विशेषज्ञों ने अपनी जगह न बदली हो।
शोध पत्र बताता है कि एआई को इस विशिष्ट "शफल" (एक परम्यूटेशन मैट्रिक्स) को कठोर पैटर्न के साथ सीखने के लिए सिखाकर, मॉडल उस लगभग पूरी सटीकता को वापस पा सकता है जो ग्रिड में बंधे होने के कारण उसने खो दी थी। यह ऐसा है जैसे यह महसूस करना कि सैनिकों को अपनी फॉर्मेशन बदलने की ज़रूरत नहीं है; उन्हें बस नए रंगरूटों को एक अलग क्रम में उनके सामने खड़ा करने की ज़रूरत है।
टीम ने इस विचार का परीक्षण दो बहुत अलग परिदृश्यों में किया। पहले, उन्होंने इमेज रिकग्निशन कार्यों (जैसे बिल्ली और कुत्ते की पहचान करना) और भाषा कार्यों पर शून्य से मॉडल प्रशिक्षित किए (डायनेमिक स्पार्स ट्रेनिंग)। उन्होंने पाया कि SHUFFLESPARSE ने लगातार कठोर, तेज़ मॉडलों और लचीले, धीमे मॉडलों के बीच के अंतर को कम किया। उदाहरण के लिए, ViT-B/16 नामक एक लोकप्रिय इमेज मॉडल पर, इस शफल को जोड़ने से बहुत उच्च स्पैरसिटी स्तरों (90-95%) पर सटीकता का अंतर लगभग 2% से घटकर 1% से भी कम रह गया। GPT-2 जैसे भाषा मॉडलों में, इसने समान रूप से सुधार किया कि एआई टेक्स्ट को कितनी अच्छी तरह समझता है, जिससे इसकी "परप्लेक्सिटी" (भ्रम का एक माप) में महत्वपूर्ण रूप से कमी आई।
दूसत, उन्होंने पहले से प्रशिक्षित, विशाल भाषा मॉडलों (जैसे LLaMA-2 और Qwen) पर इसका परीक्षण किया जो फ्रीज थे और जिन्हें फिर से प्रशिक्षित नहीं किया जा सकता था। उन्होंने वेट्स को काटने के लिए एक "वन-शॉट" प्रूनिंग विधि का उपयोग किया और फिर SHUFFLESPARSE शफल लागू किया। परिणाम आश्चर्यजनक थे: LLaMA-2 7B मॉडल पर, इस पद्धति ने गैर-शफल्ड (non-shuffled) सर्वोत्तम विधि की तुलना में मॉडल की ज़ीरो-शॉट सटीकता में 4.6 अंक का सुधार किया। यह सुझाव देता है कि विशाल, पहले से बने मॉडलों के लिए भी, एक सरल सीखा हुआ पुनर्व्यवस्था पूरे मॉडल को फिर से प्रशिक्षित किए बिना छिपी हुई क्षमता को अनलॉक कर सकती है।
महत्वपूर्ण रूप से, लेखक दिखाते हैं कि यह केवल चीजों को बेतरतीब ढंग से शफल करने के बारे में नहीं है। जब उन्होंने सीखे गए शफल्स के बजाय रैंडम, फिक्स्ड शफल्स के साथ सिस्टम का परीक्षण किया, तो प्रदर्शन वास्तव में गिर गया या स्थिर रहा। जादू इस बात में है कि एआई कार्य के लिए सबसे उपयुक्त विशिष्ट शफल को सीखता है। शोध पत्र यह भी नोट करता है कि इस शफल की एक बहुत छोटी लागत है (मॉडल चलाने के समय में लगभग 3% से 8.7% की वृद्धि), लेकिन यह सटीकता में मिलने वाले भारी उछाल के लिए एक छोटा सा मूल्य है, विशेष रूप से क्योंकि स्ट्रक्चर्ड पैटर्न के मुख्य गति लाभ सुरक्षित रहते हैं।
संक्षेप में, SHUFFLESPARSE सुझाव देता है कि हमें गति और बुद्धिमत्ता के बीच चुनाव करने की आवश्यकता नहीं है। एआई को कठोर, तेज़-प्रोसेसिंग गियर्स से टकराने से ठीक पहले अपने इनपुट्स को सही ढंग से पुनर्व्यवस्थित करने के लिए सिखाकर, हम दोनों चीज़ें प्राप्त कर सकते हैं: एक ऐसा मॉडल जो अविश्वसनीय रूप से तेज़ भी है और आश्चर्यजनक रूप से सटीक भी। लेखक निष्कर्ष निकालते हैं कि यह सीखा हुआ परम्यूटेशन एक सामान्य उपकरण है जो विभिन्न प्रकार के कठोर पैटर्न और विभिन्न प्रकार के एआई कार्यों में काम करता है, जो कुशल, उच्च-प्रदर्शन वाले एआई बनाने के लिए एक आशाजनक मार्ग प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।