Reservoir of Importance: Learning Semi-Structured Sparsity with Differentiable Subset Sampling
यह शोध पत्र 'रिजर्वायर ऑफ इम्पॉर्टेंस' (RoI) का प्रस्ताव करता है, जो एक हल्का अर्ध-संरचित प्रूनिंग फ्रेमवर्क है जो बड़े भाषा मॉडलों (LLMs) के स्केलेबल और कुशल परिनियोजन को सक्षम करने के लिए, पैरामीटर और मेमोरी ओवरहेड को काफी कम करते हुए स्पर्सिटी मास्क सीखने के लिए डिफरेंशिएबल सबसेट सैंपलिंग का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
लार्ज लैंग्वेज मॉडल्स आज के कई सबसे उन्नत आर्टिफिशियल इंटेलिजेंस टूल्स के पीछे के इंजन हैं, जो कहानियाँ लिखने, समस्याओं को हल करने और जटिल प्रश्नों के उत्तर देने में सक्षम हैं। हालाँकि, ये मॉडल्स विशाल होते हैं, जिनमें अक्सर अरबों संख्याएँ होती हैं जो उनके ज्ञान का प्रतिनिधित्व करती हैं। यह अत्यधिक आकार उन्हें मानक कंप्यूटरों पर चलाना कठिन बना देता है, जिसके लिए महंगे हार्डवेयर और महत्वपूर्ण ऊर्जा की आवश्यकता होती है। इन प्रणालियों को अधिक व्यावहारिक बनाने के लिए, शोधकर्ताओं ने लंबे समय से उन्हें उनकी बुद्धिमत्ता खोए बिना छोटा करने के तरीके खोजे हैं। एक आशाजनक रणनीति में "प्रूनिंग" (pruning) शामिल है, जो मॉडल के भीतर सबसे कम महत्वपूर्ण संख्याओं को पहचानने और हटाने की प्रक्रिया है। जबकि यादृच्छिक (random) संख्याओं को हटाना अक्सर मॉडल को खराब कर देता है, एक अधिक परिष्कृत दृष्टिकोण जिसे "सेमी-स्ट्रक्चर्ड स्पैरसिटी" (semi-structured sparsity) कहा जाता है, संख्याओं को विशिष्ट, नियमित पैटर्न में हटाता है। यह विधि मॉडल की संरचना को इतना बरकरार रखती है कि वह मौजूदा कंप्यूटर चिप्स के साथ काम कर सके, जो तेज़ और अधिक कुशल आर्टिफिशियल इंटेलिजेंस का मार्ग प्रशस्त करती है।
इस प्रूनिंग तकनीक की क्षमता के बावजूद, एक बड़ी बाधा बनी हुई है: यह तय करना कि वास्तव में किन संख्याओं को हटाना है, अत्यंत कठिन है। पिछले तरीकों ने इस समस्या को हल करने के लिए हर संभावित हटाने के पैटर्न को एक अलग विकल्प के रूप में माना, जो प्रभावी रूप से कंप्यूटर को संख्याओं के प्रत्येक समूह के लिए एक अद्वितीय नियम सीखने के लिए कहता था। जैसे-जैसे मॉडल बड़े होते गए, यह दृष्टिकोण बोझिल होता गया, जिसमें इतनी अतिरिक्त मेमोरी और कंप्यूटिंग शक्ति की आवश्यकता थी कि सबसे बड़े मॉडल्स पर इसे लागू करना अक्सर असंभव हो जाता था। "रिजर्वायर ऑफ इम्पॉर्टेंस" (Reservoir of Importance) नामक एक नए अध्ययन के पीछे के शोधकर्ताओं ने इस समस्या को संभालने का एक अलग तरीका विकसित किया है। वे एक ऐसा तरीका प्रस्तावित करते हैं जो संख्याओं को एक सुचारू, निरंतर तरीके से नमूना (sampling) लेकर उन्हें रखने के लिए सर्वश्रेष्ठ संख्याओं को चुनने के लिए सीखता है, न कि हर संभव संयोजन को याद रखने की कोशिश करता है।
टीम ने अपने नए दृष्टिकोण का परीक्षण किया, जिसे वे "रिजर्वायर ऑफ इम्पॉर्टेंस" कहते हैं, छोटे से लेकर बहुत बड़े आकार के लार्ज लैंग्वेज मॉडल्स के एक परिवार पर किया। हर संभावित प्रूनिंग पैटर्न का एक जटिल मानचित्र बनाने के बजाय, उनका तरीका चयन प्रक्रिया को बिना वापस रखे (without putting them back) एक पूल से वस्तुओं की एक विशिष्ट संख्या निकालने जैसा मानता है। कल्पना कीजिए कि आपके पास कंचों (marbles) का एक थैला है और आपको रखने के लिए हर चार में से ठीक दो को चुनना है, लेकिन आप उन्हें उनकी महत्ता के आधार पर सर्वश्रेष्ठ चुनना चाहते हैं। पुराने तरीके उन सभी तरीकों की गणना करने की कोशिश करेंगे जिनसे आप उन दो कंचों को चुन सकते हैं, जो एक कार्य है जो थैला बड़ा होने पर अत्यधिक जटिल हो जाता है। इसके विपरीत, नया तरीका प्रत्येक कंचे को एक सरल स्कोर प्रदान करता है और फिर शीर्ष दो को चुनने के लिए एक चतुर गणितीय चाल का उपयोग करता है। यह चाल कंप्यूटर को यह सीखने की अनुमति देती है कि कौन से स्कोर सबसे अच्छे काम करते हैं, प्रशिक्षण के दौरान उन्हें थोड़ा समायोजित करके, बिल्कुल वैसे ही जैसे रेडियो को स्पष्ट सिग्नल खोजने के लिए ट्यून किया जाता है।
इस रणनीति में बदलाव से तत्काल लाभ हुआ। शोधकर्ताओं ने पाया कि उनके नए तरीके को प्रूनिंग पैटर्न सीखने के लिए काफी कम समायोज्य सेटिंग्स (adjustable settings) की आवश्यकता थी। दो में से दो संख्याओं को रखने वाले एक सामान्य पैटर्न के लिए, नए तरीके ने पिछले अग्रणी दृष्टिकोण की तुलना में लगभग एक-तिहाई कम सीखने योग्य पैरामीटर का उपयोग किया। इस कमी का अर्थ था कि सिस्टम को चलाने के लिए बहुत कम मेमोरी की आवश्यकता थी, जिससे कंप्यूटर संसाधनों की कमी के बिना बहुत बड़े मॉडल्स पर प्रशिक्षण लेना संभव हो गया। जब उन्होंने परिणामों का परीक्षण किया, तो इस नए तरीके से प्रून किए गए मॉडल्स ने पुराने तकनीकों की तरह ही या उनसे थोड़ा बेहतर प्रदर्शन किया। उन्होंने विभिन्न कार्यों पर उच्च सटीकता बनाए रखी, जैसे कि बहुविकल्पीय प्रश्नों के उत्तर देना या वाक्य में अगले शब्द की भविष्यवाणी करना, जबकि वहां तक पहुँचने के लिए बहुत कम कंप्यूटिंग शक्ति का उपयोग किया।
अध्ययन ने यह भी देखा कि क्या होता है जब प्रूनिंग और भी आक्रामक हो जाती है, जैसे कि हर आठ में से केवल दो संख्याओं को रखना। ऐसे चरम मामलों में, पुराने तरीके जो सरल नियमों या स्थिर महत्व स्कोर पर निर्भर करते हैं, अक्सर पूरी तरह से विफल हो जाते हैं, जिससे मॉडल अपनी भाषा समझने की क्षमता खो देता है। हालाँकि, नया तरीका प्रभावी ढंग से काम करना जारी रखता है। इसने कठोर परिस्थितियों में भी रखने के लिए सही संख्याओं की सफलतापूर्वक पहचान की, जो यह साबित करता है कि प्रूनिंग पैटर्न को सीधे सीखना स्थिर नियमों के आधार पर अनुमान लगाने की तुलना में कहीं अधिक मजबूत है। शोधकर्ताओं ने देखा कि जैसे-जैसे वे मॉडल को अधिक प्रशिक्षण डेटा खिलाते रहे, इसका प्रदर्शन लगातार सुधरता गया, जबकि अन्य तरीके एक ऐसी सीमा (ceiling) पर पहुँच जाते थे जहाँ अधिक डेटा जोड़ने से कोई मदद नहीं मिलती थी।
हालाँकि परिणाम उत्साहजनक हैं, शोधकर्ता नोट करते हैं कि इस तकनीक का व्यावहारिक उपयोग काफी हद तक आपके कंप्यूटर हार्डवेयर पर निर्भर करता है। मॉडल द्वारा उपयोग किए जाने वाले विशिष्ट पैटर्न कुछ प्रकार के आधुनिक ग्राफिक्स प्रोसेसर पर कुशलतापूर्वक काम करने के लिए डिज़ाइन किए गए हैं, जो उच्च-स्तरीय कंप्यूटिंग में सामान्य हैं लेकिन सभी उपकरणों पर नहीं। यदि किसी कंप्यूटर में यह विशिष्ट सहायता नहीं है, तो मॉडल छोटा होने के बावजूद गति का लाभ प्राप्त नहीं किया जा सकेगा। फिर भी, यह कार्य बड़े आर्टिफिशियल इंटेलिजेंस मॉडल्स को अधिक कुशल बनाने के लिए एक स्पष्ट मार्ग प्रदान करता है। कंप्यूटर को खुद को प्रून करने का तरीका सिखाकर सरल बनाकर, शोधकर्ताओं ने दिखाया है कि उनकी बुद्धिमत्ता से समझौता किए बिना इन विशाल प्रणालियों को छोटा करना संभव है, जो भविष्य में अधिक शक्तिशाली और सुलभ एआई टूल्स के लिए मार्ग प्रशस्त करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।