FlashAttention for Scalable Vector Architectures
यह शोध पत्र FlashAttention-V प्रस्तुत करता है, जो स्केलेबल वेक्टर आर्किटेक्चर के लिए अनुकूलित एक ब्लॉक्ड FlashAttention कार्यान्वयन है जो इंटर-हेड पैरेललिज्म और कुशल मेमोरी एक्सेस का लाभ उठाकर CPU पर ट्रांसफॉर्मर इन्फरेंस को महत्वपूर्ण रूप से तेज करता है, जिससे प्रीफिल में 42x तक और डिकोड में 11x तक की गति वृद्धि प्राप्त होती है, साथ ही लॉन्ग-वेक्टर निष्पादन के लिए वर्तमान क्वांटाइजेशन प्रारूपों में संरचनात्मक बाधाओं को भी रेखांकित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक आर्टिफिशियल इंटेलिजेंस सिस्टम, ईमेल ड्राफ्ट करने वाले चैटबॉट्स से लेकर सॉफ्टवेयर को डीबग करने वाले कोडिंग असिस्टेंट तक, एक विशिष्ट प्रकार के कंप्यूटर प्रोग्राम पर निर्भर करते हैं जिसे 'ट्रांसफॉर्मर' कहा जाता है। ये प्रोग्राम वाक्य में शब्द एक-दूसरे से कैसे संबंधित हैं, इसे देखकर भाषा को समझने के लिए बनाए गए हैं। ऐसा करने के लिए, वे 'अटेंशन' (attention) नामक एक तंत्र का उपयोग करते हैं, जो एक स्पॉटलाइट की तरह कार्य करता है, जिससे सिस्टम को शेष भाग को अनदेखा करते हुए टेक्स्ट के सबसे प्रासंगिक हिस्सों पर ध्यान केंद्रित करने की अनुमति मिलती है। हालांकि ये सिस्टम अक्सर शक्तिशाली ग्राफिक्स कार्ड वाले विशाल डेटा सेंटरों पर चलाए जाते हैं, लेकिन इन्हें लैपटॉप, टैबलेट और यहाँ तक कि इंटरनेट ऑफ थिंग्स (IoT) में पाए जाने वाले विशेष माइक्रोचिप्स जैसे छोटे, रोजमर्रा के उपकरणों पर चलाने की बढ़ती आवश्यकता है। ये छोटे उपकरण अक्सर एक अलग प्रकार के प्रोसेसर का उपयोग करते हैं जो डेटा को लंबी लाइनों में प्रोसेस करके एक साथ कई गणनाओं को संभालने के लिए डिज़ाइन किया गया है, जिसे 'वेक्टर आर्किटेक्चर' (vector architectures) के रूप में जाना जाता है। हालांकि, एक बड़ी बाधा सामने आई है: अटेंशन मैकेनिज्म अत्यधिक मेमोरी-प्यास वाला है, जिसके लिए प्रोसेसर को लगातार बड़ी मात्रा में डेटा लाने और स्टोर करने की आवश्यकता होती है, जिससे सब कुछ धीमा हो जाता है।
चैल्मर्स यूनिवर्सिटी ऑफ टेक्नोलॉजी और यूनिवर्सिटी ऑफ ग्लासगो के शोधकर्ताओं ने इन वेक्टर प्रोसेसर्स पर अटेंशन मैकेनिज्म के काम करने के तरीके को फिर से डिजाइन करके इस समस्या का समाधान किया है। उन्होंने FlashAttention-V नामक एक नई विधि बनाई है, जो इस बात को बदल देती है कि कंप्यूटर इन प्रोसेसर्स के अनूठे आकार में फिट होने के लिए अपने काम को कैसे व्यवस्थित करता है। प्रोसेसर को एक बार में डेटा के एक छोटे टुकड़े को संभालने के लिए मजबूर करने के बजाय, यह नई विधि कई स्वतंत्र गणनाओं को डेटा की एक एकल, चौड़ी लाइन में समूहित करती है। एक फैक्ट्री असेंबली लाइन की कल्पना करें जहाँ कर्मचारी आमतौर पर एक समय में एक वस्तु को संभालते हैं; यह नया दृष्टिकोण उन्हें वस्तुओं की एक पूरी ट्रे उठाने और एक ही बार में उन सभी को प्रोसेस करने की अनुमति देता है, जिससे स्टोरेज शेल्फों तक बार-बार आने-जाने में लगने वाला समय काफी कम हो जाता है। ऑपरेशन्स के क्रम को पुनर्व्यवस्थित करके और डेटा को अधिक सघन रूप से पैक करके, शोधकर्ताओं ने पाया कि वे इन छोटे उपकरणों को काफी तेजी से चला सकते हैं, विशेष रूप से टेक्स्ट के छोटे विस्फोटों (bursts) के दौरान या जब डिवाइस एक-एक करके नए शब्द बना रहा होता है।
टीम ने वास्तविक हार्डवेयर और विस्तृत कंप्यूटर सिमुलेशन दोनों का उपयोग करके TinyLlama, Llama 3.2 और Qwen2.5 सहित कई विभिन्न भाषा मॉडलों पर अपने नए दृष्टिकोण का परीक्षण किया। Banana Pi BPI-F3 नामक एक भौतिक डेवलपमेंट बोर्ड पर, जो RISC-V प्रोसेसर का उपयोग करता है, यह नया तरीका एक व्यापक सुधार साबित हुआ। जब डिवाइस एक छोटे इनपुट को पढ़ने की तैयारी कर रहा था, तो नया दृष्टिकोण मानक, गैर-अनुकूलित संस्करण की तुलना में बारह से चौदह गुना अधिक तेज़ था। जब डिवाइस एक-एक करके शब्द उत्पन्न कर रहा था, तो यह चार से पांच गुना तेज़ था। शोधकर्ताओं ने यह देखने के लिए व्यापक सिमुलेशन भी चलाए कि यदि प्रोसेसर को और भी चौड़ी डेटा लाइनों के साथ बनाया जाए, तो यह विधि कैसा प्रदर्शन करेगी, जो एक साथ सूचना के बहुत बड़े हिस्से को संभालने में सक्षम हैं। इन सिमुलेशनों ने दिखाया कि जैसे-जैसे डेटा लाइनें चौड़ी होती गईं, गति में वृद्धि भी बढ़ती गई, जो इनपुट तैयार करने के सर्वोत्तम परिदृश्यों में बुनियादी संस्करण की तुलना में चालीस-दो गुना तक पहुँच गई।
हालाँकि, अध्ययन ने इस बात का भी खुलासा किया कि ये उपकरण कितनी तेजी से बढ़ सकते हैं, इसकी एक स्पष्ट सीमा है। शोधकर्ताओं ने पाया कि जबकि प्रोग्राम का अटेंशन हिस्सा इन चौड़ी डेटा लाइनों से बहुत लाभान्वित होता है, सिस्टम के अन्य हिस्से, विशेष रूप से वे परतें (layers) जो संख्याओं को भविष्यवाणियों में परिवर्तित करती हैं, ऐसा नहीं करते हैं। ये परतें संख्याओं को स्टोर करने के एक विशिष्ट तरीके का उपयोग करती हैं जिसे 'क्वांटाइजेशन' (quantization) कहा जाता है, जो जगह बचाने के लिए डेटा को कंप्रेस करता है। डेटा को वर्तमान में जिस तरह से पैक किया जाता है, वह एक संरचनात्मक बेमेल (mismatch) पैदा करता है, जो प्रोसेसर को संख्याओं को अलग करने और फिर से संयोजित करने के लिए अतिरिक्त, अक्षम कार्य करने के लिए मजबूर करता है। सिमुलेशन ने दिखाया कि इन विशिष्ट परतों के लिए, एक साथ अधिक डेटा प्रोसेस करने से बचा गया समय, डेटा को पुनर्व्यवस्थित करने में लगने वाले समय द्वारा पूरी तरह से खा लिया जाता है। इसका अर्थ यह है कि जबकि अटेंशन मैकेनिज्म को अविश्वसनीय रूप से तेज़ बनाया जा सकता है, सिस्टम की समग्र गति वर्तमान में इन अन्य घटकों द्वारा रोकी जा रही है, जो यह सुझाव देता है कि भविष्य के सुधारों के लिए केवल यह नहीं, बल्कि यह बदलने की भी आवश्यकता है कि इन संख्याओं को कैसे स्टोर किया जाता है।
ये निष्कर्ष रोजमर्रा के उपकरणों पर आर्टिफिशियल इंटेलिजेंस को अधिक सुलभ बनाने के लिए एक स्पष्ट मार्ग प्रदान करते हैं। नया तरीका, FlashAttention-V, आधुनिक भाषा मॉडलों के डिज़ाइन और स्केलेबल वेक्टर प्रोसेसर्स की क्षमताओं के बीच के अंतर को सफलतापूर्वक पाटता है। यह सिद्ध करता है कि केवल कंप्यूटर के अपने कार्यों के बारे में सोचने के तरीके को बदलकर और डेटा को अधिक कुशलता से पैक करके, नए हार्डवेयर की आवश्यकता के बिना महत्वपूर्ण प्रदर्शन लाभ प्राप्त करना संभव है। शोध पुष्टि करता है कि छोटे कार्यों और रियल-टाइम टेक्स्ट जनरेशन के लिए, ये अनुकूलित प्रोसेसर अत्यधिक प्रभावी हो सकते हैं। फिर भी, यह एक चेतावनी के रूप में भी कार्य करता है कि इन उपकरणों के लिए डेटा को कंप्रेस करने के वर्तमान तरीके एक सीमा तक पहुँच रहे हैं, और भविष्य के व्यापक प्रोसेसर्स की पूर्ण क्षमता को अनलॉक करने के लिए संभवतः इन कंप्रेस्ड नंबरों को अधिक बुद्धिमानी से स्टोर करने और मूव करने की पहेली को सुलझाने पर निर्भर करेगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।