Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding
फास्टर फ्लैश डिकोडिंग (FFD) एक ट्रेनिंग-मुक्त, हार्डवेयर-एल्गोरिदम को-डिज़ाइन फ्रेमवर्क है जो चयन और गणना को एक एकल कर्नेल में संलयित करके और वितरण-अनुकूलनशील स्पर्सिटी के लिए एक टॉप-डेल्टा रणनीति का उपयोग करके, मॉडल की सटीकता बनाए रखते हुए, 11.6x तक कर्नेल-स्तरीय गति वृद्धि प्राप्त करता है और 256K कॉन्टेक्स्ट लंबाई तक स्केल करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की दुनिया में, लार्ज लैंग्वेज मॉडल्स के रूप में ज्ञात आधुनिक कंप्यूटर प्रोग्राम मानव भाषा को समझने और उत्पन्न करने में उल्लेखनीय रूप से कुशल हो गए हैं। ये सिस्टम एक समय में एक टोकन करके, वाक्य में अगले शब्द का अनुमान लगाकर, चरण दर चरण एक सुसंगत प्रतिक्रिया बनाने के काम करते हैं। हालाँकि, जैसे-जैसे ये मॉडल अधिक सक्षम होते जा रहे हैं, उन्हें बहुत लंबे दस्तावेज़ों या बातचीत को प्रोसेस करने के लिए एक महत्वपूर्ण भौतिक बाधा का सामना करना पड़ता है। मॉडल को जितना अधिक संदर्भ याद रखने की आवश्यकता होती है, उतना ही अधिक डेटा उसे अपनी तेज़ आंतरिक मेमोरी और अपने मुख्य स्टोरेज के बीच लगातार इधर-उधर भेजना पड़ता है। डेटा का यह निरंतर आवागमन एक बाधा (बॉटलनेक) पैदा करता है, ठीक वैसे ही जैसे बगीचे के पाइप से स्विमिंग पूल भरने की कोशिश करना जबकि ड्रेन पूरी तरह खुला हो। कंप्यूटर वास्तव में सोचने के बजाय जानकारी आने का इंतज़ार करने में अपना अधिकांश समय बिताता है, जो पूरी प्रक्रिया को धीमा कर देता है और यह सीमित कर देता है कि एक मॉडल एक बार में कितना टेक्स्ट संभाल सकता है।
इसे हल करने के लिए, फुदान यूनिवर्सिटी और शंघाई इनोवेशन इंस्टीट्यूट के शोधकर्ताओं ने 'फास्टर फ्लैश डिकोडिंग' नामक एक नई विधि विकसित की है। उनका दृष्टिकोण इस बात को बदलकर इस समस्या का समाधान करता है कि मॉडल यह कैसे तय करता है कि जानकारी के किन हिस्सों को रखना है और किन्हें अनदेखा करना है। एक विशाल दस्तावेज़ में प्रासंगिक शब्दों को खोजने के लिए हर एक शब्द को पढ़ने की कोशिश करने के बजाय, यह नई प्रणाली एक चतुर शॉर्टकट का उपयोग करती है। यह पहले बातचीत के पूरे इतिहास का एक छोटा, संकुचित स्केच (sketch) तैयार करती है। यह स्केच इतना छोटा होता है कि कंप्यूटर इसे लगभग तुरंत स्कैन कर सकता है। इस स्केच को देखकर, सिस्टम तेज़ी से पहचान सकता है कि इतिहास के कौन से हिस्से महत्वपूर्ण होने की संभावना रखते हैं और किन्हें सुरक्षित रूप से अनदेखा किया जा सकता है। इस त्वरित स्कैन के बाद ही, मॉडल अंतिम गणना करने के लिए चयनित हिस्सों के पूर्ण, विस्तृत संस्करण को प्राप्त करता है। यह दो-चरणीय प्रक्रिया मॉडल को मूल अर्थ को समझे बिना सूचना के विशाल मात्रा को छोड़ने की अनुमति देती है।
शोधकर्ताओं ने इस विधि का परीक्षण शक्तिशाली ग्राफिक्स कार्ड पर किया, जो उच्च-स्तरीय गेमिंग और वैज्ञानिक कंप्यूटिंग के लिए उपयोग किए जाते हैं, और पाया कि यह वर्तमान मानक तकनीकों की तुलना में नाटकीय रूप से तेज़ है। 256,000 टोकन के संदर्भ को प्रोसेस करते समय, इस नई प्रणाली ने एक एकल टोकन उत्पन्न करने में लगने वाले समय को एक मिलीसेकंड से घटाकर उसका एक अंश कर दिया। समग्र गति के मामले में, इस प्रणाली ने पिछले तरीकों की तुलना में 2.37 गुना अधिक तेज़ी से टेक्स्ट जेनरेट किया, जबकि सटीकता का वही स्तर बनाए रखा। टीम ने जटिल तर्क और लंबे दस्तावेज़ों से विशिष्ट तथ्यों को निकालने सहित कार्यों की एक विस्तृत श्रृंखला में इस प्रदर्शन को सत्यापित किया, जिससे पुष्टि हुई कि गति में वृद्धि बुद्धिमत्ता की कीमत पर नहीं आई। यह सिस्टम बिना मॉडल को फिर से प्रशिक्षित (retrain) किए काम करता है, जिसका अर्थ है कि इसे मौजूदा आर्टिफिशियल इंटेलिजेंस सिस्टम की दक्षता में सुधार करने के लिए तुरंत उनमें जोड़ा जा सकता है।
इस कार्य में एक प्रमुख नवाचार सूचना को फ़िल्टर करने का विशिष्ट तरीका है। पारंपरिक विधियाँ अक्सर निश्चित नियमों पर निर्भर करती हैं, जैसे कि केवल शीर्ष दस सबसे महत्वपूर्ण शब्दों को रखना, या जटिल गणनाएँ जिनमें आगे बढ़ने से पहले पूरे सिस्टम को रुकने और सिंक्रोनाइज़ होने की आवश्यकता होती है। नई विधि एक गतिशील थ्रेशोल्ड (dynamic threshold) का उपयोग करती है जो बातचीत के स्वाभाविक प्रवाह के अनुकूल होती है। यह उन शब्दों को खोजती है जो वर्तमान संदर्भ में सबसे महत्वपूर्ण शब्द की तुलना में काफी महत्वपूर्ण हैं, जिससे यह ध्यान (attention) के संकेंद्रण के आधार पर यह तय करने की क्षमता पाती है कि वह कितना रखेगी। यह लचीलापन, प्रारंभिक स्कैन के लिए अत्यंत कम-परिशुद्धता (low-precision) वाले डेटा के उपयोग के साथ मिलकर, कंप्यूटर को उस मेमोरी बॉटलनेक को बायपास करने की अनुमति देता है जिसने लंबे संदर्भ प्रसंस्करण (long-context processing) को लंबे समय से पीछे धकेल रखा था। परिणाम एक ऐसा सिस्टम है जो उत्तरों की गुणवत्ता से समझौता किए बिना, टेक्स्ट की विशाल मात्रा को ऐसी गति के साथ संभाल सकता है जो पहले असंभव मानी जाती थी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।