← नवीनतम पेपर
💬 NLP

SpecLA: Efficient Speculative Decoding for Linear-Attention Models

यह शोध पत्र SpecLA प्रस्तुत करता है, जो विशेष रूप से स्टेटफुल लीनियर-अटेंशन मॉडल्स के लिए डिज़ाइन किया गया एक कुशल स्पेक्युलेटिव डिकोडिंग रनटाइम है, जो मानक ऑटोरिग्रेसिव डिकोडिंग की तुलना में 1.70x तक एंड-टू-एंड स्पीडअप प्राप्त करने के लिए टोपोलॉजी-अवेयर वेरिफिकेशन, कॉम्पैक्ट स्टेट रिकवरी और टार्गेट-अलाइन्ड ड्राफ्टर का उपयोग करता है।

मूल लेखक: Zhibin Wang, Xuying Han, Zhaohua Yang, Fuliang Liu, Xue Li, Rong Gu, Sheng Zhong, Chen Tian

प्रकाशित 2026-07-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhibin Wang, Xuying Han, Zhaohua Yang, Fuliang Liu, Xue Li, Rong Gu, Sheng Zhong, Chen Tian

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कहानी लिखने की कोशिश कर रहे हैं, लेकिन आपका एक बहुत ही सख्त संपादक है जो आपको एक बार में केवल एक ही शब्द लिखने की अनुमति देता है। इससे पहले कि आप अगला शब्द लिख सकें, आपको रुकना पड़ता है, अपनी अब तक लिखी गई पूरी नोटबुक की जाँच करनी पड़ती है, अपनी मानसिक स्थिति को अपडेट करना पड़ता है, और फिर अगला शब्द लिखना पड़ता है। वर्तमान में कई शक्तिशाली AI मॉडल इसी तरह काम करते हैं: वे एक समय में एक टोकन (शब्द का हिस्सा) उत्पन्न करते हैं, और अपनी तेज़ मेमोरी और मुख्य स्टोरेज के बीच लगातार भारी मात्रा में डेटा को इधर-उधर भेजते रहते हैं। यह प्रक्रिया धीमी है, जैसे एक लाइब्रेरियन जिसे आपके द्वारा बोले गए हर एक शब्द के लिए लाइब्रेरी के पिछले हिस्से में जाकर किताब चेक करनी पड़ती है।

इस गति को बढ़ाने के लिए, वैज्ञानिकों ने "स्पेक्युलेटिव डिकोडिंग" (speculative decoding) नामक एक तरकीब ईजाद की। कल्पना कीजिए कि एक शब्द लिखने के बजाय, आपके पास एक तेज़, थोड़ा कम बुद्धिमान सहायक है जो आपके लिए अगले कुछ शब्दों का अनुमान लगाता है। फिर आप अपने सख्त संपादक से उन सभी अनुमानों को एक साथ जाँचने के लिए कहते हैं। यदि संपादक उन अनुमानों से सहमत होता है, तो आप एक शब्द लिखने में लगने वाले समय में कई शब्द लिख पाते हैं। यह इस प्रकार के मानक AI मॉडल (ट्रांसफॉर्मर्स) के लिए बहुत अच्छा काम करता है क्योंकि वे पिछले सभी शब्दों की एक सूची रखते हैं जिसे संपादित करना आसान होता है। लेकिन, एक नया और तेज़ प्रकार का AI मॉडल (जिसे लीनियर-अटेंशन कहा जाता है) है जो कोई सूची नहीं रखता; इसके बजाय, यह एक एकल, सघन "सारांश अवस्था" (summary state) रखता है, जो हर बार एक नया शब्द जोड़े जाने पर बदल जाती है। पुराने अनुमान लगाने वाले तरीके यहाँ काम नहीं करते क्योंकि आप इस सारांश अवस्था से गलत अनुमान को बिना पूरी चीज़ को दोबारा लिखे हटा नहीं सकते। यह वह पहेली है जिसे शोधकर्ता हल करने की कोशिश कर रहे हैं: हम कई शब्द आगे का अनुमान लगाने की गति प्राप्त कैसे करें बिना इन नए मॉडलों के याद रखने के अनूठे तरीके को बाधित किए?

यहाँ SpecLA आता है, जो एक नया सिस्टम है जिसे विशेष रूप से इन स्टेटफुल, लीनियर-अटेंशन मॉडलों के लिए "अनुमान लगाने" की यह तकनीक काम करने के योग्य बनाने के लिए डिज़ाइन किया गया है। शोधकर्ताओं ने पाया कि केवल इन नए मॉडलों पर पुराने अनुमान लगाने के तरीकों को थोपना बुरी तरह विफल हो जाता है। यदि आप अनुमानों की एक-एक करके जाँच करने की कोशिश करते हैं, तो आप गति का लाभ खो देते हैं क्योंकि आप अभी भी हर एक अनुमान के लिए भारी सारांश अवस्था को इधर-उधर ले जा रहे होते हैं। यदि आप उन्हें एक बैच की तरह एक साथ जाँचने की कोशिश करते हैं, तो गणित जटिल और धीमा हो जाता है, क्योंकि अनुमान अलग-अलग दिशाओं में निकल सकते हैं, और मॉडल की मेमोरी ब्रांचिंग (शाखाओं में बँटने) को अच्छी तरह से हैंडल नहीं करती है।

इसलिए, टीम ने SpecLA बनाया, जो इन AI मॉडलों के लिए एक स्मार्ट ट्रैफिक कंट्रोलर की तरह काम करता है। हर अनुमान को एक अलग यात्रा मानने के बजाय, SpecLA अनुमानों के आकार को देखता है। यदि अनुमान एक सीधी रेखा बनाते हैं, तो यह मॉडल की मेमोरी अवस्था को तेज़ प्रोसेसर चिप पर ही रखता है, जिससे मुख्य स्टोरेज तक जाने वाली धीमी यात्रा से बचा जा सके। यदि अनुमान एक पेड़ की तरह शाखाओं में बँट जाते हैं, तो यह विभिन्न रास्तों को आपस में मिलाए बिना उन सभी को एक साथ जाँचने के लिए एक विशेष "ट्री मास्क" (tree mask) का उपयोग करता है। सबसे महत्वपूर्ण बात यह है कि जब सख्त संपादक कुछ अनुमानों को "हाँ" और अन्य को "ना" कहता है, तो SpecLA पूरी मेमोरी अवस्था को फिर से लिखने में समय बर्बाद नहीं करता है। इसके बजाय, यह जाँच प्रक्रिया के दौरान होने वाले परिवर्तनों के छोटे, संक्षिप्त "रसीद" (जिन्हें फैक्टर्स कहा जाता है) को सुरक्षित करता है। निर्णय लिया जाने के बाद, यह मेमोरी अवस्था को तुरंत अपडेट करने के लिए इन रसीदों का उपयोग करता है, जिससे भारी काम करने की ज़रूरत ही नहीं पड़ती।

इसके परिणाम उत्साहजनक हैं। एक शक्तिशाली NVIDIA H100 कंप्यूटर पर GDN-1.3B नामक एक सार्वजनिक मॉडल का उपयोग करते हुए, SpecLA ने AI को मानक, एक-एक शब्द वाली विधि की तुलना में 1.70 गुना तेज़ टेक्स्ट लिखने में सक्षम बनाया। कुछ परीक्षणों में, यह 1.42 गुना तेज़ था और अन्य में 1.06 गुना तेज़ था। शोधकर्ताओं ने यह देखने के लिए छोटे परीक्षण भी किए कि यह इतना अच्छा क्यों काम करता है। उन्होंने पाया कि अनुमानों की पेड़ जैसी संरचना वाली शाखाओं को जाँचने का उनका नया "हाइब्रिड" तरीका, अनुमानों को एक-एक करके फिर से चलाने के पुराने तरीके की तुलना में 1.80 से 7.11 गुना तेज़ था। उन्होंने यह भी खोजा कि मेमोरी को अपडेट करने के लिए उन संक्षिप्त "रसीदों" का उपयोग करना, शब्दों को फिर से चलाने की तुलना में 2.74 से 4.28 गुना तेज़ था, और अंतिम अपडेट को अगले चरण तक टालने से समय में 1.15 से 1.44 गुना की और बचत हुई।

हालाँकि, पेपर सावधानीपूर्वक यह नोट करता है कि यह गति इस बात पर निर्भर करती है कि "अनुमान लगाने वाला सहायक" कितना अच्छा है। यदि सहायक बहुत अधिक गलत अनुमान लगाता है, तो सिस्टम उन्हें जाँचने में समय बिताता है और फिर उन्हें खारिज कर देता है, जिससे गति का लाभ समाप्त हो जाता है। शोधकर्ताओं ने दिखाया कि सिस्टम के बेहतर ढंग से काम करने के लिए, सहायक इतना सटीक होना चाहिए कि कम से कम 70% से 80% अनुमान स्वीकार किए जाएं। यदि सहायक पूर्णतः सटीक है, तो गति सैद्धांतिक रूप से और भी अधिक हो सकती है, लेकिन एक वास्तविक दुनिया के सहायक के साथ, लाभ ठोस हैं लेकिन अनुमानों की गुणवत्ता पर निर्भर करते हैं। पेपर यह दावा नहीं करता कि यह हर समस्या को हर AI मॉडल के लिए हल कर देता है, लेकिन यह साबित करता है कि इस विशिष्ट प्रकार के स्टेटफुल मॉडल के लिए, एक नया, अनुकूलित दृष्टिकोण आवश्यक और प्रभावी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →