← नवीनतम पेपर
💬 NLP

Batch Speculative Decoding Done Right

यह शोध पत्र पहचान करता है कि मौजूदा बैच स्पेक्युलेटिव डिकोडिंग कार्यान्वयन रैग्ड टेंसर (ragged tensor) की समस्या के कारण आउटपुट समानता बनाए रखने में विफल रहते हैं, और पहला सही ढांचा, EQSPEC, इसके अनुकूलित संस्करण EXSPEC के साथ प्रस्तावित करता है, जो विभिन्न मॉडल युग्मों में एल्गोरिदम की शुद्धता सुनिश्चित करते हुए 3 गुना तक थ्रूपुट सुधार प्राप्त करता है।

मूल लेखक: Ranran Haoran Zhang, Soumik Dey, Ashirbad Mishra, Hansi Wu, Binbin Li, Rui Zhang

प्रकाशित 2026-02-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ranran Haoran Zhang, Soumik Dey, Ashirbad Mishra, Hansi Wu, Binbin Li, Rui Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक हाई-स्पीड ट्रेन स्टेशन चला रहे हैं। आपका लक्ष्य अधिक से अधिक यात्रियों (टोकन) को ट्रेनों (AI मॉडल के आउटपुट) में चढ़ाना है, वह भी जितनी जल्दी हो सके।

समस्या: "अनुमान और जाँच" का ट्रैफिक जाम

सामान्यतः, एक AI मॉडल एक बार में एक शब्द लिखता है, अगले शब्द पर जाने से पहले अपने काम की जाँच करता है। यह सुरक्षित है लेकिन धीमा है।
स्पेक्युलेटिव डिकोडिंग (Speculative Decoding) एक तेज़, जूनियर सहायक (एक "ड्राफ्ट मॉडल") को नियुक्त करने जैसा है जो आपके लिए अगले 5 शब्दों का अनुमान लगाता है। फिर मुख्य AI (एक "टारगेट मॉडल") तेज़ी से जाँच करता है कि उसके अनुमान सही हैं या नहीं। यदि वे सही हैं, तो आप समय बचाते हैं। यदि नहीं, तो वह गलती सुधारता है और फिर से प्रयास करता है।

यह एक अकेले यात्री के लिए बहुत अच्छा काम करता है। लेकिन क्या होता है जब यात्रियों का एक समूह (एक "बैच") एक साथ चढ़ने की कोशिश कर रहा हो?

आपदा: "रैग्ड टेंसर" (Ragged Tensor) का दुःस्वप्न

वास्तविक दुनिया में, अलग-अलग यात्री अनुमानों की अलग-अलग संख्या स्वीकार करते हैं।

  • यात्री A, सभी 5 अनुमानों को स्वीकार करता है।
  • यात्री B, केवल पहले 2 को स्वीकार करता है, फिर कहता है, "नहीं, यह गलत है!"
  • यात्री C, 4 को स्वीकार करता है।

अब, आपके पास एक अस्त-व्यस्त लाइन है। कुछ लोग स्थिति 5 पर हैं, कुछ 2 पर, कुछ 4 पर। कंप्यूटर विज्ञान में, इसे "रैग्ड टेंसर" (Ragged Tensor) समस्या कहा जाता है। कंप्यूटर का मस्तिष्क (GPU) साफ-सुथरे, आयताकार ग्रिड पसंद करता है। उसे टेढ़ी-मेढ़ी, ऊबड़-खाबड़ लाइनें पसंद नहीं हैं।

पुराना तरीका: "टूटे हुए" समाधान

रैग्ड लाइन को एक चौकोर बॉक्स में फिट करने के प्रयास में पिछले प्रयासों ने नियमों को तोड़ने की कोशिश की:

  1. "मास्किंग" (Masking) विधि: उन्होंने अंतरों को छिपाने की कोशिश की, लेकिन इससे ट्रेन का शेड्यूल भ्रमित हो गया। AI कल्पना करने लगा (hallucinating), शब्द दोहराने लगा जैसे "नहीं नहीं नहीं नहीं" या बकवास प्रिंट करने लगा।
  2. "रोलबैक" (Rollback) विधि: उन्होंने सभी को सबसे छोटी लाइन पर रुकने के लिए मजबूर किया। यदि यात्री B ने केवल 2 शब्द स्वीकार किए, तो अन्य सभी को अपने अतिरिक्त 3 शब्दों को फेंकना पड़ा और प्रतीक्षा करनी पड़ी। इससे गति का सारा लाभ बर्बाद हो गया।

परिणाम? मौजूदा बैच सिस्टम तेज़ थे लेकिन कचरा आउटपुट देते थे। वे एक ऐसी रेस कार की तरह थे जो 200 मील प्रति घंटे की रफ्तार से चलती है लेकिन हर 10 सेकंड में दीवार से टकरा जाती है।

समाधान: "पूरी तरह से व्यवस्थित" स्टेशन

यह पेपर बिना नियमों को तोड़े स्टेशन को ठीक करने के लिए दो नए तरीके, EQSPEC और EXSPEC पेश करता है।

1. EQSPEC: "सख्त ट्रैफिक कंट्रोलर"

EQSPEC को एक बहुत ही सख्त, व्यवस्थित ट्रैफिक कंट्रोलर के रूप में सोचें।

  • यह कैसे काम करता है: अनुमान लगाने के प्रत्येक दौर के बाद, यह ट्रेन को रोकता है। यह सभी के टिकट लेता है, उन्हें इस तरह से व्यवस्थित (shuffle) करता है कि हर कोई पूरी तरह से एक सीधी रेखा में आ जाए, शेड्यूल (Position IDs) को अपडेट करता है, और सामान (KV-Cache) को सही जगह पर ले जाता है।
  • लागत: यह पुनर्गठन (shuffling) समय लेता है। यह सीटिंग चार्ट को व्यवस्थित करने के लिए ट्रेन रोकने जैसा है। यह लगभग 40% ओवरहेड (अतिरिक्त काम) जोड़ता है, लेकिन यह गारंटी देता है कि आउटपुट 100% सही है। कोई बकवास नहीं, कोई क्रैश नहीं।
  • रूपक (Metaphor): यह एक लाइब्रेरियन की तरह है जो हर कुछ पन्ने पढ़े जाने के बाद किताबों को पूरी तरह से फिर से शेल्फ में रखने के लिए पूरी लाइब्रेरी को रोकता है। यह धीमा है, लेकिन किताबें हमेशा सही जगह पर होती हैं।

2. EXSPEC: "स्मार्ट ग्रुपिंग" सिस्टम

EQSPEC सही है लेकिन थोड़ा धीमा है क्योंकि यह हर बार पुनर्गठन के लिए रुकता है। EXSPEC इसका अपग्रेड है।

  • यह कैसे काम करता है: सभी को एक बड़ी, अव्यवस्थित लाइन में डालने के बजाय, EXSPEC यात्रियों का एक "पूल" रखता है। यह देखता है और कहता है, "हे, यात्री A और यात्री C दोनों ने 4 शब्द स्वीकार किए! आइए केवल उन्हें एक साथ एक ट्रेन में रखें।"
  • जादू: यदि एक विशिष्ट ट्रेन पर मौजूद सभी लोगों ने शब्दों की समान संख्या स्वीकार की है, तो किसी पुनर्गठन की आवश्यकता नहीं है। ट्रेन तुरंत निकल जाती है।
  • रूपक (Metaphor): एक बस प्रणाली की कल्पना करें जहाँ ड्राइवर सभी को एक बस में डालने के लिए मजबूर नहीं करता है। इसके बजाय, वे लोगों को इस आधार पर समूह में बांटते हैं कि वे कितनी दूर जा रहे हैं। यदि 5 लोगों का एक समूह चाहता है कि वे बिल्कुल 3 स्टॉप तक जाएं, तो वे एक ऐसी बस में चढ़ते हैं जो बिना किसी प्रतीक्षा या पुनर्गठन के तुरंत निकल जाती है।

परिणाम: तेज़ और सही

लेखकों ने वास्तविक AI मॉडल (जैसे Vicuna और Qwen) पर इनका परीक्षण किया।

  • पुराने तरीके: तेज़ थे, लेकिन निरर्थक परिणाम (जैसे एक रोबोट जो गोल-गोल घूमकर बोल रहा हो) देते थे।
  • नए तरीके (EQSPEC/EXSPEC):
    • सटीकता (Correctness): 95%+ समय, आउटपुट धीमे, सटीक तरीके से प्राप्त आउटपुट के समान होता है। 5% का मामूली अंतर केवल कंप्यूटर की गणितीय गणना (floating-point errors) के कारण है, न कि किसी लॉजिक एरर के कारण।
    • गति: 8 के बैच साइज पर, वे एक-एक करके चलाने की तुलना में 3 गुना तेज़ हैं, जबकि फिर भी सटीक टेक्स्ट प्रदान करते हैं।

संक्षेप में

पिछली बैच स्पेक्युलेटिव डिकोडिंग एक अराजक 'मोश पिट' (mosh pit) की तरह थी: तेज़, लेकिन लोग घायल हो रहे थे (भ्रष्ट आउटपुट)।
इस पेपर ने एक सुव्यवस्थित डांस फ्लोर बनाया है।

  • EQSPEC वह कोरियोग्राफर है जो सबके कदमों को ठीक करने के लिए संगीत रोकता है (सटीकता की गारंटी देता है)।
  • EXSPEC वह स्मार्ट डीजे है जो केवल वही गाने बजाता है जहाँ सभी को डांस के स्टेप्स पता होते हैं, ताकि किसी को कभी रुकना न पड़े (गति को अधिकतम करता है)।

उन्होंने साबित किया कि आप AI में गति और सटीकता दोनों प्राप्त कर सकते हैं, जब तक कि आप कंप्यूटर की मेमोरी के काम करने के नियमों का सम्मान करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →