Approximate Speculative Decoding
यह शोध पत्र एप्रॉक्सिमेट स्पेक्युलेटिव डिकोडिंग (ASD) को प्रस्तुत करता है, जो एक ट्रेनिंग-मुक्त विधि है जो वैध सफिक्स (suffixes) के पुन: उपयोग के लिए रिग्रेट बजट (regret budget) के आधार पर ड्राफ्ट टोकन मिसमैच को चुनिंदा रूप से स्वीकार करके ऑटोरेग्रेसिव जनरेशन को त्वरित करती है, जिससे नए ड्राफ्ट मॉडल या फाइन-ट्यूनिंग की आवश्यकता के बिना थ्रूपुट में सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन अविश्वसनीय रूप से धीमे मित्र के साथ एक कहानी लिखने की कोशिश कर रहे हैं। हर बार जब आप अपनी कहानी में एक नया शब्द जोड़ना चाहते हैं, तो आपको अपने मित्र के गहराई से सोचने, उनके ज्ञान के पूरे पुस्तकालय की जांच करने और फिर आपको यह बताने के लिए इंतजार करना पड़ता है कि अगला शब्द कौन सा होगा। आधुनिक AI भाषा मॉडल इसी तरह काम करते हैं: वे एक बार में एक शब्द बनाकर टेक्स्ट जेनरेट करते हैं, और "सोचने" वाला हिस्सा अधिकांश समय ले लेता है, जिससे यह प्रक्रिया पेंट सूखने देखने जैसा उबाऊ महसूस होती है। इस प्रक्रिया को तेज करने के लिए, वैज्ञानिकों ने "स्पेक्युलेटिव डिकोडिंग" (speculative decoding) नामक एक तरकीब ईजाद की। इसे ऐसे समझें जैसे आपके पास एक तेज़, कनिष्ठ सहायक (junior assistant) है जो आपके लिए अगले कुछ शब्दों का अनुमान लगाता है। फिर आप अपने धीमे, विशेषज्ञ मित्र से पूछते हैं कि क्या वे अनुमान सही हैं। यदि विशेषज्ञ सहमत होता है, तो आप एक बार में एक शब्द के बजाय एक साथ कई शब्द लिख पाते हैं, जिससे बहुत सारा समय बच जाता है।
हालाँकि, इसमें एक पेच है। विशेषज्ञ मित्र नियमों का बहुत पक्का है। यदि सहायक द्वारा लगाया गया एक भी अनुमान उस शब्द से अलग है जिसे विशेषज्ञ बिल्कुल सही चुनता, तो विशेषज्ञ तुरंत पूरी प्रक्रिया को रोक देता है। वे उन सभी शब्दों को फेंक देते हैं जिनका अनुमान सहायक ने उस मोड़ पर लगाया था, भले ही उनमें से अधिकांश वास्तव में सही रहे हों। यह एक शिक्षक की तरह है जो एक टेस्ट ग्रेड करते समय एक भी गलत उत्तर देखते ही पढ़ना बंद कर देता है और बाकी के पेपर को कूड़ेदान में फेंक देता है। यह "सब-या-कुछ-नहीं" वाला नियम कहानी को एकदम सटीक रखता है, लेकिन यह सहायक की बहुत सारी मेहनत को बर्बाद कर देता है और काम को धीमा कर देता है।
यह पेपर एप्रोक्सिमेट स्पेक्युलेटिव डिकोडिंग (ASD) नामक एक नई विधि पेश करता है, जो एक स्मार्ट और अधिक लचीले शिक्षक की तरह काम करती है। एक छोटी सी गलती होने पर भी पूरा टेस्ट फेंक देने के बजाय, ASD पूछता है: "क्या यह गलती मामूली है? और क्या सहायक ने अगले कुछ शब्द सही लिखे हैं?" यदि उत्तर हाँ है, तो ASD उस छोटी गलती को स्वीकार कर लेता है, उन अच्छे शब्दों को बरकरार रखता है जो उसके बाद आए थे, और आगे बढ़ जाता है। यह एक ऐसे शिक्षक की तरह है जो कहता है, "तुमने 'because' की स्पेलिंग गलत लिखी, लेकिन तुमने अगले दस शब्द बिल्कुल सही लिखे हैं, इसलिए चलो बस इस एक शब्द को ठीक करते हैं और आगे बढ़ते हैं।" शोधकर्ताओं ने पाया कि छोटी गलतियों के प्रति थोड़ा अधिक उदार होने से, वे कहानी की गुणवत्ता खराब किए बिना AI को काफी तेजी से लिखवा सकते थे।
"बजट वाले" सहायक की कहानी
ASD के पीछे का मुख्य विचार यह है कि हर गलती को एक आपदा मानना बंद किया जाए। पुराने तरीके में, यदि आपके सहायक ने ऐसा शब्द अनुमानित किया जो शीर्ष विकल्प नहीं था, तो सिस्टम तुरंत रुक जाता था। लेकिन लेखकों ने महसूस किया कि कभी-कभी, सहायक का "गलत" अनुमान वास्तव में सही वाले के बहुत करीब होता है, और उसके बाद आने वाले शब्द अभी भी एकदम सही होते हैं।
इसे ठीक करने के लिए, टीम ने एक बजट वाली प्रणाली बनाई। कल्पना कीजिए कि आपके पास "गलती टोकन" (mistake tokens) का एक जार है। आपको कुछ छोटी गलतियाँ करने की अनुमति है, लेकिन आपको उनके लिए अपने जार से भुगतान करना होगा।
- लोकल गेट (The Local Gate): एक गलती को स्वीकार करने से पहले, सिस्टम जांचता है कि वह कितनी "बुरी" है। यदि सहायक का अनुमान आदर्श शब्द की तुलना में केवल थोड़ा कम संभावित है, तो यह एक सस्ती गलती है। यदि यह एक बड़ी त्रुटि है, तो इसकी कीमत बहुत अधिक टोकन होगी, और सिस्टम "ना" कह देगा।
- ब्लॉक कैप (The Block Cap): आप अनुमान लगाने के एक ही बैच में बहुत अधिक गलतियाँ नहीं कर सकते। यह सहायक को एक साथ बहुत अधिक गलत होने से रोकता है।
- अनुरोध बजट (The Request Budget): यह पूरी बातचीत के लिए टोकन का कुल जार है। एक बार जब आपके टोकन खत्म हो जाते हैं, तो आपको शेष कहानी के लिए वापस पूरी तरह से सटीक (पुराने नियमों का सख्ती से पालन करते हुए) होना पड़ता है।
जादू तब होता है जब सिस्टम एक छोटी गलती को स्वीकार कर लेता है। क्योंकि सहायक के अगले कुछ अनुमान वास्तव में सटीक थे (वे वही थे जो विशेषज्ञ चुनता), सिस्टम उन्हें "पुन: उपयोग" (reuse) कर सकता है। इसे उन्हें फिर से जांचने के लिए धीमे विशेषज्ञ की आवश्यकता नहीं होती। यह बस उन्हें स्वीकार करता है और आगे बढ़ता है। यह एक "रुकें और फेंक दें" वाले क्षण को "ठीक करें और आगे बढ़ें" वाले क्षण में बदल देता है।
उन्होंने क्या पाया
शोधकर्ताओं ने इस विचार का परीक्षण बहुत लोकप्रिय AI मॉडलों (जैसे Qwen3 और DeepSeek) का उपयोग करके विभिन्न कार्यों पर किया, जिनमें गणित की समस्याओं को हल करने से लेकर कोड लिखना शामिल है। उन्हें मॉडलों को फिर से प्रशिक्षित करने या सहायक को कुछ भी नया सिखाने की आवश्यकता नहीं पड़ी; उन्होंने केवल यह बदला कि "शिक्षक" (verifier) काम को कैसे ग्रेड करता है।
परिणाम काफी उत्साहजनक थे। इस बजट वाले दृष्टिकोण का उपयोग करके, सिस्टम बिना किसी अतिरिक्त प्रशिक्षण के काफी तेज़ हो गया।
- सात अलग-अलग कार्यों पर, यह सख्त, पुराने तरीके की तुलना में औसतन 7.78% तेज़ हो गया।
- सबसे अच्छे मामलों में, जैसे कि MATH-500 डेटासेट पर, इसकी गति 11.73% तक बढ़ गई।
- जब उन्होंने DeepSeek-V4-Flash जैसे विशाल मॉडल का परीक्षण किया, तो उन्होंने देखा कि स्वीकृति दर (कितने अनुमानों को सिस्टम ने रखा) लगभग 10% से 16% तक बढ़ गई।
पेपर सावधानीपूर्वक नोट करता है कि यह कोई जादुई छड़ी नहीं है जो सब कुछ एकदम सही बना देती है। लेखक स्पष्ट रूप से कहते हैं कि यह विधि उस पथ को बदल देती है जिस पर AI उत्तर तक पहुँचता है। कभी-कभी, कहानी थोड़ी अलग हो सकती है, या उसका "हैश" (टेक्स्ट का डिजिटल फिंगरप्रिंट) बदल सकता है, भले ही अंतिम उत्तर सही हो। उदाहरण के लिए, कुछ कोडिंग टेस्ट पर, सटीकता थोड़ी कम हो गई (1.5 प्रतिशत अंक से भी कम), लेकिन कई अन्य कार्यों पर, सटीकता या तो बिल्कुल समान रही या थोड़ा बेहतर हुई।
यह क्यों महत्वपूर्ण है
इस पेपर की खूबसूरती यह है कि इसके लिए कोई नया, तेज़ AI बनाने या नया सहायक प्रशिक्षित करने की आवश्यकता नहीं है। यह केवल आपके पास मौजूद सिस्टम के खेल के नियम बदलने जैसा है। यह वैसा ही है जैसे यह महसूस करना कि एक सख्त ट्रैफिक पुलिसकर्मी पूरे शहर को धीमा कर रहा है क्योंकि वह हर एक मामूली उल्लंघन के लिए कार को रोक देता है, जबकि एक अधिक लचीला दृष्टिकोण केवल छोटे, प्रबंधनीय जोखिमों के साथ यातायात को सुचारू रूप से चालू रख सकता है।
लेखक सुझाव देते हैं कि यह विधि वर्तमान AI सिस्टम से अधिक गति निकालने का एक शानदार तरीका है। वे इस बात पर जोर देते हैं कि हालांकि गति में वृद्धि वास्तविक और मापने योग्य है (कुछ मामलों में 15.26% तक), उपयोगकर्ताओं को यह जानने की आवश्यकता है कि वे पूर्णता की एक सूक्ष्म मात्रा के बदले बहुत सारी गति प्राप्त कर रहे हैं। यह एक गणना किया गया समझौता है: आपको अपनी कहानी बहुत तेज़ी से लिखी हुई मिलती है, और अधिकांश लोगों के लिए, शब्दों के चयन में मामूली अंतर मायने नहीं रखेगा। पेपर निष्कर्ष निकालता है कि यह "बजट वाला" दृष्टिकोण AI जनरेशन को तेज़ बनाने का एक व्यावहारिक, प्रशिक्षण-मुक्त तरीका है, बशर्ते आप परिणामों की जाँच करें कि क्या गुणवत्ता आपकी आवश्यकताओं के लिए पर्याप्त अच्छी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।