← नवीनतम पेपर
💬 NLP

DBLAST: Dependent Block Drafting for Stochastic Speculative Decoding

यह शोधपत्र DBLAST को प्रस्तुत करता है, जो एक डिपेंडेंट ब्लॉक ड्राफ्टर (dependent block drafter) है जिसमें एक एक्सेप्टेंस-ओरिएंटेड (acceptance-oriented) प्रशिक्षण उद्देश्य है जो स्टोकेस्टिक स्पेकुलेटिव डिकोडिंग में इंडिपेंडेंट ब्लॉक सैंपलिंग की सीमाओं को दूर करता है, जिससे विशेष रूप से उच्च-एन्ट्रॉपी (high-entropy) वाले क्षेत्रों में स्वीकृत ड्राफ्ट की लंबाई में महत्वपूर्ण सुधार होता है।

मूल लेखक: Amirmohammad Karimi, Chao Gao, Negar Hassanpour

प्रकाशित 2026-08-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Amirmohammad Karimi, Chao Gao, Negar Hassanpour

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने दोस्त द्वारा सुनाई जा रही एक कहानी में अगले शब्द का अनुमान लगाने की कोशिश कर रहे हैं। यदि आप केवल बेतरतीब ढंग से अनुमान लगा रहे हैं, तो आप सही हो सकते हैं, लेकिन हर संभावना की जांच करने में बहुत समय लगता है। अब, कल्पना कीजिए कि आपके पास एक सुपर-फास्ट, छोटा सहायक है जो एक साथ पूरे वाक्य के अनुमान चिल्ला सकता है। आपका दोस्त (मुख्य मस्तिष्क) फिर जल्दी से जांच करता है कि क्या वे अनुमान समझ में आते हैं। यदि वे समझ में आते हैं, तो आप आगे बढ़ जाते हैं; यदि नहीं, तो आप फिर से प्रयास करते हैं। यही "स्पेक्युलेटिव डिकोडिंग" (speculative decoding) का जादू है, जो विशाल AI मस्तिष्क को तेजी से सोचने के लिए उपयोग किया जाने वाला एक तरीका है। आमतौर पर, सहायक एक-एक करके शब्द अनुमान लगाता है, या वह शब्दों के एक पूरे ब्लॉक का अनुमान इस धारणा के साथ लगाता है कि वे एक-दूसरे पर निर्भर नहीं हैं। लेकिन यहाँ एक पेंच है: जब कहानी रचनात्मक, अव्यवद्य या अप्रत्याशित हो जाती है (जैसे कविता या कोई रोमांचक साहसिक कार्य लिखना), तो वे "स्वतंत्र" अनुमान अक्सर विफल हो जाते हैं क्योंकि शब्द वास्तव में एक-दूसरे पर निर्भर होते हैं। सहायक एक ऐसा शब्द अनुमान लगाता है जो शुरुआत के अनुकूल होता है, लेकिन फिर अगला अनुमानित शब्द पहले वाले के अनुकूल नहीं होता, और पूरा ब्लॉक खारिज कर दिया जाता है। यह शोध पत्र इस बात की गहराई से जांच करता है कि ऐसा क्यों होता है और इसे कैसे ठीक किया जाए ताकि सहायक बिना धीमे हुए जंगली, रचनात्मक कहानियों को संभाल सके।

इस शोध पत्र के पीछे के शोधकर्ताओं ने, जो Huawei में काम कर रहे हैं, देखा कि वर्तमान में ये AI सहायक कैसे काम करते हैं इसमें एक विशिष्ट समस्या है। उन्होंने पाया कि जब मुख्य AI को रचनात्मक होने के लिए कहा जाता है—विविध अंत उत्पन्न करने के लिए "स्टोकेस्टिक" (stochastic) या रैंडम सैंपलिंग का उपयोग करते हुए—तो अनुमान लगाने का पुराना तरीका विफल हो जाता है। यह एक टीम की तरह है जो एक गुप्त कोड का अनुमान लगाने की कोशिश कर रही है जहाँ हर कोई स्वतंत्र रूप से एक नंबर चिल्ला रहा है। यदि कोड के लिए आवश्यक है कि नंबर एक विशिष्ट पैटर्न का पालन करें (जैसे "सभी सम संख्याएँ"), तो स्वतंत्र अनुमान लगभग हमेशा विफल हो जाएंगे क्योंकि वे एक-दूसरे से बात नहीं कर रहे हैं। शोध पत्र दिखाता है कि जैसे-जैसे लक्षित AI अधिक अप्रत्याशित (उच्च एंट्रॉपी) होता जाता है, स्वीकृत अनुमानों की संख्या काफी कम हो जाती है क्योंकि "स्वतंत्र" ब्लॉक ड्राफ्टर्स शब्दों के बीच के छिपे हुए संबंधों को पकड़ने में असमर्थ होते हैं।

इसे हल करने के लिए, टीम ने DBLast (डिपेंडेंट ब्लॉक ड्राफ्टिंग) नामक एक नई विधि पेश की। शब्दों के ब्लॉक का अनुमान इस तरह लगाने के बजाय कि वे असंबंधित हैं, DBLast एक चतुर "लेटेंट मिश्रण" (latent mixture) प्रणाली का उपयोग करता है। इसे ऐसे सोचें: इससे पहले कि सहायक शब्दों का ब्लॉक अनुमान लगाना शुरू करे, वह गुप्त रूप से एक छोटे मेनू (जैसे "रहस्य", "कॉमेडी", या "उदासी") से एक "थीम" या "मोड" चुनता है। एक बार थीम चुनने के बाद, ब्लॉक के सभी शब्द उस विशिष्ट थीम के अनुरूप बनाए जाते हैं। यह एक सुसंगत कहानी बनाता है, भले ही शब्द अभी भी एक ही तेज़ प्रक्रिया में उत्पन्न किए जा रहे हों। यह एक समूह के लोगों के बीच का अंतर है जो यादृच्छिक शब्द चिल्ला रहे हैं बनाम एक समूह के बीच का अंतर जो पहले एक शैली (genre) पर सहमत होते हैं और फिर मिलकर एक दृश्य में सुधार करते हैं।

शोधकर्ताओं ने इस तरीके से अपने सहायक को प्रशिक्षित करने के तरीके को भी बदला। इसे केवल "सही" होने (अगले शब्द की संभावना से मेल खाना) के लिए सिखाने के बजाय, उन्होंने इसे "स्वीकार्य" होने के लिए सिखाया। उन्होंने एक नया प्रशिक्षण लक्ष्य बनाया जो सहायक को उन ब्लॉक्स के लिए पुरस्कृत करता है जिन्हें मुख्य AI द्वारा रखे जाने की संभावना अधिक होती है। यह एक बास्केटबॉल खिलाड़ी को प्रशिक्षित करने जैसा है कि वह न केवल गेंद फेंकना सीखे, बल्कि इस तरह से फेंके कि रेफरी उसके बास्केट को मान्य कर सके। इस "थीम-आधारित" अनुमान को "स्वीकृति-केंद्रित" प्रशिक्षण के साथ जोड़कर, नया DBLast तरीका लगातार पुराने स्वतंत्र तरीकों से बेहतर प्रदर्शन करता है।

अपने प्रयोगों में, शोधकर्ताओं ने गणित, कोडिंग और रचनात्मक लेखन सहित विभिन्न कार्यों के लिए Qwen3-4B और Qwen3-8B मॉडल पर इसका परीक्षण किया। उन्होंने पाया कि DBLast ने स्वीकृत टोकन की संख्या में लगातार सुधार किया, विशेष रूप से तब जब AI को रचनात्मक होने के लिए कहा जा रहा था। सबसे अप्रत्याशित, उच्च-एंट्रॉपी सेटिंग्स में, नई विधि ने बड़े मॉडल के लिए औसत 12.1% की वृद्धि के साथ स्वीकृत लंबाई में सुधार किया। शोध पत्र सुझाव देता है कि यह दृष्टिकोण एक प्रमुख गायब कड़ी है जो AI को रचनात्मक होने की आवश्यकता होने पर तेज़ और अधिक कुशल बनाने के लिए है, यह सिद्ध करता है कि बोलने से पहले "टीम" का एक थीम पर सहमत होना, सभी के स्वतंत्र विचार चिल्लाने से कहीं बेहतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →