DominoTree: Conditional Tree-Structured Drafting with Domino for Speculative Decoding
DominoTree एक प्रशिक्षण-मुक्त, बेस्ट-फर्स्ट ट्री-स्ट्रक्चर्ड स्पेक्युलेटिव डिकोडिंग पद्धति पेश करता है जो विभिन्न बेंचमार्क और तापमानों में DFlash, DDTree और मूल Domino डिकोडर जैसे मौजूदा तरीकों की तुलना में बेहतर स्वीकृति लंबाई और थ्रूपुट प्राप्त करने के लिए Domino के कंडीशनल, नॉन-फ़ैक्टरिज़्ड सुधारों का लाभ उठाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कहानी में अगले शब्द का अनुमान लगाने की कोशिश कर रहे हैं। इसे करने का "स्मार्ट" तरीका यह है कि एक शब्द के बारे में सोचें, जाँच करें कि क्या वह सही है, फिर अगले के बारे में सोचें, और इसी तरह आगे बढ़ें। आज के अधिकांश AI मॉडल इसी तरह बात करते हैं, लेकिन यह धीमा है क्योंकि उन्हें हर एक शब्द को एक-एक करके जाँचना पड़ता है।
स्पेक्युलेटिव डिकोडिंग (Speculative Decoding) इसे तेज़ करने की एक तरकीब है। एक-एक करके शब्द का अनुमान लगाने के बजाय, एक "ड्राफ्ट" मॉडल तेजी से बहुत सारे शब्दों (एक ब्लॉक) का एक साथ अनुमान लगाता है। फिर, "बड़ा बॉस" मॉडल उन सभी की एक बार में जाँच करता है। यदि बॉस उनसे सहमत है, तो बहुत अच्छा! आप अपनी धीमी सोच को छोड़ सकते हैं और आगे बढ़ सकते हैं। यदि बॉस असहमत है, तो आपको फिर से शुरू करना होगा।
यह पेपर एक नई विधि पेश करता है जिसे डोमिनो ट्री (DominoTree) कहा जाता है। यह कैसे काम करता है, यह अलग क्यों है, और लेखकों ने क्या पाया, यहाँ दिया गया है।
समस्या: "एक-पथ" का जाल (The "One-Path" Trap)
कल्पना कीजिए कि ड्राफ्ट मॉडल एक भूलभुलैया में समूह का मार्गदर्शन करने वाला एक टूर गाइड है।
- पुराना तरीका (DFlash): गाइड दरवाजों की एक पूरी दीवार की ओर इशारा करता है और कहता है, "कोई भी दरवाजा चुनें!" लेकिन गाइड को यह पता नहीं होता कि आपने कौन सा दरवाजा चुना है जब तक कि वह अगले दरवाजे की ओर इशारा न करे। यह एक पूरा वाक्य अनुमान लगाने जैसा है बिना यह जाने कि आपने अभी कौन से शब्द कहे थे। यह तेज़ है, लेकिन अनुमान बहुत स्मार्ट नहीं होते।
- "डोमिनो" विधि: गाइड के पास एक छोटा सहायक (एक GRU) होता है जो याद रखता है कि आपने वास्तव में कौन से दरवाजे खोले थे। अब, अगले दरवाजे की ओर इशारा करते समय, गाइड कहता है, "चूंकि आपने दरवाजा A खोला था, इसलिए आपको शायद दरवाजा B चुनना चाहिए।" यह अनुमानों को बहुत स्मार्ट बनाता है।
- पेंच (The Catch): मूल डोमिनो विधि अभी भी केवल एक ही पथ पर चलने में फंसी हुई थी। भले ही गाइड स्मार्ट था, वे केवल दरवाजों की एक ही रेखा दिखा रहे थे। यदि आपने गलत दरवाजा चुना, तो आपको फिर से शुरू करना पड़ता था।
समाधान: "डोमिनो ट्री" (The "DominoTree")
लेखकों ने पूछा: "क्या होगा यदि गाइड हमें एक साथ कई पथ दिखा सके, लेकिन फिर भी उस स्मार्ट सहायक का उपयोग करे जो यह याद रखे कि हम किस पथ पर हैं?"
उन्होंने डोमिनो ट्री बनाया, जो एक टूर गाइड की तरह है जो मानचित्र पर संभावित पथों का एक पूरा पेड़ (tree) बनाता है।
- स्मार्ट सहायक: पेड़ की प्रत्येक शाखा के लिए, गाइड अब तक लिए गए विशिष्ट पथ के आधार पर अनुमानों को समायोजित करने के लिए "स्मार्ट सहायक" का उपयोग करता है।
- फ़िल्टर: भूलभुलैया में हर एक दरवाजे की जाँच करना बहुत धीमा है। इसलिए, गाइड प्रत्येक चरण पर केवल शीर्ष 64 सबसे संभावित दरवाजों को देखता है (इसे "कैंडिडेट रिस्ट्रिक्शन" कहा जाता है)। यह गणित को तेज़ रखता है।
- स्पीड बूस्ट: इसे कंप्यूटर को धीमा किए बिना करने के लिए, उन्होंने एक विशेष "GPU-नेटिव" इंजन बनाया है। इसे एक पूर्व-नियोजित ट्रेन ट्रैक सिस्टम के रूप में समझें। कंप्यूटर हर कदम के लिए "अगला क्या है?" पूछने के लिए रुकने के बजाय (जो धीमा है), पूरा ट्रैक पहले से ही ग्राफिक्स कार्ड पर बिछा दिया जाता है। ट्रेन बस तेज़ी से दौड़ती है।
उन्होंने क्या पाया (आंकड़े)
लेखकों ने इस मॉडल का परीक्षण Qwen3-4B (और एक बड़े मॉडल Qwen3-8B) पर आठ अलग-अलग कार्यों, जैसे गणित, कोडिंग और चैट पर किया।
- गति (Speed): छोटे मॉडल पर, डोमिनो ट्री ने AI को सामान्य धीमी बातचीत की तुलना में 6.6 गुना तक तेज़ बना दिया।
- स्वीकृति (Acceptance): "स्मार्ट सहायक" इतना अच्छा था कि, औसतन, बड़ा बॉस मॉडल अपने सर्वश्रेष्ठ स्तर पर प्रति राउंड 10.7 टोकन (शब्द) स्वीकार करता है। इसका मतलब है कि AI बिना कोई गलती किए एक बार में 10 से अधिक शब्द निकाल सकता है।
- तुलना: डोमिनो ट्री ने मूल "डोमिनो" विधि (जो केवल एक पथ पर चलती थी) को गति में लगभग 9-10% से पछाड़ दिया। इसने अन्य ट्री-आधारित विधियों (जैसे DDTree) को भी हराया जिनमें पथ के अनुसार समायोजन के लिए "स्मार्ट सहायक" का उपयोग नहीं किया गया था।
उन्होंने क्या खारिज किया (The "No-Go" Zones)
यह पेपर बहुत स्पष्ट है कि क्या काम नहीं करता है या समाधान का हिस्सा नहीं है:
- कोई "जादुई" ट्रेनिंग नहीं: डोमिनो ट्री ट्रेनिंग-फ्री (training-free) है। उन्होंने मॉडल को कुछ नया नहीं सिखाया। उन्होंने बस मौजूदा "डोमिनो" वेट्स (weights) को लिया और उनके ऊपर एक बेहतर ट्री स्ट्रक्चर बनाया। यदि आप सोचते हैं कि इसके लिए एक विशाल नए प्रशिक्षण सत्र की आवश्यकता थी, तो आप गलत हैं; इसकी आवश्यकता नहीं थी।
- "एडेप्टिव बजट" काम नहीं आया: लेखकों ने CondAdaptive नामक एक फैंसी विचार का परीक्षण किया। विचार यह था कि AI यह तय करने दे कि पेड़ कितना बड़ा होना चाहिए (बड़ा पेड़ = अधिक अनुमान, लेकिन धीमा)। उन्होंने एक फॉर्मूला इस्तेमाल किया ताकि पेड़ को ठीक उसी समय रोका जा सके जब यह सबसे कुशल हो।
- परिणाम: यह विफल रहा। "स्मार्ट सहायक" अपने पथ को लेकर इतना आश्वस्त था कि फॉर्मूला लगातार सोचता रहा, "ओह, हमें और पेड़ों की आवश्यकता है!" जब तक कि वह हर बार अधिकतम सीमा तक नहीं पहुँच गया। इसलिए, उन्होंने एडेप्टिव विचार को खारिज कर दिया और एक निश्चित पेड़ के आकार (16 नोड्स) पर टिके रहे।
- कोडिंग के लिए "हल" नहीं है: जबकि डोमिनो ट्री गणित और चैट में जीता, यह कोडिंग कार्यों (जैसे LiveCodeBench) पर पुराने "DDTree" तरीके से हार गया। पेपर स्पष्ट रूप से कहता है कि कोडिंग के लिए, पुराना तरीका अभी भी बेहतर है।
वे कितने आश्वस्त हैं?
लेखक अपने आंकड़ों के बारे में बहुत आश्वस्त हैं क्योंकि उन्होंने वास्तविक हार्डवेयर (RTX 5080 और A6000 ग्राफिक्स कार्ड) पर सीधे मापा है।
- उन्होंने साबित किया कि उनका "GPU-नेटिव" बिल्डर एक धीमे पायथन संस्करण के बिट-आइडेंटिकल (bit-identical) है। इसका मतलब है कि स्पीडअप कोई ट्रिक नहीं है; यह वही तर्क है जो तेज़ चल रहा है।
- उन्होंने "पेयर्ड-बूटस्ट्रैप" (paired-bootstrap) नामक एक सांख्यिकीय पद्धति का उपयोग यह दिखाने के लिए किया कि उनकी जीत अन्य विधियों पर वास्तविक और सुसंगत है, न कि केवल भाग्यशाली संयोग। उदाहरण के लिए, वे 95% आश्वस्त हैं कि डोमिनो ट्री द्वारा परीक्षण किए गए सभी तापमानों में डोमिनो विधि की तुलना में तेज़ है।
निचोड़ (The Bottom Line)
डोमिनो ट्री AI को तेज़ बनाने का एक चतुर तरीका है, जो इसे एक साथ कई पथों का अनुमान लगाने की अनुमति देता है, जबकि यह सुनिश्चित करने के लिए एक "मेमोरी हेल्पर" का उपयोग करता है कि वे अनुमान स्मार्ट हों। यह एक ऐसे टूर गाइड की तरह है जो आपको विकल्पों का एक पूरा जंगल दिखा सकता है, लेकिन उसे पता है कि आप किस रास्ते पर चल रहे हैं ताकि वह आपको गलत दिशा न दे।
यह हर चीज़ के लिए जादुई समाधान नहीं है (कोडिंग अभी भी कठिन है), और इसके लिए AI को फिर से प्रशिक्षित करने की आवश्यकता नहीं है, लेकिन गणित और चैट के लिए, यह एक मापा गया, प्रमाणित स्पीड बूस्ट है जो एक धीमे, सावधान चलने वाले को स्प्रिंटर (धावक) में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।