← नवीनतम पेपर
💻 computer science

Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding

यह शोध पत्र डोमिनो (Domino) का प्रस्ताव करता है, जो एक स्पेक्युलेटिव डिकोडिंग फ्रेमवर्क है जो एक समानांतर बैकबोन को एक हल्के रिफाइनमेंट हेड और एक बेस-एंकरित प्रशिक्षण पाठ्यक्रम के साथ जोड़कर कॉज़ल डिपेंडेंसी मॉडलिंग को ऑटोरेग्रेसिव ड्राफ्टिंग से अलग करता है, जिससे Qwen3 मॉडलों पर 5.8x तक थ्रूपुट स्पीडअप प्राप्त होता है।

मूल लेखक: Jianuo Huang, Yaojie Zhang, Qituan Zhang, Hao Lin, Hanlin Xu, Linfeng Zhang

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jianuo Huang, Yaojie Zhang, Qituan Zhang, Hao Lin, Hanlin Xu, Linfeng Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कहानी में अगले शब्द का अनुमान लगाने की कोशिश कर रहे हैं, लेकिन आप इसे एक बहुत ही सख्त, धीमी नियम के साथ कर रहे हैं: आपको एक शब्द सोचना होगा, उसे लिखना होगा, यह जांचना होगा कि क्या वह सही है, और फिर अगले शब्द के बारे में सोचना होगा। यह वर्तमान बड़े AI मॉडल (LLMs) आमतौर पर कैसे काम करते हैं। यह सटीक है, लेकिन यह एक भीड़भाड़ वाले कमरे में एक समय में एक कदम चलने जैसा है, भले ही आपके पास दौड़ने के लिए एक सुपर-फास्ट टीम तैयार हो।

यह शोध पत्र एक नया तरीका पेश करता है जिसे Domino कहा जाता है ताकि इस प्रक्रिया को बहुत तेज़ बनाया जा सके। यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:

समस्या: "गति बनाम सटीकता" का जाल (The "Speed vs. Accuracy" Trap)

चीजों को तेज़ करने के लिए, शोधकर्ता एक ट्रिक का उपयोग करते हैं जिसे Speculative Decoding कहा जाता है। इसे एक "ड्राफ्टिंग टीम" (एक छोटा, तेज़ AI) के रूप में सोचें जो "मुख्य बॉस" (बड़े, धीमे AI) द्वारा जांचे जाने के लिए अगले कुछ शब्दों का अनुमान लगाती है।

  • पुराना तरीका (Autoregressive): ड्राफ्टिंग टीम एक शब्द का अनुमान लगाती है, फिर अगला, फिर अगला, एक-एक करके। यह बहुत सटीक है क्योंकि वे अगले शब्द का अनुमान लगाने से पहले पिछले शब्द को देख सकते हैं। लेकिन यह अभी भी धीमा है क्योंकि उन्हें प्रत्येक चरण के लिए प्रतीक्षा करनी पड़ती है।
  • "समानांतर" तरीका (The "Parallel" Way): ड्राफ्टिंग टीम एक साथ अगले सभी शब्दों का अनुमान लगाती है, जैसे मेज पर ताश के पत्तों का एक मुट्ठी भर हिस्सा फेंक देना। यह सुपर फास्ट है, लेकिन अनुमान अक्सर अस्त-व्यस्त या गलत होते हैं क्योंकि उन्होंने एक-दूसरे को नहीं देखा होता है।

शोध पत्र कहता है: क्यों न हमारे पास "ताश के पत्तों के एक मुट्ठी भर" जैसी गति हो लेकिन "एक-एक करके" वाले तरीके जैसी सटीकता हो?

समाधान: डोमिनो फ्रेमवर्क (The Domino Framework)

लेखकों ने दोनों दुनियाओं का सर्वश्रेष्ठ प्राप्त करने के लिए काम को दो भागों में विभाजित किया है।

1. पैरेलल बैकबोन (The "Rough Draft")

सबसे पहले, डोमिनो एक तेज़, समानांतर इंजन का उपयोग करता है जो अगले कुछ शब्दों का एक "रफ ड्राफ्ट" एक साथ बाहर निकालता है।

  • उपमा: कल्पना करें कि एक शेफ तेजी से कई सामग्रियों को काटने से पहले बिना काटे एक कटिंग बोर्ड पर फेंक देता है। यह तेज़ है, लेकिन सामग्रियां सही क्रम या आकार में नहीं हैं।

2. डोमिनो हेड (The "Lightweight Refiner")

यही जादुई हिस्सा है। पूरी खाना पकाने की प्रक्रिया को फिर से करने के बजाय (जो कि धीमा है), डोमिनो एक छोटा, विशेष उपकरण जोड़ता है जिसे Domino Head कहा जाता है।

  • उपमा: कल्पना करें कि एक सहायक शेफ (sous-chef) सामग्रियों के ढेर को जल्दी से देखता है। वे पूरा भोजन फिर से नहीं पकाते; वे बस पहले से आए संदर्भ के आधार पर सामग्रियों के क्रम और आकार में छोटे, सटीक समायोजन करते हैं।
  • यह कैसे काम करता है: डोमिनो हेड "कॉज़ल" (causal) है, जिसका अर्थ है कि यह समझता है कि शब्द B, शब्द A पर निर्भर करता है। यह रफ ड्राफ्ट लेता है और उसमें थोड़ा "सुधार" जोड़ता है ताकि शब्द तार्किक रूप से प्रवाहित हों, बिना धीमी, चरण-दर-चरण प्रक्रिया की प्रतीक्षा किए।

प्रशिक्षण तकनीक: "टीचर फोर्सिंग" (The Training Trick: "Teacher Forcing")

इस प्रणाली को सिखाने के लिए, लेखकों ने एक चतुर प्रशिक्षण पद्धति का उपयोग किया।

  • समस्या: यदि आप AI को अपनी गलतियों का अनुमान लगाकर अभ्यास करने देते हैं, तो यह भ्रमित हो जाता है और बुरी आदतें सीख लेता है।
  • समाधान: उन्होंने "टीचर फोर्सिंग" का उपयोग किया। कल्पना करें कि एक शिक्षक छात्र को सुधार करने का अभ्यास करते समय देखने के लिए सही कार्ड थमा रहा है। यह सुनिश्चित करता है कि AI अपने स्वयं के त्रुटियों के आधार पर नहीं, बल्कि सही संदर्भ के आधार पर ड्राफ्ट को ठीक करना सीखता है।
  • पाठ्यक्रम (The Curriculum): उन्होंने AI को चरणों में भी सिखाया। पहले, उन्होंने यह सुनिश्चित किया कि "रफ ड्राफ्ट" (पैरेलल बैकबोन) मजबूत हो। फिर, उन्होंने धीरे-धीरे "रिफाइनर" (डोमिनो हेड) को फाइन-ट्यूनिंग का कार्यभार संभालने दिया। इसने AI को बहुत अधिक रिफाइनर पर निर्भर होने और मूल रूप से एक अच्छा रफ ड्राफ्ट बनाने के तरीके को भूल जाने से रोका।

परिणाम: गुणवत्ता खोए बिना तेज़ (The Results: Faster Without Losing Quality)

शोध पत्रों ने शक्तिशाली AI मॉडल (Qwen3) पर इसका परीक्षण किया और पाया:

  • गति: यह पिछले तरीकों की तुलना में काफी तेज़ है। कुछ कार्यों पर, यह मानक तरीके की तुलना में लगभग 8 गुना तेज़ था।
  • दक्षता: यह उच्च "स्वीकृति दर" (acceptance rate) बनाए रखता है (जिसका अर्थ है कि मुख्य बॉस अधिकांश समय ड्राफ्टिंग टीम के अनुमानों से सहमत होता है) जबकि ड्राफ्टिंग लागत को कम रखता है।
  • तुलना: यह अपनी शक्तियों को जोड़कर अन्य तेज़ तरीकों (जैसे DFlash) और अन्य सटीक तरीकों (जैसे EAGLE) को मात देता है।

सारांश

Domino एक ऐसी तेज़ टीम को काम पर रखने जैसा है जो कहानी के अगले कुछ शब्दों का एक साथ अनुमान लगाती है, लेकिन फिर एक छोटा, स्मार्ट संपादक जोड़ती है जो अंतिम बॉस द्वारा जांच किए जाने से पहले तर्क और प्रवाह को जल्दी से ठीक करता है। यह AI को एक सावधानीपूर्वक चलने की सटीकता बनाए रखते हुए एक स्प्रिंट की गति से चलने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →