← नवीनतम पेपर
💬 NLP

DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding

DFlare एक हल्के स्तर के लेयर-वाइज़ फ्यूजन मैकेनिज्म के माध्यम से पूर्व ब्लॉक डिफ्यूजन विधियों की अभिव्यक्ति सीमाओं को दूर करके LLM इन्फरेंस को त्वरित करता है जो गहरे और अधिक सक्षम ड्राफ्ट मॉडल को सक्षम बनाता है, जिससे विविध बेंचमार्क में महत्वपूर्ण गति प्राप्त होती है।

मूल लेखक: Jiebin Zhang, Zhenghan Yu, Song Liu, Eugene J. Yu, Zheng Li, Dawei Zhu, Jiangshan Duo, Weimin Xiong, Yifan Song, Guanghua Yu, Jianchen Zhu, Sujian Li

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiebin Zhang, Zhenghan Yu, Song Liu, Eugene J. Yu, Zheng Li, Dawei Zhu, Jiangshan Duo, Weimin Xiong, Yifan Song, Guanghua Yu, Jianchen Zhu, Sujian Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लंबी कहानी लिखने की कोशिश कर रहे हैं, लेकिन आप एक बहुत ही धीमे, पूर्णतावादी (perfectionist) लेखक (Target Model) हैं। हर बार जब आप अगला शब्द लिखना चाहते हैं, तो आपको बहुत गहराई से सोचना पड़ता है, व्याकरण की जाँच करनी पड़ती है, और यह सुनिश्चित करना पड़ता है कि वह पूरी तरह से सटीक हो। इसमें बहुत समय लगता है।

इस प्रक्रिया को तेज़ करने के लिए, आप एक तेज़, ऊर्जावान सहायक (Draft Model) को काम पर रखते हैं। सहायक आपके लिए अगले कुछ शब्दों का अनुमान लगाने की कोशिश करता है। यदि सहायक सही है, तो आप बस कहते हैं "हाँ, जारी रखो!" और तेज़ी से आगे बढ़ते हैं। यदि सहायक गलत है, तो आपको रुकना पड़ता है, उसे सुधारना पड़ता है, और फिर से शुरू करना पड़ता है। इसे Speculative Decoding कहा जाता है।

समस्या: "एक ही आकार सबके लिए" वाला सहायक

हाल ही में, DFlash नामक एक नई विधि ने सहायक को और भी बेहतर बनाने की कोशिश की। एक-एक शब्द का अनुमान लगाने के बजाय, DFlash का सहायक एक बार में शब्दों का पूरा ब्लॉक (जैसे कि एक ही बार में अगली पूरी पंक्ति का अनुमान लगाना) अनुमान लगाने की कोशिश करता है।

हालाँकि, DFlash में एक बड़ी खामी थी। इसने सहायक को मुख्य लेखक के मस्तिष्क से प्राप्त एक एकल, सामान्य "चीट शीट" (cheat sheet) दी।

  • खामी: कल्पना कीजिए कि सहायक के पास सोचने के 7 स्तर (जैसे एक इमारत में 7 मंजिलें) हैं। DFlash ने पहली मंजिल, चौथी मंजिल और सातवीं मंजिल को बिल्कुल एक जैसी चीट शीट दी।
  • परिणाम: सहायक भ्रमित हो गया। निचली मंजिलों को सरल व्याकरण नियमों की आवश्यकता थी, जबकि ऊपरी मंजिलों को जटिल कहानी के विचारों की। क्योंकि उन सभी को एक ही सामान्य जानकारी मिली, इसलिए सहायक अधिक मंजिलें जोड़कर स्मार्ट नहीं हो सका। वह एक "सीलिंग" (सीमा) पर पहुँच गया जहाँ अधिक परतें जोड़ने से कोई लाभ नहीं हुआ।

समाधान: DFLARE

लेखकों ने DFLARE बनाया है। DFLARE को सहायक के प्रशिक्षण सिस्टम को अपग्रेड करने के रूप में समझें ताकि हर मंजिल को एक अनुकूलित (customized) चीट शीट मिल सके।

DFLARE कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. अनुकूलित चीट शीट्स (Layer-wise Fusion)

DFLARE में, हर मंजिल को एक ही सामान्य चीट शीट देने के बजाय, सिस्टम प्रत्येक मंजिल के लिए जानकारी का एक अनूठा मिश्रण बनाता है।

  • उदाहरण: कल्पना कीजिए कि मुख्य लेखक (Target Model) के पास किताबों का एक पुस्तकालय है।
    • DFlash ने पुस्तकालय से एक पन्ना लिया, उसकी 7 प्रतियां बनाईं, और हर मंजिल को एक प्रति दे दी।
    • DFLARE पुस्तकालय को देखता है और कहता है: "मंजिल 1 को व्याकरण के बारे में एक पन्ने की आवश्यकता है, मंजिल 4 को कहानी के मोड़ (plot twists) के बारे में, और मंजिल 7 को पात्रों की भावनाओं के बारे में।" यह प्रत्येक विशिष्ट मंजिल के लिए एक अनूठा, सटीक मार्गदर्शक बनाने के लिए अलग-अलग पन्नों को मिलाता है।
  • लाभ: क्योंकि हर मंजिल के पास एक विशेष मार्गदर्शक है, इसलिए सहायक वास्तव में अधिक मंजिलें जोड़कर स्मार्ट हो सकता है। वह "सीलिंग" टूट जाती है।

2. अलग नोटबुक (Heterogeneous KV Projections)

सहायक को दो प्रकार के नोट्स संग्रहीत करने की आवश्यकता होती है: उसके अपने अनुमान और मुख्य लेखक की जानकारी।

  • उदाहरण: पुराने सिस्टम में, सहायक अपने अनुमान और मुख्य लेखक के नोट्स को एक ही नोटबुक में लिखने की कोशिश करता था। स्याही आपस में मिल जाती थी, और इसे पढ़ना कठिन हो जाता था।
  • DFLARE का समाधान: यह सहायक को दो अलग-अलग नोटबुक देता है। एक उसके अपने जंगली अनुमानों के लिए है, और दूसरा विशेष रूप से मुख्य लेखक के नोट्स के लिए है। यह जानकारी को साफ और उपयोग में आसान रखता है।

3. चरणों में सीखना (Progressive Loss)

जब सहायक सीखता है, तो उसे तुरंत कहानी के सबसे कठिन हिस्सों में महारत हासिल करने की कोशिश नहीं करनी चाहिए।

  • उदाहरण: कल्पना कीजिए कि एक शिक्षक छात्र का मूल्यांकन कर रहा है।
    • पुराना तरीका: शिक्षक पहले दिन से ही पहले आसान वाक्य और अंतिम कठिन वाक्य दोनों को समान महत्व के साथ ग्रेड देता था। छात्र अभिभूत (overwhelmed) हो जाता था।
    • DFLARE का तरीका: शिक्षक आत्मविश्वास बनाने के लिए केवल पहले कुछ आसान वाक्यों पर ध्यान केंद्रित करके शुरू करता है। जैसे-जैसे छात्र बेहतर होता है, शिक्षक धीरे-धीरे ब्लॉक के अंत में कठिन वाक्यों को ग्रेड देना शुरू करता है। यह "वार्म-अप" दृष्टिकोण सहायक को तेज़ी से और अधिक प्रभावी ढंग से सीखने में मदद करता है।

परिणाम: कितनी तेज़?

पेपर में इस नए सिस्टम का परीक्षण तीन अलग-अलग "मुख्य लेखकों" (AI मॉडल्स) पर किया गया और पाया गया कि DFLARE पिछली सर्वश्रेष्ठ विधि (DFlash) की तुलना में काफी तेज़ है।

  • मध्यम आकार के लेखक (Qwen3-4B) पर: यह 5.52 गुना तेज़ है।
  • बड़े लेखक (Qwen3-8B) पर: यह 5.46 गुना तेज़ है।
  • बहुत बड़े लेखक (GPT-OSS-20B) पर: यह 3.91 गुना तेज़ है।

सरल शब्दों में, यदि पुराने तरीके को एक पैराग्राफ लिखने में 10 सेकंड लगते, तो DFLARE उसी उच्च-गुणवत्ता वाली कहानी को लिखते हुए, इसे लगभग 2 सेकंड में कर सकता है।

सारांश

DFLARE एक तेज़ सहायक को अपग्रेड करने जैसा है, जिसमें उसे एक सामान्य गाइड के बजाय हर हिस्से के लिए एक विशेष, कस्टम-मेड गाइड दी जाती है। यह सहायक को बड़ा और स्मार्ट बनने की अनुमति देता है, जिससे AI द्वारा टेक्स्ट, कोड या गणित की समस्याओं को हल करने की गति में भारी उछाल आता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →