← नवीनतम पेपर
💻 computer science

DFlash: Block Diffusion for Flash Speculative Decoding

DFlash एक स्पेक्युलेटिव डिकोडिंग फ्रेमवर्क है जो ड्राफ्ट टोकन को समानांतर में जेनरेट करने के लिए एक लाइटवेट ब्लॉक डिफ्यूजन मॉडल का लाभ उठाता है, जिससे 6 गुना से अधिक लॉसलेस त्वरण प्राप्त होता है और यह EAGLE-3 जैसे अत्याधुनिक तरीकों से 2.5 गुना तक बेहतर प्रदर्शन करता है।

मूल लेखक: Jian Chen, Yesheng Liang, Zhijian Liu

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jian Chen, Yesheng Liang, Zhijian Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत लंबी, जटिल कहानी लिखने की कोशिश कर रहे हैं जिसके पास एक बहुत ही बुद्धिमान लेकिन धीमी गति से सोचने वाला संपादक (Target Model) है। हर बार जब आप एक शब्द लिखते हैं, तो आपको रुकना पड़ता है, संपादक के पूरे कहानी को पढ़ने का इंतज़ार करना पड़ता है, और फिर आपको अगला शब्द देना होता है। यह प्रक्रिया अविश्वसनीय रूप से धीमी है क्योंकि संपादक एक समय में केवल एक ही शब्द सोच सकता है, भले ही वह बहुत समझदार हो।

DFlash एक नया सिस्टम है जिसे इसे तेज़ करने के लिए डिज़ाइन किया गया है बिना किसी गलती के। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. समस्या: "एक-समय-में-एक-शब्द" की बाधा

वर्तमान में, AI मॉडल टेक्स्ट को ऐसे जेनरेट करते हैं जैसे कोई व्यक्ति टाइपराइटर पर टाइप कर रहा हो: क्लिक, क्लिक, क्लिक। उन्हें अगले अक्षर को शुरू करने से पहले एक अक्षर को पूरा करना ही होगा। भले ही कंप्यूटर शक्तिशाली हो, वह तेज़ी से टाइप नहीं कर सकता क्योंकि खेल के नियम उसे पिछले अक्षर का इंतज़ार करने के लिए मजबूर करते हैं। इसे ऑटोरिग्रेसिव डिकोडिंग (autoregressive decoding) कहा जाता है।

2. पुराना समाधान: "तेज़ लेकिन उथला" सहायक

चीजों को तेज़ करने के लिए, शोधकर्ताओं ने पहले एक स्पेक्टुलेटिव डिकोडिंग (Speculative Decoding) विधि का उपयोग किया था। उन्होंने एक तेज़, सस्ता सहायक (एक Draft Model) काम पर रखा जो अगले कुछ शब्दों का अनुमान लगा सके। बुद्धिमान संपादक फिर जल्दी से जाँच करता है कि क्या उसके अनुमान सही हैं।

  • चुनौती: पुराने सहायक भी "टाइपराइटर" की तरह थे। वे केवल एक शब्द का अनुमान लगा सकते थे, फिर रुकते थे, फिर अगले शब्द का अनुमान लगाते थे। क्योंकि वे बहुत तेज़ लेकिन बहुत समझदार नहीं थे, वे अक्सर गलतियाँ करते थे, जिससे संपादक को उनके अनुमानों को खारिज करने और फिर से शुरू करने के लिए मजबूर होना पड़ता था। इसने इस पूरे सिस्टम को कितना तेज़ बनाया जा सकता था, इसकी सीमा तय कर दी।

3. DFlash समाधान: "अति-व्यवस्थित" सहायक

DFlash एक नए प्रकार के सहायक को पेश करता है जो डिफ्यूजन (Diffusion) पर आधारित है। एक डिफ्यूजन मॉडल को टाइपराइटर के रूप में नहीं, बल्कि एक पेंटर के रूप में सोचें जो एक साथ कैनवास के एक पूरे हिस्से को भर सकता है

एक शब्द लिखने के बजाय, DFlash सहायक अब तक की कहानी को देखता है और एक ही झटके में अगले 16 शब्दों के एक पूरे ब्लॉक को पेंट करता है।

4. गुप्त मंत्र: "संपादक के नोट्स"

इन "पेंटर" सहायकों के साथ सबसे बड़ी चुनौती यह है कि वे मुख्य संपादक जितने बुद्धिमान नहीं होते। यदि आप बस उनसे अनुमान लगाने के लिए कहते हैं, तो वे बेतरतीब ढंग से अनुमान लगा सकते हैं।

DFlash इसे मुख्य संपादक के मस्तिष्क से प्राप्त एक चीट शीट (cheat sheet) देकर हल करता है।

  • यह कैसे काम करता है: सहायक द्वारा अनुमान लगाना शुरू करने से पहले, मुख्य संपादक कहानी पर एक त्वरित नज़र डालता है और आगे क्या होने की संभावना है, इसके बारे में "छिपे हुए नोट्स" (context features) निकालता है।
  • इंजेक्शन: DFlash इन नोट्स को सीधे सहायक की मेमोरी (विशेष रूप से इसके "की-वैल्यू" (Key-Value) कैश) में इंजेक्ट करता है। यह ऐसा है जैसे संपादक फुसफुसा रहा हो, "मैं एक तूफान के बारे में सोच रहा हूँ, इसलिए अगले शब्द शायद 'अंधेरा', 'बादल' और 'हवा' होंगे।"
  • परिणाम: सहायक को शून्य से अनुमान लगाने की ज़रूरत नहीं है; उसे बस संपादक के मज़बूत संकेतों का पालन करना है। यह सहायक को एक बार में शब्दों के एक पूरे ब्लॉक के बारे में बहुत सटीक अनुमान लगाने में सक्षम बनाता है।

5. परिणाम: बिना समझौते के गति

क्योंकि सहायक अब तेज़ (एक साथ 16 शब्दों को पेंट करता है) और सटीक (संपादक के छिपे हुए नोट्स द्वारा निर्देशित) है, इसलिए मुख्य संपादक को शायद ही कभी कहना पड़ता है कि "नहीं, यह गलत है।"

  • पेपर का दावा: अपने परीक्षणों में, DFlash ने AI को मानक धीमी विधि की तुलना में 6 गुना तेज़ बना दिया।
  • तुलना: यह वर्तमान सर्वोत्तम विधि (EAGLE-3) से लगभग 2.5 गुना तेज़ था, जो अभी भी धीमी, एक-समय-में-एक-शब्द वाले अनुमान लगाने पर निर्भर करती है।

सारांश उपमा

  • पुराना तरीका: एक धीमा संपादक एक अक्षर टाइप करता है, इंतज़ार करता है, फिर अगला अक्षर टाइप करता है।
  • पिछली गति वृद्धि: एक तेज़ टाइपिस्ट एक-एक करके अगले 5 अक्षरों का अनुमान लगाता है। संपादक उनकी जाँच करता है। यदि टाइपिस्ट गलत है, तो वे फिर से शुरू करते हैं।
  • DFlash: एक तेज़ पेंटर संपादक के गुप्त नोट्स को देखता है और एक ही स्ट्रोक में अगले 16 अक्षरों को पूरी तरह से पेंट करता है। संपादक बस "हाँ" कहकर आगे बढ़ जाता है।

पेपर यह निष्कर्ष निकालता है कि विशेष रूप से अनुमान लगाने के चरण के लिए इस "ब्लॉक डिफ्यूजन" पद्धति का उपयोग करके, हमें दोनों दुनियाओं का सर्वश्रेष्ठ मिलता है: समानांतर पीढ़ी (parallel generation) की उच्च गति और बड़े भाषा मॉडल (large language model) की उच्च सटीकता, बिना अंतिम आउटपुट को बदले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →