← नवीनतम पेपर
💬 NLP

FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion

यह शोध पत्र FlashBlock का प्रस्ताव करता है, जो एक नवीन तंत्र है जो वर्तमान ब्लॉक के बाहर के टोकन से स्थिर क्रॉस-स्टेप अटेंशन आउटपुट को कैश और पुन: उपयोग करके लॉन्ग-कॉन्टेक्स्ट ब्लॉक डिफ्यूजन को त्वरित करता है, जिससे जनरेशन की गुणवत्ता बनाए रखते हुए कम्प्यूटेशनल ओवरहेड और KV कैश एक्सेस को महत्वपूर्ण रूप से कम किया जा सकता है।

मूल लेखक: Zhuokun Chen, Jianfei Cai, Bohan Zhuang

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhuokun Chen, Jianfei Cai, Bohan Zhuang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फिल्म निर्देशित कर रहे हैं। हर दृश्य (या "ब्लॉक") को फिल्माया जाना है, लेकिन कहानी के प्रवाह को बनाए रखने के लिए, निर्देशक लगातार पिछले दृश्यों में जो कुछ भी हुआ है उसे देखता रहता है ताकि पात्रों की निरंतरता बनी रहे।

AI वीडियो और टेक्स्ट जनरेशन की दुनिया में, इस "पीछे मुड़कर देखने" की प्रक्रिया को अटेंशन (Attention) कहा जाता है। AI को कहानी के अगले हिस्से को बेहतर बनाने के लिए हर बार अपने पूरे इतिहास (जिसे "KV कैश" कहा जाता है) को फिर से पढ़ना पड़ता है। जैसे-जैसे कहानी लंबी होती जाती है, यह प्रक्रिया अविश्वसनीय रूप से धीमी और थकाऊ होती जाती है, जैसे एक निर्देशक जिसे वर्तमान दृश्य में संवाद की एक छोटी सी पंक्ति को बदलने के लिए भी पूरी 10 घंटे की फिल्म दोबारा देखनी पड़ती है।

यह शोध पत्र इस प्रक्रिया को बिना कहानी खराब किए तेज करने के लिए एक चतुर तकनीक, FlashBlock पेश करता है। यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. समस्या: "दोबारा पढ़ने" का जाल

वर्तमान "ब्लॉक डिफ्यूजन" (Block Diffusion) मॉडल्स में, AI सामग्री को टुकड़ों (ब्लॉक्स) में बनाता है। भले ही वह केवल वर्तमान टुकड़े को बदल रहा हो, फिर भी वह यह गणना करने के लिए फिर से गणना करता है कि वह टुकड़ा उससे पहले जो कुछ भी हुआ है, उससे कैसे संबंधित है।

  • उदाहरण: कल्पना कीजिए कि आप एक लंबी किताब लिख रहे हैं। हर बार जब आप एक नया पैराग्राफ लिखते हैं, तो आप यह सुनिश्चित करने के लिए कि आपका नया वाक्य फिट बैठता है या नहीं, पेज 1 से लेकर वर्तमान पेज तक पूरी किताब को दोबारा पढ़ते हैं। जैसे-जैसे किताब लंबी होती जाती है, आप अपना 99% समय पुराने पन्नों को फिर से पढ़ने में और केवल 1% समय वास्तव में नया लिखने में बिताते हैं।

2. खोज: "स्थिर पृष्ठभूमि" (Stable Background)

शोधकर्ताओं ने AI को काम करते हुए देखते समय एक दिलचस्प बात गौर की।

  • "अंदर" बनाम "बाहर": जब AI एक विशिष्ट ब्लॉक (वर्तमान दृश्य) पर काम करता है, तो उस ब्लॉक के अंदर के विवरण तेजी से बदलते हैं (अभिनेताओं की हरकतें, संवाद बदलना)। हालांकि, पुराने दृश्यों (बैकग्राउंड कॉन्टेक्स्ट) का प्रभाव आश्चर्यजनक रूप से स्थिर रहता है।
  • उदाहरण: एक न्यूज़ एंकर की कल्पना करें जो समाचार पढ़ रहा है। एंकर का चेहरा और आवाज (वर्तमान ब्लॉक) हर सेकंड थोड़ा बदल सकता है। लेकिन स्क्रीन के नीचे चलने वाली न्यूज़ टिकर (पुराना कॉन्टेक्स्ट) लंबे समय तक बिल्कुल एक जैसी रहती है।
  • अंतर्दृष्टि: AI हर सेकंड "न्यूज़ टिकर" (पुराने कॉन्टेक्स्ट) की पुनर्गणना करने में अपनी ऊर्जा बर्बाद कर रहा था, जबकि वह बदला ही नहीं था।

3. समाधान: FlashBlock (एक "मेमो" सिस्टम)

FlashBlock एक स्मार्ट सहायक की तरह काम करता है जो स्थिर हिस्सों का एक मेमो (नोट) रखता है।

  • यह कैसे काम करता है: पूरे इतिहास को फिर से पढ़ने के बजाय, AI कहता है, "ठीक है, पुराना हिस्सा ज्यादा नहीं बदला है। मैं बस यह समझने के लिए अपने पास मौजूद 'कैश्ड मेमो' का उपयोग करूँगा कि अतीत वर्तमान से कैसे संबंधित है, और मैं केवल उस नए हिस्से के लिए कठिन गणित करूँगा जिस पर मैं अभी काम कर रहा हूँ।"
  • रूपक: यह एक शेफ की तरह है जो स्टू (stew) बना रहा है। शोरबा (पुराना कॉन्टेक्सट) पक रहा है और स्थिर है। हर बार नया मसाला डालने पर पूरे बर्तन को शुरू से चखने के बजाय, शेफ शोरबे के स्वाद पर भरोसा करता है और केवल उसी नए मसाले को चखता है जिसे उसने अभी जोड़ा है।

4. परिणाम: तेज़ और स्मार्ट

स्थिर "पुराने हिस्से" की पुनर्गणना को छोड़कर, FlashBlock दो मुख्य चीजें हासिल करता है:

  • गति: यह AI को टेक्स्ट और वीडियो जेनरेट करने में 1.44 गुना तेज़ बनाता है। यह एक अध्याय लिखने में लगने वाले समय को आधा करने जैसा है क्योंकि आपने हर बार पूरी लाइब्रेरी को दोबारा पढ़ना बंद कर दिया है।
  • गुणवत्ता: क्योंकि "मेमो" बहुत सटीक है, इसलिए कहानी की गुणवत्ता में गिरावट नहीं आती है। AI अभी भी संदर्भ (context) को पूरी तरह से समझता है; यह बस इसे अधिक कुशलता से करता है।

5. बोनस: "स्पार्स अटेंशन" (Sparse Attention) के साथ टीमवर्क

पेपर में एक अन्य तकनीक का भी उल्लेख है जिसे "स्पार्स अटेंशन" कहा जाता है (जो केवल सबसे महत्वपूर्ण वाक्यों को पढ़ने जैसा है)।

  • उदाहरण: यदि "स्पार्स अटेंशन" एक ऐसे पाठक की तरह है जो केवल सुर्खियां पढ़ता है, तो वह कुछ विवरण छोड़ सकता है। FlashBlock एक सुरक्षा जाल (safety net) के रूप में कार्य करता है, जो छोड़े गए हिस्सों के "मेमो" से छूटे हुए विवरणों को भर देता है। यह AI को बिना कहानी खोए और भी तेज़ (कम शब्द पढ़कर) होने की अनुमति देता है।

सारांश

FlashBlock AI के लिए एक स्मार्ट कैशिंग सिस्टम है। यह समझता है कि लंबी कहानियाँ या वीडियो बनाते समय, कहानी के "पुराने" हिस्से एक पल से दूसरे पल में बहुत अधिक नहीं बदलते हैं। इन स्थिर हिस्सों को पुनर्गणना करने के बजाय उन्हें याद रखकर, यह AI को अपनी ऊर्जा नए, बदलते हिस्सों पर केंद्रित करने के लिए मुक्त करता है, जिससे लंबी अवधि का जनरेशन गुणवत्ता खोए बिना बहुत तेज़ हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →