← नवीनतम पेपर
💻 computer science

SPADE: An Input-Adaptive Sparse Attention Engine for Fast Video Diffusion Models Inference

SPADE एक ट्रेनिंग-मुक्त, इनपुट-अनुकूल स्पार्स अटेंशन इंजन है जो डायनेमिक टोकन चयन और कुशल कर्नेल निष्पादन के माध्यम से जनरेशन गुणवत्ता को बनाए रखते हुए वीडियो डिफ्यूजन ट्रांसफॉर्मर इन्फरेंस को 1.49x–1.80x तक एंड-टू-एंड गति प्रदान करता है।

मूल लेखक: Shanghao Liu (Eric), Renze Chen (Eric), Size Zheng (Eric), Yuanqiang Liu (Eric), Yun (Eric), Liang, Hailong Yang

प्रकाशित 2026-08-05
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shanghao Liu (Eric), Renze Chen (Eric), Size Zheng (Eric), Yuanqiang Liu (Eric), Yun (Eric), Liang, Hailong Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक हलचल भरे शहर का एक विशाल, चलता-फिरता भित्ति चित्र (mural) बनाने की कोशिश कर रहे हैं। इसे वास्तविक दिखाने के लिए, आपको यह तय करना होगा कि हर एक पिक्सेल दूसरे पिक्सेल से कैसे संबंधित है। यदि आपके पास दस लाख पिक्सेल हैं, तो हर एक पिक्सेल की दूसरे के साथ तुलना करना काम का एक चक्करदार बोझ बन जाता है—इतना अधिक कि आपका कंप्यूटर पहला फ्रेम भी पूरा करने से पहले ही क्रैश हो सकता है। यही चुनौती आधुनिक "वीडियो जनरेशन" AI के सामने है। ये स्मार्ट सिस्टम, जो एक साधारण टेक्स्ट प्रॉम्प्ट से फिल्में रच सकते हैं, "अटेंशन" (attention) नामक एक गणितीय उपकरण का उपयोग करते हैं ताकि यह पता लगाया जा सके कि छवि के कौन से हिस्से सबसे महत्वपूर्ण हैं। समस्या यह है कि जैसे-जैसे वीडियो लंबा और अधिक स्पष्ट (sharp) होता जाता है, इन कनेक्शनों की जांच करने के लिए आवश्यक कार्य विस्फोटक रूप से बढ़ता है, जैसे कि एक पहाड़ी से लुढ़कता हुआ बर्फ का गोला जो हर सेकंड बड़ा होता जाता है।

इसे ठीक करने के लिए, वैज्ञानिकों ने स्मार्ट तरीकों से कुशल होने की कोशिश की है। कुछ लोग बस दूर के पिक्सेल को अनदेखा कर देते हैं (जैसे केवल अपने आस-पास के पड़ोस को देखना), जबकि अन्य चलते-फिरते "महत्वपूर्ण" पिक्सेल चुनने की कोशिश करते हैं। लेकिन इन तरीकों के साथ एक पेंच है: या तो वे महत्वपूर्ण विवरणों को छोड़ देते हैं, जिससे वीडियो अजीब दिखने लगता है, या वे यह तय करने में इतना समय खर्च कर देते हैं कि क्या छोड़ना है, कि वे वास्तव में समय बचा ही नहीं पाते। बड़ा सवाल यह है: क्या हम एक ऐसा सिस्टम बना सकते हैं जो तेज़ हो, इतना स्मार्ट हो कि बिना समय बर्बाद किए ठीक से जान सके कि किसे छोड़ना है, और फिर भी एक सुंदर, उच्च-गुणवत्ता वाली फिल्म बना सके?

यहाँ आता है SPADE, एक नया "इंजन" जिसे इस पहेली को सुलझाने के लिए डिज़ाइन किया गया है। SPADE को एक अत्यंत कुशल फिल्म निर्देशक के रूप में समझें जो केवल अंदाज़ा नहीं लगाता कि कौन से दृश्य काटने हैं; उनके पास एक जादुई स्क्रिप्ट है जो तुरंत उन्हें बताती है कि हर एक फ्रेम में किन अभिनेताओं को आपस में बात करने की आवश्यकता है, और वह भी बिना रिहर्सल का एक भी सेकंड बर्बाद किए।

समस्या: "बहुत अधिक विकल्प" का जाल

वर्तमान वीडियो AI मॉडल उन छात्रों की तरह हैं जो पुस्तकालय की हर किताब के हर एक पन्ने को बार-बार पढ़ कर अपनी अंतिम परीक्षा की तैयारी करने की कोशिश कर रहे हैं। वे बहुत विस्तृत होते हैं, लेकिन अविश्वसनीय रूप से धीमे होते हैं। उनके द्वारा उपयोग किया जाने वाला "अटेंशन" तंत्र हर टोकन (वीडियो का एक छोटा सा हिस्सा) की हर दूसरे टोकन के साथ तुलना करता है। एक छोटे वीडियो के लिए, यह ठीक है। लेकिन एक हाई-डेफिनिशन फिल्म के लिए, गणित इतना भारी हो जाता है कि कंप्यूटर दम तोड़ देता है।

शोधकर्ताओं ने "स्पार्स अटेंशन" (sparse attention) का उपयोग करके इसे तेज़ करने की कोशिश की है, जिसका अर्थ है केवल कुछ महत्वपूर्ण कनेक्शनों की जांच करना। हालाँकि, मौजूदा तरीकों में दो मुख्य खामियां हैं:

  1. स्थिर (Static) तरीके एक कठोर नियम पुस्तिका की तरह हैं: "हमेशा बैकग्राउंड को अनदेखा करें।" यह तेज़ है, लेकिन यह मूर्खतापूर्ण है। कभी-कभी बैकग्राउंड वास्तव में महत्वपूर्ण होता है, और AI उसे मिस कर देता है।
  2. गतिशील (Dynamic) तरीके वीडियो को पहले देखकर यह तय करने की कोशिश करते हैं कि क्या छोड़ना है। लेकिन वे उस छात्र की तरह हैं जो यह तय करने में 10 मिनट बिता देता है कि कौन से पन्ने पढ़ने हैं, और फिर उसे एहसास होता है कि उसने पढ़ने से ज्यादा सोचने में समय बिता दिया। "क्या छोड़ना है" इस बारे में सोचने में बिताया गया समय, स्किप करने से बचे हुए समय को खा जाता है।

समाधान: SPADE का तीन-चरणीय जादू

इस पेपर के लेखकों, शांगहाओ लियू और उनकी टीम ने इस समस्या को हल करने के लिए SPADE (SPArse video DiT Engine) बनाया। उन्होंने केवल गणित में बदलाव नहीं किया; उन्होंने पूरी प्रक्रिया को तीन चतुर भागों में पुनर्गठित किया जो एक सुव्यवस्थित मशीन की तरह मिलकर काम करते हैं।

1. ब्लूप्रिंट (vDiT-SSR): "स्किपिंग" के लिए एक सार्वभौमिक भाषा
सबसे पहले, उन्होंने वीडियो के हिस्सों को छोड़ने का वर्णन करने का एक एकीकृत तरीका बनाया। कल्पना कीजिए कि आपके पास वीडियो ब्लॉक्स का एक विशाल 3D ग्रिड है (समय, ऊंचाई और चौड़ाई से बना एक रूबिक क्यूब की तरह)। पिछले तरीके इस क्यूब को केवल एक विशिष्ट तरीके से काट सकते थे। हालाँकि, SPADE के पास इस क्यूब को काटने के कई अलग-अलग तरीकों का एक "मेन्यू" है—कुछ स्लाइस चौड़े और चपटे हैं, कुछ लंबे और पतले हैं, और कुछ मिश्रित हैं। यह सिस्टम को यह चुनने की अनुमति देता है कि वह जो वीडियो बना रहा है, उसके लिए सर्वश्रेष्ठ आकार क्या है, न कि किसी गलत आकार को जबरदस्ती फिट करने की।

2. तत्काल निर्णय लेने वाला (Scheme Generation)
यह इस ऑपरेशन का मस्तिष्क है। स्लाइस को रखने का अनुमान लगाने में समय बिताने के बजाय, SPADE SICS (Sum of Intra-block Cosine Similarities) नामक एक ट्रिक का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि एक कमरा लोगों की बातचीत से भरा है। आपको सबसे महत्वपूर्ण बातचीत चुननी है। एक धीमी विधि हर एक शब्द को सुनने की कोशिश करेगी। SPADE की विधि एक त्वरित नज़र की तरह है: यह लोगों को छोटे समूहों में बांटती है और जाँचती है कि वे एक-दूसरे के साथ कितनी सहमति में सिर हिला रहे हैं। यदि एक समूह पूरी तरह से सहमति में सिर हिला रहा है, तो वह समूह "महत्वपूर्ण" है और उसे अगले दौर के लिए टिकट मिलता है। यदि कोई समूह भ्रमित है और एक-दूसरे के ऊपर चिल्ला रहा है, तो उन्हें अनदेखा कर दिया जाता है।
  • जादू: यह जाँच अविश्वसनीय रूप से तेज़ होती है—इतनी तेज़ कि यह अटेंशन पर लगने वाले कुल समय का केवल लगभग 8% ही लेती है। यह हर एक "हेड" (AI के मस्तिष्क का एक हिस्सा) और वीडियो के हर एक क्षण के लिए, ठीक से तय करता है कि वीडियो के किन ब्लॉक्स पर ध्यान केंद्रित करना है। यह एक ट्रैफिक पुलिसकर्मी की तरह है जो तुरंत जानता है कि कौन सी लेन खुली है और कौन सी बंद है, और AI का ध्यान केवल वहीं निर्देशित करता है जहाँ इसकी आवश्यकता है।

3. सुपर-वर्कर (Head-wise Sparse Attention)
एक बार निर्णय ले लिए जाने के बाद, वास्तविक कार्य शुरू होता है। SPADE एक विशेष "इंजन" का उपयोग करता है जो सीधे हार्डवेयर (कंप्यूटर चिप्स) के लिए बनाया गया है। यह समान कार्यों को एक साथ समूहित करता है और वीडियो को प्रोसेस करने के लिए कंप्यूटर के सबसे तेज़ मेमोरी लेन का उपयोग करता है। यह उन श्रमिकों की एक टीम होने जैसा है जो केवल बक्से नहीं उठाते; वे सही बक्से, सही क्रम में, एक ऐसे कन्वेयर बेल्ट का उपयोग करके उठाते हैं जो विशेष रूप से उनके लिए बनाया गया है। यह उन "ट्रैफिक जैम" से बचाता है जो आमतौर पर कंप्यूटर को धीमा कर देते हैं जब वे जटिल, अनियमित कार्यों को करने की कोशिश करते हैं।

परिणाम: तेज़, स्मार्ट और फिर भी सुंदर

टीम ने आज के सबसे उन्नत वीडियो AI मॉडलों में से कुछ पर, जिनमें Hunyuan-Video और Wan 2.1/2.2 शामिल हैं, SPADE का परीक्षण किया। उन्होंने इसकी तुलना अन्य "स्पार्स" तरीकों और मानक, धीमी "फुल अटेंशन" विधि से की।

परिणाम प्रभावशाली थे:

  • गति: SPADE ने मानक विधि की तुलना में "अटेंशन" प्रक्रिया को 2.26 से 3.40 गुना तेज़ बना दिया। जब आप शुरू से अंत तक पूरी वीडियो जनरेशन प्रक्रिया को देखते हैं, तो यह 1.49 से 1.80 गुना तेज़ थी।
  • दक्षता: इसने अनावश्यक गणनाओं (sparsity) के लगभग 85% हिस्से को सफलतापूर्वक छोड़ दिया, जो परीक्षण किए गए अन्य किसी भी तरीके से अधिक है।
  • गुणवत्ता: महत्वपूर्ण रूप से, इसने गुणवत्ता से समझौता नहीं किया। वीडियो उतने ही अच्छे दिखे जितने कि धीमी, फुल-अटेंशन संस्करण। वास्तव में, कुछ परीक्षणों में, SPADE ने अन्य तेज़ तरीकों की तुलना में थोड़े अधिक स्पष्ट और विस्तृत वीडियो बनाए।

टीम ने SPADE का एक "टर्बो" संस्करण भी पेश किया। यह संस्करण गति को और आगे बढ़ाता है, 1.80 गुना की एंड-टू-एंड स्पीडअप तक पहुँचता है, हालांकि यह वहां तक पहुँचने के लिए गुणवत्ता में एक बहुत ही मामूली और नियंत्रित समझौता करता है।

यह क्यों मायने रखता है

SPADE से पहले, उच्च-गुणवत्ता वाले AI वीडियो बनाना ईंटों से भरे भारी बैकपैक के साथ मैराथन दौड़ने जैसा था। आप इसे कर सकते थे, लेकिन इसमें बहुत समय लगता था। SPADE दौड़ने के नए जूतों की तरह है जो न केवल आपको हल्का बनाते हैं बल्कि आपको सबसे अच्छा रास्ता चुनने में भी मदद करते हैं ताकि आप बेकार के रास्तों पर ऊर्जा बर्बाद न करें।

लेखक दिखाते हैं कि आपको गति और गुणवत्ता के बीच चुनाव करने की आवश्यकता नहीं है। एक लचीले वीडियो विवरण, एक बिजली जैसी तेज़ निर्णय प्रणाली और एक हार्डवेयर-अनुकूलित इंजन को जोड़कर, SPADE साबित करता है कि हम जटिल, हाई-डेफिनिशन वीडियो बहुत तेज़ी से बना सकते हैं बिना AI के "आलसी" हुए या गलतियाँ किए। यह AI वीडियो जनरेशन को वास्तविक समय (real-time) में होने वाली चीज़ बनाने की दिशा में एक महत्वपूर्ण कदम है, न कि ऐसी चीज़ जिसे रेंडर करने में घंटों लगें।

संक्षेप में, SPADE वह "स्मार्ट स्किप" बटन है जिसका वीडियो AI को इंतजार था, जो एक धीमी, भारी प्रक्रिया को एक तेज़, सुचारू अनुभव में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →