← नवीनतम पेपर
💻 computer science

DFSAttn: Dynamic Fine-grained Sparse Attention for Efficient Video Generation

यह शोध पत्र DFSAttn प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो हिल्बर्ट कर्व-आधारित टोकन पुनर्व्यवस्था, पदानुक्रमित ब्लॉक स्कोरिंग और अनुकूली मास्क कैशिंग द्वारा सक्षम गतिशील, सूक्ष्म-स्तरीय विरलकरण (fine-grained sparsification) के माध्यम से मौजूदा ब्लॉक स्पार्स अटेंशन विधियों की सीमाओं को दूर करके कुशल, उच्च-गुणवत्ता वाले वीडियो निर्माण को प्राप्त करता है।

मूल लेखक: Jie Hu, Zixiang Gao, Yutong He, Kun Yuan

प्रकाशित 2026-05-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jie Hu, Zixiang Gao, Yutong He, Kun Yuan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, चलती-फिरती भित्ति चित्र (एक उच्च-गुणवत्ता वाला वीडियो) पेंट करने की कोशिश कर रहे हैं (एक कलाकार की टीम जिसे डिफ्यूजन ट्रांसफॉर्मर नामक कंप्यूटर मॉडल कहा जाता है)। इस पेंटिंग को एकदम सटीक बनाने के लिए, प्रत्येक कलाकार को अगला रंग चुनने के लिए दूसरे हर कलाकार के काम को देखना होगा। इसे "फुल अटेंशन" (full attention) कहा जाता है।

समस्या यह है कि जैसे-जैसे भित्ति चित्र बड़ा और विस्तृत होता जाता है, कलाकारों को आपस में बातचीत करने की आवश्यकता विस्फोट की तरह बढ़ती जाती है। यह एक स्टेडियम में एक साथ सभी लोगों से बातचीत करने जैसा है; इसमें बहुत समय लगता है और टीम थक जाती है। यही कारण है कि वर्तमान में उच्च-गुणवत्ता वाले वीडियो बनाना बहुत अधिक समय और कंप्यूटर शक्ति लेता है।

यह पेपर इस समस्या को हल करने के लिए एक नया तरीका पेश करता है जिसे DFSAttn कहा जाता है। इसे एक स्मार्ट मैनेजर के रूप में समझें जो कलाकारों को कहता है, "आपको हर किसी से बात करने की ज़रूरत नहीं है। बस उन लोगों से बात करें जो आपके विशिष्ट स्थान के लिए वास्तव में प्रासंगिक हैं।"

यहाँ बताया गया है कि DFSAttn कैसे काम करता है, जिसे तीन सरल तरीकों में विभाजित किया गया है:

1. "हिल्बर्ट कर्व" शफल (कलाकारों को पुनर्व्यवस्थित करना)

समस्या: वर्तमान में, कलाकार एक उबाऊ, पंक्ति-दर-पंक्ति क्रम में खड़े होते हैं (जैसे किताब पढ़ना)। लेकिन एक वीडियो में, महत्वपूर्ण संबंध ऊपर-बाleft कोने के एक कलाकार और नीचे-right कोने के एक कलाकार के बीच, या कल के एक फ्रेम और आज के एक फ्रेम के बीच हो सकते हैं। वर्तमान लाइन-अप में, ये महत्वपूर्ण साथी एक-दूसरे से बहुत दूर हैं, इसलिए "ब्लॉक" सिस्टम (समय बचाने के लिए कलाकारों को समूहों में बांटना) उन्हें पकड़ नहीं पाता।

DFSAttn का समाधान: यह तरीका कलाकारों को काम शुरू करने से पहले उन्हें व्यवस्थित करने के लिए 3D हिल्बर्ट कर्व नामक एक विशेष, घुमावदार पथ का उपयोग करता है।

  • उपमा: एक 3D क्यूब के माध्यम से घूमते हुए सांप की कल्पना करें। सीधी पंक्तियों में खड़े होने के बजाय, कलाकारों को इस तरह व्यवस्थित किया जाता है कि जो भी लाइन में एक-दूसरे के बगल में खड़ा है, वह वीडियो में भी शारीरिक रूप से करीब (स्थान और समय में पास) है।
  • परिणाम: अब, जब मैनेजर समय बचाने के लिए कलाकारों को "ब्लॉक्स" में समूहबद्ध करता है, तो प्रत्येक ब्लॉक में एक सुसंगत और संबंधित दृश्य होता है। मैनेजर बिना कुछ महत्वपूर्ण छोड़े, अन्य ब्लॉक्स को सुरक्षित रूप से अनदेखा कर सकता है।

2. "सब-ब्लॉक" स्कोर (बेहतर अनुमान)

समस्या: इस नए लाइन-अप के साथ भी, मैनेजर कभी-कभी एक ही "ब्लॉक" में अलग-अलग दृश्यों का मिश्रण (जैसे आकाश और एक पेड़) रख देता है। यदि मैनेजर केवल उस ब्लॉक के "औसत" को देखता है, तो वह इस तथ्य को मिस कर सकता है कि पेड़ महत्वपूर्ण है जबकि आकाश नहीं। यह एक पूरे पिज्जा का न्याय केवल उसके क्रस्ट (किनारे) से करने जैसा है जब आपको वास्तव में पेपरोनी की परवाह होती है।

DFSAttn का समाधान: यह तय करने से पहले कि किन ब्लॉक्स को रखना है, मैनेजर ज़ूम इन करता है। वे पहले बड़े ब्लॉक्स को छोटे "सब-ब्लॉक्स" में तोड़ देते हैं।

  • उपमा: यह पूछने के बजाय कि "क्या यह पूरा कमरा महत्वपूर्ण है?", मैनेजर पूछता है, "क्या खिड़की वाला कोना महत्वपूर्ण है? क्या दरवाजे वाला कोना महत्वपूर्ण है?" वे महत्व की एक सच्ची तस्वीर पाने के लिए इन छोटे, सटीक स्कोर को जोड़ते हैं।
  • परिणाम: यह मैनेजर को किसी महत्वपूर्ण विवरण को गलती से फेंकने से रोकता है, जो शायद एक अव्यवस्थित, मिश्रित समूह के भीतर छिपा हुआ था।

3. "स्मार्ट कैश" (अनुकूली समय)

समस्या: वीडियो बनाने के शुरुआती चरणों में, छवि केवल स्टैटिक नॉइज़ (जैसे टीवी का शोर/झिलमिलाहट) होती है। सब कुछ एक जैसा दिखता है, इसलिए यह समझने के लिए कि क्या हो रहा है, आपको लगभग सब कुछ देखना पड़ता है। लेकिन जैसे-जैसे वीडियो स्पष्ट होता जाता है, महत्वपूर्ण हिस्से स्पष्ट हो जाते हैं, और आप शोर के बहुत अधिक हिस्सों को अनदेखा कर सकते हैं।

DFSAttn का समाधान: यह तरीका वीडियो बनते समय अपनी रणनीति बदलता है।

  • उपमा: एक जासूस की तरह सोचें। केस की शुरुआत में, जासूस हर एक सुराग की जांच करता है (लो स्पैरसिटी/कम विरलता)। लेकिन एक बार जब उनके पास संदिग्ध आ जाता है, तो वे अप्रासंगिक सुरागों की जांच करना बंद कर देते हैं और केवल मुख्य साक्ष्यों पर ध्यान केंद्रित करते हैं (हाई स्पैरसिटी/उच्च विरलता)।
  • परिणाम: DFSAttn सावधानी बरतने के साथ शुरू होता है और जैसे-जैसे वीडियो साफ होता जाता है, यह काम छोड़ने में अधिक आक्रामक होता जाता है। यह उन सुरागों को "याद" (कैश) भी रखता है जो पिछले चरण में महत्वपूर्ण थे, ताकि उसे उन्हें तुरंत फिर से जांचने की आवश्यकता न पड़े, जिससे और भी समय बचता है।

निचोड़

इन तीन तरीकों को मिलाकर, DFSAttn वीडियो की गुणवत्ता को खराब किए बिना लगभग 80% अनावश्यक गणनाओं को छोड़ने की अनुमति देता है।

  • गति: यह वीडियो बनाने की गति को 2.1 गुना तेज़ बनाता है।
  • गुणवत्ता: वीडियो अभी भी शार्प और विस्तृत दिखते हैं, लगभग उतने ही अच्छे जितने कि तब होते यदि कंप्यूटर ने सारा काम किया होता।
  • कोई ट्रेनिंग आवश्यक नहीं: सबसे अच्छी बात यह है कि यह एक "प्लग-एंड-प्ले" अपग्रेड है। आपको AI मॉडल को फिर से प्रशिक्षित करने की आवश्यकता नहीं है; आप बस इस नए मैनेजर (DFSAttn) को अधिक कुशलता से शो चलाने के लिए बदल सकते हैं।

संक्षेप में, DFSAttn वीडियो बनाने वाले AI को बताने का एक स्मार्ट तरीका है: "सब से बात करने की कोशिश करना बंद करो। बस सही लोगों से, सही क्रम में, और सही समय पर बात करो।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →