← नवीनतम पेपर
💻 computer science

DynamicRad: Content-Adaptive Sparse Attention for Long Video Diffusion

DynamicRad एक कंटेंट-एडेप्टिव स्पार्स अटेंशन फ्रेमवर्क है जो लॉन्ग वीडियो डिफ्यूजन मॉडल्स में जनरेशन क्वालिटी को बनाए रखते हुए या उसे बढ़ाते हुए महत्वपूर्ण इंफरेंस स्पीडअप (1.7×–2.5×) और उच्च स्पर्सिटी (>80%) प्राप्त करने के लिए रेडियल लोकैलिटी प्रायर और एक ऑफलाइन बेयसियन ऑप्टिमाइज़ेशन-ड्रिवन सिमेंटिक मोशन राउटर का लाभ उठाता है।

मूल लेखक: Yongji Long, Shijun Liang, Jintao Li, Yun Li

प्रकाशित 2026-04-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yongji Long, Shijun Liang, Jintao Li, Yun Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक 10 घंटे की फिल्म देखने की कोशिश कर रहे हैं, लेकिन आपका मस्तिष्क (कंप्यूटर) एक बार में केवल कुछ सेकंड ही अपनी "सक्रिय मेमोरी" में रख सकता है। पूरी कहानी समझने के लिए, आपके मस्तिष्क को शुरुआत, मध्य और अंत के बीच लगातार इधर-उधर देखना होगा।

AI वीडियो जनरेशन की दुनिया में, इस "इधर-उधर देखने" की प्रक्रिया को Attention कहा जाता है। समस्या यह है कि लंबे वीडियो के लिए, AI हर एक फ्रेम को दूसरे हर एक फ्रेम के साथ देखने की कोशिश करता है। यह एक हज़ार पन्नों की किताब का हर पन्ना पढ़ने जैसा है ताकि सिर्फ एक वाक्य को समझा जा सके। इसमें बहुत समय लगता है और यह कंप्यूटर की सारी ऊर्जा खर्च कर देता है।

DynamicRad एक नया "स्मार्ट रीडिंग स्ट्रैटेजी" है जो इस समस्या को हल करता है। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: "ब्रूट फोर्स" दृष्टिकोण (The Brute Force Approach)

वर्तमान AI वीडियो निर्माता एक शक्की पुस्तकालयाध्यक्ष (librarian) की तरह हैं। किसी विशिष्ट तथ्य को खोजने के लिए, वे हर एक विषय से संबंधित किताबों को भी चेक करते हैं, भले ही वह किताब किसी अलग विषय पर हो।

  • परिणाम: यह सटीक तो है, लेकिन अविश्वसनीय रूप से धीमा है। एक लंबा वीडियो बनाने में घंटों लग सकते हैं।

2. पुराना समाधान: "कठोर घेरा" (The Rigid Fence)

कुछ पिछले तरीकों ने एक कठोर घेरा बनाकर गति बढ़ाने की कोशिश की। उन्होंने कहा, "हम केवल वर्तमान किताब के 5 फीट के भीतर की किताबों को देखेंगे।"

  • खामी: यह एक शांत लाइब्रेरी (सोती हुई बिल्ली का वीडियो) के लिए बहुत अच्छा काम करता है। लेकिन अगर दृश्य बदल जाता है और एक अराजक कार चेज़ (तेज गति) शुरू हो जाती है, तो यह "घेरा" बहुत छोटा होता है। AI उस कार को मिस कर देता है जो 20 फीट दूर से अचानक आ गई थी, और वीडियो ग्लिच वाला या टूटा हुआ दिखाई देता है।

3. नया समाधान: DynamicRad (द स्मार्ट स्काउट)

DynamicRad एक स्मार्ट स्काउट (Smart Scout) को काम पर रखने जैसा है जो जानता है कि कब सख्त होना है और कब लचीला। यह दो मुख्य तरकीबों का उपयोग करता है:

A. "मोशन सेंसर" (Semantic Motion Router)

वीडियो बनाना शुरू करने से पहले, AI टेक्स्ट प्रॉम्प्ट (जैसे, "एक धीमी सूर्यास्त" बनाम "एक तेज़ ड्रोन रेस") को पढ़ता है।

  • कम गति (सूर्यास्त): स्काउट कहता है, "ठीक है, ज्यादा कुछ हिल नहीं रहा है। हम आलसी हो सकते हैं! आइए केवल अपने आस-पास के पड़ोसियों को देखें।" यह बहुत सारा समय बचाता है।
  • उच्च गति (ड्रोन रेस): स्काउट कहता, "ओह! चीजें तेजी से चल रही हैं! हमें क्षितिज पर नज़र रखनी होगी। आइए सुनिश्चित करने के लिए कि हम एक्शन को मिस न करें, थोड़ा और पीछे और आगे देखें।"

B. "दो मोड" (Static vs. Dynamic)

इस सिस्टम के पास दो गियर हैं जिन्हें यह तुरंत स्विच कर सकता है:

  1. स्पीड गियर (Static-Ratio): इसका उपयोग तब किया जाता है जब आप बस चाहते हैं कि वीडियो जल्दी बन जाए। यह एक सख्त नियम का पालन करके "देखने" के काम को 80% तक कम कर देता है। यह एक किताब को सरसरी निगाह से पढ़ने जैसा है, जहाँ आप केवल हर पैराग्राफ का पहला और आखिरी वाक्य पढ़ते हैं।
  2. क्वालिटी गियर (Dynamic-Threshold): इसका उपयोग तब किया जाता है जब आप चाहते हैं कि यह एकदम परफेक्ट दिखे। यह हर फ्रेम की "महत्ता" को देखता है। यदि कोई फ्रेम उबाऊ है, तो यह उसे अनदेखा कर देता है। यदि कोई फ्रेम रोमांचक है (जैसे विस्फोट), तो यह उसे रखता है, भले ही वह टाइमलाइन में कहीं भी दूर क्यों न हो।

4. "ऑफलाइन ट्रेनिंग" (द चीट शीट)

आमतौर पर, वीडियो देखने का सबसे अच्छा तरीका पता लगाने में वीडियो बनते समय समय लगता है। DynamicRad यह होमवर्क पहले ही कर लेता है।

  • कल्पना कीजिए कि एक शेफ ग्राहक के ऑर्डर देने से पहले ही हजार अलग-अलग मसालों के मिश्रण को चख लेता है, ताकि जब ऑर्डर आए, तो वह तुरंत सही जार उठा सके।
  • DynamicRad एक "चीट शीट" (जो बेयसियन ऑप्टिमाइज़ेशन नामक गणितीय ऑप्टिमाइज़र द्वारा बनाई गई है) का उपयोग करता है ताकि यह जान सके कि वीडियो के प्रकार के आधार पर कितना "स्किप" करना है। इसका मतलब है कि वीडियो जनरेट होने के दौरान कोई देरी नहीं होती है।

5. "सेफ्टी नेट" (Mask-Aware LoRA)

कभी-कभी, बहुत अधिक जानकारी छोड़ने से वीडियो अजीब दिखने लगता है (जैसे किसी पात्र का चेहरा झिलमिलाना)।

  • DynamicRad एक छोटा सा "पैच" (जिसे LoRA कहा जाता है) जोड़ता है जो एक सेफ्टी नेट की तरह काम करता है। यह जानकारी छोड़ने से होने वाली छोटी त्रुटियों को धीरे से ठीक करता है, जिससे यह सुनिश्चित होता है कि वीडियो स्मूथ और सुसंगत बना रहे, भले ही AI फ्रेम छोड़ने के मामले में बहुत आक्रामक हो।

निष्कर्ष (The Bottom Line)

DynamicRad एक ऐसे कार में अपग्रेड करने जैसा है जो एक स्थिर, धीमी गति से चलती है, बजाय एक स्मार्ट स्पोर्ट्स कार के।

  • एक सीधे, खाली सड़क पर (धीमे वीडियो में), यह 200 मील प्रति घंटे की रफ्तार से चलता है, अनावश्यक चीजों को अनदेखा करता है।
  • एक घुमावदार, खतरनाक ट्रैक पर (तेज वीडियो में), यह मोड़ों को पूरी तरह से लेने के लिए बस इतना धीमा हो जाता है कि दुर्घटना न हो।

परिणाम: अब AI बिना गुणवत्ता खोए लंबे, उच्च-गुणवत्ता वाले वीडियो 2 से 2.5 गुना तेजी से बना सकता है, जिससे ऐसी फिल्में बनाना संभव हो गया है जिन्हें बनाने में पहले कई दिन लगते थे, अब वे घंटों में पूरी हो जाती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →