← नवीनतम पेपर
🤖 AI

Adapting VACE for Real-Time Autoregressive Video Diffusion

यह शोध पत्र रीयल-टाइम ऑटोरेग्रेसिव वीडियो जनरेशन के लिए VACE मॉडल के एक ट्रेनिंग-फ्री अनुकूलन को प्रस्तुत करता है, जो कॉज़ल अटेंशन (causal attention) और फिक्स्ड चंक साइज़्स को सक्षम करने के लिए रेफरेंस फ्रेम्स को एक पैरेलल कंडिशनिंग पाथवे में स्थानांतरित करता है, जिससे कम-लेटेंसी नियंत्रण प्राप्त होता है, हालांकि इसके बदले में रेफरेंस-टू-वीडियो फिडेलिटी में कमी आती है।

मूल लेखक: Ryan Fosdick

प्रकाशित 2026-02-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ryan Fosdick

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लाइव थिएटर नाटक निर्देशित करने की कोशिश कर रहे हैं जहाँ अभिनेता एक समय में एक दृश्य के हिसाब से अपनी लाइनें सुधारते (improvise करते) हैं, और दर्शक इसे वास्तविक समय (real-time) में देख रहे हैं। रियल-टाइम वीडियो जनरेशन बिल्कुल ऐसा ही है: कंप्यूटर वीडियो को फ्रेम-दर-फ्रेम (या चंक-दर-चंक) बनाता है, और यह तय करने के लिए कि आगे क्या होगा, केवल यह देखता है कि अतीत में क्या हुआ था। यह तेज़ है, लेकिन इसका एक सख्त नियम है: यह आगे नहीं देख सकता।

अब, कल्पना कीजिए कि आप इस इम्प्रोवाइजिंग कलाकारों के समूह को एक निर्देशक की स्क्रिप्ट देना चाहते हैं। आप कहना चाहते हैं, "अभिनेता का चेहरा बिल्कुल इस फोटो जैसा रखें," या "सुनिश्चित करें कि बैकग्राउंड इस स्केच का पालन करे," या "इस विशिष्ट स्थान पर शर्ट का रंग बदल दें।"

यहीं VACE (वीडियो ऑल-इन-वन क्रिएशन एंड एडिटिंग) काम आता है। यह एक शानदार "निर्देशक का टूलकिट" है जिसे मूल रूप से बैच प्रोसेसिंग के लिए बनाया गया था।

समस्या: "बैच" बनाम "लाइव" का बेमेल होना

सोचिए कि मूल VACE एक पोस्ट-प्रोडक्शन स्टूडियो में मूवी एडिटर की तरह है।

  • यह कैसे काम करता था: एडिटर पूरी मूवी की स्क्रिप्ट, संदर्भ फोटो और स्केच लेता है, उन्हें एक विशाल मेज पर बिछा देता है, और पूरी चीज़ को एक साथ एडिट करता है। क्योंकि उनके पास पूरी फिल्म सामने होती है, वे एक साथ शुरुआत, मध्य और अंत को देख सकते हैं ताकि सटीक निर्णय ले सकें।
  • संघर्ष: रियल-टाइम वीडियो जनरेशन एक लाइव रेडियो ब्रॉडकास्ट की तरह है। होस्ट पूरे शो के लिखे जाने का इंतज़ार नहीं कर सकता। उन्हें छोटे, निश्चित लंबाई के खंडों (chunks) में बोलना पड़ता है। वे केवल वर्तमान क्षण से पहले जो कहा गया था, उसे सुन सकते हैं।
  • क्रैश: यदि आप "पोस्ट-प्रोडक्शन एडिटर" (VACE) को "लाइव रेडियो शो" पर काम करने के लिए मजबूर करते हैं, तो यह टूट जाता है। एडिटर पूरी फिल्म को मेज पर बिछाने की कोशिश करता है, लेकिन रेडियो होस्ट के पास केवल एक छोटा सा डेस्क होता है जो एक सेगमेंट के लिए है। संदर्भ फोटो वर्तमान दृश्य के साथ मिल जाती हैं, जिससे कंप्यूटर भ्रमित हो जाता है कि क्या "इतिहास" है और क्या "निर्देश"।

समाधान: "साइड-चैनल" एडेप्टर

इस पेपर के लेखकों ने एक चतुर समाधान निकाला। संदर्भ फोटो को मुख्य डेस्क पर वीडियो फ्रेमों के साथ रखने के बजाय, उन्होंने एक समानांतर साइड-चैनल बनाया।

यहाँ उपमा (analogy) दी गई है:

  • पुराना तरीका: आप अभिनेता को एक बिल्ली की फोटो देते हैं और कहते हैं, "इस फोटो को देखो, फिर अभिनय करो।" अभिनेता अभिनय करते समय फोटो को याद रखने की कोशिश करता है, लेकिन क्योंकि वह इम्प्रोवाइज कर रहा है, वह भ्रमित हो जाता है। क्या बिल्ली कहानी का हिस्सा है, या सिर्फ एक संदर्भ?
  • नया तरीका: आप फोटो को मंच के पीछे खड़े एक स्टेज मैनेजर ("कॉन्टेक्स्ट ब्लॉक्स") को देते हैं। स्टेज मैनेजर फोटो को देखता है, उसका "वाइब" या "निर्देश" समझता है, और अभिनेता को एक सरल संकेत फुसफुसाता है: "याद रखो, तुम एक बिल्ली की तरह अभिनय कर रहे हो।"
  • परिणाम: अभिनेता (मुख्य वीडियो मॉडल) अपना ध्यान वर्तमान दृश्य और पिछले दृश्यों पर केंद्रित रखता है। उन्हें फोटो के साथ जूझना नहीं पड़ता। उन्हें बस "संकेत" मिलता है और वे अपने प्रदर्शन को समायोजित करते हैं।

यह सिस्टम को निम्नलिखित अनुमति देता है:

  1. गति बनाए रखना: अभिनेता फोटो देखने के लिए नहीं रुकता; उसे बस एक त्वरित फुसफुसाहट मिलती है।
  2. मेमोरी कम रखना: कंप्यूटर को हर एक फ्रेम के लिए अपनी "शॉर्ट-टर्म मेमोरी" (KV कैश) में पूरी फोटो को सहेजने की आवश्यकता नहीं होती है।
  3. दिमाग का पुन: उपयोग: सबसे अच्छी बात? "स्टेज मैनेजर" (VACE वेट्स) पहले से ही प्रशिक्षित और तैयार था। लेखकों को पूरा सिस्टम फिर से प्रशिक्षित करने की आवश्यकता नहीं थी; उन्होंने बस यह बदला कि मैनेजर कहाँ खड़ा था।

यह अब क्या कर सकता है?

इस "साइड-चैनल" ट्रिक के कारण, यह सिस्टम अब वास्तविक समय में अद्भुत चीजें कर सकता है (एक सामान्य गेमिंग पीसी पर लगभग 17-22 फ्रेम प्रति सेकंड):

  • स्ट्रक्चरल कंट्रोल: आप एक स्टिक फिगर (डंडी वाला आदमी) बना सकते हैं, और वीडियो उस स्टिक फिगर की तरह बिल्कुल वैसा ही व्यक्ति बनाएगा।
  • इनपेंटिंग/आउटपेंटिंग: आप कंप्यूटर को कह सकते हैं, "इस व्यक्ति को मिटाकर उसकी जगह एक कुत्ता रख दो," या "दृश्य को बाईं ओर विस्तृत करो," और यह तुरंत होता है।
  • स्टाइल ट्रांसफर: आप वैन गॉग की पेंटिंग की एक तस्वीर दिखा सकते हैं, और वीडियो ऐसा लगेगा जैसे उसे वैन गॉग ने पेंट किया हो।

ट्रेड-ऑफ (एक "कैच")

इसमें एक सीमा है। "रेफरेंस-टू-वीडियो" फीचर (जहाँ आप चाहते हैं कि वीडियो किसी विशिष्ट संदर्भ फोटो की तरह बिल्कुल दिखे) पुराने "पोस्ट-प्रोडक्शन" संस्करण जितना सटीक नहीं है।

  • क्यों? पुराने संस्करण में, कंप्यूटर संदर्भ फोटो और वर्तमान वीडियो फ्रेम को एक-दूसरे के बगल में रखकर हर सूक्ष्म विवरण को कॉपी कर सकता था। नए "लाइव" संस्करण में, कंप्यूटर को फोटो के बारे में केवल एक "संकेत" मिलता है। यह अपने डेस्क पर एक हाई-रिज़ॉल्यूशन फोटो रखने और किसी के द्वारा वॉकी-टॉकी पर आपको फोटो का वर्णन करने के बीच के अंतर जैसा है। वाइब (भाव) तो आता है, लेकिन बारीक विवरण थोड़े धुंधले हो सकते हैं।

निष्कर्ष

यह पेपर एक शक्तिशाली, भारी-भरकम वीडियो एडिटिंग टूल को लाइव स्ट्रीमिंग स्टेज पर काम करने के लिए संशोधित करने के बारे में है।

  • पहले: आपको इन शानदार फीचर्स के साथ वीडियो को एडिट करने के लिए पूरे वीडियो के खत्म होने का इंतज़ार करना पड़ता था।
  • अब: आप वीडियो बनते समय ही उसे जनरेट और एडिट कर सकते हैं, जिसमें बहुत मामूली धीमापन (लगभग 20-30% धीमा) और लगभग कोई अतिरिक्त मेमोरी लागत नहीं है।

यह एक कार को एक भारी ट्रक से, जो पूरा घर ढो सकता है, एक स्पोर्ट्स कार में अपग्रेड करने जैसा है, जो अभी भी एक टूलबॉक्स ढो सकती है लेकिन ट्रैफिक के साथ चलने के लिए पर्याप्त तेज़ चलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →