← नवीनतम पेपर
💻 computer science

DCARL: A Divide-and-Conquer Framework for Autoregressive Long-Trajectory Video Generation

यह शोध पत्र DCARL का प्रस्ताव करता है, जो एक नवीन डिवाइड-एंड-कॉन्कर ऑटोरेग्रेसिव फ्रेमवर्क है जो वैश्विक संरचनात्मक निरंतरता के लिए एक समर्पित कीफ्रेम जनरेटर को स्थानीय सुसंगतता के लिए एक इंटरपोलेशन जनरेटर के साथ जोड़ता है, जिससे 32 सेकंड तक उच्च-निष्ठा, स्थिर लंबी-ट्रैजेक्टरी वीडियो जनरेशन सक्षम होता है और दृश्य गुणवत्ता एवं कैमरा अनुपालन में अत्याधुनिक बेसलाइनों से बेहतर प्रदर्शन करता है।

मूल लेखक: Junyi Ouyang, Wenbin Teng, Gonglin Chen, Yajie Zhao, Haiwei Chen

प्रकाशित 2026-03-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junyi Ouyang, Wenbin Teng, Gonglin Chen, Yajie Zhao, Haiwei Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप कागज की एक लंबी, निरंतर पट्टी पर एक विशाल, 32 सेकंड लंबी फिल्म का दृश्य बनाने की कोशिश कर रहे हैं। आप पहले फ्रेम के एक स्केच से शुरुआत करते हैं, और आपको बस पिछले फ्रेम के आधार पर अगला फ्रेम बनाना होता है, और इसे बार-बार दोहराते रहना होता है, जब तक कि फिल्म पूरी न हो जाए।

यह वही है जो वर्तमान AI वीडियो जनरेटर करने की कोशिश करते हैं। वे एक ऐसे छात्र की तरह हैं जो एक चित्र बनाने में तो बहुत अच्छा है लेकिन कुछ समय बाद थक जाता है और भ्रमित हो जाता है। जब तक वे 30 सेकंड के निशान तक पहुँचते हैं, उनकी ड्राइंग कागज से भटक जाती है। जिस कार को वे बना रहे थे, वह अचानक एक पेड़ में बदल सकती है, या सड़क भौतिकी के नियमों को चुनौती देते हुए एक सर्पिल (spiral) में मुड़ सकती है। इसे "विजुअल ड्रिफ्ट" (visual drift) कहा जाता है। AI ट्रैक खो देता है कि उसे कहाँ जाना चाहिए।

DCARL एक नई विधि है जो इस समस्या को हल करने के लिए अपनी रणनीति बदलकर इस समस्या का समाधान करती है। एक पूरी, थका देने वाली निरंतर रेखा में पूरी फिल्म खींचने की कोशिश करने के बजाय, यह एक "डिवाइड-एंड-कॉन्कर" (Divide-and-Conquer) दृष्टिकोण का उपयोग करता है। इसे एक लंबा पुल बनाने की तरह समझें।

समस्या: "भटकने वाला" कलाकार

यदि आप एक मानक AI को एक लंबा वीडियो जेनरेट करने के लिए कहते हैं, तो यह एक ऐसे व्यक्ति की तरह व्यवहार करता है जो आंखों पर पट्टी बांधकर सीधी रेखा में चलने की कोशिश कर रहा है, जो केवल अपने पिछले कदम के आधार पर एक-एक कदम आगे बढ़ता है।

  • कदम 1: वह एक कदम आगे बढ़ता है।
  • कदम 2: वह एक और कदम लेता है, लेकिन वह कदम 1 से थोड़ा सा पटरी से उतर गया है।
  • कदम 3: वह एक और कदम लेता है, जिससे कदम 2 की त्रुटि और बढ़ जाती है।

कदम 100 तक, वे उस सीधी रेखा से मीलों दूर निकल चुके होते हैं जिसे उन्हें फॉलो करना था। वीडियो के संदर्भ में, कैमरा बेतहाशा घूम सकता है, या दृश्य बिखर कर अर्थहीन हो सकता है।

DCARL का समाधान: "आर्किटेक्ट और मेसन" (वास्तुकार और राजमिस्त्री)

DCARL काम को दो अलग-अलग भूमिकाओं में विभाजित करता है, जैसे कि एक निर्माण परियोजना जिसमें एक आर्किटेक्ट (Architect) और एक मेसन (Mason/राजमिस्त्री) होता है।

1. आर्किटेक्ट (कीफ्रेम जनरेटर)

सबसे पहले, AI हर एक फ्रेम बनाने की कोशिश नहीं करता है। इसके बजाय, यह एक आर्किटेक्ट की तरह कार्य करता है जो 32 सेकंड की टाइमलाइन में फैले हुए कुछ महत्वपूर्ण "ब्लूप्रिंट" या कीफ्रेम्स (Keyframes) बनाता है।

  • कल्पना कीजिए कि आप न्यूयॉर्क से लॉस एंजिल्स तक की सड़क यात्रा की योजना बना रहे हैं। आर्किटेक्ट सड़क के हर मील को नहीं बनाता। इसके बजाय, वे मानचित्र पर प्रमुख शहरों पर पिन गिराते हैं: न्यूयॉर्क, शिकागो, डेनवर, लॉस एंजिल्स।
  • ये "पिन" (कीफ्रेम्स) पूरी यात्रा को एक साथ देखते हुए एक साथ जेनरेट किए जाते हैं। यह सुनिश्चित करता है कि मंजिल सही है और मार्ग वैश्विक स्तर पर तर्कसंगत है। AI को पता होता है कि इन प्रमुख चेकपॉइंट्स पर सड़क वास्तव में कहाँ होनी चाहिए।

2. मेसन (इंटरपोलेशन जनरेटर)

एक बार जब आर्किटेक्ट ने पिन लगा दिए हों, तो मेसन काम को पूरा करने आता है।

  • मेसन का काम न्यूयॉर्क और शिकागो के बीच की चिकनी सड़क बनाना है, फिर शिकागो और डेनवर के बीच, और इसी तरह।
  • क्योंकि मेसन के पास "पिन" (कीफ्रेम्स) सख्त सीमाओं के रूप में मौजूद हैं, वे भटक नहीं सकते। वे जानते हैं, "मुझे शिकागो पिन से शुरू करना है और डेनवर पिन पर समाप्त करना है।"
  • सीक्रेट सॉस (Secret Sauce): सड़क को प्राकृतिक दिखाने के लिए (न कि केवल दो बिंदुओं को जोड़ने वाली एक सख्त रेखा), मेसन को थोड़ा सा "नॉइज़" (रैंडमनेस) दिया जाता है और उसे गति की कल्पना करने के लिए कहा जाता है। यह AI को केवल पिन की तस्वीरों की नकल करने से रोकता है (जिससे वीडियो अटकता हुआ दिखेगा) और उसे उनके बीच वास्तविक गति (animation) दिखाने के लिए मजबूर करता है।

यह बेहतर क्यों काम करता है

पुराने तरीके (शुद्ध ऑटोरिग्रेसिव) में, AI एक ऐसे व्यक्ति की तरह था जो बिना सुरक्षा जाल के रस्सी पर चलने की कोशिश कर रहा था। शुरुआत में एक छोटा सा डगमगाना अंत तक एक बड़ी गिरावट बन जाता था।

DCARL के साथ:

  • सुरक्षा जाल (Safety Net): कीफ्रेम्स सुरक्षा जाल के रूप में कार्य करते हैं। भले ही मेसन शिकागो और डेनवर के बीच सड़क बनाते समय कोई छोटी गलती कर दे, अगला कीफ्रेम (डेनवर) वीडियो को वापस सही पथ पर खींच लाता है। त्रुटि अनंत काल तक नहीं बढ़ सकती क्योंकि हर प्रमुख चेकपॉइंट पर इसे "रीसेट" कर दिया जाता है।
  • निर्बाध जोड़ (Seamless Stitch): पेपर में यह भी उल्लेख किया गया है कि यह सुनिश्चित करने के लिए एक चतुर तकनीक है कि सड़क ऐसी न लगे जैसे उसे काटकर जोड़ा गया हो, कि मेसन एक खंड के अंत को अगले खंड के प्रारंभ के साथ ओवरलैप करता है, जिससे वे इतने सहजता से मिल जाते हैं कि आप बता नहीं सकते कि एक खंड कहाँ समाप्त हुआ और दूसरा कहाँ शुरू हुआ।

परिणाम

पेपर दिखाता है कि यह विधि AI को 32-सेकंड के वीडियो जेनरेट करने की अनुमति देती है जो पूरी तरह से ट्रैक पर रहते हैं।

  • विजुअल क्वालिटी: वीडियो स्पष्ट और वास्तविक दिखता है, धुंधला या बिखरा हुआ नहीं।
  • कैमरा कंट्रोल: यदि आप AI को कहते हैं, "कैमरा आगे बढ़ाएं और बाएं मुड़ें," तो यह पूरे 32 सेकंड के लिए वास्तव में ऐसा करता है। यह बीच में निर्देश नहीं भूलता।
  • स्थिरता (Stability): वीडियो भ्रम (hallucination) में नहीं भटकता। कार सड़क पर रहती है, और इमारतें सीधी रहती हैं।

संक्षेप में: DCARL AI को एक बार में पूरी फिल्म याद रखने की कोशिश करने से रोकता है। इसके बजाय, यह AI को प्रमुख स्थलों (कीफ्रेम्स) के साथ एक नक्शा देता है और उससे उनके बीच के विवरण भरने को कहता है, जिससे यह सुनिश्चित होता है कि यात्रा शुरुआत से अंत तक सही दिशा में रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →