← नवीनतम पेपर
💻 computer science

DCDM: Divide-and-Conquer Diffusion Models for Consistency-Preserving Video Generation

यह शोध पत्र DCDM का प्रस्ताव करता है, जो एक डिवाइड-एंड-कॉन्कर डिफ्यूजन फ्रेमवर्क है जो इंट्रा-क्लिप कोहेरेंस के लिए LLM-संचालित सिमेंटिक पार्सिंग, इंटर-क्लिप नियंत्रण के लिए नॉइज़-स्पेस टेम्पोरल कैमरा रिप्रेजेंटेशन, और इंटर-शॉट नैरेटिव निरंतरता के लिए स्पार्स अटेंशन के साथ एक समग्र सीन जनरेशन प्रतिमान को एकीकृत करके वीडियो जनरेशन की निरंतरता को बढ़ाता है।

मूल लेखक: Haoyu Zhao, Yuang Zhang, Junqi Cheng, Jiaxi Gu, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

प्रकाशित 2026-02-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoyu Zhao, Yuang Zhang, Junqi Cheng, Jiaxi Gu, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक निर्देशक हैं जो एक जादुई, AI-संचालित कैमरे के साथ एक फिल्म बनाने की कोशिश कर रहे हैं। आप चाहते हैं कि फिल्म शानदार दिखे, लेकिन आप तीन विशिष्ट डरावनी समस्याओं का सामना कर रहे हैं जो AI से वीडियो बनाने पर आती हैं:

  1. "भुलक्कड़ अभिनेता" की समस्या (The "Forgetful Actor" Problem): एक ही दृश्य में, AI किसी पात्र के अचानक तीन आँखें बना सकता है, या बिना किसी कारण के कॉफी का कप उल्टा तैरता हुआ दिखा सकता है। यह दुनिया के बुनियादी नियमों को भूल जाता है।
  2. "डगमगाते हाथ" की समस्या (The "Wobbly Hand" Problem): आप कैमरे को "सुचारू रूप से ज़ूम इन करने" के लिए कहते हैं, लेकिन AI कैमरे को हिला देता है, झटके देता है, या इस तरह से चलता है जैसे उसे किसी नशे में धुत व्यक्ति ने पकड़ा हो।
  3. "अल्जाइमर/स्मृति लोप" की समस्या (The "Amnesia" Problem): आप 10 मिनट की कहानी मांगते हैं। पहले मिनट में, नायक के पास लाल टोपी है। पांचवें मिनट तक, टोपी नीली हो जाती है। दसवें मिनट तक, वह पूरी तरह से एक अलग व्यक्ति बन जाता है। AI उस कहानी को भूल जाता है जो उसने अभी शुरू की थी।

जिस शोध पत्र को आपने साझा किया है, वह DCDM (Divide-and-Conquer Diffusion Model) नामक एक नई प्रणाली पेश करता है। एक विशाल, भ्रमित मस्तिष्क के माध्यम से इन सभी समस्याओं को ठीक करने के बजाय, लेखकों ने काम को तीन विशिष्ट टीमों में विभाजित करने का निर्णय लिया, जो एक ही छत के नीचे काम करती हैं।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. स्क्रिप्ट डॉक्टर (इंट्रा-क्लिप कंसिस्टेंसी - Intra-clip Consistency)

समस्या: जब आप "एक बिल्ली चूहे का पीछा कर रही है" जैसा सरल प्रॉम्प्ट देते हैं, तो AI को बहुत से विवरणों का अनुमान लगाना पड़ता है। क्या चूहा भाग रहा है? क्या बिल्ली गुस्से में है? वे कहाँ हैं? यदि AI गलत अनुमान लगाता है, तो दृश्य अजीब दिखता है।
समाधान: AI वीडियो बनाना शुरू करने से पहले, वे एक स्मार्ट स्क्रिप्ट डॉक्टर (एक लार्ज लैंग्वेज मॉडल) का उपयोग करते हैं।

  • उपमा: कल्पना कीजिए कि आप एक चित्रकार को कहते हैं, "एक कुत्ता बनाओ।" चित्रकार पंखों वाला कुत्ता बना सकता है। लेकिन यदि आप कहते हैं, "एक सुनहरे रिट्रीवर को धूप वाले पार्क में खुशी से दौड़ते हुए, एक लाल गेंद का पीछा करते हुए चित्रित करें," तो चित्रकार को ठीक पता होता है कि क्या करना है।
  • यह कैसे काम करता है: सिस्टम आपके छोटे प्रॉम्प्ट को लेता है और "स्क्रिप्ट डॉक्टर" से इसे एक अत्यंत विस्तृत विवरण में विस्तारित करने के लिए कहता है। यह गायब तर्क (logic) को भर देता है ताकि AI को वीडियो बनाना शुरू करने से पहले पता हो कि दुनिया कैसी दिखती है। यह "तीन आँखों वाली बिल्ली" की समस्या को रोकता है।

2. स्टेडीकैम ऑपरेटर (इंटर-क्लिप कैमरा कंसिस्टेंसी - Inter-clip Camera Consistency)

समस्या: AI को "कैमरा बाईं ओर ले जाओ" कहना अक्सर एक अस्थिर, अप्रत्याशित गड़बड़ी का परिणाम देता है क्योंकि AI वास्तव में ज्यामिति या भौतिकी (physics) को नहीं समझता है।
समाधान: उन्होंने एक विशेषज्ञ कैमरा ऑपरेटर बनाया जो गति के एक "ब्लूप्रिंट" के साथ काम करता है।

  • उपमा: एक अराजक भीड़ को बस "बाएं जाओ!" चिल्लाने के बजाय, आप एक पेशेवर कैमरामैन को फर्श पर एक विशिष्ट ट्रैक और एक रिमोट कंट्रोल देते हैं। आप उन्हें बताते हैं, "ठीक 2 मीटर बाईं ओर, सुचारू रूप से बढ़ें।"
  • यह कैसे काम करता है: सिस्टम आपके टेक्स्ट (जैसे, "ज़ूम इन") को एक गणितीय "नॉइज़ पैटर्न" में अनुवादित करता है जो कैमरे के लिए एक कठोर ट्रैक के रूप में कार्य करता है। यह एक पूर्ण संदर्भ छवि (जैसे स्टोरीबोर्ड स्केच) से भी शुरू होता है ताकि यह सुनिश्चित हो सके कि कैमरा बिल्कुल योजना के अनुसार चले, बिना हिले या डगमगाए।

3. मेमोरी कीपर (इंटर-शॉट एलिमेंट कंसिस्टेंसी - Inter-shot Element Consistency)

समस्या: कई शॉट्स के साथ लंबा वीडियो बनाते समय, AI आमतौर पर अंतिम शॉट तक पहुँचते-पहुँचते भूल जाता है कि पात्र पहले शॉट में कैसे दिखते थे।
समाधान: उन्होंने एक मेमोरी कीपर बनाया जो पूरी फिल्म को एक साथ देखता है, लेकिन केवल महत्वपूर्ण हिस्सों पर ध्यान देता है।

  • उपमा: कल्पना कीजिए कि आप एक उपन्यास लिख रहे हैं। यदि आप हर अध्याय के हर शब्द को एक विशाल ब्लॉक के रूप में लिखते हैं, तो आपका मस्तिष्क थक जाता है और आप मुख्य पात्र का नाम भूल जाते हैं। इसके बजाय, आप अध्याय दर अध्याय लिखते हैं, लेकिन अपने डेस्क पर एक "चरित्र शीट" (Character Sheet) रखते हैं जिसे आप हर बार नया अध्याय शुरू करते समय देखते हैं।
  • यह कैसे काम करता है: AI वीडियो को "शॉट्स" (दृश्यों) में उत्पन्न करता है। यह स्पार्स अटेंशन (Sparse Attention) नामक एक विशेष तकनीक का उपयोग करता है। यह एक एकल शॉट के भीतर प्रत्येक फ्रेम को बारीकी से देखता है (ताकि क्रिया सुचारू रहे), लेकिन जब यह अगले शॉट पर जाता है, तो यह पिछले शॉट्स से केवल कुछ "सारांश नोट्स" की जांच करता है। यह पात्र के चेहरे, शैली और कहानी को सुसंगत बनाए रखता है बिना हर बार पूरे वीडियो की पुन: गणना किए, जिससे भारी मात्रा में कंप्यूटर शक्ति बचती है।

बड़ी तस्वीर: "विभाजित करो और जीतो" (Divide and Conquer)

इस पेपर की प्रतिभा इसके नाम में है: डिवाइड एंड कॉन्कर (Divide and Conquer)

एक विशाल, अति-जटिल रोबोट बनाने के बजाय जो एक साथ स्क्रिप्ट राइटर, कैमरामैन और मेमोरी बैंक बनने की कोशिश करता है (जो आमतौर पर हर चीज़ में विफल रहता है), उन्होंने एक केंद्रीय इंजन (वीडियो जनरेटर) बनाया और उसे तीन विशेषज्ञ सहायक दिए:

  1. एक दृश्य के तर्क (logic) को ठीक करने के लिए।
  2. एक कैमरा मूवमेंट को ठीक करने के लिए।
  3. एक दीर्घकालिक स्मृति (long-term memory) को ठीक करने के लिए।

परिणाम

टीम ने एक प्रमुख प्रतियोगिता (AAAI'26) में इस सिस्टम का परीक्षण किया और जीत हासिल की। उनके वीडियो हैं:

  • तार्किक (Logical): वस्तुएं वास्तविक वस्तुओं की तरह व्यवहार करती हैं।
  • स्थिर (Stable): कैमरा एक पेशेवर फिल्म क्रू की तरह सुचारू रूप से चलता है।
  • सुसंगत (Consistent): पात्र पहले सेकंड से लेकर आखिरी सेकंड तक एक जैसे दिखते हैं।

संक्षेप में, उन्होंने AI को एक साथ सब कुछ करने के लिए मजबूर करना बंद कर दिया और इसके बजाय इसे एक स्पष्ट, व्यवस्थित कार्यप्रवाह (workflow) दिया, जिसके परिणामस्वरूप बहुत बेहतर, अधिक विश्वसनीय फिल्में मिलीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →