← नवीनतम पेपर
💻 computer science

UniTemp: Unlocking Video Generation in Any Temporal Order via Bidirectional Distillation

UniTemp एक द्विदिशीय (bidirectional) आसवन ढांचा (distillation framework) है जो ब्लॉकवाइज एंकर लैटेंट्स (blockwise anchor latents) की शुरुआत के माध्यम से कॉज़ल 3D VAEs की सीमाओं को दूर करके ऑटोरिग्रेसिव वीडियो डिफ्यूजन मॉडल्स को किसी भी टेम्पोरल ऑर्डर में वीडियो जेनरेट करने में सक्षम बनाता है।

मूल लेखक: Lin Zhang, Sicheng Mo, Zefan Cai, Jinhong Lin, Zihao Lin, Jiuxiang Gu, Krishna Kumar Singh, Yuheng Li, Yin Li

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lin Zhang, Sicheng Mo, Zefan Cai, Jinhong Lin, Zihao Lin, Jiuxiang Gu, Krishna Kumar Singh, Yuheng Li, Yin Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फिल्म की पटकथा लिखने की कोशिश कर रहे हैं। आज के अधिकांश AI वीडियो जनरेटर उन लेखकों की तरह हैं जो केवल शुरुआत से अंत तक कहानी लिख सकते हैं। वे पहला दृश्य देखते हैं, फिर दूसरा लिखते हैं, फिर तीसरा, और इसी तरह। वे इसमें बहुत अच्छे हैं, लेकिन वे एक "केवल आगे की ओर" वाली मानसिकता में फंसे हुए हैं।

यदि आप एक "प्रिक्वेल" (यानी पहले दृश्य से पहले क्या हुआ था) लिखना चाहते या दो मौजूदा दृश्यों के बीच के अंतराल को भरना चाहते, तो ये लेखक भ्रमित हो जाते और कहानी बिखर जाती।

UniTemp एक नया AI सिस्टम है जो इस नियम को तोड़ता है। यह AI को किसी भी क्रम में वीडियो कहानी लिखने की अनुमति देता है: आगे, पीछे, या बीच के हिस्से को भरकर। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

समस्या: "एकतरफा रास्ता"

पेपर बताता है कि वर्तमान वीडियो AI एक विशेष "अनुवादक" (जिसे Causal 3D VAE कहा जाता है) का उपयोग करता है जो वीडियो को उस डेटा में बदल देता है जिसे कंप्यूटर समझ सके।

  • उपमा: कल्पना कीजिए कि यह अनुवादक एक ऐसे व्यक्ति की तरह है जो एक किताब पढ़ रहा है जो केवल वर्तमान पृष्ठ से पहले के पृष्ठ देख सकता है। जब वह अध्याय 2 पढ़ रहा होता है, तो उसे पता होता है कि अध्याय 1 में क्या हुआ था।
  • समस्या: यदि आप कहानी को उल्टा (अध्याय 10 से शुरू करके अध्याय 1 तक) लिखने की कोशिश करते हैं, तो यह अनुवादक खो जाता है। जब यह अध्याय 9 लिखने की कोशिश करता है, तो यह अध्याय 8 को नहीं देख पाता क्योंकि इसके तर्क के अनुसार, अध्याय 8 अभी तक लिखा ही नहीं गया है।
  • परिणाम: जब AI उल्टा वीडियो बनाने की कोशिश करता है, तो दृश्यों के उन किनारों पर जहाँ एक वीडियो ब्लॉक दूसरे से मिलता है, वहां "ग्लिच" या झिलमिलाहट (flicker) आती है, क्योंकि अनुवादक उस संदर्भ (context) को नहीं देख पाता जिसकी उसे आवश्यकता होती है।

समाधान: "भूतिया पन्ने" (Blockwise Anchor Latents)

पूरे अनुवादक को फिर से बनाए बिना (जो बहुत कठिन और धीमा होगा) इस ग्लिच को ठीक करने के लिए, शोधकर्ताओं ने एक चतुर तकनीक का आविष्कार किया जिसे Blockwise Anchor Latents कहा जाता है।

  • उपमा: कल्पना कीजिए कि आप उलटी कहानी लिख रहे हैं। भले ही आपने पिछला अध्याय अभी तक नहीं लिखा है, आप अपने वर्तमान पृष्ठ के बाईं ओर कुछ "भूतिया पन्ने" (ghost pages) चिपका देते हैं। ये भूतिया पन्ने अंतिम कहानी का हिस्सा नहीं हैं जो आप दर्शकों को दिखाते हैं; वे केवल प्लेसहोल्डर्स हैं जो अनुवादक को याद दिलाते हैं कि पिछला दृश्य कैसा दिखता था।
  • यह कैसे काम करता है: AI वीडियो का एक छोटा ब्लॉक (असली दृश्य) और साथ में ये अतिरिक्त "एंकर" लैटेंट्स (भूतिया पन्ने) बनाता है। AI संदर्भ को समझने के लिए एंकर्स का उपयोग करता है, वास्तविक दृश्य को सुचारू रूप से लिखता है, और फिर एंकर्स को फेंक देता है
  • परिणाम: वीडियो बिना किसी झिलमिलाहट या उछाल के पूरी तरह से पीछे की ओर बहता है, भले ही इसका मूल अनुवादक अभी भी यह सोचता हो कि इसे केवल आगे की ओर ही देखना चाहिए।

द "स्विस आर्मी नाइफ" मॉडल

आमतौर पर, यदि आप आगे की ओर लिखना चाहते हैं, तो आप एक मॉडल को प्रशिक्षित करते हैं। यदि आप पीछे की ओर लिखना चाहते हैं, तो आप दूसरे को प्रशिक्षित करते हैं। यदि आप बीच में भरना चाहते हैं, तो आप तीसरे को प्रशिक्षित करते हैं।

UniTemp अलग है। यह एक एकल, एकीकृत मॉडल है जिसने एक साथ तीनों काम करना सीखा है।

  • आगे (Forward): यह वीडियो को भविष्य की ओर बढ़ा सकता है।
  • पीछे (Backward): यह एक प्रिक्वेल बना सकता है या वीडियो को अतीत की ओर बढ़ा सकता है।
  • बीच में (In-between): यह दो अलग-अलग क्लिप्स (जैसे एक "शुरुआत" और एक "अंत") को ले सकता है और उन्हें जोड़ने वाले लापता दृश्यों का आविष्कार कर सकता है।

आप इसके साथ क्या कर सकते हैं?

पेपर दिखाता है कि इस एकल मॉडल के साथ, आप ऐसी चीजें कर सकते हैं जो पहले असंभव थीं या जिनके लिए कई अलग-अलग उपकरणों की आवश्यकता थी:

  1. लूपिंग वीडियो: आप एक वीडियो के अंत को उसके आरंभ से सहजता से जोड़ सकते हैं ताकि एक अंतहीन लूप बनाया जा सके।
  2. दृश्य संक्रमण (Scene Transitions): आप दो बहुत अलग दृश्यों (जैसे एक जंगल और एक शहर) को ले सकते हैं और AI को उनके बीच एक सहज संक्रमण (transition) बनाने के लिए कह सकते हैं।
  3. विजुअल स्टोरीज: केवल एक कहानी को चलते हुए देखने के बजाय, आप मुख्य दृश्य चुन सकते हैं (दृश्य 1, दृश्य 3, दृश्य 5) और AI से उनके बीच के अंतराल (दृश्य 2 और दृश्य 4) को भरने या अंत लिखने के लिए कह सकते हैं, वह भी आपके द्वारा चुने गए किसी भी क्रम में।

सारांश

UniTemp एक वीडियो लेखक को "रिवाइंड" बटन और "खाली स्थान भरने" वाला टूल देने जैसा है। यह "भूतिया पन्नों" का उपयोग करके पीछे की ओर निर्माण के तकनीकी ग्लिच को हल करता है ताकि कहानी सुचारू बनी रहे, जिसके परिणामस्वरूप एक स्मार्ट मॉडल प्राप्त होता है जो आपकी आवश्यकता के अनुसार किसी भी दिशा में वीडियो निर्माण को संभाल सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →