← नवीनतम पेपर
💻 computer science

Motion Prior Distillation in Time Reversal Sampling for Generative Inbetweening

यह शोध पत्र मोशन प्रायर डिस्टिलेशन (MPD) का प्रस्ताव देता है, जो एक इन्फरेंस-टाइम तकनीक है जो इमेज-टू-वीडियो डिफ्यूजन मॉडल्स में द्विदिश मिसअलाइनमेंट (bidirectional misalignment) के कारण होने वाले टेम्पोरल डिस्कंटीन्यूइटी और विजुअल आर्टिफैक्ट्स को समाप्त करने के लिए फॉरवर्ड पाथ से मोशन रेसिडुअल को बैकवर्ड पाथ में डिस्टिल करके जनरेटिव इनबिटवीनिंग (generative inbetweening) में सुधार करता है।

मूल लेखक: Wooseok Jeon, Seunghyun Shin, Dongmin Shin, Hae-Gon Jeon

प्रकाशित 2026-02-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wooseok Jeon, Seunghyun Shin, Dongmin Shin, Hae-Gon Jeon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फिल्म निर्देशक हैं जो एक फिल्म के छूटे हुए दृश्यों को भरने की कोशिश कर रहे हैं। आपके पास पहला फ्रेम है (एक ट्रैफिक लाइट पर शुरू होती हुई कार) और आखिरी फ्रेम है (उसी कार का गंतव्य पर पार्क होना)। आपका काम बीच के सभी सुचारू और तार्किक फ्रेम बनाना है ताकि कार स्वाभाविक रूप से A से B तक चल सके।

यह जेनरेटिव इनबिटवीनिंग (Generative Inbetweening) की चुनौती है।

समस्या: दो निर्देशक, एक स्क्रिप्ट

अतीत में, AI मॉडल इस समस्या को हल करने के लिए दो अलग-अलग "निर्देशकों" को एक साथ फिल्म पर काम करने के लिए कहने की कोशिश करते थे:

  1. निर्देशक A शुरुआती फ्रेम को देखता है और कल्पना करता है, "ठीक है, कार आगे बढ़ रही है।"
  2. निर्देशक B आखिरी फ्रेम को देखता है और कोशिश करता है कि, "ठीक है, यह यहाँ कैसे पहुँची?"

टकराव:
यहाँ पेंच यह है: AI वीडियो मॉडल भविष्य की भविष्यवाणी करने के लिए प्रशिक्षित होते हैं। वे यह बताने में माहिर हैं कि, "यदि कार यहाँ है, तो वह वहाँ जाएगी।" लेकिन वे पीछे की ओर देखने में बहुत खराब हैं। जब निर्देशक B आखिरी फ्रेम से पीछे की ओर काम करने की कोशिश करता है, तो AI भ्रमित हो जाता है। बजाय इसके कि वह सोचे, "कार बाईं ओर से आई थी," वह अक्सर सोचता है, "कार बाईं ओर जा रही है।"

इससे मोशन प्रायर कॉन्फ्लिक्ट (Motion Prior Conflict) पैदा होता है।

  • निर्देशक A कहता है: "आगे बढ़ो!"
  • निर्देशक B कहता है: "पीछे जाओ!"

जब आप उनके विचारों को मिलाने की कोशिश करते हैं, तो परिणाम एक ग्लिच वाला (glitchy) दृश्य होता है। कार बीच के दृश्य में झिलमिला सकती है, धुंधली (ghost) हो सकती है या अचानक दिशा बदल सकती है। यह वैसा ही है जैसे आगे चलने की कोशिश करना जबकि कोई दूसरा आपको पीछे खींच रहा हो; आप अपनी जगह पर लड़खड़ाने लगते हैं।

समाधान: मोशन प्रायर डिस्टिलेशन (MPD)

इस शोध के लेखकों ने एक चतुर समाधान प्रस्तावित किया है जिसे मोशन प्रायर डिस्टिलेशन (Motion Prior Distillation) कहा जाता है।

इसे इस तरह सोचें: दोनों निर्देशकों को बहस करने देने के बजाय, आप निर्देशक B की कल्पना को फायर (निकाल) कर देते हैं और उन्हें केवल निर्देशक A की स्क्रिप्ट दे देते हैं, लेकिन उसे उल्टा चलाकर।

यह कैसे काम करता है, इसके सरल चरण यहाँ दिए गए हैं:

  1. फॉरवर्ड पाथ (Forward Path) को देखें: सबसे पहले, AI शुरुआत से अंत तक जाने वाले वीडियो का एक कच्चा ड्राफ्ट तैयार करता है। यह "मोशन एनर्जी" या "रेसिड्यूल" (अवशेष) को कैप्चर करता है (यानी अंतर कि कार अभी कहाँ है और एक पल पहले कहाँ थी)।
  2. मोशन को डिस्टिल करें: AI इस फॉरवर्ड पाथ से इस "मोशन एनर्जी" को लेता है और इसे डिस्टिल करता है (जैसे किसी चीज़ से उसका सार निकालना) और फिर इसे बैकवर्ड पाथ (पीछे की ओर जाने वाले पथ) में डाल देता है।
  3. जादुई ट्रिक: जब AI पीछे का रास्ता (अंत से शुरुआत तक) बनाने की कोशिश करता है, तो वह एंड फ्रेम से यह नहीं पूछता कि, "तुम कहाँ से आए थे?" इसके बजाय, वह कहता है, "मुझे पता है कि कार आगे कैसे बढ़ी, इसलिए मैं वापस शुरुआत तक पहुँचने के लिए बस उस विशिष्ट गति को उलट (reverse) दूँगा।"

ऐसा करके, AI पीछे की गति का अनुमान लगाना बंद कर देता है और बस फॉरवर्ड मोशन को रिवर्स कर देता है। यह सुनिश्चित करता है कि कार अचानक विपरीत दिशा में जाने का निर्णय न ले ले। यह एक एकल, सुसंगत कहानी बनाता है जहाँ कार बिना किसी घोस्टिंग या भ्रम के सुचारू रूप से A से B तक चलती है।

यह बेहतर क्यों है?

  • कोई घोस्टिंग नहीं: पिछले तरीकों में, कार दो कारों के ओवरलैप होने जैसी दिख सकती थी क्योंकि दोनों निर्देशक एक-दूसरे से सहमत नहीं हो पाते थे। MPD के साथ, केवल एक निर्देशक का तर्क होता है, इसलिए कार ठोस और वास्तविक दिखती है।
  • कोई अतिरिक्त ट्रेनिंग नहीं: आमतौर पर, इन AI ग्लिच को ठीक करने के लिए, आपको पूरे मॉडल को फिर से प्रशिक्षित करना पड़ता है, जिसमें हफ्तों और विशाल कंप्यूटरों की आवश्यकता होती है। यह एक "प्लग-एंड-प्ले" ट्रिक है। आपको AI को कुछ नया सिखाने की ज़रूरत नहीं है; आप बस जनरेशन प्रक्रिया के दौरान उसके सोचने के तरीके को बदलते हैं।
  • सुचारू फिल्में: परिणाम एक ऐसा वीडियो है जहाँ गति स्वाभाविक, निरंतर और भौतिक रूप से संभव लगती है, भले ही शुरुआती और अंतिम फ्रेम समय में एक-दूसरे से बहुत दूर हों।

उपमा: हाइकर और मैप (Hiker and the Map)

कल्पना कीजिए कि आप एक ट्रेलहेड (शुरुआत) से पहाड़ की चोटी (अंत) तक हाइकिंग कर रहे हैं।

  • पुराना तरीका: आप ट्रेलहेड पर मौजूद गाइड से पूछते हैं, "मैं चोटी तक कैसे पहुँचूँ?" और चोटी पर मौजूद गाइड से पूछते हैं, "मैं यहाँ कैसे पहुँचा?" चोटी वाला गाइड, जिसने कभी चढ़ाई नहीं की है, गलती से आपको पहाड़ से नीचे या गोल-गोल घूमने के लिए इशारा कर सकता है। आप खो जाते हैं।
  • नया तरीका (MPD): आप ट्रेलहेड वाले गाइड से रास्ता पूछते हैं। फिर, आप उसी रास्ते को लेते हैं और उसे बस उल्टा चलते हैं। आपको पता है कि आपका हर कदम कहाँ जा रहा है क्योंकि आप बस उन कदमों को दोहरा रहे हैं जो आपने पहले ही तय किए थे। आप चोटी पर पूरी तरह से पहुँच जाते हैं, और यदि आप मुड़ते हैं, तो आप जानते हैं कि बिना भटके वापस नीचे कैसे आना है।

सारांश

यह पेपर ग्लिच वाले AI वीडियो को ठीक करने के लिए एक स्मार्ट, ट्रेनिंग-फ्री ट्रिक पेश करता है। यह महसूस करते हुए कि "पीछे देखना" AI को भ्रमित करता है, वे बस "फॉरवर्ड" मोशन को लेते हैं, उसके सार को डिस्टिल करते हैं, और बैकवर्ड जनरेशन को मजबूर करते हैं कि वह उस सटीक पथ का उल्टा पालन करे। परिणाम? सुचारू, वास्तविक वीडियो जो टूटे हुए VCR टेप की तरह नहीं दिखते।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →