← नवीनतम पेपर
🤖 AI

Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models

यह शोध पत्र DyMoS को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त और मॉडल-अज्ञेय (model-agnostic) विधि है जो अटेंशन मैकेनिज्म में संदर्भ-फ्रेम के प्रभुत्व को पुनर्संतुलित करके इमेज-टू-वीडियो जनरेशन में मोशन डायनेमिक्स को बढ़ाती है, जिससे विजुअल फिडेलिटी से समझौता किए बिना या अतिरिक्त प्रशिक्षण की आवश्यकता के बिना मोशन सप्रेशन (motion suppression) पर विजय प्राप्त की जाती है।

मूल लेखक: Wooseok Jeon, Seungho Park, Seunghyun Shin, Sangeyl Lee, Hyeonho Jeong, Hae-Gon Jeon

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wooseok Jeon, Seungho Park, Seunghyun Shin, Sangeyl Lee, Hyeonho Jeong, Hae-Gon Jeon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: "जमी हुई" वीडियो (The "Frozen" Video)

कल्पना कीजिए कि आपके पास एक घोड़े की तस्वीर है, और आप कंप्यूटर से उस घोड़े को दौड़ते हुए वीडियो में बदलने के लिए कहते हैं। आप उम्मीद करेंगे कि घोड़ा दौड़ रहा होगा। लेकिन अक्सर, वर्तमान AI मॉडल आपकी मूल फोटो के प्रति बहुत अधिक "विनम्र" होते हैं। वे घोड़े को अपनी जगह पर स्थिर रखते हैं, शायद केवल उसके कान हिलाते हुए, क्योंकि वे उस तस्वीर को बदलने से बहुत डरते हैं जो आपने उन्हें दी है।

पेपर इसे "Static Motion Bias" (स्थिर गति पूर्वाग्रह) कहता है। AI इस बात पर इतना केंद्रित है कि वह पहली फ्रेम (संदर्भ छवि) को एकदम सटीक रखे, कि वह बाकी वीडियो को चलाने के लिए भूल जाता है।

खोज: "अति-सतर्क" छात्र (The "Over-Attentive" Student)

शोधकर्ताओं ने इस बात की जांच की कि ये AI मॉडल कैसे काम करते हैं। उन्होंने एक विशिष्ट व्यवहार देखा जिसे वे "Reference-Frame Dominance" (संदर्भ-फ्रेम प्रभुत्व) कहते हैं।

AI मॉडल को एक छात्र के रूप में सोचें जो परीक्षा दे रहा है:

  • टेक्स्ट प्रॉम्प्ट (Text Prompt) प्रश्न है: "घोड़े को दौड़ने दो।"
  • संदर्भ छवि (Reference Image) डेस्क पर रखी घोड़े की तस्वीर है।

एक सामान्य Text-to-Video मॉडल में, छात्र प्रश्न को देखता है और दौड़ते हुए घोड़े की कल्पना करता है।
एक Image-to-Video मॉडल में, छात्र डेस्क पर रखी तस्वीर को बहुत गहराई से घूर रहा है। जब भी छात्र वीडियो का अगला फ्रेम बनाने की कोशिश करता है, वह तस्वीर को देखता है और कहता है, "ठीक है, मुझे अगला फ्रेम बिल्कुल इस तस्वीर जैसा ही बनाना होगा।"

क्योंकि छात्र तस्वीर की नकल करने के प्रति जुनूनी है, वह वास्तव में घोड़े को हिलते हुए नहीं बना पाता। "तस्वीर" उसकी "कल्पना" पर हावी हो जाती है।

समाधान: DyMoS (द "मोशन स्लाइडर")

शोधकर्ताओं ने DyMoS (डायनेमिक मोशन स्लाइडर) नामक एक टूल बनाया है। इसके लिए AI को फिर से प्रशिक्षित (retrain) करने या मूल फोटो को बदलने की आवश्यकता नहीं है। इसके बजाय, यह छात्र के जुनून के लिए एक 'वॉल्यूम नॉब' (volume knob) की तरह काम करता है।

यह कैसे काम करता है:

  1. हस्तक्षेप (The Intervention): वीडियो बनाने के शुरुआती कुछ क्षणों के दौरान ("डिनोइजिंग" चरणों में), DyMoS छात्र को धीरे से कंधे पर थपथपाता है। यह कहता है, "हे, संदर्भ तस्वीर को इतनी गहराई से घूरना बंद करो। अब तुम्हें गति की कल्पना करनी होगी।"
  2. तंत्र (The Mechanism): तकनीकी रूप से, यह AI के अटेंशन सिस्टम में एक विशिष्ट संख्या (एक "बायस") को एडजस्ट करता है। यह उस स्कोर को थोड़ा कम कर देता है जो AI संदर्भ छवि के टोकन को देता है, जब वह यह तय करने की कोशिश कर रहा होता है कि अगला फ्रेम कैसा दिखना चाहिए।
  3. परिणाम (The Result): AI को अभी भी तस्वीर देखने की अनुमति है (ताकि घोड़ा अभी भी घोड़े जैसा ही दिखे), लेकिन अब उसे उसे पूरी तरह से कॉपी करने के लिए मजबूर नहीं किया जाता है। यह AI को घोड़े को दौड़ने, कार चलाने, या पानी छलकने देने के लिए स्वतंत्र करता है।

"स्लाइडर" फीचर

सबसे अच्छी बात यह है कि DyMoS एक स्लाइडर है, न कि केवल एक ऑन/ऑफ स्विच। उपयोगकर्ता के पास एक नंबर है जिसे वे घुमा सकते हैं:

  • इसे नीचे घुमाएं (Negative numbers): AI तस्वीर के प्रति अधिक जुनूनी हो जाता है। वीडियो और भी अधिक स्थिर हो जाता है (यदि आप चाहते हैं कि एक स्थिर छवि बहुत कम हिले)।
  • इसे ऊपर घुमाएं (Positive numbers): AI को तस्वीर के "जमे हुए" स्वभाव को अनदेखा करने के लिए कहा जाता है। वीडियो बहुत गतिशील और ऊर्जावान हो जाता है।
  • मध्य मार्ग (Middle ground): आप वह सही संतुलन पा सकते हैं जहाँ वीडियो स्वाभाविक रूप से चलता है लेकिन पात्र अभी भी आपकी शुरुआती फोटो जैसा ही दिखता है।

यह पिछले तरीकों से बेहतर क्यों है?

"जमी हुई वीडियो" की इस समस्या को ठीक करने के पिछले प्रयास ऐसे थे जैसे इंजन को तोड़ने या पहियों पर पेंट करने से कार को ठीक करने की कोशिश करना।

  • कुछ तरीकों के लिए पूरे AI को पुनः प्रशिक्षित (retraining) करने की आवश्यकता थी (जो महंगा और धीमा है)।
  • अन्य तरीकों ने इनपुट इमेज को धुंधला या खराब करने की कोशिश की ताकि गति पैदा की जा सके, जिससे अक्सर वीडियो बदसूरत या विकृत दिखने लगता था।

DyMoS अलग है क्योंकि:

  1. यह ट्रेनिंग-मुक्त (Training-Free) है: आपको AI को कुछ भी नया सिखाने की आवश्यकता नहीं है। आप बस AI के काम करते समय इस टूल का उपयोग करते हैं।
  2. यह मॉडल-स्वतंत्र (Model-Agnostic) है: यह लगभग किसी भी आधुनिक वीडियो AI (जैसे Wan 2.2, HunyuanVideo, CogVideoX) पर काम करता है।
  3. यह गुणवत्ता बनाए रखता है: यह वीडियो को बिना धुंधला या अजीब बनाए गति प्रदान करता है।

सारांश

पेपर यह पहचानता है कि Image-to-Video मॉडल अपनी इनपुट छवियों के प्रति "बहुत विनम्र" होते हैं, जिससे वीडियो उबाऊ और स्थिर हो जाते हैं। उन्होंने इसे DyMoS के साथ ठीक किया, जो एक सरल टूल है जो वॉल्यूम नॉब की तरह काम करता है, जो AI के शुरुआती फोटो के प्रति जुनून को बस इतना कम कर देता है कि गति होने के लिए पर्याप्त जगह मिल सके, और यह सब मॉडल या मूल छवि को बदले बिना किया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →