← नवीनतम पेपर
💻 computer science

Improving Motion in Image-to-Video Models via Adaptive Low-Pass Guidance

यह शोध पत्र अडैप्टिव लो-पास गाइडेंस (ALG) प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त विधि है जो इमेज-टू-वीडियो जनरेशन में मोशन डायनेमिक्स को बेहतर बनाती है, जो शुरुआती डिनोइजिंग चरणों के दौरान कंडीशनिंग इमेज से हाई-फ्रीक्वेंसी विवरणों को फ़िल्टर करती है, जिससे इमेज क्वालिटी और टेक्स्ट अलाइनमेंट को बनाए रखते हुए मॉडल को स्थिर स्वरूपों (static appearances) पर ओवरफिट होने से रोका जा सके।

मूल लेखक: June Suk Choi, Kyungmin Lee, Sihyun Yu, Yisol Choi, Jinwoo Shin, Kimin Lee

प्रकाशित 2026-02-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: June Suk Choi, Kyungmin Lee, Sihyun Yu, Yisol Choi, Jinwoo Shin, Kimin Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Improving Motion in Image-to-Video Models via Adaptive Low-Pass Guidance" पेपर का सरल, बोलचाल की भाषा और रचनात्मक उपमाओं (analogies) के साथ हिंदी अनुवाद दिया गया है।

समस्या: "फ्रोज़न फ्रेम" (स्थिर फ्रेम) प्रभाव

कल्पना कीजिए कि आपके पास एक जादुई फोटो फ्रेम है (Image-to-Video AI)। आप उसमें बिल्ली की एक तस्वीर रखते हैं और उससे कहते हैं, "बिल्ली को दौड़ते हुए दिखाओ।"

आदर्श रूप से, बिल्ली को स्क्रीन पर तेज़ी से दौड़ना चाहिए। लेकिन वास्तव में, ये AI मॉडल अक्सर अटक जाते हैं। बिल्ली बस हल्की सी हिलती-डुलती सी लगती है। यह एक जीवंत वीडियो के बजाय एक उच्च-गुणवत्ता वाली स्थिर फोटो जैसा दिखता है जो बस थोड़ा सा थरथरा रही है।

शोधकर्ताओं ने पता लगाया कि ऐसा क्यों होता है। यह ऐसा है जैसे AI मूल फोटो के विवरणों के प्रति बहुत अधिक जुनूनी हो जाता है।

  • उपमा: कल्पना कीजिए कि एक चित्रकार को बिल्ली की एक फोटो दी जाती है और उसे बिल्ली के दौड़ने का वीडियो बनाने के लिए कहा जाता है। यदि चित्रकार फोटो के सूक्ष्म विवरणों (जैसे मूंछों का सटीक आकार, बालों की बनात्मक बनावट) को बहुत बारीकी से देखता है, तो वह वहीं "लॉक" हो जाता है। वह उन छोटे विवरणों को पूरी तरह से मिलाने में इतना समय बिता देता है कि वह गति (movement) बनाना ही भूल जाता है। परिणाम स्वरूप, एक सुंदर, स्थिर पेंटिंग मिलती है जो कभी हिलती नहीं है।

तकनीकी शब्दों में, AI मूल छवि के उच्च-आवृत्ति वाले विवरणों (sharp edges, textures) से "ओवर-कंडीशन्ड" हो जाता है। यह छवि के लुक को तुरंत कॉपी करने का एक "शॉर्टकट" लेता है, जिससे गति (motion) का बलिदान हो जाता है।

एक सरल समाधान (लेकिन एक पेंच के साथ)

शोधकर्ताओं ने पहले एक सरल ट्रिक आजमाई: AI को दिखाने से पहले फोटो को धुंधला (blur) कर दें।

  • उपमा: यदि आप चित्रकार को बिल्ली की एक धुंधली, कम-रिज़ॉल्यूशन वाली फोटो देते हैं, तो वह छोटी मूंछों पर अटक नहीं पाएगा। उसे बड़े चित्र पर ध्यान केंद्रित करना होगा: "ठीक है, बिल्ली यहाँ है, और इसे दौड़ना है।" क्योंकि विवरण धुंधले हैं, चित्रकार को एक गतिशील और प्रवाहमयी गति बनाने के लिए मजबूर होना पड़ता है।
  • पेंच: हालांकि गति बेहतरीन होती है, लेकिन अंतिम वीडियो धुंधला और कम गुणवत्ता वाला दिखता है क्योंकि AI ने एक धुंधली छवि से शुरुआत की थी। आपको एक गतिशील वीडियो तो मिलता है, लेकिन वह मूल बिल्ली जैसा नहीं दिखता।

समाधान: "एडैप्टिव लो-पास गाइडेंस" (ALG)

टीम ने एक चतुर, दो-चरणीय रणनीति विकसित की जिसे ALG कहा जाता है। इसे एक ऐसे निर्देशक (Director) के रूप में सोचें जो जानता है कि कब सख्त होना है और कब ढीला छोड़ना है।

यहाँ बताया गया है कि ALG कैसे काम करता है, चरण-दर-चरण:

  1. "धुंधली शुरुआत" (शुरुआती चरण):
    वीडियो निर्माण के बिल्कुल प्रारंभ में (पेंटिंग के पहले कुछ सेकंड में), AI को इनपुट इमेज का एक धुंधला संस्करण (blurred version) दिखाया जाता है।

    • क्यों? यह AI को सूक्ष्म विवरणों के प्रति जुनूनी होने से रोकता है। यह AI को बड़ी गति (big motion) पर ध्यान केंद्रित करने के लिए मजबूर करता है: "बिल्ली दौड़ रही है!" यह वीडियो के लिए एक गतिशील, प्रवाहमयी ढांचा तैयार करता है।
  2. "स्पष्ट समापन" (बाद के चरण):
    एक बार जब गति स्थापित हो जाती है और वीडियो बहने लगता है, तो AI को अचानक मूल, स्पष्ट और उच्च-गुणवत्ता वाली फोटो दिखाई जाती है।

    • क्यों? अब जब "दौड़ने" की क्रिया पहले से ही हो रही है, तो AI सुरक्षित रूप से सभी तीखे विवरण (बाल, मूंछें, आँखें) वापस जोड़ सकता है बिना अटके। यह धुंधली गति को एक स्पष्ट, हाई-डेफिनिशन वीडियो में बदल देता है।

रूपक (Metaphor):
एक घर बनाने की कल्पना करें।

  • पुराना तरीका (Standard AI): आप हर एक ईंट को पूरी तरह से बिछाने की कोशिश करते हैं जबकि नींव अभी भी गीली होती है। घर खड़ा तो हो जाता है, लेकिन दीवारें टेढ़ी हो जाती हैं क्योंकि आप ईंटों पर बहुत अधिक ध्यान केंद्रित कर रहे थे।
  • "ब्लर" वाला तरीका: आप पूरा घर कीचड़ से बनाते हैं। यह बहुत अच्छी तरह से हिलता और बहता है, लेकिन यह कीचड़ का ढेर है।
  • ALG वाला तरीका: पहले आप एक मोटा, तेज़-गति वाला मिट्टी का ढांचा बनाते हैं ताकि आकार और प्रवाह सही रहे (गति)। फिर, एक बार जब आकार ठोस हो जाता है, तो आप मिट्टी को हटाकर सटीक, स्पष्ट ईंटों का उपयोग करते हैं (विवरण)। आपको एक ऐसा घर मिलता है जो गतिशील भी है और सुंदर भी।

परिणाम

शोधकर्ताओं ने कई लोकप्रिय AI वीडियो मॉडलों (जैसे Wan 2.1, Wan 2.2, और LTX-Video) पर इसका परीक्षण किया।

  • मोशन बूस्ट: वीडियो 33% अधिक गतिशील हो गए। जानवर तेज़ी से दौड़े, कारें स्वाभाविक रूप से चलीं, और दृश्य जीवंत महसूस हुए।
  • गुणवत्ता बरकरार: "धुंधली शुरुआत" वाले तरीके के विपरीत, अंतिम वीडियो मूल की तरह ही स्पष्ट और उच्च-गुणवत्ता वाले थे।
  • कोई ट्रेनिंग आवश्यक नहीं: सबसे अच्छी बात? उन्हें AI को फिर से सिखाने की ज़रूरत नहीं पड़ी। उन्होंने बस निर्माण प्रक्रिया के दौरान फोटो को देखने के "नियमों" को बदल दिया। यह एक मुफ्त अपग्रेड है!

सारांश

यह पेपर AI वीडियो के बहुत स्थिर होने की समस्या को हल करता है, यह सिखाकर कि AI को शुरुआत में सूक्ष्म विवरणों को अनदेखा करना चाहिए (गति को बढ़ावा देने के लिए) और अंत में उन्हें वापस जोड़ना चाहिए (गुणवत्ता सुनिश्चित करने के लिए)। यह एक डांसर को यह बताने जैसा है: "पहले, बस लय और बड़े मूव्स पर ध्यान दो। अपने जूतों की चिंता मत करो। एक बार जब तुम मूव करने लगो, तब हम जूतों को पॉलिश करेंगे।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →