← नवीनतम पेपर
💻 computer science

Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation

Pusa V1.0 एक नॉन-डिस्ट्रक्टिव वेक्टराइज्ड टाइमस्टेप अडैप्टेशन (VTA) विधि पेश करता है जो प्रीट्रेन्ड वीडियो डिफ्यूजन मॉडल्स में इमेज-टू-वीडियो कन्वर्जन, स्टार्ट-एंड फ्रेम कंडीशनिंग और वीडियो एक्सटेंशन सहित सूक्ष्म, ज़ीरो-शॉट टेम्पोरल कंट्रोल को सक्षम बनाता है, जबकि बेस मॉडल की मूल जेनरेटिव क्षमताओं को पूरी तरह से सुरक्षित रखता है।

मूल लेखक: Yaofang Liu, Yumeng Ren, Aitor Artola, Yuxuan Hu, Xiaodong Cun, Xiaotong Zhao, Alan Zhao, Raymond H. Chan, Suiyun Zhang, Rui Liu, Dandan Tu, Jean-Michel Morel

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yaofang Liu, Yumeng Ren, Aitor Artola, Yuxuan Hu, Xiaodong Cun, Xiaotong Zhao, Alan Zhao, Raymond H. Chan, Suiyun Zhang, Rui Liu, Dandan Tu, Jean-Michel Morel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक मास्टर शेफ है जो शून्य से एक विशिष्ट प्रकार का व्यंजन बनाने में अविश्वसनीय रूप से कुशल है: टेक्स्ट-टू-वीडियो (Text-to-Video)। आप उन्हें एक रेसिपी (टेक्स्ट प्रॉम्प्ट) देते हैं और वे एक शानदार वीडियो तैयार कर देते हैं। यह शेफ "बेस मॉडल" (विशेष रूप से, एक मॉडल जिसे Wan-T2V कहा जाता है) है।

हालाँकि, एक समस्या है। यदि आप शेफ को एक विशिष्ट शुरुआती सामग्री (जैसे कि एक बिल्ली की फोटो) देना चाहते हैं और कहना चाहते हैं, "इस बिल्ली से शुरू करते हुए एक वीडियो बनाओ," तो शेफ भ्रमित हो जाता है। पुराने तरीके में, शेफ को बिल्कुल नए सिरे से खाना बनाना सीखना पड़ता था, और इस प्रक्रिया में वह अक्सर अपने मूल व्यंजनों को अच्छी तरह से बनाना भी भूल जाता था। यह ऐसा ही है जैसे शेफ को एक नया हुनर सीखने के लिए उसकी पूरी पाक कला की ट्रेनिंग भुला देने के लिए मजबूर किया जाए।

यहाँ प्रवेश होता है Pusa V1.0 का।

समस्या: "कठोर घड़ी" (The Rigid Clock)

वर्तमान वीडियो AI मॉडल एक कठोर, सिंक्रोनाइज़्ड घड़ी की तरह काम करते हैं। कल्पना कीजिए कि एक वीडियो गिरते हुए डोमिनोज़ की एक पंक्ति है। इन पुराने मॉडलों में, हर एक डोमिनो (फ्रेम) को बिल्कुल एक ही गति और समय पर गिरना होता है।

  • यदि आप चाहते हैं कि पहला डोमिनो खड़ा रहे (आपकी शुरुआती इमेज) जबकि बाकी गिरें, तो घड़ी टूट जाती है।
  • इसे ठीक करने के लिए, अन्य मॉडल शेफ को "रीट्रेन" करने की कोशिश करते हैं, जो महंगा, धीमा है, और अक्सर उनके मूल व्यंजन बनाने की क्षमता को खराब कर देता है।

समाधान: "व्यक्तिगत रिमोट कंट्रोल" (The Individual Remote Controls)

Pusa एक अवधारणा पेश करता है जिसे वेक्टराइज्ड टाइमस्टेप अडैप्टेशन (Vectorized Timestep Adaptation - VTA) कहा जाता है।

पूरे वीडियो के लिए एक मास्टर क्लॉक के बजाय, Pusa हर एक फ्रेम को अपना खुद का रिमोट कंट्रोल देता है।

  • फ्रेम 1 (आपकी शुरुआती इमेज) को एक रिमोट मिलता है जिसे "पॉज़" (Pause) पर सेट किया गया है।
  • फ्रेम 2 को एक रिमोट मिलता है जिसे "धीरे चलें" (Move slowly) पर सेट किया गया है।
  • फ्रेम 3 को एक रिमोट मिलता है जिसे "तेज़ चलें" (Move fast) पर सेट किया गया है।

यह AI को प्रत्येक फ्रेम को स्वतंत्र रूप से विकसित करने की अनुमति देता है। पहला फ्रेम बिल्कुल वहीं रहता है जहाँ आपने उसे रखा था, जबकि बाकी वीडियो उसके चारों ओर स्वाभाविक रूप से बहता है।

जादुई ट्रिक: "नॉन-डिस्ट्रक्टिव" सर्जरी (The "Non-Destructive" Surgery)

सबसे प्रभावशाली हिस्सा यह है कि Pusa इसे कैसे सीखता है।

  • पुराना तरीका: "एक इमेज से शुरू करने" की ट्रिक सीखने के लिए, पुराने मॉडलों (जैसे Wan-I2V) को एक बड़े, विनाशकारी ओवरहाल से गुजरना पड़ता था। उन्हें लाखों उदाहरणों पर फिर से प्रशिक्षित (Retrain) करना पड़ता था, जो मूल रूप से शेफ के मस्तिष्क को फिर से बनाने जैसा था। इसमें कंप्यूटिंग पावर का बहुत खर्च होता था और अक्सर इससे उनकी टेक्स्ट-टू-वीडियो कार्य करने की क्षमता खत्म हो जाती थी।
  • Pusa का तरीका: Pusa "सर्जिकल" समायोजन करता है। यह शेफ के मस्तिष्क को फिर से नहीं बनाता; यह बस मौजूदा मस्तिष्क में एक छोटा, विशिष्ट उपकरण (वेक्टराइज्ड टाइमस्टेप) जोड़ देता है।
    • उपमा: कल्पना कीजिए कि शेफ पहले से ही पूरी तरह से खाना बनाना जानता है। उसे निकालने और नया काम पर रखने के बजाय, आप बस उसे एक विशिष्ट टाइमर थमा देते हैं जो उसे बताता है कि पहले बर्तन को कब चलाना बंद करना है। शेफ के मूल कौशल 100% बरकरार रहते हैं।

परिणाम: सस्ता, तेज़ और बहुमुखी (The Results: Cheap, Fast, and Versatile)

चूंकि Pusa को सब कुछ शून्य से फिर से सीखने की आवश्यकता नहीं है, इसलिए इसके परिणाम आश्चर्यजनक हैं:

  1. अत्यधिक कुशल (Ultra-Efficient): जबकि अन्य मॉडलों को लाखों उदाहरणों और विशाल कंप्यूटिंग बजट (जिसकी लागत $100,000 से अधिक थी) की आवश्यकता थी, Pusa ने केवल 4,000 उदाहरणों और लागत के एक बहुत छोटे हिस्से (लग लगभग $500) के साथ शीर्ष स्तर के परिणाम प्राप्त किए।
  2. ज़ीरो-शॉट सुपरपावर्स (Zero-Shot Superpowers): क्योंकि शेफ का मस्तिष्क बदला नहीं गया था, Pusa ने न केवल एक इमेज से शुरू करने की क्षमता सीखी। इसने बिना किसी अतिरिक्त प्रशिक्षण के अन्य जटिल चीजें करने की क्षमता भी तुरंत हासिल कर ली, जैसे:
    • स्टार्ट-एंड फ्रेम्स (Start-End Frames): AI को शुरुआत और अंत के लिए एक तस्वीर देना, और बीच के हिस्से को भरना।
    • वीडियो एक्सटेंशन (Video Extension): एक छोटे वीडियो को लेकर उसे सहजता से लंबा बनाना।
    • टेक्स्ट-टू-वीडियो (Text-to-Video): इसने टेक्स्ट प्रॉम्प्ट से वीडियो बनाने की अपनी मूल क्षमता को पूरी तरह से बनाए रखा।

सारांश

Pusa V1.0 एक कार को अलग किए बिना उसके इंजन को अपग्रेड करने जैसा है। हर फ्रेम को अपना स्वयं का "टाइम डायल" देकर, बजाय इसके कि उन्हें एक साथ चलने के लिए मजबूर किया जाए, यह मॉडल जटिल वीडियो कार्यों (जैसे किसी विशिष्ट इमेज से शुरू करना) को अविश्वसनीय दक्षता के साथ संभाल सकता है। यह मूल मॉडल की बुद्धिमत्ता को सुरक्षित रखता है और नई, लचीली क्षमताओं को अनलॉक करता है, जिससे उच्च-गुणवत्ता वाला वीडियो जेनरेशन बहुत सस्ता और अधिक सुलभ हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →