← नवीनतम पेपर
💻 computer science

Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator

Uni-ViGU एक जनरेशन-केंद्रित ढांचे का प्रस्ताव करता है जो एक यूनिफाइड फ्लो मैचिंग पद्धति और एक द्विदिशीय प्रशिक्षण तंत्र के साथ एक डिफ्यूजन-आधारित वीडियो जनरेटर का विस्तार करके वीडियो जनरेशन और समझ को एकीकृत करता है, जो दोनों डोमेन में प्रतिस्पर्धी प्रदर्शन प्राप्त करने के लिए इन कार्यों के बीच कम्प्यूटेशनल असंतुलन को प्रभावी ढंग से दूर करता है।

मूल लेखक: Luozheng Qin, Jia Gong, Qian Qiao, Tianjiao Li, Li Xu, Haoyu Pan, Chao Qu, Zhiyu Tan, Hao Li

प्रकाशित 2026-04-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Luozheng Qin, Jia Gong, Qian Qiao, Tianjiao Li, Li Xu, Haoyu Pan, Chao Qu, Zhiyu Tan, Hao Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसा रोबोट बनाने की कोशिश कर रहे हैं जो एक महारत हासिल चित्रकार (master painter) भी हो और एक तेज तर्रार कला समीक्षक (art critic) भी।

परंपरागत रूप से, वैज्ञानिक इस रोबोट को बनाने के लिए एक शानदार कला समीक्षक (एक मॉडल जो छवियों को समझता है) से शुरुआत करते थे और फिर उसे पेंटिंग करना सिखाने की कोशिश करते थे। लेकिन इसमें एक बड़ी समस्या है: पेंटिंग करना थका देने वाला काम है। एक उच्च गुणवत्ता वाला वीडियो बनाने के लिए, रोबोट को लाखों छोटी, दोहराव वाली गणनाएं करनी पड़ती हैं (जैसे रेत के एक कण से मूर्ति तराशने की कोशिश करना)। एक समीक्षक को यह भारी काम करने के लिए प्रशिक्षित करना धीमा, महंगा और अक्सर अव्यवसायिक पेंटिंग का परिणाम देता है।

Uni-ViGU इस पटकथा को उलट देता है। एक समीक्षक को पेंटिंग करना सिखाने के बजाय, शोधकर्ताओं ने एक महारत हासिल चित्रकार (एक शक्तिशाली वीडियो जनरेटर) से शुरुआत की और फिर उसे समीक्षक बनना सिखाया।

उन्होंने इसे कैसे किया, यहाँ कुछ सरल उपमाओं का उपयोग करके बताया गया है:

1. "दो-ट्रैक" ट्रेन सिस्टम (एकीकृत प्रवाह - Unified Flow)

एक रेलवे स्टेशन की कल्पना करें जहाँ दो अलग-अलग प्रकार की ट्रेनें आती हैं:

  • वीडियो ट्रेनें: ये पानी की चिकनी, निरंतर धाराओं की तरह हैं (जैसे एक नदी)। चित्र बनाने के लिए उन्हें धीरे-से बहने की आवश्यकता होती है।
  • टेक्स्ट ट्रेनें: ये अलग-अलग, ब्लॉक जैसे लेगो (Lego) ईंटों से बनी होती हैं। वे एक-एक करके आपस में जुड़ती हैं।

आमतौर पर, इन्हें संभालने के लिए आपको दो अलग-अलग स्टेशनों की आवश्यकता होती है। लेकिन Uni-ViGU ने एक सुपर-स्टेशन बनाया जो दोनों को एक साथ संभालता है।

  • यह वीडियो को एक नदी की तरह मानता है जिसे सुधारा जाना चाहिए (निरंतर प्रवाह - Continuous Flow)।
  • यह टेक्स्ट को लेगो ईंटों की तरह मानता है जिन्हें अपनी जगह पर फिट होना चाहिए (विच्छिन्न प्रवाह - Discrete Flow)।
  • जादू: स्टेशन दोनों ट्रेनों को एक ही ट्रैक पर एक साथ चलाता है। जैसे-जैसे वीडियो स्पष्ट होता है, टेक्स्ट अधिक सटीक होता जाता है, और वे रास्ते में एक-दूसरे की मदद करते हैं।

2. "साझा मस्तिष्क, विशिष्ट हाथ" (MoE आर्किटेक्चर)

AI मॉडल को एक कारखाने के रूप में सोचें जिसमें एक केंद्रीय मस्तिष्क (Brain) और कई हाथ (Hands) हैं।

  • मस्तिष्क (अटेंशन लेयर्स - Attention Layers): यह हिस्सा समझता है कि चीजें एक-दूसरे से कैसे संबंधित हैं। "कुत्ता गेंद का पीछा कर रहा है।" यह तर्क शब्दों और चित्रों के बीच समान रहता है। Uni-ViGU इस मस्तिष्क को दोनों कार्यों के लिए साझा (shared) रखता है।
  • हाथ (FFN लेयर्स - FFN Layers): यहीं पर वास्तविक काम होता है।
    • वीडियो हाथ: ये पहले से ही मजबूत हैं क्योंकि मॉडल को पेंटिंग करने के लिए प्री-ट्रेन किया गया था। वे अपनी मूल, शक्तिशाली मांसपेशियों को बनाए रखते हैं।
    • टेक्स्ट हाथ: ये नए और कमजोर हैं। इसलिए, शोधकर्ताओं ने मॉडल को लिखने के लिए विशेष रूप से समर्पित हाथों का एक दूसरा जोड़ा दिया।

परिणाम: मॉडल शब्दों और चित्रों के संबंध को समझने के लिए अपने साझा मस्तिष्क का उपयोग करता है, लेकिन भारी काम करने के लिए यह अपने विशिष्ट हाथों का उपयोग करता है। इसे पेंटिंग करना फिर से सीखने की आवश्यकता नहीं है; इसे बस यह सीखना है कि जो वह पेंट कर रहा है उसका वर्णन कैसे किया जाए।

3. "रिवर्स इंजीनियरिंग" प्रशिक्षण (द्विदिश शिक्षण - Bidirectional Learning)

आप एक चित्रकार को समीक्षक कैसे बनाते हैं? आप एक दो-चरणीय प्रशिक्षण शिविर का उपयोग करते हैं:

  • चरण 1: स्मृति खेल (ज्ञान की पुनरावृत्ति - Knowledge Recall)
    मॉडल को एक वीडियो और एक छोटा, अस्पष्ट प्रॉम्प्ट (जैसे, "एक बिल्ली") दिखाया जाता है। इसे केवल वीडियो के आधार पर प्रॉम्प्ट को फिर से बनाने के लिए कहा जाता है।

    • क्यों? चूंकि मॉडल पहले से ही जानता है कि "एक बिल्ली" को वीडियो में कैसे बदलना है, इसलिए यह प्रक्रिया को आसानी से उल्टा कर सकता है: वीडियो को वापस "एक बिल्ली" में बदलना। यह शब्दों और छवियों के बीच के संबंध की इसकी स्मृति को जगा देता है।
  • चरण 2: जासूसी कार्य (क्षमता का परिशोधन - Capability Refinement)
    अब, मॉडल को एक वीडियो और एक छोटा प्रॉम्प्ट दिखाया जाता है, लेकिन इसे वीडियो के बारे में एक लंबी, विस्तृत कहानी लिखने के लिए कहा जाता है (जैसे, "एक भूरे रंग की बिल्ली जिसके गले में नीला पट्टा है, एक हरे घास के मैदान में लाल गेंद का पीछा कर रही है...")।

    • क्यों? छोटा प्रॉम्प्ट इतनी लंबी कहानी लिखने के लिए पर्याप्त नहीं है। मॉडल को खाली जगहों को भरने के लिए वीडियो के विवरण (फर, रंग, गति) को बारीकी से देखने के लिए मजबूर किया जाता है। यह इसे एक तेज पर्यवेक्षक बनने के लिए मजबूर करता है।

यह क्यों मायने रखता है

पुराना तरीका ऐसा था जैसे किसी इंसान को जमीन पर तेजी से दौड़ने के लिए मजबूर करके उड़ना सिखाना। यह अक्षम है।
Uni-ViGU कहता है: "आइए एक ऐसे पक्षी से शुरुआत करें जो पहले से ही उड़ना जानता है, और उसे गाना सिखाएं।"

एक वीडियो जनरेटर (पक्षी) से शुरुआत करके, मॉडल के पास पहले से ही दृश्य दुनिया के बारे में गहरी, सहज समझ है। बस कुछ "टेक्स्ट हाथ" जोड़कर और इसे अपनी ही रचनाओं को रिवर्स-इंजीनियर करने के लिए प्रशिक्षित करके, उन्होंने एक ऐसा सिस्टम बनाया है जो है:

  1. सस्ता: इसे वीडियो की बुनियादी बातें फिर से सीखने की आवश्यकता नहीं है।
  2. स्मार्ट: यह शब्दों और चित्रों के बीच के संबंध को बेहतर ढंग से समझता है क्योंकि इसने इसे अंदर से सीखा है।
  3. एकीकृत: यह टेक्स्ट से वीडियो उत्पन्न कर सकता है, टेक्स्ट के साथ वीडियो का वर्णन कर सकता है, या यहाँ तक कि एक ही समय में दोनों को उत्पन्न कर सकता है, सब एक ही पैकेज में।

संक्षेप में, Uni-ViGU यह सिद्ध करता है कि वीडियो को समझने का सबसे अच्छा तरीका यह है कि पहले उसे बनाना सीखा जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →