← नवीनतम पेपर
🤖 machine learning

Corruption-Aware Training of Latent Video Diffusion Models for Robust Text-to-Video Generation

यह शोध पत्र CAT-LVDM को प्रस्तुत करता है, जो लेटेंट वीडियो डिफ्यूजन मॉडल्स के लिए एक करप्शन-अवेयर ट्रेनिंग फ्रेमवर्क है, जो संरचनात्मक, डेटा-एलाइन ऑपरेटरों (BCNI और SACN) का उपयोग करता है ताकि शोर युक्त कंडीशनिंग के विरुद्ध मजबूती को महत्वपूर्ण रूप से बढ़ाया जा सके और काफी कम डेटा पर प्रशिक्षित बड़े बेसलाइन्स से बेहतर प्रदर्शन करते हुए वीडियो जनरेशन की गुणवत्ता में सुधार किया जा सके।

मूल लेखक: Chika Maduabuchi, Hao Chen, Yujin Han, Jindong Wang

प्रकाशित 2026-03-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chika Maduabuchi, Hao Chen, Yujin Han, Jindong Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कलाकार को एक लिखित विवरण के आधार पर फिल्म का एक दृश्य पेंट करना सिखा रहे हैं। आप रोबोट से कहते हैं, "एक बिल्ली छुट्टियों के सजावटी गोलों (baubles) के साथ खेल रही है।"

Latent Video Diffusion Models (LVDMs) की दुनिया में, रोबोट केवल एक चित्र नहीं बनाता; वह एक धुंधले, स्थिर शोर (static mess) से शुरू करता है और धीरे-धीरे एक स्पष्ट वीडियो उभरने तक, फ्रेम-दर-फ्रेम इसे "डिनोइज़" (denoise) करता है। यह कोहरे से एक मूर्ति तराशने जैसा है: आप एक बादल से शुरू करते हैं और आकार प्रकट करने के लिए धीरे-धीरे धुंध को हटाते जाते हैं।

समस्या: "फुसफुसाता हुआ" रोबोट
यह शोध पत्र बताता है कि वर्तमान रोबोट कलाकार में एक बड़ा दोष है: वे अविश्वसनीय रूप से नाजुक हैं। यदि निर्देश थोड़े भी गड़बड़ दिए जाते हैं (जैसे कि कोई टाइपिंग की गलती, आवाज में अजीब लहजा, या थोड़ा भ्रमित करने वाला विवरण), तो रोबोट भ्रमित हो जाता है।

क्योंकि रोबोट फिल्म को चरण-दर-चरण पेंट करता है, पहले चरण में की गई एक छोटी सी गलती भी बढ़ जाती है। जब तक वह फिल्म के अंत तक पहुँचता है, बिल्ली कुत्ते में बदल सकती है, या छुट्टियों के गोले अंतरिक्ष में तैरने लग सकते हैं। रोबंडा रोबोट "सेमेंटिक ड्रिफ्ट" (Semantic Drift) का शिकार होता है, जहाँ कहानी धीरे-धीरे पटरी से उतर जाती है।

मौजूदा तरीकों ने इसे ठीक करने की कोशिश की, जैसे प्रशिक्षण के दौरान निर्देशों में रैंडम स्टैटिक नॉइज़ (जैसे टीवी पर 'स्नोली' चैनल चलाना) जोड़ना। लेकिन लेखक कहते हैं कि यह एक डांसर को लय में रहने के लिए सिखाने के लिए उन पर रेत फेंकने जैसा है। यह वीडियो के लिए काम नहीं करता क्योंकि वीडियो को समय और प्रवाह की आवश्यकता होती है। रैंडम शोर एक फ्रेम और दूसरे फ्रेम के बीच के संबंध को तोड़ देता है।

समाधान: CAT-LVDM (एक "स्मार्ट नॉइज़" कोच)
लेखक एक नई प्रशिक्षण विधि प्रस्तावित करते हैं जिसे CAT-LVDM कहा जाता है। रोबोट पर रैंडम रेत फेंकने के बजाय, वे उसे स्ट्रक्चर्ड, स्मार्ट नॉइज़ (structured, smart noise) को संभालना सिखाते हैं। वे दो विशेष तकनीकों का उपयोग करते हैं, जिन्हें हम दो अलग-अलग कोचिंग शैलियों के रूप में देख सकते हैं:

1. BCNI: "ग्रुप हग" कोच (Batch-Centered Noise Injection)

कल्पना कीजिए कि आप डांसरों के एक समूह को सिखा रहे हैं। प्रत्येक डांसर को रैंडम तरीके से हिलने के लिए कहने के बजाय, आप उन्हें बताते हैं कि वे समूह के औसत के सापेक्ष हिलें।

  • यह कैसे काम करता है: यदि समूह सामान्य रूप से "चल" रहा है, तो कोच थोड़ा सा धक्का देता है ताकि एक डांसर थोड़ा तेज़ या धीमा चले, लेकिन फिर भी वह चल ही रहा हो।
  • उपमा: यह एक शिक्षक की तरह है जो कहता है, "सभी आगे बढ़ रहे हैं। तुम, थोड़ा अधिक आत्मविश्वास के साथ चलने की कोशिश करो। तुम, थोड़ा अधिक सहजता से चलने की कोशिश करो।"
  • परिणाम: रोबोट सीखता है कि "चलना" कई तरह का दिख सकता है, लेकिन उसे हमेशा चलते रहना चाहिए। यह वीडियो को सुसंगत रखता है, भले ही निर्देश थोड़े अस्पष्ट हों।

2. SACN: "बिग पिक्चर" कोच (Spectrum-Aware Contextual Noise)

कल्पना कीजिए कि आप एक फिल्म एडिट कर रहे हैं। आपके पास दो प्रकार के विवरण हैं: बड़े, व्यापक कैमरा मूव्स (लो फ्रीक्वेंसी) और शर्ट पर छोटी लहरें (हाई फ्रीक्वेंसी)।

  • यह कैसे काम करता है: यह कोच केवल बड़े, व्यापक मूव्स के साथ छेड़छाड़ करता है। यह कहता है, "आइए कैमरा थोड़ा तेज़ या धीमा पैन करें," लेकिन यह बिल्ली के बालों की बनावट जैसे सूक्ष्म विवरणों को अकेला छोड़ देता है।
  • उपमा: यह एक निर्देशक की तरह है जो कहता है, "आइए थोड़ा ज़ूम आउट करते हैं," बिना अभिनेता के चेहरे के भाव बदले।
  • परिणाम: रोबोट सीखता है कि वीडियो का प्रवाह चिकना और सुसंगत बना रहे, भले ही निर्देश शोर भरे हों। यह वीडियो को झटकेदार या बिखरने से रोकता है।

यह एक बड़ी बात क्यों है
शोध पत्र दिखाता है कि यह "स्मार्ट नॉइज़" दृष्टिकोण एक गेम-चेंजर है:

  1. यह कुशल है: लेखकों ने अपने मॉडल को सबसे प्रसिद्ध वीडियो मॉडलों (जैसे DEMO या LaVie) की तुलना में 5 गुना कम डेटा पर प्रशिक्षित किया, फिर भी उनके मॉडल ने बेहतर वीडियो बनाए। यह उस छात्र की तरह है जो कम किताबें पढ़ता है लेकिन बेहतर ग्रेड प्राप्त करता है क्योंकि उसने सीखना कैसे है यह समझ लिया है।
  2. यह मजबूत (Robust) है: जब उन्होंने रोबोट का परीक्षण बिखरे हुए, भ्रमित करने वाले निर्देशों के साथ किया, तो "स्मार्ट नॉइज़" वाला रोबोट कहानी पर टिका रहा, जबकि पुराने रोबोट (रैंडम शोर का उपयोग करने वाले) निरर्थक परिणाम दे रहे थे।
  3. यह सैद्धांतिक है: लेखकों ने केवल अनुमान नहीं लगाया; उन्होंने गणितीय रूप से सिद्ध किया कि "महत्वपूर्ण दिशाओं" (समूह के औसत या बड़े चित्र) पर ध्यान केंद्रित करके, वे त्रुटियों को समय के साथ जमा होने से रोक रहे हैं।

निष्कर्ष
वर्तमान वीडियो AI को एक ऐसे छात्र के रूप में सोचें जो उत्तर कुंजी (answer key) रट लेता है लेकिन यदि प्रश्न को थोड़ा भी बदल दिया जाए तो विफल हो जाता है। CAT-LVDM उस छात्र की तरह है जो उत्तर के कॉन्सेप्ट को समझता है। "स्मार्ट नॉइज़" के साथ प्रशिक्षण देकर जो वीडियो की संरचना (समूह की गतिशीलता और बड़े चित्र) का सम्मान करता है, मॉडल अधिक मजबूत, विश्वसनीय और स्मूथ, उच्च-गुणवत्ता वाली फिल्में बनाने में सक्षम हो जाता है, भले ही निर्देश पूर्ण न हों।

उन्होंने यह भी दिखाया है कि यह ट्रिक न केवल वीडियो बनाने के लिए, बल्कि उन्हें समझने और अन्य प्रकार के AI के लिए भी काम करती है, जो यह सुझाव देती है कि यह AI को अधिक मजबूत बनाने की एक सार्वभौमिक कुंजी हो सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →