Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing
टेली-ओम्नी (Tele-Omni) एक एकीकृत मल्टीमॉडल फ्रेमवर्क है जो विविध टेक्स्ट, इमेज और वीडियो निर्देशों को पार्स करने के लिए प्रीट्रेंड लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है ताकि एक एकल डिफ्यूजन-आधारित मॉडल को सक्षम बनाया जा सके, जिससे एक सुसंगत प्रणाली के भीतर कई कार्यों के लिए लचीला और उच्च-गुणवत्ता वाला वीडियो जेनरेशन और एडिटिंग संभव हो सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके लिविंग रूम में एक जादुई मूवी स्टूडियो है। अभी, अधिकांश AI वीडियो टूल्स विशिष्ट श्रमिकों (specialized workers) की तरह हैं: एक कार्यकर्ता स्क्रिप्ट (टेक्स्ट) से फिल्में बनाने में माहिर है, दूसरा एक स्केच (इमेज) को एनिमेट करने में अच्छा है, और तीसरा बैकग्राउंड को एडिट करने में बेहतरीन है। लेकिन यदि आप कुछ जटिल करना चाहते हैं—जैसे "बिल्ली की इस फोटो को लो, उसे साइबरपंक सिटी में डालो, बारिश कराओ, और फिर वीडियो को एडिट करके बिल्ली को धूप का चश्मा पहना दो"—तो आमतौर पर आपको तीन अलग-अलग श्रमिकों को काम पर रखना पड़ता है और उम्मीद करनी पड़ती है कि वे एक-दूसरे से बात कर पाएंगे। अक्सर वे ऐसा नहीं करते।
Tele-Omni इस समस्या का समाधान है। इसे एक सुपर-प्रोड्यूसर के रूप में सोचें जो एक ही बार में सब कुछ कर सकता है।
यहाँ एक सरल विवरण दिया गया है कि Tele-Omni कैसे काम करता है, रोज़मर्रा के उदाहरणों का उपयोग करते हुए:
1. दो-मस्तिष्क प्रणाली (The Two-Brain System)
Tele-Omni केवल एक बड़ा दिमाग नहीं है; यह दो विशेषज्ञों की एक टीम है जो पूर्ण तालमेल में काम करती है:
- "निर्देशक" (The "Director" - MLLM): यह वह मस्तिष्क है जो भाषा, छवियों और वीडियो को समझता है। यह एक अनुभवी फिल्म निर्देशक की तरह है जो आपके बिखरे हुए नोट्स पढ़ता है ("कार को लाल बनाओ, लेकिन बारिश होने दो") और आपके संदर्भ फोटो (reference photos) को देखता है। निर्देशक फ्रेम पेंट नहीं करता है; इसके बजाय, वे एक बहुत ही सटीक शॉट लिस्ट और स्टोरीबोर्ड लिखते हैं। वे समझते हैं कि आप क्या चाहते हैं और उसे कैसे करना है।
- "सिनेमैटोग्राफर" (The "Cinematographer" - Diffusion Model): यह वह कलाकार है जो वास्तव में फिल्म को पेंट करता है। वे निर्देशक की शॉट लिस्ट और संदर्भ फोटो लेते हैं और फ्रेम-दर-फ्रेम वीडियो बनाना शुरू करते हैं। वे चीजों को वास्तविक दिखाने और गति को सुचारू बनाए रखने में अविश्वसनीय रूप से कुशल हैं।
जादू: पुराने सिस्टमों में, निर्देशक और सिनेमैटोग्राफर अलग-अलग भाषाएं बोलते थे। Tele-Omni में, वे एक ही भाषा बोलते हैं। निर्देशक आपके जटिल, मिश्रित निर्देशों (टेक्स्ट + फोटो + वीडियो क्लिप) को एक स्पष्ट योजना में अनुवादित करता है जिसे सिनेमैटोग्राफर पूरी तरह से निष्पादित कर सके।
2. वीडियो कार्यों के लिए "स्विस आर्मी नाइफ" (The "Swiss Army Knife" of Video Tasks)
अधिकांश वीडियो AI टूल्स एक एकल-उद्देश्य वाले स्क्रूड्राइवर की तरह हैं। Tele-Omni एक स्विस आर्मी नाइफ है। क्योंकि निर्देशक आपके अनुरोध के पीछे के इरादे (intent) को समझता है, इसलिए Tele-Omni बिना किसी नए प्रशिक्षण के बहुत सारे विविध काम संभाल सकता है:
- टेक्स्ट-टू-वीडियो (Text-to-Video): आप कहते हैं, "एक महल के ऊपर उड़ता हुआ ड्रैगन," और यह उसे बनाता है।
- इमेज-टू-वीडियो (Image-to-Video): आप सोती हुई बिल्ली की एक फोटो अपलोड करते हैं, और यह बिल्ली को जागते और अंगड़ाई लेते हुए दिखाता है।
- फर्स्ट-एंड-लास्ट-फ्रेम (First-and-Last-Frame): आप एक बैठे हुए व्यक्ति की फोटो और खड़े हुए व्यक्ति की फोटो देते हैं। निर्देशक "बीच की कहानी" का पता लगाता है और मूवमेंट को सुचारू रूप से भर देता है।
- वीडियो एडिटिंग (Video Editing): आप कह सकते हैं, "बैकग्राउंड से वह बदसूरत कूड़ेदान हटा दो," या "गर्मियों के कपड़ों को सर्दियों के कोट में बदल दो," और यह बाकी दृश्य को एकदम सही रखते हुए वीडियो को एडिट करता है।
- इन-कॉन्टेक्स्ट जनरेशन (In-Context Generation): आप एक डांस का संदर्भ वीडियो दिखाते हैं और कहते, "यह डांस करो, लेकिन एक रोबोट के साथ," और यह चरित्र को बदलते हुए गति (motion) की नकल करता है।
3. गुप्त मंत्र: "टास्क-अवेयर" ट्रेनिंग (The Secret Sauce: "Task-Aware" Training)
आप सोच सकते हैं, "AI कैसे जानता है कि 'नया वीडियो बनाना' और 'पुराने को एडिट करना' के बीच क्या अंतर है?"
आमतौर पर, यदि आप अलग-अलग प्रकार के ट्रेनिंग डेटा को मिलाते हैं (जैसे केक का बैटर और कार के इंजन का तेल मिलाना), तो AI भ्रमित हो जाता है। Tele-Omni एक विशेष डेटा पाइपलाइन (ट्रेनिंग का एक नुस्खा) का उपयोग करता है जो सब कुछ करीने से व्यवस्थित करता है।
इसे एक यूनिवर्सल रिमोट कंट्रोल की तरह समझें। इसके बजाय कि आपके पास टीवी, स्टीरियो और एसी के लिए अलग-अलग रिमोट हों, Tele-Omni AI को यह सिखाता है कि आपके द्वारा दबाए गए बटन क्या हैं।
- यदि आप "Make New" दबाते हैं, तो यह शून्य से निर्माण करना जानता है।
- यदि आप "Edit" दबाते हैं, तो यह बैकग्राउंड को रखता है और विषय (subject) को बदल देता है।
- यदि आप "Reference" दबाते हैं, तो यह दिए गए क्लिप से स्टाइल या मोशन को कॉपी करना जानता है।
सिस्टम को उदाहरणों के एक विशाल, व्यवस्थित पुस्तकालय पर प्रशिक्षित किया गया है ताकि यह तुरंत कार्यों के बीच अंतर करना सीख सके, केवल आपके निर्देशों को देखकर।
4. यह क्यों महत्वपूर्ण है?
Tele-Omni से पहले, यदि आप एक जटिल वीडियो बनाना चाहते थे, तो आपको विभिन्न टूल्स के बीच कूदना पड़ता था, जिससे गुणवत्ता और निरंतरता (consistency) कम हो जाती थी। यह हर पांच मिनट में हथौड़े, आरी और राजमिस्त्री के औजारों के बीच स्विच करने जैसा था।
Tele-Omni आपको एक ही कमरे में रहने देता है। आप इसे निर्देशों का एक मिश्रण देते हैं—टेक्स्ट, फोटो और वीडियो क्लिप—और यह एक एकीकृत प्रोडक्शन टीम की तरह कार्य करता है। यह समझता है कि "आसमान को नीला बनाना" पूरे वीडियो पर लागू होता है, जबकि "कार को लाल बनाना" केवल कार पर लागू होता है, और यह सब करते हुए गति को सुचारू और लाइटिंग को यथार्थवादी बनाए रखता है।
संक्षेप में: Tele-Omni पहला AI वीडियो टूल है जो एक सच्चे रचनात्मक साथी की तरह काम करता है, जो आपके बिखरे हुए, बहु-भाग वाले विचारों को समझने और उन्हें बिना किसी अलग टूल के एक एकल, उच्च-गुणवत्ता वाली फिल्म में बदलने में सक्षम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।