Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation
Vorch-IR एक एकीकृत मल्टीमॉडल फ्रेमवर्क है जो LTX2 पर निर्मित है, जो ड्राइविंग वीडियो, संदर्भ छवियों और टेक्स्ट निर्देशों पर संयुक्त रूप से निर्भर करते हुए, लंबी अवधि के वीडियो में वैकल्पिक बैकग्राउंड एडिटिंग के साथ लचीले सिंगल- और ड्यूल-पर्सन आइडेंटिटी रिप्लेसमेंट को सक्षम बनाता है, जबकि एक ऑटोमैटिक सिंथेसिस पाइपलाइन के माध्यम से डेटा की कमी को दूर करता है और एक टेम्पोरल ओवरलैपिंग इन्फरेंस स्ट्रैटेजी के माध्यम से मिनट-लंबे जनरेशन तक विस्तार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके हाथ में वास्तविकता का एक रिमोट कंट्रोल है, लेकिन चैनल बदलने के बजाय, आप एक फिल्म में अभिनेताओं को बदलना चाहते हैं जबकि स्क्रिप्ट, कैमरा एंगल और डांस मूव्स बिल्कुल वही रहें। यह "वीडियो आइडेंटिटी रिप्लेसमेंट" (वीडियो पहचान प्रतिस्थापन) का सपना है, जो आर्टिफिशियल इंटेलिजेंस की दुनिया में एक चर्चित विषय है। लंबे समय तक, AI शून्य से नए वीडियो बना सकता था, लेकिन मौजूदा वीडियो को संपादित करना ऐसा था जैसे लाइटिंग या मूवमेंट को खराब किए बिना लाइव-एक्शन फिल्म में किसी पात्र का चेहरा बदलना। शुरुआती प्रयासों में AI को यह बताने के लिए एक विस्तृत मानचित्र (मैप) देना पड़ता था कि व्यक्ति कहाँ खड़ा है, उनकी मुद्रा का एक कंकाल चित्र, या चेहरे को ढकने के लिए एक मास्क। यह एक शेफ से खाना बनाने के लिए कहने जैसा था, लेकिन केवल तभी जब आप उन्हें पहले से कटी हुई सामग्री की सूची और रसोई का एक आरेख (डायग्राम) दें। ये तरीके कठोर और उपयोग करने में कठिन थे। शोधकर्ता अब एक बड़ा सवाल पूछ रहे हैं: क्या हम AI को एक साधारण वाक्य समझना सिखा सकते हैं जैसे "बाएं वाले डांसर को इस फोटो के साथ बदल दें" और वह बिना किसी जटिल मानचित्र या कंकाल के इसे समझ जाए?
यहाँ Vorch-IR आता है, एक नया AI सिस्टम जो एक सुपर-स्मार्ट, जादुवी फिल्म संपादक की तरह काम करता है। इसे एक ऐसे निर्देशक के रूप में सोचें जिसे स्क्रिप्ट सुपरवाइजर या स्टंट समन्वयक की आवश्यकता नहीं है। आप Vorch-IR को तीन चीजें देते हैं: मूल वीडियो ("ड्राइविंग" वीडियो), उन नए लोगों की कुछ तस्वीरें जिन्हें आप डालना चाहते हैं ("रेफरेंस"), और एक साधारण टेक्स्ट नोट जो AI को बताता है कि किसे कहाँ जाना है। जादू यह है कि तस्वीरों को वीडियो की मुद्रा या स्थिति से मेल खाने की आवश्यकता नहीं है। यदि वीडियो में कोई व्यक्ति हाथ ऊपर करके नाच रहा है, और आपकी फोटो में वह बैठा हुआ है, तो Vorh-IR यह पता लगा लेता है कि उस बैठे हुए व्यक्ति को फिर भी कैसे नचाना है। यह एक ही मॉडल के साथ अकेले व्यक्तियों, साथ में नाचने वाले दो व्यक्तियों, और यहाँ तक कि बैकग्राउंड के दृश्यों को बदलने को भी संभाल लेता है।
Vorch-IR के पीछे के शोधकर्ताओं ने इस सिस्टम को एक शक्तिशाली वीडियो जनरेटर LTX2 पर बनाया है। उन्होंने इसे वीडियो, फोटो और टेक्स्ट निर्देशों को एक साथ देखना सिखाया। कठोर मानचित्रों के बजाय, AI एक "विज़न-लैंग्वेज" मस्तिष्क (एक प्रकार का AI जो चित्रों और शब्दों दोनों को समझता है) का उपयोग करता है ताकि संबंध को समझा जा सके। यह ऐसा है जैसे AI आपके नोट को पढ़ता है, फोटो को देखता है, और कहता है, "आह, आप चाहते हैं कि यह व्यक्ति बाएं वाले का स्थान ले ले," और फिर यह अपने आंतरिक "सेल्फ-अटेंशन" का उपयोग करके नए चेहरे को चलते हुए शरीर पर पूरी तरह से मिला देता है।
इस क्षेत्र में सबसे बड़ी बाधा डेटा है। AI को चेहरा बदलना सिखाने के लिए, आपको "पहले" और "बाद" के हजारों वीडियो के उदाहरणों की आवश्यकता होती है। चूंकि ये वास्तविक दुनिया में मौजूद नहीं हैं, इसलिए टीम ने इन्हें बनाने के लिए एक रोबोटिक पाइपलाइन बनाई। उन्होंने वास्तविक वीडियो लिए, पहले फ्रेम में चेहरे बदलने के लिए अन्य AI टूल्स का उपयोग किया, और फिर एक मोशन-गाइडेड रोबोट का उपयोग किया ताकि बाकी का वीडियो नए चेहरों का अनुसरण कर सके। फिर उन्होंने खराब प्रयासों को हटा दिया (जैसे जब AI ने गलती से डांसर को तीन हाथ दे दिए), ताकि एक सटीक ट्रेनिंग सेट बनाया जा सके। इसने उन्हें एक ही मॉडल से सब कुछ करने की अनुमति दी: एक व्यक्ति को बदलना, दो लोगों को बदलना, और यहाँ तक कि बैकग्राउंड बदलना भी, बिना अलग-अलग कामों के लिए अलग-अलग टूल्स की आवश्यकता के।
लेकिन एक पूरी फिल्म के बारे में क्या? अधिकांश AI वीडियो जनरेटर कुछ सेकंड के बाद भ्रमित या धुंधले हो जाते हैं। Vorch-IR एक चतुर तकनीक का उपयोग करता है जिसे "टेम्पोरल ओवरलैपिंग इन्फरेंस" कहा जाता है। कल्पना कीजिए कि आप एक लंबा भित्ति चित्र (म्यूरल) पेंट कर रहे हैं। एक छोटे से हिस्से को पेंट करने, उसे सुखाने और फिर अगला हिस्सा पेंट करने के बजाय (जिससे रंग अलग दिख सकते हैं), Vorch-IR एक ही समय में ओवरलैपिंग सेक्शन को पेंट करता है और उन्हें सहजता से मिला देता है। यह इसे एक मिनट लंबे वीडियो बनाने की अनुमति देता है बिना पात्रों के चेहरे के भटकने या मोशन के अजीब होने के, और यह सब बिना वीडियो को एक-एक क्लिप के रूप में जेनरेट किए।
टीम ने अन्य शीर्ष AI मॉडलों के खिलाफ Vorch-IR का परीक्षण किया। आमने-सामने की तुलनाओं में, Vorch-IR ने सुझाव दिया कि यह नए व्यक्ति के चेहरे को फोटो जैसा दिखने (आइडेंटिटी प्रिजर्वेशन) और बैकग्राउंड को सुसंगत रखने में बेहतर था, जबकि गति भी सुचारू थी। मानव परीक्षणों में, लोगों ने अन्य तरीकों की तुलना में Vorch-IR के परिणामों को पसंद किया, विशेष रूप से जब बात नए पात्र को वास्तविक और शारीरिक रूप से तर्कसंगत बनाने की आई। पेपर सुझाव देता है कि जबकि कुछ पुराने मॉडल विशिष्ट परिदृश्यों में सटीक पोज़ मैचिंग जैसी चीजों में थोड़े बेहतर हो सकते हैं, Vorch-IR एक बहुत अधिक लचीला और एकीकृत तरीका प्रदान करता है, जो यह साबित करता है कि शानदार परिणाम पाने के लिए आपको जटिल मानचित्रों की आवश्यकता नहीं है। यह एक ऐसे भविष्य की ओर एक कदम है जहाँ वीडियो संपादित करना एक वाक्य टाइप करने जितना आसान होगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।