InstructAV2AV: Instruction-Guided Audio-Video Joint Editing
यह शोधपत्र InstructAV2AV प्रस्तुत करता है, जो निर्देश-निर्देशित ऑडियो-वीडियो संयुक्त संपादन के लिए पहला एंड-टू-एंड फ्रेमवर्क है, जो एक नए निर्मित बड़े पैमाने के डेटासेट (InsAVE-80K) और एक विशिष्ट दो-चरणीय प्रशिक्षण रणनीति का लाभ उठाता है ताकि सिंक्रोनाइज़्ड, उच्च-गुणवत्ता वाली संपादित सामग्री उत्पन्न करने में मौजूदा विधियों से बेहतर प्रदर्शन किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास अपने किसी दोस्त के भाषण का एक होम वीडियो है। अब, कल्पना कीजिए कि आप यह बदलना चाहते हैं कि वे क्या कह रहे हैं, या यहाँ तक कि उन्हें पूरी तरह से किसी दूसरे व्यक्ति से बदलना चाहते हैं, लेकिन आप चाहते हैं कि बैकग्राउंड का शोर, लाइटिंग और टाइमिंग बिल्कुल स्वाभाविक बनी रहे।
आमतौर पर, वीडियो को एडिट करना और ऑडियो को एडिट करना दो अलग-अलग काम होते हैं। यदि आप वीडियो बदलते हैं, तो ऑडियो अक्सर सिंक से बाहर हो जाता है या अजीब लगता है (जैसे कि एक वॉइसओवर जो होंठों की हलचल से मेल नहीं खाता)। यह पेपर InstructAV2AV पेश करता है, जो एक नया टूल है जो वीडियो और ऑडियो को एक ही, अटूट पैकेज के रूप में मानता है। आप इसे एक सरल टेक्स्ट कमांड देते हैं, और यह तुरंत चित्र और ध्वनि दोनों को एक साथ फिर से लिख देता है।
यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:
1. "जादुई रेसिपी" (डेटा की समस्या)
कंप्यूटर को यह करने के लिए सिखाने हेतु, आपको "पहले" और "बाद के" वीडियो के हजारों उदाहरणों की आवश्यकता होती है। लेकिन किसी के पास ऐसे वीडियो का पुस्तकालय नहीं है जहाँ कोई "नमस्ते" कहता है और फिर जादुगर की तरह "अलविदा" कहने के लिए बदल जाता है जबकि बैकग्राउंड वैसा ही रहता है।
लेखकों ने एक डेटा फैक्ट्री (जिसे InsAVE-80K कहा जाता है) बनाई है। इसे एक हाई-टेक किचन की तरह समझें:
- उन्होंने इंटरनेट से कच्चे वीडियो लिए।
- उन्होंने विशिष्ट हिस्सों (जैसे किसी व्यक्ति का चेहरा या कार) को काटने के लिए एक "मास्क-गाइडेड" रोबोट शेफ का उपयोग किया।
- उन्होंने टेक्स्ट निर्देशों के आधार पर उन विशिष्ट भागों के लिए नया ऑडियो और वीडियो बनाने के लिए AI का उपयोग किया (उदाहरण के लिए, "आदमी को महिला में बदलें")।
- फिर उन्होंने इन नए हिस्सों को मूल वीडियो में वापस रखा, जिससे बैकग्राउंड अछूता रहा।
- अंत में, उन्होंने यह सुनिश्चित करने के लिए कि परिणाम वास्तविक दिखें और सुनाई दें, इंसानों और स्मार्ट कंप्यूटरों से इसका "टेस्ट" करवाया। इससे 80,000 प्रशिक्षण उदाहरणों की एक विशाल कुकबुक तैयार हुई।
2. "स्मार्ट एडिटर" (द मॉडल)
इस सिस्टम का मुख्य हिस्सा एक डुअल-स्ट्रीम ब्रेन (दोहरी धारा वाला मस्तिष्क) है। एक कंडक्टर की कल्पना करें जो एक साथ दो ऑर्केस्ट्रा का नेतृत्व कर रहा है: एक दृश्य दृश्य (वीडियो) के लिए और एक ध्वनि (ऑडियो) के लिए।
- द एंकर (लंगर): जब आप किसी बदलाव के लिए कहते हैं, तो सिस्टम केवल अनुमान नहीं लगाता। यह सुनिश्चित करने के लिए कि यह गलती से आकाश, पेड़ों या बैकग्राउंड के शोर को न बदल दे, यह मूल वीडियो और ऑडियो को एक "सेफ्टी एंकर" के रूप में देखता है।
- द इंस्ट्रक्शन (निर्देश): आप एक कमांड टाइप करते हैं जैसे, "एक आदमी को भूरे बालों वाली एक युवा महिला में बदलें जो कह रही हो 'मुझे लगता है कि हमें फिर से कोशिश करनी चाहिए'।"
- द गेटेड अटेंशन (SIGA): यही इस पेपर का सीक्रेट सॉस है। वीडियो के हर एक क्षण के लिए एक डिमर स्विच या ट्रैफिक लाइट की कल्पना करें।
- यदि लाइट लाल है, तो सिस्टम कहता है, "मूल वीडियो/ऑडियो को बिल्कुल वैसा ही रखें" (बैकग्राउंड को सुरक्षित रखना)।
- यदि लाइट हरी है, तो यह कहता है, "इस हिस्से को निर्देश के अनुसार बदलें।"
- यह स्विच स्वचालित रूप से एडजस्ट होता है, जिससे सिस्टम को पता चलता है कि उसे क्या बदलना है और किसे छोड़ देना है, जिससे यह सुनिश्चित होता है कि नई आवाज़ नए चेहरे से पूरी तरह मेल खाती है।
3. "दो-चरणीय नृत्य" (प्रशिक्षण रणनीति)
कंप्यूटर को एक साथ वीडियो और ऑडियो को एडिट करना सिखाना कठिन है। यदि आप इसे एक साथ सब कुछ सिखाने की कोशिश करते हैं, तो यह भ्रमित हो जाता है।
लेखक एक दो-चरणीय प्रशिक्षण रणनीति का उपयोग करते हैं:
- चरण 1 (सोलो प्रैक्टिस): पहले, वे वीडियो वाले हिस्से को एडिट करना और ऑडियो वाले हिस्से को एडिट करना अलग-अलग सिखाते हैं। वे एक-दूसरे की चिंता किए बिना अपनी चालें सीखते हैं।
- चरण 2 (द डुएट): एक बार जब वे सोलो करने में अच्छे हो जाते हैं, तो उन्हें एक साथ नृत्य करना सिखाया जाता है। वे पूरी तरह से सिंक्रोनाइज़ होना सीखते हैं ताकि जब वीडियो में कार का इंजन शुरू होने का दृश्य हो, तो ऑडियो ठीक उसी मिलीसेकंड पर इंजन की दहाड़ बजाए।
यह क्या कर सकता है?
यह पेपर केवल टेक्स्ट निर्देशों का उपयोग करके चार मुख्य "चालें" प्रदर्शित करता है:
- आइडेंटिटी स्वैप (पहचान बदलना): एक आदमी को महिला में (या इसके विपरीत) बदलना, जबकि आवाज और होंठों की हरकतें सिंक्रोनाइज़ रहें।
- स्पीच रीराइट (भाषण पुनर्लेखन): व्यक्ति का चेहरा और आवाज वही रखें, लेकिन उनके द्वारा कहे जाने वाले शब्दों को बदलकर कुछ नया कर दें।
- इंसर्शन (सम्मिलन): एक नई वस्तु जोड़ें (जैसे पास से गुजरती हुई एक विंटेज कार) और उसके मिलान वाला इंजन साउंड जनरेट करें।
- रिमूवल (हटाना): एक वस्तु को मिटा दें (जैसे चट्टान पर एक गिलहरी) और उसकी चीं-चीं की आवाज को शांत कर दें, जिससे ऐसा लगे कि वह वहां कभी थी ही नहीं।
निचोड़
संक्षेप में, InstructAV2AV पहला ऐसा सिस्टम है जो आपको केवल एक टेक्स्ट प्रॉम्प्ट का उपयोग करके वीडियो की कहानी और उसके साउंडट्रैक को एक साथ एडिट करने की अनुमति देता है। यह केवल पुराने वीडियो पर एक नई आवाज़ नहीं चिपकाता; यह समझता है कि यदि आप दृश्य बदलते हैं, तो ध्वनि को भी बदलना होगा, और यदि आप ध्वनि बदलते हैं, तो दृश्य को उससे मेल खाना चाहिए। यह एक विशाल, स्वयं-निर्मित उदाहरणों के पुस्तकालय से सीखकर और यह तय करने के लिए एक स्मार्ट "डिमर स्विच" का उपयोग करके करता है कि किसे रखना है और किसे बदलना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।