4Director: Controlling Video World Models with Rigid 3D Geometry
यह शोध पत्र 4Director को प्रस्तुत करता है, जो एक वीडियो वर्ल्ड मॉडल है जो स्पष्ट 4D रिजिड ज्योमेट्री और एक मोशन अडैप्टर पर जनरेशन को कंडीशन करके सटीक कैमरा और ऑब्जेक्ट कंट्रोल प्राप्त करता है, जिसे एक नए डेटासेट और इवैल्यूएशन मेट्रिक द्वारा प्रमाणित किया गया है ताकि मौजूदा तरीकों की तुलना में विजुअल क्वालिटी और मोशन कंसिस्टेंसी में बेहतर प्रदर्शन किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ एक कंप्यूटर एक अकेली तस्वीर देख सकता है और फिर उस स्थिर क्षण से एक फिल्म चलते हुए की कल्पना कर सकता है। यह वीडियो वर्ल्ड मॉडल्स का वादा है, जो आर्टिफिशियल इंटेलिजेंस का एक तेजी से उन्नत होता क्षेत्र है जहाँ मशीनें यह सीखती हैं कि एक दृश्य समय के साथ कैसे बदलेगा। वर्षों से, शोधकर्ताओं ने इन प्रणालियों को हजारों घंटों के वीडियो दिखाकर गतिशील चित्र उत्पन्न करना सिखाया है, इस उम्मीद में कि कंप्यूटर अपने आप भौतिकी और गति के नियमों को सीख जाएगा। हालाँकि, एक महत्वपूर्ण बाधा बनी हुई है: जबकि ये कंप्यूटर यथार्थवादी गति बनाने में बेहतर हो रहे हैं, उन्हें निर्देशित करना बेहद कठिन है। यदि कोई उपयोगकर्ता चाहता है कि कोई विशिष्ट वस्तु घूम जाए या कैमरा किसी कोने के चारों ओर चक्कर लगाए, तो कंप्यूटर अक्सर निर्देश को अनदेखा कर देता है या ऐसा परिणाम बनाता है जो देखने में तो तर्कसंगत लगता है लेकिन ज्यामितीय रूप से गलत होता है। वस्तु दूर जाने के बजाय सिकुड़ सकती है, या कैमरा हिलने पर वह एक धुंधले साये की तरह बिखर सकती है। मुख्य चुनौती एक मानव के स्पष्ट, त्रि-आयामी इरादे और कंप्यूटर की सपाट, द्वि-आयामी पैटर्न के आधार पर अनुमान लगाने की प्रवृत्ति के बीच के अंतर को पाटने की रही है।
स्टेबिलिटी एआई (Stability AI) और यूनिवर्सिटी ऑफ इलिनोइस अर्बाना-शैंपेन के शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए '4डायरेक्टर' (4Director) नामक एक नया दृष्टिकोण पेश किया है। कंप्यूटर से किसी वस्तु के पथ का अनुमान लगाने के लिए कहने के बजाय, 4डायरेक्टर वीडियो जनरेशन शुरू होने से पहले ही कंप्यूटर को दृश्य का एक पूर्ण, त्रि-आयामी मानचित्र प्रदान करता है। इस प्रणाली में, एक प्रारंभिक तस्वीर में मौजूद प्रत्येक वस्तु को एक ठोस, डिजिटल 3D मॉडल के रूप में पुनर्गठित किया जाता है, ठीक वैसे ही जैसे एक मूर्तिकार मिट्टी की आकृति बनाता है जिसका एक सामने का हिस्सा, एक पिछला हिस्सा और किनारे होते हैं, भले ही मूल फोटो में केवल सामने का हिस्सा ही दिखाया गया हो। बैकग्राउंड को भी अंतरिक्ष में बिंदुओं के एक बादल (cloud of points) में बदल दिया जाता है। एक बार जब यह डिजिटल दुनिया बन जाती है, तो उपयोगकर्ता कैमरे के लिए एक पथ और वस्तु के लिए एक पथ खींच सकता है, ठीक वैसे ही जैसे एक फिल्म निर्देशक शॉट की योजना बनाता है। इसके बाद कंप्यूटर इन ठोस 3D मॉडलों को निर्धारित पथों पर पूर्ण कठोरता (rigidity) के साथ घुमाता है, यह सुनिश्चित करते हुए कि यदि कोई वस्तु घूमती है, तो वह एक संपूर्ण इकाई के रूप में घूमती है, और यदि कैमरा चलता है, तो बैकग्राउंड सही ढंग से बदलता है।
नवाचार इस बात में निहित है कि इस कठोर कंकाल (rigid skeleton) का उपयोग अंतिम वीडियो को निर्देशित करने के लिए कैसे किया जाता है। प्रणाली पहले दृश्य का एक सरल, ब्लैक-एंड-व्हाइट डेप्थ मैप (गहराई का मानचित्र) बनाती है, जो केवल कैमरा से प्रत्येक सतह की दूरी दिखाता है जब वस्तुएं अपने पथों पर चलती हैं। यह डेप्थ मैप एक सख्त मचान (scaffold) के रूप में कार्य करता है, जो यह सटीक रूप से परिभाषित करता है कि स्थान और समय के संदर्भ में प्रत्येक पिक्सेल कहाँ होना चाहिए। एक विशेष प्रशिक्षण मॉड्यूल, जिसे शोधकर्ता 'मोशन अडैप्टर' (Motion Adapter) कहते हैं, फिर इस कठोर कंकाल को लेता है और इसमें छूटे हुए विवरण भर देता है। यह सतह की बनावट (textures), प्रकाश व्यवस्था और सूक्ष्म, गैर-कठोर गतिविधियों—जैसे किसी व्यक्ति के हाथ का हिलना या झंडे का फड़फड़ाना—को उस निश्चित 3D संरचना के ऊपर पेंट करना सीखता है। यह सुनिश्चित करता है कि अंतिम वीडियो स्थिति और अभिविन्यास (orientation) के लिए उपयोगकर्ता के सटीक निर्देशों का पालन करे और फिर भी एक प्राकृतिक, जीवंत दृश्य की तरह दिखे।
इस प्रणाली को काम करना सिखाने के लिए, शोधकर्ताओं को एक विशाल नया डेटासेट बनाना पड़ा क्योंकि मौजूदा वीडियो संग्रहों में आवश्यक 3D मानचित्र उपलब्ध नहीं थे। उन्होंने एक स्वचालित पाइपलाइन बनाई जिसने 20,000 से अधिक वीडियो क्लिप्स को रिवर्स-इंजीनियर किया, जिससे प्रत्येक को एक कठोर 3D दृश्य, कैमरा पथ और वस्तु पथ में बदल दिया गया। यह डेटासेट, जिसका नाम 'रियलसीओडी-रिजिड' (RealCOD-Rigid) है, ने मोशन अडैप्टर को एक ठोस वस्तु की कठोर गति और वास्तविक दुनिया के विवरणों की लचीली गति के बीच अंतर को सीखने में मदद की। परिणाम पिछले तरीकों की तुलना में उल्लेखनीय सुधार दिखाते हैं। परीक्षणों में, 4डायरेक्टर वस्तुओं को सुसंगत और पहचानने योग्य बनाए रखने में सक्षम रहा, यहाँ तक कि तब भी जब वे पूरी तरह से घूम गए या कैमरे के दृश्य से बाहर जाकर वापस आ गए, एक ऐसा कार्य जहाँ अन्य सिस्टम अक्सर वस्तु की पहचान खोकर या उसे बैकग्राउंड में धुंधला करके विफल हो जाते थे।
शोधकर्ताओं ने सफलता को मापने का एक नया तरीका भी विकसित किया, यह पहचानते हुए कि केवल यह जांचना कि कोई वस्तु सही स्थान पर है या नहीं, पर्याप्त नहीं है यदि वस्तु स्वयं बदल गई हो। उनका नया मीट्रिक वस्तु की स्थिति और पहचान दोनों की जांच करता है, यह सुनिश्चित करता है कि मुड़ता हुआ कार अभी भी वही कार ही रहे। अन्य अग्रणी वीडियो जनरेशन टूल्स की तुलना में, 4डायरेक्टर ने लगातार उच्च दृश्य गुणवत्ता और दृश्य के भीतर कैमरा और वस्तुओं दोनों पर बहुत अधिक सटीक नियंत्रण प्रदर्शित किया। यह प्रणाली दर्शाती है कि कंप्यूटर को वीडियो बनाना शुरू करने से पहले दुनिया की स्पष्ट, त्रि-आयामी समझ देकर, उस स्तर का नियंत्रण प्राप्त करना संभव है जो पहले पहुंच से बाहर था, जिससे उपयोगकर्ता एक पेशेवर फिल्म निर्माता की सटीकता के साथ एक दृश्य के प्रवाह को निर्देशित कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।