← नवीनतम पेपर
💻 computer science

4Director: Controlling Video World Models with Rigid 3D Geometry

यह शोध पत्र 4Director को प्रस्तुत करता है, जो एक वीडियो वर्ल्ड मॉडल है जो स्पष्ट 4D रिजिड ज्योमेट्री और एक मोशन अडैप्टर पर जनरेशन को कंडीशन करके सटीक कैमरा और ऑब्जेक्ट कंट्रोल प्राप्त करता है, जिसे एक नए डेटासेट और इवैल्यूएशन मेट्रिक द्वारा प्रमाणित किया गया है ताकि मौजूदा तरीकों की तुलना में विजुअल क्वालिटी और मोशन कंसिस्टेंसी में बेहतर प्रदर्शन किया जा सके।

मूल लेखक: Wei Cao, Hao Zhang, Vikram Voleti, Yuqun Wu, Mallikarjun B R, Shimon Vainer, Mark Boss, Yaoyao Liu

प्रकाशित 2026-10-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wei Cao, Hao Zhang, Vikram Voleti, Yuqun Wu, Mallikarjun B R, Shimon Vainer, Mark Boss, Yaoyao Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ एक कंप्यूटर एक अकेली तस्वीर देख सकता है और फिर उस स्थिर क्षण से एक फिल्म चलते हुए की कल्पना कर सकता है। यह वीडियो वर्ल्ड मॉडल्स का वादा है, जो आर्टिफिशियल इंटेलिजेंस का एक तेजी से उन्नत होता क्षेत्र है जहाँ मशीनें यह सीखती हैं कि एक दृश्य समय के साथ कैसे बदलेगा। वर्षों से, शोधकर्ताओं ने इन प्रणालियों को हजारों घंटों के वीडियो दिखाकर गतिशील चित्र उत्पन्न करना सिखाया है, इस उम्मीद में कि कंप्यूटर अपने आप भौतिकी और गति के नियमों को सीख जाएगा। हालाँकि, एक महत्वपूर्ण बाधा बनी हुई है: जबकि ये कंप्यूटर यथार्थवादी गति बनाने में बेहतर हो रहे हैं, उन्हें निर्देशित करना बेहद कठिन है। यदि कोई उपयोगकर्ता चाहता है कि कोई विशिष्ट वस्तु घूम जाए या कैमरा किसी कोने के चारों ओर चक्कर लगाए, तो कंप्यूटर अक्सर निर्देश को अनदेखा कर देता है या ऐसा परिणाम बनाता है जो देखने में तो तर्कसंगत लगता है लेकिन ज्यामितीय रूप से गलत होता है। वस्तु दूर जाने के बजाय सिकुड़ सकती है, या कैमरा हिलने पर वह एक धुंधले साये की तरह बिखर सकती है। मुख्य चुनौती एक मानव के स्पष्ट, त्रि-आयामी इरादे और कंप्यूटर की सपाट, द्वि-आयामी पैटर्न के आधार पर अनुमान लगाने की प्रवृत्ति के बीच के अंतर को पाटने की रही है।

स्टेबिलिटी एआई (Stability AI) और यूनिवर्सिटी ऑफ इलिनोइस अर्बाना-शैंपेन के शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए '4डायरेक्टर' (4Director) नामक एक नया दृष्टिकोण पेश किया है। कंप्यूटर से किसी वस्तु के पथ का अनुमान लगाने के लिए कहने के बजाय, 4डायरेक्टर वीडियो जनरेशन शुरू होने से पहले ही कंप्यूटर को दृश्य का एक पूर्ण, त्रि-आयामी मानचित्र प्रदान करता है। इस प्रणाली में, एक प्रारंभिक तस्वीर में मौजूद प्रत्येक वस्तु को एक ठोस, डिजिटल 3D मॉडल के रूप में पुनर्गठित किया जाता है, ठीक वैसे ही जैसे एक मूर्तिकार मिट्टी की आकृति बनाता है जिसका एक सामने का हिस्सा, एक पिछला हिस्सा और किनारे होते हैं, भले ही मूल फोटो में केवल सामने का हिस्सा ही दिखाया गया हो। बैकग्राउंड को भी अंतरिक्ष में बिंदुओं के एक बादल (cloud of points) में बदल दिया जाता है। एक बार जब यह डिजिटल दुनिया बन जाती है, तो उपयोगकर्ता कैमरे के लिए एक पथ और वस्तु के लिए एक पथ खींच सकता है, ठीक वैसे ही जैसे एक फिल्म निर्देशक शॉट की योजना बनाता है। इसके बाद कंप्यूटर इन ठोस 3D मॉडलों को निर्धारित पथों पर पूर्ण कठोरता (rigidity) के साथ घुमाता है, यह सुनिश्चित करते हुए कि यदि कोई वस्तु घूमती है, तो वह एक संपूर्ण इकाई के रूप में घूमती है, और यदि कैमरा चलता है, तो बैकग्राउंड सही ढंग से बदलता है।

नवाचार इस बात में निहित है कि इस कठोर कंकाल (rigid skeleton) का उपयोग अंतिम वीडियो को निर्देशित करने के लिए कैसे किया जाता है। प्रणाली पहले दृश्य का एक सरल, ब्लैक-एंड-व्हाइट डेप्थ मैप (गहराई का मानचित्र) बनाती है, जो केवल कैमरा से प्रत्येक सतह की दूरी दिखाता है जब वस्तुएं अपने पथों पर चलती हैं। यह डेप्थ मैप एक सख्त मचान (scaffold) के रूप में कार्य करता है, जो यह सटीक रूप से परिभाषित करता है कि स्थान और समय के संदर्भ में प्रत्येक पिक्सेल कहाँ होना चाहिए। एक विशेष प्रशिक्षण मॉड्यूल, जिसे शोधकर्ता 'मोशन अडैप्टर' (Motion Adapter) कहते हैं, फिर इस कठोर कंकाल को लेता है और इसमें छूटे हुए विवरण भर देता है। यह सतह की बनावट (textures), प्रकाश व्यवस्था और सूक्ष्म, गैर-कठोर गतिविधियों—जैसे किसी व्यक्ति के हाथ का हिलना या झंडे का फड़फड़ाना—को उस निश्चित 3D संरचना के ऊपर पेंट करना सीखता है। यह सुनिश्चित करता है कि अंतिम वीडियो स्थिति और अभिविन्यास (orientation) के लिए उपयोगकर्ता के सटीक निर्देशों का पालन करे और फिर भी एक प्राकृतिक, जीवंत दृश्य की तरह दिखे।

इस प्रणाली को काम करना सिखाने के लिए, शोधकर्ताओं को एक विशाल नया डेटासेट बनाना पड़ा क्योंकि मौजूदा वीडियो संग्रहों में आवश्यक 3D मानचित्र उपलब्ध नहीं थे। उन्होंने एक स्वचालित पाइपलाइन बनाई जिसने 20,000 से अधिक वीडियो क्लिप्स को रिवर्स-इंजीनियर किया, जिससे प्रत्येक को एक कठोर 3D दृश्य, कैमरा पथ और वस्तु पथ में बदल दिया गया। यह डेटासेट, जिसका नाम 'रियलसीओडी-रिजिड' (RealCOD-Rigid) है, ने मोशन अडैप्टर को एक ठोस वस्तु की कठोर गति और वास्तविक दुनिया के विवरणों की लचीली गति के बीच अंतर को सीखने में मदद की। परिणाम पिछले तरीकों की तुलना में उल्लेखनीय सुधार दिखाते हैं। परीक्षणों में, 4डायरेक्टर वस्तुओं को सुसंगत और पहचानने योग्य बनाए रखने में सक्षम रहा, यहाँ तक कि तब भी जब वे पूरी तरह से घूम गए या कैमरे के दृश्य से बाहर जाकर वापस आ गए, एक ऐसा कार्य जहाँ अन्य सिस्टम अक्सर वस्तु की पहचान खोकर या उसे बैकग्राउंड में धुंधला करके विफल हो जाते थे।

शोधकर्ताओं ने सफलता को मापने का एक नया तरीका भी विकसित किया, यह पहचानते हुए कि केवल यह जांचना कि कोई वस्तु सही स्थान पर है या नहीं, पर्याप्त नहीं है यदि वस्तु स्वयं बदल गई हो। उनका नया मीट्रिक वस्तु की स्थिति और पहचान दोनों की जांच करता है, यह सुनिश्चित करता है कि मुड़ता हुआ कार अभी भी वही कार ही रहे। अन्य अग्रणी वीडियो जनरेशन टूल्स की तुलना में, 4डायरेक्टर ने लगातार उच्च दृश्य गुणवत्ता और दृश्य के भीतर कैमरा और वस्तुओं दोनों पर बहुत अधिक सटीक नियंत्रण प्रदर्शित किया। यह प्रणाली दर्शाती है कि कंप्यूटर को वीडियो बनाना शुरू करने से पहले दुनिया की स्पष्ट, त्रि-आयामी समझ देकर, उस स्तर का नियंत्रण प्राप्त करना संभव है जो पहले पहुंच से बाहर था, जिससे उपयोगकर्ता एक पेशेवर फिल्म निर्माता की सटीकता के साथ एक दृश्य के प्रवाह को निर्देशित कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →