Scaling Sequence-to-Sequence Generative Neural Rendering
कैलीडो (Kaleido) एक एकीकृत, डिकोडर-ओनली रेक्टिफाइड फ्लो ट्रांसफार्मर है जो 3D रेंडरिंग को सीक्वेंस-टू-सीक्वेंस वीडियो सिंथेसिस कार्य के रूप में मानता है, जो बड़े पैमाने पर वीडियो प्री-ट्रेनिंग का लाभ उठाकर स्टेट-ऑफ-द-आर्ट, एक्सप्लिसिट-3D-फ्री व्यू सिंथेसिस के साथ मजबूत ज़ीरो-शॉट प्रदर्शन को सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास खिड़की पर बैठी एक बिल्ली की केवल एक फोटो है। यदि आप देखना चाहते हैं कि बिल्ली पीछे से कैसी दिखती है, या बगल से कैसी दिखती है, तो एक सामान्य कंप्यूटर प्रोग्राम संघर्ष करेगा क्योंकि उसके पास केवल वह एक सपाट तस्वीर है। वह यह नहीं "जानता" कि बिल्ली का एक 3D शरीर है; वह केवल उस एक छवि के पिक्सेल को जानता है।
यह पेपर Kaleido को पेश करता है, जो एक नए प्रकार का AI है जो इस समस्या को हल करता है और यह बदलकर कि हम 3D विजन को कैसे देखते हैं। 3D मॉडल बनाने की कोशिश करने के बजाय (जैसे कि एक डिजिटल मिट्टी की मूर्ति), Kaleido 3D विजन को एक वीडियो गेम की तरह मानता है।
यहाँ इसका सरल विवरण दिया गया है, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है:
1. बड़ा विचार: 3D बस एक विशेष प्रकार का वीडियो है
लेखकों का तर्क है कि हमें कंप्यूटर को 3D स्थान को समझने के लिए जटिल ज्यामिति (geometry) के नियम सिखाने की आवश्यकता नहीं है। इसके बजाय, उन्होंने महसूस किया कि 3D बस एक विशेष प्रकार का वीडियो है।
- उपमा: एक वीडियो को समय के साथ चलने वाले फ्रेम के क्रम के रूप में सोचें। Kaleido एक 3D दृश्य को स्थान के ऊपर चलने वाली छवियों के एक क्रम के रूप में मानता है।
- यह कैसे काम करता है: यदि आप किसी मूर्ति के चारों ओर घूमते हैं, तो आपके द्वारा देखी जाने वाली छवियां बदल जाती हैं। Kaleido इस पैटर्न को लाखों घंटों के सामान्य वीडियो को देखकर सीखता है। वह सीखता है कि "यदि मैं कैमरे को बाईं ओर ले जाता हूँ, तो वस्तु दाईं ओर खिसक जाती है।" उसे गोले (sphere) की गणित जानने की आवश्यकता नहीं है; वह बस इस दृश्य पैटर्न को सीख लेता है कि जब आप वस्तुओं के चारों ओर घूमते हैं तो वे कैसी दिखती हैं।
2. "Any-to-Any" का जादू
पुराने AI मॉडल कठोर रोबोटों की तरह थे: "मैं केवल 1 फोटो ले सकता हूँ और 5 नई बना सकता हूँ," या "मैं केवल 5 फोटो ले सकता हूँ और 1 नई बना सकता हूँ।"
Kaleido एक गिरगिट की तरह है। यह आपके द्वारा दी गई किसी भी संख्या में तस्वीरें (1, 5, या 50) ले सकता है और आपके द्वारा चुने गए किसी भी कोण से वांछित संख्या में नए दृश्य उत्पन्न कर सकता है।
- रूपक: कल्पना करें कि आपके पास एक जादुई स्केचबुक है। यदि आप इसे घर का एक चित्र दिखाते हैं, तो यह तुरंत घर का पिछला, बगल का और अंदर का हिस्सा बना सकता है। यदि आप इसे अलग-अलग कोणों से घर के दस चित्र दिखाते हैं, तो यह घर का एक और भी बेहतर, विस्तृत संस्करण बना सकता है। इससे कोई फर्क नहीं पड़ता कि आप कितनी तस्वीरों के साथ शुरुआत करते हैं; यह बस खुद को ढाल लेता है।
3. "दुनिया के पुस्तकालय" से सीखना
बहुत अच्छा बनने के लिए, Kaleido ने केवल 3D मॉडल (जो दुर्लभ और बनाने में कठिन होते हैं) का अध्ययन नहीं किया। इसने इंटरनेट के वीडियो डेटा के पूरे पुस्तकालय को पढ़ा।
- उपमा: इसे एक बच्चे के बोलने सीखने जैसा समझें। वे पहले व्याकरण की किताब का अध्ययन नहीं करते; वे हजारों घंटों तक लोगों को बात करते हुए सुनते हैं। Kaleido ने लाखों घंटों के वीडियो को "सुना"। क्योंकि वीडियो स्वाभाविक रूप से दिखाते हैं कि कैमरा हिलने पर वस्तुएं अलग-अलग कोणों से कैसी दिखती हैं, Kaleido ने "दृश्य सामान्य ज्ञान" (visual common sense) सीखा। उसने सीखा कि कप का एक निचला हिस्सा, एक ऊपरी हिस्सा और किनारे होते हैं, सिर्फ वीडियो में उसे चलते हुए देखकर।
4. "रजिस्टर" फिक्स (अराजकता को स्थिर करना)
जब शोधकर्ताओं ने AI को बड़ा और स्मार्ट बनाने की कोशिश की, तो यह "पागल" होने लगा। कंप्यूटर के मस्तिष्क के अंदर के नंबर इतने बड़े हो गए कि उन्होंने त्रुटियां (errors) पैदा कर दीं (जैसे कैलकुलेटर का ओवरफ्लो होना)।
- उपमा: एक भीड़भाड़ वाली पार्टी की कल्पना करें जहाँ हर कोई चिल्ला रहा है। शोर इतना बढ़ जाता है कि स्पीकर टूट जाते हैं। शोधकर्ताओं ने पाया कि वे सिस्टम में कुछ "म्यूट बटन" (जिन्हें रजिस्टर कहा जाता है) जोड़ सकते हैं। इन बटनों ने बातचीत को रोका नहीं, बल्कि अतिरिक्त शोर को सोख लिया, जिससे पार्टी शांत रही और AI स्थिर रहा। इसने उन्हें बिना क्रैश हुए एक बहुत बड़ा, अधिक शक्तिशाली मॉडल बनाने की अनुमति दी।
5. यह वास्तव में क्या कर सकता है?
पेपर दिखाता है कि Kaleido वर्तमान में अपने विशिष्ट कार्य में सर्वश्रेष्ठ है:
- यह विशेषज्ञों को पछाड़ता है: उन परीक्षणों में जहाँ इसे यह अनुमान लगाने के लिए कहा गया था कि एक नया दृश्य नए कोण से कैसा दिखता है, Kaleido ने अन्य AI मॉडलों से बेहतर प्रदर्शन किया, भले ही इसे बहुत कम शुरुआती तस्वीरें दी गई थीं।
- यह "धीमी" विधियों को टक्कर देता है: आमतौर पर, एक पूर्ण 3D दृश्य प्राप्त करने के लिए, आपको कंप्यूटर पर घंटों तक एक विशिष्ट दृश्य को ट्यून करने में बिताना पड़ता है। Kaleido इसे बिना किसी ट्यूनिंग के तुरंत करता है, और उसी उच्च गुणवत्ता से मेल खाता है।
- यह 3D मॉडल बनाता है: यदि आप Kaleido को किसी वस्तु की कुछ तस्वीरें देते हैं, तो यह इतने सटीक दृश्य उत्पन्न कर सकता है कि आप उस वस्तु का वास्तविक, घूमने योग्य 3D मॉडल बना सकते हैं।
यह अभी क्या नहीं कर सकता (सीमाएं)
लेखक इस बारे में ईमानदार हैं कि Kaleido अभी क्या नहीं कर सकता:
- यह अभी वास्तविक समय का वीडियो गेम इंजन नहीं है: छवियों को उत्पन्न करने में समय लगता है, इसलिए आप अभी इसका उपयोग तत्काल, लाइव-एक्शन गेमिंग के लिए नहीं कर सकते।
- यह अत्यधिक कोणों (extreme angles) पर भ्रमित हो जाता है: यदि आप इसे किसी बहुत अजीब, असंभव कोण से देखने के लिए कहते हैं, तो परिणाम थोड़ा "सपनों जैसा" या थोड़ा गलत लग सकता है।
- यह ज़ूमिंग को हैंडल नहीं करता है: यह कैमरे को चारों ओर घुमा सकता है, लेकिन यह वर्तमान में कैमरे के लेंस को चलते समय ज़ूम इन या ज़ूम आउट (एक "डॉली ज़ूम") करने का अनुकरण नहीं कर सकता।
संक्षेप में: Kaleido 3D में देखने के लिए कंप्यूटर को सिखाने का एक नया तरीका है। एक कठोर 3D मानचित्र बनाने के बजाय, यह अंतरिक्ष को एक वीडियो की तरह मानकर नए दृश्य की "कल्पना" करना सीखता है, और दुनिया को हर कोण से कैसा दिखना चाहिए, यह सीखने के लिए विशाल मात्रा में वीडियो डेटा का उपयोग करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।