← नवीनतम पेपर
💻 computer science

One View Is Enough! Monocular Training for In-the-Wild Novel View Generation

यह शोध पत्र OVIE को प्रस्तुत करता है, जो एक नवीन मोनोकुलर प्रशिक्षण ढांचा (monocular training framework) है जो अनपेयर्ड इंटरनेट छवियों से नवीन दृश्यों को संश्लेषित करने के लिए गहराई-आधारित ज्यामितीय मचान (depth-based geometric scaffold) और प्रशिक्षण के दौरान मास्क्ड लॉस (masked losses) का लाभ उठाता है, जिसके परिणामस्वरूप एक ज्यामिति-मुक्त इन्फरेंस मॉडल प्राप्त होता है जो काफी तेज़ गति के साथ अत्याधुनिक ज़ीरो-शॉट प्रदर्शन प्राप्त करता है।

मूल लेखक: Adrien Ramanana Rahary, Nicolas Dufour, Patrick Perez, David Picard

प्रकाशित 2026-03-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Adrien Ramanana Rahary, Nicolas Dufour, Patrick Perez, David Picard

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कैथेड्रल (गिरजाघर) की एक अकेली तस्वीर देख रहे हैं। आप उसका सामने का हिस्सा देख सकते हैं, लेकिन पिछला हिस्सा नहीं। मानव मस्तिष्क अद्भुत है; यह तुरंत कल्पना कर सकता है कि वह कैथेड्रल बगल से, पीछे से, या यहाँ तक कि ऊपर से (बर्ड्स-आई व्यू) कैसा दिखता होगा, क्योंकि यह इस बात की जानकारी का उपयोग करता है कि इमारतें कैसे काम करती हैं।

लंबे समय तक, कंप्यूटर ऐसा करने के लिए संघर्ष करते रहे हैं। कंप्यूटर को "कोने के पार देखना" सिखाने के लिए, शोधकर्ताओं को आमतौर पर मल्टी-व्यू डेटासेट्स (multi-view datasets) की आवश्यकता होती थी—मूल रूप से एक ही वस्तु की हर संभव कोण से ली गई हजारों तस्वीरें। यह बिल्कुल वैसा ही है जैसे किसी को केवल एक विशिष्ट कार और एक विशिष्ट ट्रैक पर उसका वीडियो दिखाकर कार चलाना सिखाना। यदि आप उन्हें एक अलग कार में अलग सड़क पर डाल देंगे, तो वे खो जाएंगे। सटीक, युग्मित (paired) डेटा की इस आवश्यकता ने कंप्यूटर को बहुत विशिष्ट, उबाऊ परिदृश्यों तक सीमित कर दिया था।

यहाँ आता है OVIE (One View Is Enough! Monocular Training for In-the-Wild Novel View Generation)। यह नया तरीका एक जादूगर की तरह है जो केवल एक फोटो देखकर किसी भी कार को किसी भी सड़क पर चलाना सीख सकता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: "पेयर" (Pair) की बाधा

पारंपरिक रूप से, कंप्यूटर को एक नया दृश्य (view) उत्पन्न करने के लिए सिखाने के लिए, आपको एक "सोर्स" (Source) फोटो और एक "टारगेट" (Target) फोटो (एक अलग कोण से उसी दृश्य की फोटो) को अगल-बगल दिखाना पड़ता था। यह एक शिक्षक की तरह है जो दो फ्लैशकार्ड पकड़कर कहता है, "देखो पेड़ कैसे हिला? अब अनुमान लगाओ कि वह कहाँ गया।"

  • समस्या: इंटरनेट पर इन सटीक जोड़ों को खोजना लगभग असंभव है। अधिकांश तस्वीरें केवल एकल स्नैपशॉट होती हैं। इसका मतलब था कि AI केवल डेटा के छोटे, क्यूरेटेड संग्रहों से ही सीख सकता था।

2. समाधान: "मैजिक स्कैफोल्ड" (Magic Scaffold)

लेखकों ने महसूस किया कि उन्हें वास्तविक "टारगेट" फोटो की आवश्यकता नहीं है। वे एक चतुर ट्रिक का उपयोग करके उन्हें नकली (fake) बना सकते हैं।

  • ट्रिक: वे एक पूर्व-प्रशिक्षित "डेप्थ एस्टिमेटर" (Depth Estimator - एक उपकरण जो यह अनुमान लगाता है कि चीजें कितनी दूर हैं) का उपयोग करते हैं।
  • उपमा: कल्पना कीजिए कि आप एक घर का 2D चित्र ले रहे हैं और एक जादुई रूलर का उपयोग करके उसे 3D मिट्टी के मॉडल (clay model) में बदल रहे हैं। एक बार जब यह 3D मॉडल बन जाता है, तो आप अपने मन में इसके चारों ओर घूम सकते हैं और पीछे से एक तस्वीर ले सकते हैं।
  • चुनौती: चूंकि मूल फोटो सपाट थी, इसलिए "मिट्टी का मॉडल" थोड़ा अस्त-व्यस्त हो सकता है। जब आप इसके चारों ओर घूमेंगे, तो आपको वहां "छेद" दिखाई दे सकते हैं जहाँ घर का पिछला हिस्सा होना चाहिए था (क्योंकि AI को नहीं पता था कि वहां क्या था)।
  • समाधान: AI उन छेदों को अनदेखा करना सीखता है। यह केवल "नकली फोटो" के उन हिस्सों से सीखता है जो समझ में आते हैं। यह एक छात्र की तरह है जो एक ऐसे मानचित्र का अध्ययन कर रहा है जिसके कुछ हिस्से गायब हैं; वे उन सड़कों को सीखते हैं जो वहां हैं और बाकी का अनुमान लगाने में बहुत माहिर हो जाते हैं।

3. प्रशिक्षण: "वाइल्ड" (Wild) से सीखना

एक छोटे, सटीक डेटासेट के बजाय, OVIE को इंटरनेट से 3 करोड़ रैंडम फोटो खिलाए गए।

  • उपमा: कल्पना कीजिए कि आप एक भाषा सीखने की कोशिश कर रहे हैं। अधिकांश छात्र व्याकरण के साथ एक आदर्श पाठ्यपुस्तक का उपयोग करते हैं (पुराने तरीके)। OVIE, हालांकि, एक व्यस्त, अराजक शहर में बातचीत को 3 करोड़ घंटों तक छिपकर सुनने (eavesdropping) में बिताया।
  • क्योंकि इसने बहुत सी अलग-अलग चीजें देखीं—जैसे घर के अंदर के कमरे, बाहरी सड़कें, पेंटिंग और वस्तुएं—इसने यह सीखा कि 3D स्पेस के सामान्य नियम क्या हैं, न कि केवल विशिष्ट कमरों को याद किया।

4. परिणाम: सुपर स्पीड और सुपर जनरलाइजेशन

प्रशिक्षण के बाद, OVIE को अब "जादुई रूलर" (डेप्थ एस्टिमेटर) की आवश्यकता नहीं होती है। यह बस एक फोटो लेता है और वांछित कैमरा एंगल के साथ तुरंत नया दृश्य प्रस्तुत कर देता है।

  • गति: यह अगली सबसे अच्छी विधि से 600 गुना तेज़ है।
    • उपमा: यदि पुराने तरीके एक उत्कृष्ट कृति (masterpiece) बनाने की कोशिश करने वाले एक घोंघे की तरह थे, तो OVIE मैक 1 की गति से उड़ते हुए एक उत्कृष्ट कृति बनाने वाले जेट फाइटर की तरह है। यह रियल-टाइम में चल सकता है, जिससे आप केवल अपने माउस को हिलाकर एक कमरे के माध्यम से "उड़" सकते हैं।
  • बहुमुखी प्रतिभा: क्योंकि इसने 3 करोड़ रैंडम छवियों से सीखा है, यह उन चीजों पर भी काम करता है जिन्हें इसे स्पष्ट रूप से नहीं सिखाया गया था। यह एक पेंटिंग, एक वीडियो गेम स्क्रीनशॉट या एक वास्तविक दुनिया की सड़क का नया दृश्य समान सहजता के साथ उत्पन्न कर सकता है।

यह क्यों मायने रखता है

इससे पहले, यदि आप किसी ऐतिहासिक इमारत या कलाकृति के 3D संस्करण को देखना चाहते थे, तो आपको सैकड़ों तस्वीरें लेने के लिए फोटोग्राफरों की एक टीम की आवश्यकता होती थी। अब, OVIE के साथ, आप एक एकल फोटो ले सकते हैं और किसी भी कोण से उस दृश्य को देख सकते हैं।

यह 2D फोटो के पूरे इंटरनेट को एक 3D प्लेग्राउंड में बदल देता है, यह साबित करते हुए कि आपको पूर्ण ज्यामिति (perfect geometry) सीखने के लिए पूर्ण डेटा की आवश्यकता नहीं है—आपको बस बहुत सारे डेटा और उससे सीखने के एक स्मार्ट तरीके की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →