← नवीनतम पेपर
🤖 AI

Unified Panoramic Geometry Estimation via Multi-View Foundation Models

यह शोध पत्र PaGeR को प्रस्तुत करता है, जो एक एकीकृत ढांचा (framework) है जो प्री-ट्रेंड पर्सपेक्टिव-आधारित 3D फाउंडेशन मॉडल्स को पर्सपेक्टिव और पैनोरमिक दोनों छवियों से स्केल-इनवेरिएंट डेप्थ, मेट्रिक डेप्थ, सरफेस नॉर्मल्स और स्काई मास्क का एक साथ अनुमान लगाने के लिए अनुकूलित करता है, जिससे 360-डिग्री दृश्य पुनर्निर्माण (scene reconstruction) में अत्याधुनिक (state-of-the-art) और ज़ीरो-शॉट प्रदर्शन प्राप्त होता है।

मूल लेखक: Vukasin Bozic, Isidora Slavkovic, Dominik Narnhofer, Nando Metzger, Denis Rozumny, Konrad Schindler, Nikolai Kalischek

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vukasin Bozic, Isidora Slavkovic, Dominik Narnhofer, Nando Metzger, Denis Rozumny, Konrad Schindler, Nikolai Kalischek

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सामान्य कैमरा है जो एक मानक फोटो लेता है। यह दुनिया को वैसे ही देखता है जैसे एक मानव आँख देखती है: एक आयताकार फ्रेम जिसमें एक सीमित दृश्य होता है। अब, एक विशेष 360-डिग्री कैमरे की कल्पना करें जो आपके चारों ओर की पूरी दुनिया को एक ही शॉट में कैद करता है, जैसे कि एक फिश-आई लेंस जो फर्श से लेकर छत तक और चारों ओर सब कुछ देख सकता है।

समस्या यह है कि अधिकांश "स्मार्ट" कंप्यूटर विजन मॉडल (वे AI दिमाग जो 3D आकृतियों को समझते हैं) केवल मानक, आयताकार तस्वीरों पर प्रशिक्षित किए गए थे। यदि आप उन्हें 360-डिग्री फोटो देते हैं, तो वे भ्रमित हो जाते हैं क्योंकि वह छवि खिंची हुई और विकृत होती है, खासकर ऊपर और नीचे (जैसे दुनिया का एक नक्शा जहाँ ध्रुव खिंचे हुए होते हैं)।

पेश है PaGeR (पैनोरमिक ज्योमेट्री रिकंस्ट्रक्शन)।

PaGeR को एक सार्वभौमिक अनुवादक (यूनिवर्सल ट्रांसलेटर) के रूप में समझें जो इन स्मार्ट AI मॉडलों को बिना अपनी बुद्धिमत्ता खोए 360-डिग्री फोटो समझने के लिए प्रशिक्षित करता है। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. "क्यूब" वाली ट्रिक (पेंट्री की उपमा)

खिंची हुई, विकृत 360-डिग्री छवि को सीधे ठीक करने के बजाय, PaGeR एक चतुर ट्रिक का उपयोग करता है। कल्पना कीजिए कि आपके पास एक विशाल, गोलाकार कमरा है (360-डिग्री दृश्य)। पूरे गोले को एक साथ देखने के बजाय, PaGeR उस गोले को छह वर्गाकार टुकड़ों में काट देता है और उन्हें एक घन (cube) के चेहरों पर चिपका देता है।

  • ऐसा क्यों किया जाता है? एक मानक फोटो बस एक वर्गाकार दृश्य है। 360-डिग्री दुनिया को छह वर्गाकार "परिप्रेक्ष्य" (perspective) फोटो में बदलकर (एक सामने, पीछे, बाएँ, दाएँ, ऊपर और नीचे के लिए), PaGeR उन्हें उन AI मॉडलों में फीड कर सकता है जो पहले से ही वर्गाकार फोटो समझने में विशेषज्ञ हैं।
  • लाभ: AI को एक नई भाषा सीखने की ज़रूरत नहीं है; यह बस छह परिचित वर्गाकार चित्रों को देखता है जो एक अजीब, खिंची हुई तस्वीर के बजाय हैं।

2. "सीमलेस स्टिच" (रजाई की उपमा)

जब आप छह वर्गाकार फोटो लेते हैं और उन्हें वापस एक गोले में जोड़ने की कोशिश करते हैं, तो आमतौर पर आपको उनके किनारों पर बदसूरत सीवन या दरारें मिलती हैं। यह एक रजाई सिलने की कोशिश करने जैसा है जहाँ पैटर्न आपस में मेल नहीं खाते।

PaGeR इसे सिखाकर हल करता है कि AI को पड़ोसियों को देखना चाहिए। जब AI क्यूब के "दाएं" चेहरे को देख रहा होता है, तो वह गुप्त रूप से "सामने" और "पीछे" के चेहरों पर भी नज़र रखता है ताकि दीवारें और फर्श पूरी तरह से मिल सकें। यह सुनिश्चित करता है कि जब अंतिम 3D मॉडल बनाया जाता है, तो उसमें कोई दरार या उछाल न हो। यह एक निर्बाध, निरंतर 3D दुनिया है।

3. "स्विस आर्मी नाइफ" (बहु-कार्य उपकरण)

अधिकांश AI उपकरण किसी एक काम के लिए डिज़ाइन किए गए होते हैं: शायद वे यह अनुमान लगाते हैं कि चीजें कितनी दूर हैं (डेप्थ/गहराई), या शायद वे यह अनुमान लगाते हैं कि दीवारें किस दिशा में हैं (नॉर्मल्स)।

PaGeR एक स्विस आर्मी नाइफ की तरह है। एक ही क्षण में (एक "फॉरवर्ड पास" में), यह एक साथ सब कुछ करता है:

  • डेप्थ (गहराई): यह आपको बताता है कि कोई वस्तु कितनी दूर है (मीटर में)।
  • सरफेस नॉर्मल्स (सतह के कोण): यह हर सतह के कोण को बताता है (क्या वह दीवार झुकी हुई है? क्या वह फर्श समतल है?)।
  • स्काई सेगमेंटेशन (आकाश का विभाजन): यह जानता है कि छवि के कौन से हिस्से आकाश हैं (जिसका कोई "दूरी" नहीं है क्योंकि यह अनंत है) ताकि यह बादलों या क्षितिज के कारण भ्रमित न हो।

4. "हाइब्रिड ट्रेनिंग" (छात्र की उपमा)

इसे सफल बनाने के लिए, शोधकर्ताओं ने AI को केवल कंप्यूटर द्वारा उत्पन्न नकली 360-डिग्री चित्रों के साथ नहीं पढ़ाया। उन्होंने एक मिश्रित आहार का उपयोग किया:

  • वास्तविक परिप्रेक्ष्य (Perspective) फोटो: यह बनाए रखने के लिए कि AI को वास्तविक दुनिया कैसी दिखती है, इसके बारे में मूल "सामान्य ज्ञान" है।
  • सिंथेटिक 360 फोटो: इसे 360-डिग्री प्रारूप को संभालने के लिए सिखाने के लिए।

यह AI को वह भूलने से रोकता है जो वह पहले से जानता था (जिसे "कैटास्ट्रोफिक फॉरगेटिंग" कहा जाता है), जबकि उसे नए 360-डिग्री कौशल सिखाना जारी रखता है।

उन्होंने क्या हासिल किया?

पेपर का दावा है कि PaGeR अभी अपने काम में सर्वश्रेष्ठ है

  • यह इनडोर दृश्यों (जैसे लिविंग रूम) और आउटडोर दृश्यों (जैसे शहर की सड़कें) दोनों पर काम करता है।
  • यह एक एकल फोटो से अत्यधिक विस्तृत 3D मानचित्र बनाता है।
  • यह इतना अच्छा है कि यह पिछले तरीकों से भी बेहतर प्रदर्शन करता है, यहाँ तक कि एक नए डेटासेट पर भी जिसे लेखकों ने ZüriPano (ज्यूरिख, स्विट्जरलैंड से वास्तविक दुनिया के आउटडोर 360-डिग्री स्कैन का एक संग्रह, क्योंकि मौजूदा डेटा परीक्षण के लिए पर्याप्त अच्छा नहीं था) नाम दिया है।

संक्षेप में: PaGeR सामान्य फोटो के लिए हमारे पास मौजूद सर्वश्रेष्ठ 3D "दिमागों" को लेता है, उन्हें 360-डिग्री दुनिया देखने के लिए एक विशेष "क्यूब" लेंस देता है, और उन्हें इन दृश्यों को पूरी तरह से जोड़ने के लिए सिखाता है, और यह सब एक साथ कई काम करते हुए करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →