← नवीनतम पेपर
💻 computer science

Enhancing In-context Panoramic Generation via Geometric-aware Pretraining

यह शोध पत्र Canvas360 को प्रस्तुत करता है, जो एक नए निर्मित 1M-नमूना डेटासेट और ज्यामिति-जागरूक प्रीट्रेनिंग तकनीकों का लाभ उठाते हुए विविध इन-कॉन्टेक्स्ट पैनोरमिक जनरेशन कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करने के साथ-साथ बेहतर ज्यामितीय निरंतरता और वैश्विक सुसंगतता सुनिश्चित करता है।

मूल लेखक: Haoran Feng, Ruiyang Zhang, Longyi Zhang, Dizhe Zhang, Lu Qi

प्रकाशित 2026-07-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Haoran Feng, Ruiyang Zhang, Longyi Zhang, Dizhe Zhang, Lu Qi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप कागज के एक सपाट टुकड़े पर एक कमरे का सटीक 360-डिग्री पैनोरमा पेंट करने की कोशिश कर रहे हैं। समस्या क्या है? जब आप एक सपाट मानचित्र को गोले (sphere) के चारों ओर लपेटते हैं, तो ऊपर और नीचे के हिस्से पिघले हुए चीज़ पिज्जा की तरह दब जाते हैं और खिंच जाते हैं। अधिकांश AI आर्ट जनरेटर इसे ठीक करने के लिए विशेष "क्यूब" मैप या 3D ट्रिक्स का उपयोग करते हैं, लेकिन इस पेपर के लेखक, Canvas360, सुझाव देते हैं कि वे तरीके अभी भी ज्यामिति (geometry) को थोड़ा अजीब बना देते हैं। उनका तर्क है कि यदि आप वास्तव में एक निर्दोष, विरूपण-मुक्त (distortion-free) पैनोरमिक दुनिया चाहते हैं, तो आप केवल चित्र को नहीं देख सकते; आपको स्थान की गहराई और आकार को समझना होगा।

तो, उन्होंने इसे कैसे ठीक किया? उन्होंने एक दो-चरणीय प्रशिक्षण पाइपलाइन बनाई जो एक मास्टर आर्किटेक्ट और फिर एक बहुमुखी चित्रकार की तरह काम करती है।

चरण 1: ज्योमेट्री बूट कैंप (Geometry Boot Camp)
सबसे पहले, टीम ने अपने AI मॉडल को दुनिया को 2D के बजाय 3D में देखना सिखाया। उन्होंने केवल मॉडल को तस्वीरें नहीं दिखाईं; उन्होंने प्रत्येक छवि को एक डेप्थ मैप (एक ब्लूप्रिंट जो दिखाता है कि प्रत्येक वस्तु कितनी दूर है) के साथ जोड़ा। उन्होंने मॉडल में इन युग्मित नमूनों के 1,00,000 उदाहरण डाले।

यह सुनिश्चित करने के लिए कि मॉडल चित्र और ब्लूप्रिंट के बीच भ्रमित न हो जाए, उन्होंने एक चतुर ट्रिक का उपयोग किया: उन्होंने डेप्थ मैप को एक "पोज़िशनल ऑफसेट" दिया, जैसे कि किसी को थिएटर में अलग सीट नंबर देना ताकि उसे पता चल सके कि वह बगल वाले चित्र के समान नहीं है। उन्होंने एक विशेष नियम भी जोड़ा जिसे "सिमिलरिटी लॉस" (similarity loss) कहा जाता है, जो मूल रूप से मॉडल को तब डांटता था जब चित्र और डेप्थ मैप एक-दूसरे के बहुत समान दिखने लगते थे, जिससे उन्हें अलग रहने के लिए मजबूर किया जा सके।

सबसे दिलचस्प बात यह है कि उन्होंने वेलोसिटी सर्कुलर पैडिंग (velocity circular padding) पेश की। एक वीडियो गेम की दुनिया की कल्पना करें जहाँ यदि आप स्क्रीन के दाहिने किनारे से बाहर निकलते हैं, तो आप तुरंत बाईं ओर दिखाई देते हैं। लेखकों ने यह सुनिश्चित किया कि AI समझ सके कि पैनोरमा के बाएं और दाएं किनारे वास्तव में एक गोले पर पड़ोसी हैं। उन्होंने केवल किनारों को कॉपी-पेस्ट नहीं किया; उन्होंने मॉडल को सिखाया कि किनारे पर "वेलोसिटी" (परिवर्तन की दिशा) दूसरे पक्ष में पूरी तरह से प्रवाहित होनी चाहिए। इसने मॉडल को अदृश्य सीम (seams) बनाए रखने में मदद की।

चरण 2: बहुमुखी चित्रकार (The Versatile Painter)
एक बार जब मॉडल ज्यामिति को समझ गया, तो वे दूसरे चरण पर चले गए: इसे इन-कॉन्टेक्स्ट जनरेशन (in-context generation) में महारत हासिल करना सिखाना। इसका अर्थ है कि AI अब एक मौजूदा छवि और एक टेक्स्ट प्रॉम्प्ट लेकर बिना डेप्थ मैप के कई जादू कर सकता है। उन्होंने इसे Canvas360Dataset नामक एक विशाल नए डेटासेट पर प्रशिक्षित किया, जिसमें 10 लाख उच्च-गुणवत्ता वाले नमूने हैं।

यह डेटासेट 9,00,000 नए उदाहरणों को संश्लेषित करके बनाया गया था जो चार विशिष्ट कार्यों को कवर करते हैं:

  • स्टाइल ट्रांसफर (Style Transfer): एक फोटो को पेंसिल स्केच या पेंटिंग में बदलना (2,00,000 नमूने)।
  • आउटपेंटिंग (Outpainting): मूल सीमाओं से परे दृश्य का विस्तार करना (2,50,000 नमूने)।
  • इनपेंटिंग (Inpainting): छवि में गायब छेदों को भरना (2,50,000 नमूने)।
  • एडिटिंग (Editing): वस्तुओं (जैसे सोफा) को हटाना या नई वस्तुएं जोड़ना (2,00,000 नमूने)।

लेखक स्पष्ट रूप से इस विचार का खंडन करते हैं कि आपको इन सभी कार्यों के लिए अलग-अलग मॉडल प्रशिक्षित करने की आवश्यकता है या पुराने "क्यूब मैप" तरीकों पर निर्भर रहने की आवश्यकता है। इसके बजाय, वे सुझाव देते हैं कि एक एकल, एकीकृत मॉडल, जो ज्यामिति पर प्री-ट्रेंड है, इन सभी कामों को बेहतर ढंग से संभाल सकता है।

क्या यह काम आया?
परिणाम एक मजबूत सुधार का सुझाव देते हैं। जब उन्होंने मॉडल का परीक्षण किया, तो इसने एक विशिष्ट मीट्रिक जिसे FAED कहा जाता है (जो यह मापता है कि पैनोरमा ज्यामिति के प्रति कितना वफादार है) पर सर्वश्रेष्ठ स्कोर किया और अन्य गुणवत्ता जांचों पर भी बहुत अच्छा प्रदर्शन किया। 71 लोगों के एक उपयोगकर्ता अध्ययन में, जो 10 छवियों को देख रहे थे, Canvas360 सबसे निर्दोष सीमाओं और सर्वोत्तम समग्र गुणवत्ता के लिए पसंदीदा रहा।

लेखक नोट करते हैं कि जबकि पिछले तरीकों ने अक्सर पैनोरमा को संपादित करते समय धुंधले किनारे या विकृत वस्तुएं छोड़ीं, Canvas360 ने 3D संरचना को बरकरार रखने में सफलता प्राप्त की। उन्होंने यह दावा नहीं किया कि उन्होंने ब्रह्मांड की हर समस्या को हल कर दिया है, लेकिन उनके प्रयोगों से पता चलता है कि दुनिया के गोलाकार आकार का सम्मान करना सिखाकर, उन्होंने एक ऐसा उपकरण बनाया है जो बहुत अधिक सुसंगत और यथार्थवादी पैनोरमिक चित्र उत्पन्न करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →