← नवीनतम पेपर
🤖 AI

Extend3D: Town-Scale 3D Generation

Extend3D एक ट्रेनिंग-फ्री पाइपलाइन है जो एक एकल छवि से टाउन-स्केल 3D दृश्य उत्पन्न करने के लिए एक ऑब्जेक्ट-सेंट्रिक जनरेटिव मॉडल के लेटेंट स्पेस को विस्तारित करती है, जिसमें स्थानिक संरेखण और ओवरलैपिंग पैच में ज्यामितीय निरंतरता सुनिश्चित करने के लिए पॉइंट क्लाउड प्रायर्स और एक नवीन "अंडर-नॉयजिंग" रिफाइनमेंट रणनीति का उपयोग किया जाता है।

मूल लेखक: Seungwoo Yoon, Jinmo Kim, Jaesik Park

प्रकाशित 2026-04-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Seungwoo Yoon, Jinmo Kim, Jaesik Park

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुंदर तस्वीर है, जैसे कि वेटिकन सिटी जैसा एक हलचल भरा शहर का चौक। आप उस एक सपाट 2D तस्वीर को एक पूर्ण, चलने योग्य 3D दुनिया में बदलना चाहते हैं जहाँ आप चारों ओर देख सकें, इमारतों के पीछे के हिस्से देख सकें और छिपी हुई गलियों की खोज कर सकें।

यह बिल्कुल वही है जो Extend3D पेपर करने की कोशिश करता है। हालाँकि, एक ही फोटो से पूरा शहर बनाना वर्तमान AI के लिए अविश्वसनीय रूप से कठिन है। यहाँ इसका एक सरल विवरण दिया गया है कि उन्होंने इसे कैसे हल किया, कुछ रोजमर्रा के उदाहरणों का उपयोग करते हुए।

समस्या: "छोटे बॉक्स" की सीमा (The "Tiny Box" Limitation)

अधिकांश AI मॉडल जो 3D ऑब्जेक्ट्स बनाते हैं, वे मिट्टी के एक छोटे से बॉक्स वाले मास्टर मूर्तिकार की तरह होते हैं। वे उस छोटे बॉक्स के भीतर एक अकेली मूर्ति या कॉफी कप बनाने में माहिर होते हैं। लेकिन यदि आप उनसे पूरा शहर बनाने के लिए कहते हैं, तो वे उस पूरे शहर को उस छोटे से बॉक्स में दबाने की कोशिश करते हैं। परिणाम? शहर धुंधला हो जाता है, इमारतें आपस में मिल जाती हैं, और विवरण गायब हो जाते हैं। यह एक डाक टिकट पर एक विशाल भित्ति चित्र (mural) पेंट करने की कोशिश करने जैसा है।

साथ ही, ये AI "ऑब्जेक्ट-सेंट्रिक" हैं, जिसका अर्थ है कि उन्हें चीजों को एक जुड़े हुए विश्व के बजाय अलग-अलग वस्तुओं (एक कुर्सी, एक कार) के रूप में देखने के लिए प्रशिक्षित किया गया है। यदि आप उनसे एक सड़क बनाने के लिए कहते हैं, तो वे इमारतों को सही जगह पर रख सकते हैं लेकिन जमीन बनाना भूल सकते हैं, या वे किसी इमारत को टेढ़ा कर सकते हैं क्योंकि वे एक सड़क के "प्रवाह" को नहीं समझते हैं।

समाधान: Extend3D

सियोल नेशनल यूनिवर्सिटी के शोधकर्ताओं ने इसे हल करने के लिए एक "ट्रेनिंग-फ्री" पाइपलाइन (जिसका अर्थ है कि उन्हें AI को शुरू से फिर से प्रशिक्षित करने की आवश्यकता नहीं थी) विकसित की। उन्होंने तीन मुख्य तरकीबों का उपयोग किया:

1. "पहेली के टुकड़े" की रणनीति (Overlapping Patches)

पूरे शहर को एक बार में उस छोटे से बॉक्स में बनाने के बजाय, उन्होंने उस बॉक्स को बहुत बड़ा बना दिया। लेकिन एक बहुत बड़ा बॉक्स AI के लिए एक बार में संभालना बहुत कठिन है।

इसलिए, उन्होंने उस विशाल बॉक्स को कई छोटे, एक-दूसरे पर चढ़ते हुए (overlapping) पहेली के टुकड़ों में काट दिया।

  • उदाहरण: कल्पना कीजिए कि कलाकारों का एक समूह एक विशाल भित्ति चित्र पेंट कर रहा है। पूरे चित्र को एक व्यक्ति द्वारा पेंट करने के बजाय, वे प्रत्येक को एक छोटा हिस्सा सौंप देते हैं। लेकिन यहाँ जादू यह है: वे हिस्से एक-दूसरे के ऊपर चढ़ते (overlap) हैं
  • ओवरलैप क्यों? यदि कलाकार A एक पेड़ पेंट कर रहा है जो कलाकार B के हिस्से की रेखा को पार करता है, तो वे एक-दूसरे से बात कर सकते हैं। कलाकार B कह सकता है, "अरे, उस शाखा को मेरे तने से जुड़ने की जरूरत है।" यह सुनिश्चित करता है कि पूरा दृश्य सुसंगत और विस्तृत बना रहे, न कि टुकड़ों के मिलने वाली जगह पर कटे-फटे दिखें।

2. "कंकाल" और "भूत" (Initialization & Under-noising)

जब AI पेंट करना शुरू करता है, तो वह अक्सर भ्रमित हो जाता है। वह फर्श बनाना भूल सकता है, या इमारतों के लिए बड़े छेद छोड़ सकता है (क्योंकि मूल फोटो इमारतों के पीछे का हिस्सा नहीं दिखाती है)।

  • कंकाल (The Skeleton): AI शुरू करने से पहले, शोधकर्ता उसे फोटो के डेप्थ (गहराई) से प्राप्त एक "पॉइंट क्लाउड" (बिंदुओं का एक 3D मानचित्र) से बना एक "कंकाल" देते हैं। यह AI को बताता है, "जमीन यहाँ है, और इमारतें वहाँ हैं।" यह मूर्तिकार को एक वायरफ्रेम देने जैसा है ताकि वे खाली स्लेट से शुरुआत न करें।
  • "अंडर-नोइजिंग" (Under-noising) की तरकीब: यह सबसे शानदार हिस्सा है। आमतौर पर, जब AI गलती सुधारने की कोशिश करता है, तो वह छवि को धुंधला करने के लिए "नॉइज़" (रैंडम स्टैटिक) जोड़ता है और फिर उसे साफ करने की कोशिश करता है। शोधकर्ताओं ने पाया कि 3D के लिए, उन्हें इसके विपरीत करना चाहिए: सामान्य से कम नॉइज़ जोड़ना चाहिए।
    • उदाहरण: कल्पना कीजिए कि आपके पास एक कमरे का स्केच है, लेकिन पीछे की दीवार गायब है। यदि आप बहुत अधिक स्टैटिक जोड़ते हैं, तो AI भ्रमित हो जाता है। लेकिन यदि आप केवल थोड़ा सा स्टैटिक (under-noising) जोड़ते हैं, तो AI गायब दीवार को एक "रहस्य को सुलझाने" के रूप में देखता है, न कि एक खाली शून्य के रूप में। यह गायब हिस्सों को स्वाभाविक रूप से भर देता है, जैसे कोई जासूस कहानी के अंतराल को भरता है।

3. "संपादक की कलम" (The "Editor's Model" - Optimization)

पहेली के टुकड़ों और कंकाल के बावजूद, AI अभी भी भटक सकता है। वह किसी इमारत को तैरते हुए बादल जैसा बना सकता है या फर्श को गायब कर सकता है।

इसे ठीक करने के लिए, उन्होंने एक चरण जोड़ा जहाँ वे काम करते समय लगातार मूल फोटो और 3D कंकाल के विरुद्ध AI के काम की जांच करते हैं।

  • उदाहरण: इसे एक फिल्म निर्देशक के रूप में सोचें जो फिल्मांकन के दौरान एक दृश्य को देख रहा है। यदि अभिनेता (AI) कल्पना करने लगता है और सेट से बाहर जाने लगता है, तो निर्देशक "कट!" चिल्लाता है और उसे वापस पटकथा पर लाता है। शोधकर्ता हर कदम पर AI के गणित को "धक्का" देते हैं ताकि यह सुनिश्चित हो सके कि इमारतें जमीन पर टिकी रहें और बनावट वास्तविक दिखे।

परिणाम

इन तीन चरणों को जोड़कर, Extend3D एक फोटो से एक विशाल, विस्तृत 3D दुनिया बना सकता है जिसे आप एक्सप्लोर कर सकते हैं।

  • पहले से बेहतर: पिछले तरीकों के परिणाम अक्सर धुंधले धब्बे या कटे हुए ब्लॉक होते थे। यह तरीका तीक्ष्ण और सुसंगत दृश्य बनाता है।
  • छवि के प्रति वफादार: 3D दुनिया बिल्कुल वैसी ही दिखती है जैसी आपकी शुरुआती फोटो थी, बस इसमें एक वास्तविक दुनिया की गहराई जुड़ गई है।

संक्षेप में

Extend3D एक ऐसे मास्टर मूर्तिकार की तरह है जो केवल छोटी मूर्तियाँ बनाना जानता है, उन्हें एक विशाल कैनवास दिया जाता है, कैनवास को ओवरलैपिंग सेक्शन में विभाजित किया जाता ताकि वे सहयोग कर सकें, उन्हें एक वायरफ्रेम कंकाल दिया जाता है जिसका वे पालन कर सकें, और एक सख्त संपादक लगातार उनकी गलतियों को सुधारता है। परिणाम एक शानदार, चलने योग्य 3D शहर है जो एक सिंगल स्नैपशॉट से उत्पन्न हुआ है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →