← नवीनतम पेपर
💻 computer science

GS-Voxel: Fitting-Free Structured Latents for Large-Scale 3DGS Generation

GS-Voxel एक फिटिंग-मुक्त फ्रेमवर्क पेश करता है जो प्री-ऑप्टिमाइज्ड 3D गॉसियन स्प्लेटिंग पुनर्निर्माणों को स्ट्रक्चर्ड स्पार्स वोक्सेल लेटेंट्स में परिवर्तित करता है, जिससे प्रति-दृश्य अनुकूलन के बिना बड़े पैमाने के हवाई 3D दृश्यों के स्केलेबल, इमेज-कंडीशन्ड जनरेशन को सक्षम बनाया जा सके।

मूल लेखक: Ming Qian, Zijian Wang, Minchao Sun, Jincheng Xiong, Hang Zhang, Mu Xu, Chi Wang, Baoquan Chen

प्रकाशित 2026-08-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ming Qian, Zijian Wang, Minchao Sun, Jincheng Xiong, Hang Zhang, Mu Xu, Chi Wang, Baoquan Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक जंगल की पूरी बनावट को, हर छत के सटीक घुमाव को, और एक हज़ार अलग-अलग खिड़कियों पर प्रकाश पड़ने के तरीके को, एक ही डिजिटल मॉडल में कैद करने की कल्पना करें। दशकों से, वैज्ञानिक ऐसे विस्तृत 3D संसार बनाने के लिए संघर्ष कर रहे हैं जो इतने छोटे हों कि उन्हें स्टोर किया जा सके और इतने तेज़ हों कि उन्हें जनरेट किया जा सके। पारंपरिक तरीके अक्सर जटिल वायरफ्रेम मेश (wireframe meshes) बनाने पर निर्भर करते हैं, जो कारों या मूर्तियों जैसी चिकनी सतहों के लिए तो बेहतरीन हैं, लेकिन पेड़ों, झाड़ियों और बिखरे हुए मलबे जैसी अव्यवस्थपूर्ण और अराजक वास्तविकता के लिए बहुत खराब हैं। एक नया दृष्टिकोण, जिसे 3D गॉसियन स्प्लैटिंग (3D Gaussian Splating) के रूप में जाना जाता है, इसे इस प्रकार हल करता है कि यह दृश्य को एक ठोस वस्तु के रूप में नहीं, बल्कि लाखों छोटे, रंगीन, घूमते हुए दीर्घवृत्त (ellipsoids) के एक विशाल बादल के रूप में प्रस्तुत करता है। ये दीर्घवृत्त 3D स्थान में तैरते हुए व्यक्तिगत पिक्सेल की तरह कार्य करते हैं, जिससे कंप्यूटर को जटिल बाहरी वातावरण की अविश्वसनीय रूप से यथार्थवादी छवियां रेंडर करने की अनुमति मिलती है। हालांकि, जबकि यह तरीका दृश्य के अस्तित्व में आने के बाद उसे कैप्चर करने के लिए उत्कृष्ट है, कंप्यूटर को शून्य से नए दृश्य आविष्कार करने के लिए सिखाना बहुत कठिन है। समस्या यह है कि ये दीर्घवृत्तों के बादल अव्यवस्थित हैं; उनका कोई निश्चित आकार नहीं है, एक दृश्य से दूसरे दृश्य में उनकी संख्या बहुत भिन्न होती है, और वे इस तरह से बिखरे हुए हैं जिन्हें मानक कंप्यूटर प्रोग्राम आसानी से समझ या अनुमान नहीं लगा सकते।

यही वह चुनौती है जिसे Amap, Alibaba, Zhejiang University और Peking University के शोधकर्ताओं ने हल करने का संकल्प लिया। उन्होंने एक नया सिस्टम विकसित किया जिसे GS-Voxel कहा जाता है, जिसे विशेष रूप से शहरों और परिदृश्यों के बड़े पैमाने पर, यथार्थवादी हवाई दृश्यों को उत्पन्न करने के लिए डिज़ाइन किया गया है। उनका मुख्य नवाचार एक "फिटिंग-फ्री" (fitting-free) प्रक्रिया है जो एक मौजूदा, अत्यधिक विस्तृत 3D मॉडल को लेता है और उसे बिना दृश्य को फिर से बनाए या पुन: अनुकूलित किए, एक संरचित प्रारूप में पुनर्गठित करता है। अतीत में, इन अव्यवस्थित दीर्घवृत्तों के बादलों को जेनेरेटिव AI के लिए उपयोगी बनाने के लिए, वैज्ञानिकों को उन्हें एक कठोर, पूर्व-निर्धारित बॉक्स में मजबूर करना पड़ता था या उन्हें जटिल गणितीय युक्तियों का उपयोग करके पुनर्व्यवस्थित करना पड़ता था जो अक्सर मूल विवरणों को विकृत कर देते थे। नया तरीका इससे पूरी तरह बचता है। दृश्य को एक निश्चित सांचे में ढालने के बजाय, सिस्टम दुनिया को अदृश्य 3D ब्लॉकों, या वोक्सेल्स (voxels) के एक ग्रिड में विभाजित कर देता है। फिर यह प्रत्येक ब्लॉक के अंदर देखता है, दीर्घवृत्तों की गिनती करता है, और सबसे महत्वपूर्ण वाले को रखता है, बाकी को हटा देता है। महत्वपूर्ण रूप से, यह इसे रखे गए दीर्घवृत्तों की स्थिति या रंग को बदले बिना करता है, जिससे मूल कैप्चर के सूक्ष्म विवरण सुरक्षित रहते हैं।

एक बार जब दृश्य को इन व्यवस्थित ब्लॉकों में व्यवस्थित कर दिया जाता है, तो शोधकर्ता जानकारी को संकुचित करने के लिए एक विशेष मशीन लर्निंग मॉडल का उपयोग करते हैं। इस मॉडल को एक अनुवादक के रूप में समझें जो 3D दीर्घवृत्तों के दृश्य डेटा को एक संक्षिप्त, संरचित कोड में परिवर्तित करता है जिसे एक जेनेरेटिव AI आसानी से पढ़ और सीख सकता है। यह कोड दुनिया के आकार (कौन से ब्लॉक भरे हुए हैं) को उनके अंदर के विवरणों (दीर्घवृत्तों के रंग और स्थिति) से अलग करता है। इन हजारों संकुचित 3D दृश्यों पर प्रशिक्षण लेकर, AI यह अनुमान लगाना सीखता है कि एक एकल उपग्रह छवि के आधार पर एक नया, अनदेखा शहर ब्लॉक कैसा दिखना चाहिए। परिणाम एक ऐसा सिस्टम है जो विशाल, सुसंगत 3D वातावरण उत्पन्न कर सकता है। शोधकर्ताओं ने इसे 1,400 मीटर गुणा 800 मीटर जैसे बड़े क्षेत्रों को कवर करने वाले दृश्य बनाकर प्रदर्शित किया, जो पिछले तरीकों द्वारा संभाले जाने वाले पैमाने से कहीं अधिक है। उन्होंने इसे ओवरलैपिंग टाइल्स (overlapping tiles) में दृश्य उत्पन्न करके और उन्हें निर्बाध रूप से जोड़कर हासिल किया, जिससे यह सुनिश्चित हुआ कि शहर के विभिन्न हिस्सों के बीच का संक्रमण सुचारू और यथार्थवादी बना रहे।

इस कार्य का महत्व वास्तविक दुनिया के पैमाने और अनियमितता को संभालने की इसकी क्षमता में निहित है। 3D दृश्य उत्पन्न करने के पिछले प्रयास अक्सर कुर्सियों या कमरों जैसी छोटी वस्तुओं के लिए अच्छी तरह से काम करते थे लेकिन शहरों में पाए जाने वाले लाखों व्यक्तिगत तत्वों का सामना करने पर विफल हो जाते थे। नए सिस्टम ने सिद्ध किया कि यह विवरण खोए बिना या कंप्यूटर को प्रत्येक टुकड़े की व्यवस्था का "अनुमान" लगाने की आवश्यकता के बिना, लाखों 3D तत्वों वाले उच्च-गुणवत्ता वाले हवाई दृश्य उत्पन्न करना संभव है। शोधकर्ताओं ने पाया कि उनकी विधि एक ऐसा स्तर का दृश्य गुणवत्ता प्रदान कर सकती है जो वास्तविक दुनिया के डेटा से बारीकी से मेल खाती है, जो इमारतों के घनत्व और वनस्पतियों की बनावट को आश्चर्यजनक सटीकता के साथ कैप्चर करती है। उन्होंने यह भी दिखाया कि सिस्टम को एक एकल उपग्रह फोटो द्वारा निर्देशित किया जा सकता है, जिससे यह पहले कभी न देखे गए शहर के ब्लॉक का पूर्ण 3D मॉडल संश्लेषित कर सकता है। यह शहरी नियोजन, आपदा सिमुलेशन और नेविगेशन जैसे अनुप्रयोगों के लिए डिजिटल ट्विन्स (digital twins) के निर्माण के द्वार खोलता है, जहाँ एक यथार्थवादी, बड़े पैमाने वाला 3D दृश्य होना आवश्यक है।

हालाँकि, इस अध्ययन की कुछ सीमाएँ भी हैं। वर्तमान सिस्टम विशेष रूप से ऊपर से देखे जाने वाले बाहरी दृश्यों, जैसे शहरों और परिदृश्यों के लिए डिज़ाइन किया गया है, और एक विशिष्ट प्रकार के रंग डेटा पर निर्भर करता है जो इन कोणों के लिए सबसे अच्छा काम करता है। इसका अभी तक इनडोर वातावरण या सड़क-स्तर के दृश्यों पर परीक्षण नहीं किया गया है, जहाँ कैमरा कोण और वस्तुओं के प्रकार बहुत अलग होते हैं। इसके अलावा, जबकि सिस्टम इन दृश्यों को तेज़ी से उत्पन्न कर सकता है, शोधकर्ता नोट करते हैं कि गुणवत्ता काफी हद तक उच्च-गुणवत्ता वाले प्रशिक्षण डेटा की उपलब्धता पर निर्भर करती है, जिसे पृथ्वी के हर संभावित स्थान के लिए प्राप्त करना कठिन हो सकता है। इन सीमाओं के बावजूद, यह कार्य बड़े पैमाने पर 3D जनरेशन को व्यावहारिक बनाने की दिशा में एक महत्वपूर्ण कदम है। वास्तविक दुनिया के डेटा की अराजकता को एक ऐसे प्रारूप में व्यवस्थित करने का तरीका खोजकर, जिससे कंप्यूटर सीख सकें, शोधकर्ताओं ने भविष्य के डिजिटल मानचित्र बनाने के लिए एक नया आधार प्रदान किया है। सरल छवियों से विशाल, विस्तृत 3D दुनिया उत्पन्न करने की क्षमता एक ऐसे भविष्य का संकेत देती है जहाँ हम उन स्थानों का अनुकरण और अन्वेषण कर सकते हैं जहाँ हम कभी गए नहीं हैं, वह भी उस स्तर की वास्तविकता के साथ जो पहले पहुंच से बाहर थी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →