← नवीनतम पेपर
💻 computer science

GaussianGrow: Geometry-aware Gaussian Growing from 3D Point Clouds with Text Guidance

GaussianGrow एक नवीन विधि है जो टेक्स्ट मार्गदर्शन के साथ उन्हें पुनरावृत्ति से विकसित करके 3D पॉइंट क्लाउड्स से उच्च-गुणवत्ता वाले 3D गॉसियन्स उत्पन्न करती है, जिसमें ज्यामितीय सटीकता और अनदेखे क्षेत्रों के पूर्ण कवरेज को सुनिश्चित करने के लिए अपीयरेंस सिंथेसिस और इनपेंटिंग के लिए मल्टी-व्यू डिफ्यूजन मॉडल का उपयोग किया जाता है।

मूल लेखक: Weiqi Zhang, Junsheng Zhou, Haotian Geng, Kanle Shi, Shenkun Xu, Yi Fang, Yu-Shen Liu

प्रकाशित 2026-04-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weiqi Zhang, Junsheng Zhou, Haotian Geng, Kanle Shi, Shenkun Xu, Yi Fang, Yu-Shen Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप "एक वर्क जैकेट पहने हुए लोमड़ी" की एक सुंदर, विस्तृत 3D मूर्ति बनाना चाहते हैं। अतीत में, कंप्यूटर के साथ ऐसा करना आँखों पर पट्टी बाँधकर एक उत्कृष्ट कृति को तराशने जैसा था, या उससे भी बदतर, बिना किसी ब्लूप्रिंट के यह अनुमान लगाने जैसा था कि ईंटें कहाँ रखी जानी चाहिए।

GaussianGrow एक नया तरीका है जो खेल बदल देता है। अनुमान लगाने के बजाय, यह एक 3D पॉइंट क्लाउड (point cloud) का उपयोग ब्लूप्रिंट के रूप में करता है। पॉइंट क्लाउड को एक "डिजिटल धूल के बादल" के रूप में समझें जो लोमड़ी के आकार को पूरी तरह से रेखांकित करता है, लेकिन इसमें अभी कोई रंग या बनावट (texture) नहीं है। यह केवल एक कंकाल है।

यहाँ बताया गया है कि GaussianGrow कैसे काम करता है, जिसे सरल चरणों और कुछ मजेदार उपमाओं में विभाजित किया गया है:

1. "ग्रोथ" (विकास) की अवधारणा

पारंपरिक तरीके पूरी मूर्ति को शून्य से बनाने की कोशिश करते हैं, जिससे अक्सर आकार गलत हो जाता है। GaussianGrow कुछ अलग करता है: यह मूर्ति को "उगाता" (grow) है।

  • उपमा: कल्पना करें कि आपके पास लोमड़ी का एक वायरफ्रेम (wireframe) है (पॉइंट क्लाउड)। GaussianGrow एक जादुई माली की तरह है जो उस वायरफ्रेम पर सीधे "3D पिक्सल" (जिन्हें Gaussians कहा जाता है) लगाता है। क्योंकि वायरफ्रेम पहले से ही वहाँ है, इसलिए पिक्सल को पता है कि उन्हें कहाँ बैठना है। उन्हें आकार का अनुमान लगाने की ज़रूरत नहीं है; वे बस रंग और विवरण भरना जानते हैं। यह सुनिश्चित करता है कि लोमड़ी बिल्कुल एक लोमड़ी जैसी दिखे, न कि एक धब्बे जैसी।

2. "कलाकार" और "मार्गदर्शक"

यह सिस्टम एक टेक्स्ट प्रॉम्प्ट (जैसे, "वर्कवियर स्टाइल में लोमड़ी") का उपयोग यह बताने के लिए करता है कि लोमड़ी कैसी दिखनी चाहिए।

  • उपमा: टेक्स्ट प्रॉम्प्ट को एक आर्ट डायरेक्टर (Art Director) के रूप में सोचें। कंप्यूटर पेंटर (Painter) है।
  • आमतौर पर, पेंटर्स को यह सुनिश्चित करने में संघर्ष करना पड़ता है कि पेंटिंग के सामने, पीछे और किनारे सभी आपस में मेल खाएं। यदि पेंटर सामने की ओर देखता है, तो वह लाल जैकेट पेंट कर सकता है, लेकिन जब वह पीछे मुड़ता है, तो वह गलती से नीली जैकेट पेंट कर सकता है।
  • GaussianGrow एक विशेष "मल्टी-व्यू डिफ्यूजन मॉडल" (एक सुपर-स्मार्ट AI कलाकार) का उपयोग करता है जो एक साथ सभी कोणों से लोमड़ी को देखता है ताकि यह सुनिश्चित हो सके कि जैकेट हर जगह लाल रहे।

3. "सीम्स" (जोड़ों) की समस्या का समाधान

जब आप किसी वस्तु को विभिन्न कोणों से देखते हैं, तो वे किनारे जहाँ दृश्य मिलते हैं, अक्सर अस्त-व्यत या ग्लिच वाले दिखते हैं (जैसे कि एक खराब फोटो कोलाज)।

  • उपमा: कल्पना करें कि आप एक मूर्ति की तस्वीरें सामने, बाईं और दाईं ओर से ले रहे हैं। जब आप उन्हें आपस में जोड़ने की कोशिश करते हैं, तो जहाँ बायां फोटो सामने के फोटो से मिलता है, वह जोड़ टेढ़ा-मेढ़ा लग सकता है।
  • समाधान: GaussianGrow एक चतुर ट्रिक अपनाता है। यह सटीक रूप से गणना करता है कि "सीम्स" कहाँ हैं और उस स्थान पर एक नया, परफेक्ट एंगल लेने के लिए कैमरा मूव करता है ताकि एक "बोनस फोटो" ली जा सके। फिर यह इस नई फोटो का उपयोग ग्लिच को ठीक करने और ट्रांजिशन को निर्बाक (seamless) बनाने के लिए करता है।

4. "ब्लाइंड स्पॉट" इनपेंटिंग (Inpainting)

कई तस्वीरों के बावजूद, वस्तु के कुछ हिस्से छिपे रह सकते हैं (जैसे लोमड़ी के कान यदि वे नीचे झुके हुए हों, या उसके सिर का पिछला हिस्सा)।

  • उपमा: कल्पना करें कि आप एक मूर्ति को पेंट करने की कोशिश कर रहे हैं, लेकिन आप उसके सिर के पिछले हिस्से को नहीं देख पा रहे हैं। आप उसे खाली छोड़ सकते हैं या गलत पेंट कर सकते हैं।
  • समाधान: GaussianGrow "लुका-छिपी" का खेल खेलता है। यह उन हिस्सों को देखता है जिन्हें वह अभी तक नहीं देख सकता, उन छिपे हुए स्थानों को देखने के लिए कैमरा मूव करने के लिए एकदम सही स्थान की गणना करता है, और फिर टेक्स्ट विवरण के आधार पर छूटे हुए विवरणों को भरने के लिए एक AI "इनपेंटिंग" टूल (जैसे एक जादुई इरेज़र और ब्रश) का उपयोग करता है। यह तब तक इसे जारी रखता है जब तक कि पूरी लोमड़ी पेंट न हो जाए।

यह एक बड़ी बात क्यों है?

  • मैनुअल मॉडलिंग की अब ज़रूरत नहीं: आपको किसी वस्तु के लिए घंटों तक डिजिटल स्किन (3D मेश) बनाने के लिए मानव कलाकार की आवश्यकता नहीं है। आपको बस एक साधारण स्कैन (पॉइंट क्लाउड) की आवश्यकता है, जिसे आधुनिक स्कैनर्स या यहाँ तक कि फोन ऐप्स के साथ प्राप्त करना आसान है।
  • बेहतर गुणवत्ता: क्योंकि आकार वास्तविक स्कैन द्वारा निर्देशित होता है, इसलिए अंतिम परिणाम डगमगाता हुआ या विकृत नहीं दिखता है। यह स्पष्ट और वास्तविक दिखता है।
  • टेक्स्ट टू 3D: आप "एक फ्लोरल चोंगमसा (cheongsam)" या "एक बाघ का सिर" टाइप कर सकते हैं, एक सामान्य आकार खोज सकते हैं जो उससे मेल खाता हो, और GaussianGrow तुरंत उस सामान्य आकार को एक उच्च-गुणवत्ता वाली, टेक्सचर्ड 3D वस्तु में बदल देगा।

संक्षेप में: GaussianGrow एक स्मार्ट, स्वचालित निर्माण दल की तरह है। वे एक रफ आउटलाइन (पॉइंट क्लाउड) लेते हैं, टेक्स्ट विवरण को अपने ब्लूप्रिंट के रूप में उपयोग करते हैं, और उस आउटलाइन पर एक हाई-डेफिनिशन, पूरी तरह से टेक्सचर्ड 3D ऑब्जेक्ट को "उगाते" हैं, और रास्ते में किसी भी गलती या ब्लाइंड स्पॉट को ठीक करते हैं। यह 3D दुनिया बनाने को तेज़, आसान और बहुत अधिक सटीक बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →