← नवीनतम पेपर
💻 computer science

TCGSplat: Temporal Confidence Guided 3D Gaussian Splatting for RGB-D SLAM

TCGSplat एक सुदृढ़ 3D Gaussian Splatting-आधारित SLAM सिस्टम है जो अविश्वसनीय अवलोकनों को फ़िल्टर करने के लिए प्रत्येक Gaussian प्रिमिटिव के लिए समय-विकसित विश्वास स्कोर (confidence scores) को बनाए रखकर और रेंडर करके ट्रैकिंग, मैपिंग और लूप क्लोजर को बढ़ाता है।

मूल लेखक: Xingchen Guo, Zhi Liu, Dandan Huang, Xingzhao Wang, Huiji Wang, Huilin Jiang

प्रकाशित 2026-08-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xingchen Guo, Zhi Liu, Dandan Huang, Xingzhao Wang, Huiji Wang, Huilin Jiang

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट और ऑगमेंटेड रियलिटी चश्मे को कार्य करने के लिए यह जानने की आवश्यकता होती है कि वे कहाँ हैं और उनके आस-पास क्या है। ऐसा करने के लिए, वे 'सिमल्टेनियस लोकलाइजेशन एंड मैपिंग' (Simultaneous Localization and Mapping) नामक तकनीक का उपयोग करते हैं, जिसे SLAM कहा जाता है। कल्पना कीजिए कि एक रोबोट कमरे में घूम रहा है; उसे दीवारों, फर्नीचर और फर्श का डिजिटल मानचित्र बनाने के साथ-साथ लगातार अपनी स्थिति की गणना करनी पड़ती है। वर्षों तक, इन प्रणालियों ने दुनिया का प्रतिनिधित्व करने के लिए कठोर ज्यामितीय आकृतियों पर भरोसा किया। हालांकि ये सटीक थीं, लेकिन ये आकृतियाँ अक्सर ब्लॉक जैसी दिखती थीं और वास्तविक वातावरण के समृद्ध रंगों और बनावटों को पकड़ने में विफल रहती थीं। हाल ही में, 3D गॉसियन स्प्लेटिंग (3D Gaussian Splatting) नामक एक नई विधि उभरी है, जो कंप्यूटर को लाखों छोटे, धुंधले, 3D दीर्घवृत्तों (ellipses) का उपयोग करके दृश्यों का प्रतिनिधित्व करने की अनुमति देती है। यह दृष्टिकोण कमरे का आश्चर्यजनक रूप से यथार्थवादी, फोटो जैसा दृश्य वास्तविक समय में बनाता है। हालाँकि, एक महत्वपूर्ण समस्या बनी हुई है: जैसे-जैसे रोबोट चलता है, सेंसर के शोर या अचानक हलचल के कारण उसके डिजिटल मानचित्र के कुछ हिस्से अस्थिर या अविश्वसनीय हो जाते हैं। यदि रोबोट इन अस्थिर हिस्सों पर बहुत अधिक भरोसा करता है, तो वह अपना रास्ता भटक सकता है या एक विकृत मानचित्र बना सकता है।

चांगचुन यूनिवर्सिटी ऑफ साइंस एंड टेक्नोलॉजी के शोधकर्ताओं ने इस विशिष्ट समस्या को हल करने के लिए TCGSplat नामक एक नई प्रणाली विकसित की है। डिजिटल मानचित्र के प्रत्येक हिस्से को समान रूप से भरोसेमंद मानने के बजाय, उनकी प्रणाली प्रत्येक छोटे 3D दीर्घवृत्त को एक "कॉन्फिडेंस स्कोर" (विश्वास स्कोर) देती है जो समय के साथ बदलता रहता है। इस स्कोर को एक विश्वसनीयता रेटिंग की तरह समझें जो हर बार जब रोबोट किसी स्थान को देखता है, तो अपडेट होता है। यदि मानचित्र के किसी हिस्से को कई बार देखा गया है और वह सुसंगत दिखता है, तो उसका कॉन्फिडेंस स्कोर बढ़ जाता है। यदि कोई हिस्सा नया, धुंधला है, या अप्रत्याशित रूप से बदला है, तो उसका स्कोर गिर जाता है। प्रणाली इस स्कोर का उपयोग यह तय करने के लिए करती है कि विभिन्न क्षेत्रों पर कितना ध्यान दिया जाए। जब रोबोट अपनी स्थिति का पता लगाने की कोशिश कर रहा होता है, तो वह उच्च-विश्वास वाले क्षेत्रों पर भारी ध्यान केंद्रित करता है और अस्थिर क्षेत्रों को अनदेखा कर देता है। जब वह मानचित्र को बेहतर बनाने की कोशिश कर रहा होता है, तो वह कम-विश्वास वाले क्षेत्रों को ठीक करने में अधिक प्रयास करता है। यह सरल लेकिन शक्तिशाली विचार रोबोट को कठिन, शोर वाले वातावरण में भी सही रास्ते पर रहने की अनुमति देता है।

टीम ने सिंथेटिक इनडोर दृश्यों और हैंडहेल्ड कैमरों से वास्तविक दुनिया की रिकॉर्डिंग सहित कई मानक डेटासेट्स पर अपने सिस्टम का परीक्षण किया। इन परीक्षणों में, नया सिस्टम कैमरा के पथ को ट्रैक करने में पिछले तरीकों की तुलना में अधिक सटीक साबित हुआ। वास्तविक दुनिया के इनडोर वीडियो के एक सेट पर, सिस्टम ने कैमरा ट्रैकिंग में औसत त्रुटि को घटाकर 3.37 सेंटीमीटर कर दिया, जो उसी 3D ग meskipun तकनीक पर आधारित अन्य अग्रणी तरीकों से बेहतर था। शोधकर्ताओं ने पाया कि उत्पादित मानचित्र न केवल ज्यामिति के मामले में अधिक सटीक थे, बल्कि मानवीय दृष्टि के लिए भी बेहतर दिखे, जिनमें स्पष्टता अधिक थी और विजुअल आर्टिफैक्ट्स (दृश्य दोष) कम थे। सिस्टम ने यह हासिल किया क्योंकि वह लगातार पूछता था, "मैं इस दृश्य के बारे में कितना आश्वस्त हूँ?" और उसके अनुसार अपना व्यवहार बदलता था।

इस कार्य की एक प्रमुख विशेषता यह है कि सिस्टम अपने स्वयं के इतिहास से कैसे सीखता है। यह केवल वर्तमान छवि को देखकर यह तय नहीं करता कि मानचित्र का कोई हिस्सा अच्छा है या नहीं। इसके बजाय, यह याद रखता है कि उस हिस्से ने अतीत में कैसा व्यवहार किया है। यदि एक विशिष्ट 3D दीर्घवृत्त लंबे समय से स्थिर रहा है, तो सिस्टम उस पर अधिक भरोसा करता है। यदि वही दीर्घवृत्त अचानक उछलता है या आकार में इस तरह बदलता है जो उसके इतिहास से मेल नहीं खाता, तो सिस्टम उसे अविश्वसनीय के रूप में चिह्नित कर देता है। यह टेम्पोरल (सामयिक) पहलू महत्वपूर्ण है क्योंकि यह रोबोट को दुनिया में वास्तविक बदलाव और उसके अपने सेंसर द्वारा की गई गलती के बीच अंतर करने की अनुमति देता है। शोधकर्ताओं ने प्रदर्शित किया कि समय-आधारित विश्वास का उपयोग करके, रोबोट कठिन स्थितियों, जैसे कि तीव्र हलचल या खराब रोशनी वाले क्षेत्रों को पहले की तुलना में बहुत बेहतर तरीके से संभाल सकता है।

अध्ययन ने यह भी दिखाया कि इस दृष्टिकोण से गति पर भारी लागत नहीं आती है। जबकि सिस्टम विश्वास को ट्रैक करने के लिए अतिरिक्त गणना करता है, फिर भी यह आधुनिक कंप्यूटर हार्डवेयर पर वास्तविक समय के उपयोग के लिए पर्याप्त तेज़ चलता है। प्रत्येक फ्रेम को प्रोसेस करने में लगने वाला समय पिछले सर्वोत्तम तरीकों की तुलना में केवल थोड़ा बढ़ा है, जिसका अर्थ है कि रोबोट अभी भी तेजी से चल और प्रतिक्रिया कर सकता है। शोधकर्ताओं ने पुष्टि की कि उनका तरीका साधारण कार्यालय कक्षों से लेकर जटिल, अव्यवस्थित स्थानों तक, विभिन्न प्रकार के वातावरणों में काम करता है। इस आत्मविश्वास तंत्र को एकीकृत करके, उन्होंने 3D गॉसियन स्प्लेटिंग को नेविगेशन के लिए एक अधिक मजबूत उपकरण बना दिया है। यह कार्य सुझाव देता है कि रोबोटों के लिए दुनिया को वास्तव में समझने के लिए, उन्हें केवल वहां मौजूद चीज़ों की तस्वीर की ही नहीं, बल्कि उस तस्वीर के बारे में उनकी निश्चितता के बोध की भी आवश्यकता है। यह नया सिस्टम वह बोध प्रदान करता है, जिससे वास्तविक दुनिया में सुरक्षित और अधिक विश्वसनीय नेविगेशन संभव होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →