← नवीनतम पेपर
💻 computer science

Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting

यह शोध पत्र एक एम्बोडीडड मल्टीमॉडल ग्राउंडिंग फ्रेमवर्क प्रस्तुत करता है जो मौजूदा अत्याधुनिक दृष्टिकोणों की तुलना में अव्यवस्थित, अवरुद्ध और विभिन्न दृष्टिकोण-परिवर्तनीय घरेलू वातावरणों में ओपन-वोकैबुलरी मोबाइल मैनिपुलेशन सफलता दरों को महत्वपूर्ण रूप से सुधारने के लिए एक्टिव मल्टी-व्यू सिमेंटिक 3D गॉसियन स्प्लेटिंग को डिफ्यूजन-आधारित विजन-लैंग्वेज-एक्शन पॉलिसी के साथ एकीकृत करता है।

मूल लेखक: Huosen Ou, Dongni Song, Yuncong Wang, Tao Zhou, Yiding Ji

प्रकाशित 2026-08-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Huosen Ou, Dongni Song, Yuncong Wang, Tao Zhou, Yiding Ji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रोबोट आपके बिखरे हुए लिविंग रूम में आपकी मदद करने की कोशिश कर रहा है। यह केवल अपने हाथों को हिलाने के बारे में नहीं है; यह आपकी आवाज़ सुनते हुए तीन आयामों (3D) में दुनिया को समझने के बारे में है। यह "एम्बोडीड एआई" (embodied AI) का केंद्र है, एक ऐसा क्षेत्र जहाँ रोबोट स्क्रीन पर डेटा प्रोसेस करने के बजाय भौतिक स्थानों के साथ बातचीत करना सीखते हैं। ऐसा करने के लिए, उन्हें तीन चीजों को जोड़ने की आवश्यकता है: भाषा (आप क्या कहते हैं), दृष्टि (वे क्या देखते हैं), और ज्यामिति (चीजें वास्तव में 3D स्थान में कहाँ हैं)। इसे एक अंधेरी, बिखरी हुई रसोई में जार से एक विशिष्ट कुकी निकालने की कोशिश करने जैसा समझें। यदि आपके पास रसोई की केवल एक 2D फोटो है, तो आप गलत जार पकड़ सकते हैं या सब कुछ गिरा सकते हैं। लेकिन यदि आपके पास एक मानसिक 3D मानचित्र है जो आपके हिलने-डुलने के साथ अपडेट होता रहता है, तो आप बाधाओं के बीच से रास्ता निकाल सकते हैं, यह पता लगा सकते हैं कि आपका हाथ वास्तव में कहाँ जाना चाहिए, और दूध गिराए बिना सही कुकी पकड़ सकते हैं। यही वह चुनौती है जिसे शोधकर्ता हल करने की कोशिश कर रहे हैं: रोबोट को इतना स्मार्ट बनाना कि वे हमारे घरों की अव्यवस्थित, अप्रत्याशित वास्तविकता को संभाल सकें, न कि केवल साफ, आदर्श प्रयोगशालाओं को।

आप जो पेपर पढ़ रहे हैं, जिसका शीर्षक "Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting" है, वह रोबोट को इस तरह की 'सुपर-साइट' देने का एक नया तरीका प्रस्तावित करता है। लेखक, एक वास्तविक रोबोट डॉग (जो एक हाथ से लैस है) के साथ काम करते हुए, तर्क देते हैं कि कई वर्तमान रोबोट इसलिए विफल होते हैं क्योंकि वे बहुत अधिक सपाट, 2D चित्रों पर निर्भर करते हैं। यदि एक रोबोट एक टैबलेट स्क्रीन पर केले की फोटो देखता है, तो 2D-केंद्रित रोबोट उस सपाट छवि को पकड़ने की कोशिश कर सकता है, यह सोचकर कि वह एक असली केला है। या, यदि रोबोट गलत जगह पर खड़ा है, तो वह ऐसी वस्तु की ओर हाथ बढ़ा सकता है जिसे वह वास्तव में छू नहीं सकता।

इसे ठीक करने के लिए, टीम ने एक प्रणाली बनाई है जो एक "रिफ्रेश करने योग्य 3D स्केचपैड" की तरह कार्य करती है। केवल एक तस्वीर देखने के बजाय, रोबोट सक्रिय रूप से अलग-अलग कोणों से चार त्वरित स्नैपशॉट लेकर वस्तु के चारों ओर अपना कैमरा घुमाता है। फिर यह एक तकनीक का उपयोग करता है जिसे "सिमेंटिक 3D गॉसियन स्प्लैटिंग" (Semantic 3D Gaussian Splatting) कहा जाता है, ताकि इन तस्वीरों को बिंदुओं के एक धुंधले, चमकते हुए 3D क्लाउड में बदला जा सके। लेकिन यह केवल एक सुंदर चित्र नहीं है; इस क्लाउड के हर बिंदु को पता होता है कि वह क्या है (जैसे "केला" या "कुर्सी") और वह स्थान में कहाँ है। यह क्लाउड एक साझा मानचित्र के रूप में कार्य करता है जिसका उपयोग रोबलभ रोबोट हर चीज़ के लिए करता है: यह तय करने के लिए कि उसे कहाँ खड़ा होना है, यह जाँचने के लिए कि रास्ते में कोई बाधा तो नहीं है, और अपने हाथ को ठीक से कैसे चलाना है।

शोधकर्ताओं ने इस प्रणाली का परीक्षण एक वास्तविक सेटिंग में एक वास्तविक रोबोट डॉग पर किया। उन्होंने पाया कि जब रोबोट ने इस 3D क्लाउड मैप का उपयोग किया, तो वह कठिन स्थितियों को संभालने में बहुत बेहतर था। लंबे, बहु-चरणीय कार्यों (जैसे दराज खोलना, केला लेना और उसे कुर्सी पर रखना) में, पूर्ण प्रणाली 60% बार सफल रही, जबकि 3D मैप का उपयोग न करने वाली प्रणाली केवल 40% बार सफल रही। इससे भी अधिक प्रभावशाली बात यह है कि एक "बिखरे हुए" (cluttered) परिदृश्य में, जहाँ लक्ष्य वस्तु कई अन्य चीजों के बीच छिपी हुई थी, नया सिस्टम 74% बार सफल रहा, जबकि पुराने तरीकों की सफलता दर 28% जितनी कम रही। सिस्टम ने यह भी साबित किया कि इसे आसानी से मूर्ख नहीं बनाया जा सकता; जब एक असली केले को केले की एक यथार्थवादी फोटो से बदल दिया गया, तो 3D मैप वाला रोबोट उसे सही ढंग से अनदेखा कर गया, जबकि बिना 3D मैप वाले रोबोटों ने उस सपाट स्क्रीन को पकड़ने की कोशिश की।

हालाँकि, लेखक सावधानी बरतते हुए कहते हैं कि यह हर स्थिति के लिए जादुई समाधान नहीं है। यह प्रणाली "क्वासी-स्टैटिक" (quasi-static) वातावरण में सबसे अच्छा काम करती है—ऐसी जगहें जहाँ चीजें बहुत तेज़ी से नहीं हिलती हैं, जैसे कि एक लिविंग रूम। रोबोट अपने हाथ को चलाने से पहले इस 3D मैप को बनाने के लिए कुछ सेकंड लेता है, इसलिए यह हवा में उड़ती हुई गेंद को पकड़ने के लिए डिज़ाइन नहीं किया गया है। इसके अलावा, मैप बनाने के लिए आवश्यक भारी गणित रोबोट के बाहर एक शक्तिशाली कंप्यूटर पर होता है, अभी तक रोबोट के भीतर नहीं। शोधकर्ता सुझाव देते हैं कि हालांकि यह दृष्टिकोण रोबोट को बिखराव, ऊंचाई में बदलाव और विजुअल ट्रिक्स को संभालने में काफी सुधार करता है, लेकिन इसे रोबोट के लिए अधिक तेज़ और हल्का बनाने के लिए अभी भी काम करना बाकी है। अंततः, यह पेपर दिखाता है कि रोबोट को उनके परिवेश की स्पष्ट, अपडेट करने योग्य 3D समझ देना हमारी वास्तविक, अव्यवस्थित दुनिया में उन्हें सहायक, विश्वसनीय मददगार बनाने की दिशा में एक महत्वपूर्ण कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →