← नवीनतम पेपर
💻 computer science

OVI-MAP:Open-Vocabulary Instance-Semantic Mapping

OVI-MAP एक वास्तविक समय की प्रणाली है जो वृद्धिशील ओपन-वोकैबुलरी 3D इंस्टेंस-सिमेंटिक मैपिंग के लिए है, जो जटिल वातावरण में स्थिर ट्रैकिंग और ज़ीरो-शॉट लेबलिंग प्राप्त करने के लिए विज़न-लैंग्वेज मॉडल का उपयोग करके क्लास-एग्नोस्टिक इंस्टेंस रिकंस्ट्रक्शन को सिमेंटिक इन्फरेंस से अलग करती है।

मूल लेखक: Zilong Deng, Federico Tombari, Marc Pollefeys, Johanna Wald, Daniel Barath

प्रकाशित 2026-03-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zilong Deng, Federico Tombari, Marc Pollefeys, Johanna Wald, Daniel Barath

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट दोस्त के साथ एक बिल्कुल नए, बिखरे हुए घर में घूम रहे हैं। आपका लक्ष्य कमरे का एक सटीक 3D मानचित्र बनाना है ताकि रोबोट बाद में चीजों को ढूंढ सके, जैसे कि "लाल कुर्सी" या "वह जगह जहाँ संगीत बज रहा है।"

समस्या यह है कि आज के अधिकांश रोबोट ऐसे छात्रों की तरह हैं जिन्हें केवल शब्दावली के एक निश्चित समूह (जैसे, "कुर्सी," "मेज," "बिस्तर") का पता है। यदि आप उनसे "बीनबैग" या "अजीब मूर्ति" को खोजने के लिए कहते हैं, तो वे भ्रमित हो जाते हैं क्योंकि वे शब्द उनकी सूची में नहीं हैं। वे चीजों को ट्रैक करने में भी संघर्ष करते हैं क्योंकि जब आप इधर-उधर घूमते हैं, तो वे चीजों को खो देते हैं या दो अलग-अलग कुर्सियों को एक ही समझ लेते हैं।

OVI-MAP एक नया सिस्टम है जो इसे हल करता है। यह एक स्मार्ट, अनुकूलन योग्य लाइब्रेरियन की तरह काम करता जिसे दुनिया को समझने के लिए किसी पूर्व-लिखित शब्दकोश की आवश्यकता नहीं है। यह कैसे काम करता है, इसके सरल चरण यहाँ दिए गए हैं:

1. "आकार-प्रथम" रणनीति (Class-Agnostic Mapping)

कल्पना कीजिए कि आप एक लेगो (Lego) किला बना रहे हैं। अधिकांश रोबोट किला बनाने के दौरान ही हर ईंट को "दीवार" या "खिड़की" के रूप में लेबल करने की कोशिश करते हैं। यदि उन्हें नहीं पता कि "खिड़की" क्या है, तो वे रुक जाते हैं या भ्रमित हो जाते हैं।

OVI-MAP कुछ अलग करता है। यह पहले किले का आकार (shape) बनाता है, बिना इस बात की चिंता किए कि ईंटों को क्या कहा जाता है।

  • यह कैसे काम करता है: यह 3D ज्यामिति (आकार और गहराई) को देखता है और पिक्सेल को उनके भौतिक रूप के आधार पर एक साथ समूह में बाँटता है। यह कहता है, "ये पिक्सेल एक साथ जुड़े हुए हैं और एक ठोस वस्तु बनाते हैं," बिना यह पूछे कि, "क्या यह सोफा है या कुत्ता?"
  • उपमा: यह ब्लॉक से टावर बनाने वाले बच्चे की तरह है। बच्चा जानता है कि यह एक "टावर" है क्योंकि ब्लॉक कैसे फिट होते हैं, भले ही उसे अभी "वास्तुकला" (architecture) शब्द का ज्ञान न हो। यह मानचित्र को स्थिर रखता है और रोबोट को नए ऑब्जेक्ट्स से भ्रमित होने से बचाता है।

2. "स्मार्ट फोटोग्राफर" (View Selection)

एक बार जब रोबोट के पास किसी वस्तु का ठोस 3D आकार आ जाता है, तो उसे यह पता लगाने की आवश्यकता होती है कि वह क्या है। पुराने तरीके किसी वस्तु की हर एक कोण से फोटो लेते थे और उन सभी फोटो को एक बहुत ही स्मार्ट AI (Vision-Language Model) के पास भेज देते थे यह पूछने के लिए कि, "यह क्या है?" यह धीमा, महंगा है और बहुत अधिक अनावश्यक डेटा पैदा करता है (जैसे सोफे के सामने के हिस्से की 50 फोटो लेना)।

OVI-MAP एक स्मार्ट फोटोग्राफर दृष्टिकोण का उपयोग करता है:

  • समस्या: यदि आप सोफे के सामने के हिस्से की 10 फोटो लेते हैं, तो आप कुछ भी नया नहीं सीखते।
  • समाधान: OVI-MAP वस्तु के चारों ओर एक मानसिक "गोला" (sphere) रखता है। यह केवल तभी फोटो लेता है जब कैमरा वस्तु के किसी नए हिस्से को देख रहा हो जिसे पहले नहीं देखा गया है।
  • उपमा: कल्पना कीजिए कि आप अपने मित्र को एक रहस्यमय मूर्ति का वर्णन करने की कोशिश कर रहे हैं। आप उसके सामने के हिस्से की 10 फोटो नहीं लेंगे। आप उसके चारों ओर घूमेंगे, और केवल तभी फोटो लेंगे जब आप एक नया हिस्सा (पीछे, बगल, या ऊपर) देखेंगे। यह समय बचाता है और कम फोटो के साथ एक पूर्ण चित्र प्रदान करता है।

3. "डिक्शनरी लुकअप" (Zero-Shot Semantic Inference)

अब जब रोबोट के पास एक साफ 3D आकार और कुछ स्मार्ट फोटो हैं, तो वह सुपर-स्मार्ट AI (Vision-Language Model) से पूछता है: "इन फोटो के आधार पर, यह क्या हो सकता है?"

चूंकि यह AI "ओपन-वोकैबुलरी" (open-vocabulary) है, इसे पूर्व-निर्धारित सूची की आवश्यकता नहीं है। आप इससे पूछ सकते हैं, "क्या यह एक 'तकिया' है?" या "क्या यह 'सोने की जगह' है?" और यह उस अवधारणा को समझ जाएगा, भले ही इसने पहले कभी उस विशिष्ट वस्तु को न देखा हो।

  • परिणाम: रोबट पहले से बनाए गए 3D आकार के साथ यह लेबल जोड़ देता है। अब, मानचित्र जानता है कि "Shape #42" एक "सोफा" है।

यह एक बड़ी बात क्यों है?

  • यह तेज़ है: मानचित्र बनाते समय लेबलिंग न करने और केवल "स्मार्ट" फोटो लेने के कारण, यह रियल-टाइम में चलता है। आप एक कमरे में घूम सकते हैं, और मानचित्र तुरंत अपडेट होता है।
  • यह लचीला है: आप इससे कुछ भी खोजने के लिए कह सकते हैं। "कॉफी जैसी महक वाली चीज़ ढूंढो" या "नीली चीज़ ढूंढो।" इसे फिर से प्रशिक्षित करने की आवश्यकता नहीं है।
  • यह स्थिर है: क्योंकि यह "आकार" को "नाम" से अलग करता है, इसलिए रोशनी बदलने या अजीब वस्तु दिखने पर यह भ्रमित नहीं होता। आकार ठोस रहता है; नाम बाद में बस जोड़ दिया जाता है।

सारांश

Oally, OVI-MAP को एक ऐसे रोबोट के रूप में सोचें जो पहले कमरे का एक सटीक 3D पहेली (puzzle) बनाता है (इस बात की परवाह किए बिना कि टुकड़ों को क्या कहा जाता है) और फिर एक स्मार्ट मित्र से उन टुकड़ों को नाम देने के लिए कहता है केवल तभी जब उसके पास उनका एक अच्छा दृश्य हो। यह रोबोट को तुरंत नई, बिखरी हुई दुनियाओं का पता लगाने और मानव की तरह प्राकृतिक भाषा का उपयोग करके उन्हें समझने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →