← नवीनतम पेपर
💻 computer science

GoalVLM: VLM-driven Object Goal Navigation for Multi-Agent System

GoalVLM एक ज़ीरो-शॉट, ओपन-वोकैबुलरी सहकारी मल्टी-एजेंट नेविगेशन फ्रेमवर्क है जो विज़न-लैंग्वेज मॉडल्स, SAM3 और SpaceOM को एकीकृत करता है ताकि एजेंट मुक्त-रूप भाषा लक्ष्यों की व्याख्या कर सकें और बिना किसी कार्य-विशिष्ट प्रशिक्षण के नवीन वस्तुओं तक नेविगेट कर सकें।

मूल लेखक: MoniJesu James, Amir Atef Habel, Aleksey Fedoseev, Dzmitry Tsetserokou

प्रकाशित 2026-03-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: MoniJesu James, Amir Atef Habel, Aleksey Fedoseev, Dzmitry Tsetserokou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक दोस्त के साथ एक विशाल, अपरिचित घर में हैं, और आपके पास एक बहुत ही विशिष्ट, अजीब खरीदारी सूची है: "एक लाल टोस्टर ढूंढें, फिर एक नीला टेडी बियर, फिर एक विंटेज लैंप।" आपके पास कोई नक्शा नहीं है, और आपने पहले कभी यह घर नहीं देखा है।

आज के अधिकांश रोबोट उन लोगों की तरह हैं जो केवल उन चीजों को खोजने के लिए जानते हैं जिन्हें उन्होंने याद किया है। यदि आप उनसे "टोस्टर" के लिए पूछते हैं, तो वे जानते हैं कि वह क्या है। लेकिन यदि आप उनसे "विंटेज लैंप" या "टेडी बियर" के लिए पूछते हैं, तो वे भ्रमित हो जाते हैं क्योंकि उन्हें केवल 10 सामान्य वस्तुओं की एक निश्चित सूची पर प्रशिक्षित किया गया था।

GoalVLM रोबोटों की एक नई टीम है जिसे इस समस्या को हल करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, यहाँ सरल उपमाओं के माध्यम से समझाया गया है:

1. टीम: एक साझा मस्तिष्क वाले दो खोजकर्ता

एक अकेले भटकते हुए रोबोट के बजाय, GoalVLM दो एजेंटों (रोबोटों) का उपयोग करता है जो मिलकर काम करते हैं।

  • उपमा: इन्हें एक जंगल में दो हाइकर्स (पदयात्रियों) के रूप में सोचें। उनके पास एक वॉकी-टॉकी है। यदि हाइकर A एक रास्ता देखता है, तो वह हाइकर B को बताता है, "वहाँ मत जाओ, मैं इसे चेक कर रहा हूँ।" यदि हाइकर B को कोई खाली जगह मिलती है, तो वह हाइकर A को बताता है।
  • लाभ: वास्तविक समय में जो वे देखते हैं उसे साझा करके, वे पूरे "घर" (वातावरण) को बहुत तेज़ी से कवर करते हैं और एक ही कमरे को बार-बार चेक करने या गोल-गोल घूमने में समय बर्बाद नहीं करते हैं।

2. आँखें: "यूनिवर्सल ट्रांसलेटर" (SAM3)

पुराने रोबोटों को वस्तुओं को पहचानने के लिए विशिष्ट शब्दों के शब्दकोश की आवश्यकता होती थी। GoalVLM एक बहुत ही स्मार्ट AI का उपयोग करता है जिसे SAM3 (एक विजन-लैंग्वेज मॉडल) कहा जाता है।

  • उपमा: कल्पना करें कि आप एक तस्वीर देख रहे हैं और आप पूछ सकते हैं, "वह चीज़ कहाँ है जो एक उदास जोकर जैसी दिखती है?" या "चमकदार धातु का डिब्बा ढूँढो।" SAM3 एक बहुत ही चौकस दोस्त की तरह है जिसे शब्दकोश की आवश्यकता नहीं है। यह आपके द्वारा दिए गए किसी भी विवरण को साधारण अंग्रेजी में समझ सकता है। यह एक "ट्रॉली", "धूसर कुर्सी" या "क्रिसमस ट्री" को भी पहचान सकता है, भले ही उसने उन्हें पहले कभी न देखा हो।
  • जादू: यह केवल अनुमान नहीं लगाता; यह अपने द्वारा पाई गई वस्तु के चारों ओर एक सटीक रूपरेखा खींचता है, जैसे कि हाइलाइटर पेन।

3. मानचित्र: "बर्ड्स-आई व्यू" (ऊपर से दृश्य)

रोबोट केवल फर्श को नहीं देखते; वे ऊपर से एक मानसिक मानचित्र बनाते हैं।

  • उपमा: कल्पना करें कि रोबोट एक कमरे की फोटो लेता है, फिर जादू से उसे फर्श पर एक 2D मैप में बदल देता है, जैसे कि एक वीडियो गेम मैप। यह जो कुछ भी देखता है (कुर्सियाँ, दीवारें, वह वस्तु जिसे आपने मांगा था) उसे इस सपाट मानचित्र पर प्रोजेक्ट करता है।
  • "गोल प्रोजेक्टर": जब रोबोट एक फोटो में "ट्रॉली" देखता है, तो वह केवल यह नहीं कहता कि "मैंने इसे देखा।" वह गणना करता है कि वह ट्रॉली उस सपाट मानचित्र पर वास्तव में कहाँ है, भले ही रोबोट उससे दूर हो। यह रोबोट को यह जानने में मदद करता है कि उसे ठीक कहाँ चलना है।

4. मस्तिष्क: "कॉमन सेंस डिटेक्टिव" (SpaceOM)

यह सबसे चतुर हिस्सा है। रोबोट केवल बिना सोचे-समझे नहीं घूमता। यह एक "कॉमन सेंस डिटेक्टिव" (SpaceOM) का उपयोग करता है ताकि यह अनुमान लगाया जा सके कि चीजें कहाँ हो सकती हैं।

  • उपमा: यदि आप रोबोट से "माइक्रोवेव" खोजने के लिए कहते हैं, तो रोबोट सोचता है, "हम्म, माइक्रोवेव आमतौर पर किचन में होते हैं, बाथरूम या बेडरूम में नहीं।"
  • रणनीति: हर एक कमरे की जाँच करने के बजाय, रोबोट इस सामान्य ज्ञान का उपयोग करके किचन को पहले चेक करने को प्राथमिकता देता है। यह "फ्रंटियर्स" (अज्ञात क्षेत्रों के किनारों) को इस आधार पर रैंक करता है कि उनमें वस्तु होने की कितनी संभावना है।

5. यात्रा: "डिटूर के साथ जीपीएस"

एक बार जब रोबोट को पता चल जाता है कि उसे कहाँ जाना है, तो वह फास्ट मार्चिंग मेथड नामक नेविगेशन सिस्टम का उपयोग करता है।

  • उपमा: यह एक ऐसे GPS की तरह है जो गंतव्य तक पहुँचने के लिए फर्नीचर के चारों ओर सबसे सुगम रेखा खींचता है। यह "ट्रॉली" या "लैंप" की ओर बढ़ते समय कुर्सियों और दीवारों से टकराने से बचता है।

यह कितना अच्छा काम करता है?

शोधकर्ताओं ने इसका परीक्षण GOAT-Bench नामक एक विशाल डिजिटल डेटासेट पर किया, जो सैकड़ों अलग-अलग कमरों और वस्तुओं वाले एक विशाल, जटिल वीडियो गेम की तरह है।

  • परिणाम: GoalVLM ने 55.8% बार वस्तुओं को सफलतापूर्वक खोजा।
  • यह प्रभावशाली क्यों है? अधिकांश अन्य रोबोट जो प्रशिक्षण की आवश्यकता नहीं रखते (Zero-Shot), वे केवल 16-29% सही होते हैं। GoalVLM उनसे लगभग दोगुना बेहतर है!
  • कमी: यह पूर्ण नहीं है। यदि कोई वस्तु बहुत चमकदार है (जैसे दर्पण) या बहुत छोटी है (जैसे मेज पर रखी फोटो), तो रोबोट कभी-कभी भ्रमित हो जाता है क्योंकि कैमरा उसे स्पष्ट रूप से नहीं देख पाता। साथ ही, क्योंकि इसे खोजने के लिए खोजबीन करनी पड़ती है, इसलिए यह उस रोबोट की तुलना में थोड़ा लंबा रास्ता लेता है जिसने पूरे घर को याद कर लिया हो।

वास्तविक दुनिया का परीक्षण

टीम ने केवल कंप्यूटर में इसका परीक्षण नहीं किया। उन्होंने इस सिस्टम को एक वास्तविक लैब में उड़ने वाले दो वास्तविक ड्रोनों पर लगाया।

  • परिणाम: ड्रोनों ने सफलतापूर्वक सूटकेस और ट्रॉली जैसी वास्तविक वस्तुओं को खोजने के लिए अपने कैमरों का उपयोग किया और वास्तविक समय में मानचित्र बनाया। यह साबित करता है कि यह सिस्टम केवल एक वीडियो गेम का कमाल नहीं है; यह वास्तविक दुनिया में काम करता है।

सारांश

GoalVLM को एक टीम के रोबोटों को एक सुपरपावर देने जैसा है: मानव भाषा को समझने, चीजें कहाँ हो सकती हैं इसका अनुमान लगाने के लिए सामान्य ज्ञान का उपयोग करने और किसी भी चीज़ को खोजने के लिए मिलकर काम करने की क्षमता, भले ही उन्होंने उसे पहले कभी न देखा हो। यह उन रोबोटों की दिशा में एक बड़ा कदम है जो वास्तव में बिना किसी नए प्रशिक्षण के हमारे घरों में हमारी मदद कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →