← नवीनतम पेपर
💻 computer science

AnyGoal: Vision-Language Guided Multi-Agent Exploration for Training-Free Lifelong Navigation

AnyGoal एक प्रशिक्षण-मुक्त (training-free), मल्टी-एजेंट नेविगेशन फ्रेमवर्क है जो लाइफलॉन्ग, ओपन-वोकेबुलरी एक्सप्लोरेशन को सक्षम करने के लिए एक विजन-लैंग्वेज मॉडल और एक साझा 2D गॉसियन बेयसियन वैल्यू मैप का लाभ उठाता है, जिससे बिना किसी रिट्रेनिंग या केंद्रीकृत नियंत्रण के GOAT-Bench पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: MoniJesu James, Marcelino Julio Fernando, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

प्रकाशित 2026-06-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: MoniJesu James, Marcelino Julio Fernando, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने दोस्तों के एक समूह के साथ एक विशाल, अपरिचित घर में हैं। आपका मिशन विभिन्न सुरागों के आधार पर विशिष्ट वस्तुओं को खोजना है: कभी कोई नाम होता है ("टोस्टर खोजें"), कभी एक फोटो ("लाल कुर्सी खोजें"), और कभी एक अस्पष्ट विवरण होता है ("वह चीज़ खोजें जहाँ आप ठंडे पेय रखते हैं")।

समस्या यह है कि अधिकांश रोबोट (या AI एजेंट) उन छात्रों की तरह होते हैं जिन्होंने केवल एक विशिष्ट परीक्षा के लिए पढ़ाई की है। यदि आप उनसे टोस्टर खोजने के लिए कहते हैं, तो वे विफल हो सकते हैं यदि उन्हें केवल चम्मच खोजने के लिए प्रशिक्षित किया गया था। कुछ रोबोट उन वस्तुओं का एक विशाल, पूर्ण मानचित्र (map) उपयोग करने की कोशिश करते हैं जिन्हें उन्होंने पहले देखा है, लेकिन वह मानचित्र इतना भारी और धीमा होता है कि वे कुछ खोजने से पहले ही अटक जाते हैं या उनकी बैटरी खत्म हो जाती है।

"AnyGoal" से मिलिए।

यह शोध पत्र एक टीम के रोबोटों के लिए बिना किसी पूर्व प्रशिक्षण के चीजों को खोजने और खोजने का एक नया तरीका पेश करता है। यह कैसे काम करता है, इसे सरल उपमाओं (analogies) का उपयोग करके यहाँ समझाया गया है:

1. "स्मार्ट ब्रेन" (विज़न-लैंग्वेज मॉडल)

वस्तुओं की सूची याद करने के बजाय, रोबोट एक "स्मार्ट ब्रेन" (एक विज़न-लैंग्वेज मॉडल) का उपयोग करते हैं। इस मस्तिष्क को एक बहुत ही जानकार लेकिन थोड़े भुलक्कड़ लाइब्रेरियन के रूप में सोचें।

  • जब एक रोबोट कुछ देखता है, तो वह लाइब्रेरियन से पूछता है, "क्या यह उस वस्तु जैसा दिखता है जिसे मैं खोज रहा हूँ?"
  • लाइब्रेरियन "शायद" या "हाँ" का उत्तर देता है। क्योंकि लाइब्रेरियन पूर्ण नहीं है, इसलिए उत्तर एक विश्वास स्तर (probability) के साथ आता है।

2. "साझा मूड मैप" (गौसियन बायेसियन वैल्यू मैप)

यह इस शोध पत्र का सबसे बड़ा नवाचार है। प्रत्येक रोबोट द्वारा घर का एक भारी 3D फोटो एल्बम रखने के बजाय, वे सभी एक साझा, सरल 2D "मूड मैप" साझा करते हैं।

  • कल्पना कीजिए कि फर्श पर एक ग्रिड है। ग्रिड के प्रत्येक वर्ग (square) में एक संख्या है जो यह दर्शाती है कि वहां लक्षित वस्तु होने की कितनी संभावना है।
  • जादू: यह मानचित्र कभी भी पूरी तरह साफ नहीं किया जाता है। यदि एक रोबलेट किचन में टोस्टर के लिए "शायद" देखता है, तो वह उस वर्ग को अपडेट करता है। यदि दूसरा रोबोट बाद में "बिल्कुल नहीं" देखता है, तो वह संख्या को फिर से समायोजित करता है।
  • समय के साथ, मानचित्र साक्ष्यों का एक "जीवनकाल" बनाता है। यह हाइकर्स (पदयात्रियों) के समूह द्वारा निशान छोड़ने जैसा है; भले ही एक हाइकर गलत हो, समूह का साझा मानचित्र अंततः उसकी गलती को सुधार देता है।

3. "टीम हडल" (विकेंद्रीकृत समन्वय)

रोबोटों के पास उन्हें क्या करना है, इसके लिए कोई बॉस नहीं है। वे स्वतंत्र खोजकर्ताओं का एक झुंड हैं।

  • वे सभी एक ही "मूड मैप" को देखते हैं।
  • वे एक सरल नियम का उपयोग करते हैं: "मैं उस स्थान पर जाऊंगा जो सबसे अधिक आशाजनक दिखता है, जब तक कि मेरा दोस्त पहले से ही वहां न जा रहा हो।"
  • यदि दो रोबोट एक ही स्थान पर जाना चाहते हैं, तो एक को "पेनल्टी" (एक दूसरे जगह जाने के लिए हल्का धक्का) मिलती है ताकि वे एक-दूसरे को भीड़ न दें। वे केवल साझा मानचित्र को देखकर संवाद करते हैं, आपस में बात करके नहीं।

4. "डबल-चेक" (फ्रंटियर रैंकिंग)

जब रोबोट एक नए क्षेत्र (एक "फ्रंटियर") में पहुँचते हैं, तो उन्हें तय करना होता है: "क्या मुझे यहाँ रुकना चाहिए और कहना चाहिए कि 'मुझे मिल गया'?"

  • "स्मार्ट ब्रेन" एक जज के रूप में कार्य करता है। यह नए स्थान को देखता है और कहता है, "यह किचन जैसा दिखता है, इसलिए शायद टोस्टर यहाँ है।"
  • लेकिन सिस्टम इतना स्मार्ट है कि वह कह सकता है, "रुको, हमारे मानचित्र के अनुसार हमने इस बाथरूम की अच्छी तरह से जाँच कर ली है, और यह निश्चित रूप से वहाँ नहीं है।"
  • रोबोट ब्रेन के अनुमान को मैप के इतिहास के साथ जोड़ता है ताकि एक अंतिम निर्णय ले सके।

परिणाम: यह क्यों मायने रखता है

शोधकर्ताओं ने इस प्रणाली का परीक्षण एक बहुत ही सख्त, वास्तविक सिमुलेशन (कोई टेलीपोर्टिंग नहीं, सीमित कैमरा दृश्य, एक वास्तविक रोबोट की तरह) में किया।

  • पुराना तरीका: सबसे अच्छा पिछला तरीका (Modular GOAT) केवल 25% बार सही वस्तु खोज पाता था।
  • नया तरीका (AnyGoal): केवल दो रोबोटों के मिलकर काम करने से, उन्होंने वस्तु को 52% बार खोज लिया।
  • आश्चर्य: केवल एक रोबोट के साथ भी, नया सिस्टम वस्तुओं को 42% बार खोज लेता है। यह साबित करता है कि सिस्टम डिज़ाइन (साझा मानचित्र और स्मार्ट निर्णय लेना) ही असली नायक है, न कि केवल अधिक रोबोटों का होना।

बड़ी खोज: "फॉल्स अलार्म" की समस्या

इस शोध पत्र ने यह जानकर बहुत दिलचस्प पाया कि रोबोट क्यों विफल होते हैं।

  • अतीत में, रोबोट इसलिए विफल होते थे क्योंकि वे वस्तु को देख नहीं पाते थे (डिटेक्टर खराब था)।
  • उन्नत डिटेक्टर्स का उपयोग करने वाले इस नए सिस्टम के साथ, रोबलेट लगभग कुछ भी देख सकते हैं। अब, मुख्य समस्या सत्यापन (verification) है।
  • रोबोट संभावित मिलान को पहचानने में इतने अच्छे हैं कि वे अक्सर रुक जाते हैं और कहते हैं, "मुझे मिल गया!" जबकि वास्तव में उन्होंने उसे नहीं पाया होता है। नया संघर्ष वस्तु को खोजने का नहीं है; बल्कि यह जानने का है कि रुकने से पहले आपने वास्तव में सही वस्तु पा ली है या नहीं।

संक्षेप में: AnyGoal रोबोटों की एक ऐसी टीम है जो "चीजें कहाँ हो सकती हैं" के एक निरंतर अपडेट होने वाले मानचित्र को साझा करती है। वे अनुमान लगाने के लिए एक स्मार्ट AI का उपयोग करते हैं, लेकिन गलतियों से बचने के लिए अपने साझा इतिहास पर भरोसा करते हैं। यह पिछले तरीकों की तुलना में बेहतर काम करता है क्योंकि इसे हर नए घर या नई वस्तु के लिए पुन: प्रशिक्षित किए बिना, मौके पर सीखने और अनुकूलित होने के लिए डिज़ाइन किया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →