← नवीनतम पेपर
💻 computer science

LangMap: A Human-Verified Benchmark for Hierarchical Open-Vocabulary Goal Navigation

यह शोध पत्र LangMap प्रस्तुत करता है, जो चार लक्ष्य स्तरों में मानव-सत्यापित पदानुक्रमित अर्थ संबंधी एनोटेशन (hierarchical semantic annotations) के साथ वाला पहला वास्तविक दुनिया का 3D इनडोर नेविगेशन बेंचमार्क है, और यह मौजूदा ओपन-वोकैबुलरी लैंग्वेज-कंडीशन्ड गोल नेविगेशन मूल्यांकनों की सीमाओं को दूर करने के लिए PlaNaVid बेसलाइन के साथ आता है।

मूल लेखक: Bo Miao, Weijia Liu, Jun Luo, Lachlan Shinnick, Jian Liu, Thomas Hamilton-Smith, Yuhe Yang, Zijie Wu, Vanja Videnovic, Feras Dayoub, Anton van den Hengel

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bo Miao, Weijia Liu, Jun Luo, Lachlan Shinnick, Jian Liu, Thomas Hamilton-Smith, Yuhe Yang, Zijie Wu, Vanja Videnovic, Feras Dayoub, Anton van den Hengel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जटिल घर के अंदर "हाइड एंड सीक" (लुका-छिपी) के एक हाई-स्टेक्स खेल खेल रहे हैं, लेकिन आपकी आँखों पर पट्टी बंधी है और आप केवल अपने ठीक सामने देख सकते हैं। आपका एक दोस्त वॉकी-टॉकी पर निर्देश चिल्लाकर आपको बता रहा है कि कहाँ जाना है।

यह पेपर इस खेल का एक नया, बहुत कठिन और बहुत अधिक निष्पक्ष संस्करण, साथ ही इसे खेलने की एक नई रणनीति पेश करता है।

समस्या: "खराब मानचित्र" की समस्या

अतीत में, शोधकर्ताओं ने रोबोट को भाषा के आधार पर चीजें खोजने के लिए सिखाने की कोशिश की। लेकिन इसमें एक बड़ी खामी थी: जो "मानचित्र" (निर्देश) उन्होंने उपयोग किए थे, वे अक्सर AI (विज़न-लैंग्वेज मॉडल्स) द्वारा लिखे गए थे जो घर को ठीक से समझ नहीं पाते थे।

इसे ऐसे समझें: यदि आप किसी AI से कमरों से भरे कमरे में एक विशिष्ट लाल कुर्सी को खोजने के लिए कहें, तो वह कह सकता है, "लाल कुर्सी खोजो।" लेकिन यदि वहां तीन लाल कुर्सियाँ हैं, तो यह निर्देश बेकार है। AI भ्रमित भी हो सकता है और कह सकता है, "खिड़की के पास वाली कुर्सी खोजो," जबकि खिड़की वास्तव में दूसरे कमरे में हो सकती है। पेपर में पाया गया कि इनमें से लगभग 40% AI-जनित निर्देश गलत या भ्रमित करने वाले थे। यह एक ऐसे व्यक्ति द्वारा बनाए गए नक्शे का उपयोग करके शहर में नेविगेट करने जैसा है जिसने कभी अपने कमरे से बाहर कदम ही नहीं रखा।

समाधान: LangMap (मानव-सत्यापित मानचित्र)

इसे ठीक करने के लिए, लेखकों ने LangMap बनाया। AI को निर्देशों का अनुमान लगाने देने के बजाय, उन्होंने मनुष्यों को घरों के वास्तविक 3D स्कैन देखने और निर्देश लिखने के लिए काम पर लगाया।

उन्होंने केवल "कुर्सी खोजो" तक ही सीमित नहीं रहे। उन्होंने कठिनाई का एक चार-स्तरीय पदानुक्रम (hierarchy) बनाया, जो बढ़ते स्तरों वाले एक वीडियो गेम की तरह है:

  1. सीन लेवल (आसान मोड): "पूरे घर में कोई भी कुर्सी खोजें।" (जैसे घास के ढेर में सुई खोजना, लेकिन आपको फर्क नहीं पड़ता कि कौन सी सुई है)।
  2. रूम लेवल (मध्यम मोड): "रसोई में एक कुर्सी खोजें।" (अब आपको पता होना चाहिए कि रसोई कैसी दिखती है)।
  3. रीजन लेवल (कठिन मोड): "नीले कालीन वाले बेडरूम में एक कुर्सी खोजें।" (अब आपको दो अलग-अलग बेडरूमों के बीच अंतर करना होगा)।
  4. इंस्टेंस लेवल (एक्सपर्ट मोड): "खिड़की के पास, बाईं ओर के पैर पर उस विशिष्ट कुर्सी को खोजें जिसमें खरोंच है।" (इसके लिए सूक्ष्म विवरणों को पहचानने और यह जानने की आवश्यकता है कि कौन सी वस्तु कौन सी है)।

लेखक इसे HieraNav (हायरार्किकल नेविगेशन) कहते हैं। उन्होंने 414 विभिन्न प्रकार की वस्तुओं को कवर करने वाले 18,000 से अधिक कार्यों का एक विशाल डेटासेट बनाया। प्रत्येक निर्देश की मानव द्वारा जांच की गई थी ताकि यह सुनिश्चित किया जा सके कि वह अद्वितीय और सटीक है। यह एक धुंधली फोटोकॉपी वाले मानचित्र और एक उच्च-परिभाषा (high-definition), हाथ से बने खजाने के नक्शे के बीच का अंतर है।

नया खिलाड़ी: PlaNaVid

इस समस्या को हल करने वाले अधिकांश रोबोट महंगे 3D सेंसर (जैसे LiDAR) या गहरे डेप्थ कैमरों पर भरोसा करते हैं ताकि वे कमरे का 3D मॉडल बना सकें। यह ऐसा है जैसे रोबोट एक हाई-टेक हेलमेट पहने हुए है जो उसे कमरे के "कंकाल" को देखने देता है।

PlaNaVid अलग है। इसके पास केवल एक मानक कैमरा (RGB) है, बिल्कुल एक मानव आँख की तरह। यह 3D मॉडल नहीं बनाता है, और इसे वस्तुओं की सटीक दूरी का पता नहीं होता है। तो, यह कैसे जीतता है?

यह बाउंडेड डाइवर्स मेमोरी (BDM) नामक एक चतुर ट्रिक का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आप एक भूलभुलैया में चल रहे हैं। अपने द्वारा उठाए गए हर कदम को याद रखने के बजाय (जो आपके मस्तिष्क के लिए बहुत अधिक है), आप अपनी यात्रा के सबसे दिलचस्प या अलग हिस्सों के कुछ स्नैपशॉट लेते हैं।
  • रणनीति: जब रोबोट को यह तय करने की आवश्यकता होती है कि आगे कहाँ जाना है, तो वह केवल अपने सामने जो है उसे नहीं देखता है। वह अपने पिछले कुछ अद्वितीय स्थानों के मानसिक फोटो एल्बम को "पलटता" है। वह एक स्मार्ट प्लानर (एक AI मस्तिष्क) का उपयोग करता है जो इन तस्वीरों को देखता है और कहता है, "आह, मुझे याद है कि मैंने इस फोटो में एक गलियारा देखा था जो किचन की ओर जाता है। चलो उसी दिशा में चलते हैं।"

यह रोबot को जटिल, बहु-चरणीय कार्यों (जैसे "एक कप खोजें, फिर कॉफी मशीन के पास जाएं, फिर एक किताब खोजें") को पूरा करने के लिए आगे की योजना बनाने की अनुमति देता है, बिना महंगे 3D हार्डवेयर की आवश्यकता के।

परिणाम

जब उन्होंने इस नए सेटअप का परीक्षण किया:

  • मानचित्र: मानव-लिखित निर्देश AI-लिखित निर्देशों की तुलना में कहीं बेहतर थे। एक परीक्षण में जहाँ कंप्यूटर को सही वस्तु से विवरण मिलाने के लिए देखा गया, मानव-लिखित निर्देश 81% बार सही थे, जबकि पुराने AI निर्देश केवल 58% बार सही थे।
  • रोबोट: PlaNaVid, केवल एक मानक कैमरे और अपने "फोटो एल्बम" मेमोरी का उपयोग करके, बाजार के लगभग हर अन्य रोबोट को हरा देता है। यह जटिल बहु-चरणीय कार्यों में 42.6% बार लक्ष्यों को खोजने में सफल रहा, जो महंगे 3D सेंसरों का उपयोग करने वाले रोबोटों से बेहतर प्रदर्शन है।

क्या अभी भी कठिन है?

इस नए मानचित्र और रोबोट के साथ भी, पेपर स्वीकार करता है कि अभी भी कठिन चुनौतियाँ हैं:

  • "लॉन्ग टेल" (The Long Tail): यदि रोबोट को किसी बहुत दुर्लभ वस्तु (जैसे किसी विशिष्ट प्रकार के विंटेज टोस्टर) को खोजने के लिए कहा जाता है, तो उसे संघर्ष करना पड़ता है क्योंकि उसने इसके बहुत कम उदाहरण देखे हैं।
  • छोटी और दूर की वस्तुएं: यदि लक्ष्य छोटा या दूर है, तो उसे पहचानना कठिन होता है।
  • चेन रिएक्शन: यदि रोबोट बहु-चरणीय कार्य के पहले चरण में विफल हो जाता है (जैसे, वह कप नहीं ढूंढ पाता), तो पूरा मिशन विफल हो जाता है। यह अभी भी हल करना बहुत कठिन है।

सारांश

संक्षेप में, लेखकों ने रोबोट नेविगेशन के लिए एक बेहतर, मानव-सत्यापित मानचित्र बनाया है जो रोबोटों का परीक्षण "एक कुर्सी खोजें" से लेकर "उस विशिष्ट नीले कमरे में खरोंच वाली कुर्सी खोजें" तक करता है। उन्होंने एक स्मार्ट रोबोट भी बनाया है जो केवल एक सामान्य कैमरे और एक चतुर मेमोरी सिस्टम का उपयोग करके इस जटिल दुनिया में नेविगेट कर सकता है, यह साबित करते हुए कि एक अच्छा नेविगेटर होने के लिए आपको महंगे 3D सेंसरों की आवश्यकता नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →