← नवीनतम पेपर
💻 computer science

HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System

Hierarchical Memory System को पेश करके, MemVLN ओपन-सोर्स ज़ीरो-शॉट विज़न-एंड-लैंग्वेज नेविगेशन में "नेविगेशन एम्नेशिया" (Navigation Amnesia) की समस्या का समाधान किया है, जो दीर्घकालिक स्थानीयकरण (long-term localization) और विज़ुअल रिकॉल को महत्वपूर्ण रूप से बढ़ाता है, जिससे मौजूदा अत्याधुनिक ओपन-सोर्स विधियों के प्रदर्शन को लगभग दोगुना कर दिया गया है।

मूल लेखक: Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan Sun, Ce Hao

प्रकाशित 2026-07-21
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan Sun, Ce Hao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसे रोबोट की कल्पना करें जो आपकी आवाज़ को समझ सके और दुनिया को बिल्कुल आपकी तरह देख सके। यह "एम्बोडीड एआई" (Embodied AI) का सपना है, एक ऐसा क्षेत्र जहाँ कंप्यूटर केवल चैट या गणना नहीं करते; वे कमरों में शारीरिक रूप से घूमते हैं, "रसोई में जाओ और एक कप उठा लाओ" जैसे निर्देशों का पालन करते हैं, और दीवारों से टकराए बिना जटिल स्थानों में रास्ता खोजते हैं। लंबे समय तक, इन रोबोटों को चलने का तरीका सीखने के लिए भारी मात्रा में मानव-लिखित प्रशिक्षण डेटा की आवश्यकता होती थी, जिससे उन्हें नए घरों या कार्यालयों के अनुकूल होने में बहुत समय लगता था। हाल ही में, वैज्ञानिकों ने रोबोटों को सामान्य समझ (common sense) देने के लिए "लार्ज लैंग्वेज मॉडल्स" (LLMs) जैसे विशाल "मस्तिष्क" मॉडल्स का उपयोग करना शुरू किया, जिससे वे बिना किसी पूर्व प्रशिक्षण के चलते-फिरते नेविगेशन का पता लगा सकते हैं। हालाँकि, इसमें एक पेच है: सबसे स्मार्ट मस्तिष्क महंगे, क्लाउड-आधारित दरवाजों के पीछे बंद हैं जिनका उपयोग करने के लिए पैसे लगते हैं और गोपनीयता संबंधी चिंताएं भी पैदा होती हैं क्योंकि वे आपके घर का वीडियो फीड एक सर्वर पर भेजते हैं। जबकि ओपन-सोर्स मॉडल (मुफ्त, स्थानीय मस्तिष्क) मौजूद हैं, वे अक्सर भ्रमित हो जाते हैं, भूल जाते हैं कि वे कहाँ हैं, या गोल-गोल घूमते रहते हैं, जिससे उनकी क्षमताओं और महंगे, क्लोज्ड-सोर्स मॉडल्स के बीच एक बड़ा अंतर रह जाता है।

यहाँ HiMemVLN का आगमन होता है, एक नया दृष्टिकोण जो ओपन-सोर्स रोबोट मस्तिष्क को यह सिखाता है कि वे कहाँ गए थे और वे कहाँ जा रहे हैं, जो प्रभावी रूप से उनकी "नेविगेशन भूलने की बीमारी" (navigation amnesia) को ठीक करता है। शोधकर्ताओं ने पाया कि इन ओपन-सोर्स रोबोट्स दो प्रकार की विस्मृति से जूझते हैं: शॉर्ट-टर्म एमनेशिया (अल्पकालिक विस्मृति), जहाँ वे तत्काल परिवेश का ट्रैक खो देते हैं और लूप में चलने लगते हैं, और लॉन्ग-टर्म एमनेशिया (दीर्घकालिक विस्मृति), जहाँ वे मूल लक्ष्य को भूल जाते हैं और कुछ कदमों के बाद पथ से भटक जाते हैं। इसे ठीक करने के लिए, टीम ने मानव मस्तिष्क से प्रेरित एक "पदानुक्रमित स्मृति प्रणाली" (hierarchical memory system) बनाई। उन्होंने एक शॉर्ट-टर्म लोकलर (Short-Term Localer) बनाया जो एक विजुअल स्केचबुक की तरह काम करता है, जो लगातार उन कमरों का एक नक्शा बनाता है जहाँ वह अभी-अभी गया था ताकि यह पता लगाया जा सके कि क्या वह गोल-गोल घूम रहा है। उन्होंने एक लॉन्ग-टर्म ग्लोबलर (Long-Term Globaler) भी बनाया जो एक दिशा-सूचक यंत्र (compass) और मिशन नियंत्रक की तरह कार्य करता है, जो लगातार रोबोट को बड़ी तस्वीर की याद दिलाता रहता है: "तुम बेडरूम से शुरू हुए थे, तुम्हें किचन में जाना है, और तुम वर्तमान में गलत दिशा में जा रहे हो।"

इन दोनों स्मृति प्रणालियों को जोड़कर, HiMemVLN ओपन-सोर्स रोबोट्स को नेविगेशन की वह विश्वसनीयता प्रदान करता है जो पहले केवल महंगे, क्लोज्ड-सोर्स मॉडल्स में देखी जाती थी। परीक्षणों में, इस पद्धति ने न केवल रोबोट्स को लूप से बचने में मदद की; बल्कि इसने पिछले सर्वश्रेष्ठ ओपन-सोर्स तरीकों की तुलना में उनकी सफलता दर को लगभग दोगुना कर दिया। सिम्युलेटेड वातावरण में, इस नई प्रणाली ने 30% की सफलता दर और 26.85 का सक्सेस-वेटेड पाथ लेंथ (SPL) प्राप्त किया, जो पिछले ओपन-सोर्स लीडर, OpenNav से काफी बेहतर था, जिसने केवल 16% सफलता हासिल की थी। शोधकर्ताओं ने वास्तविक कमरों में एक वास्तविक पहिये वाले रोबोट पर भी इसका परीक्षण किया, जहाँ इसने फिर से प्रतिस्पर्धा को पछाड़ते हुए, OpenNav के 18% की तुलना में 32% की सफलता दर हासिल की। अध्ययन बताता है कि रोबोटों को उनके तत्काल दृश्य परिवेश और दीर्घकालिक लक्ष्यों दोनों को याद रखने का एक संरचित तरीका देकर, हम सुरक्षित, निजी और अत्यधिक सक्षम नेविगेशन एजेंट बना सकते हैं जिन्हें क्लाउड पर निर्भर रहने की आवश्यकता नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →