← नवीनतम पेपर
💻 computer science

VLN-AVP: Zero-Shot Vision-Language Navigation with Hybrid Long-Short-Term Memory for Autonomous Valet Parking

यह शोध पत्र VLN-AVP का प्रस्ताव करता है, जो एक ज़ीरो-शॉट नेविगेशन फ्रेमवर्क है जो स्वायत्त वैलेट पार्किंग के लिए बर्ड्स-आई-व्यू परसेप्शन को विज़न-लैंग्वेज मॉडल्स और एक हाइब्रिड मेमोरी सिस्टम के साथ जोड़ता है ताकि मैप की निर्भरता को समाप्त किया जा सके, प्राकृतिक भाषा निर्देशों की व्याख्या की जा सके, और सिमुलेशन एवं वास्तविक दुनिया के भूमिगत पार्किंग वातावरण दोनों में उत्कृष्ट प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Yijian Li, Xiangru Mu, Changze Li, Hantian Shi, Jiyuan Cai, Jia Cai, Xiaoxue Liu, Yajing Sun, Ming Yang, Tong Qin

प्रकाशित 2026-07-21
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yijian Li, Xiangru Mu, Changze Li, Hantian Shi, Jiyuan Cai, Jia Cai, Xiaoxue Liu, Yajing Sun, Ming Yang, Tong Qin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को गाड़ी चलाना सिखा रहे हैं। लंबे समय तक, एक रोबोट को कार पार्क करना सिखाने का एकमात्र तरीका उसे पूरे पार्किंग गैरेज का एक सटीक, पहले से बना हुआ नक्शा देना था, जैसे कि एक खजाने का नक्शा जिसमें हर मोड़ और बाधा को स्याही से अंकित किया गया हो। यह तब बहुत अच्छा काम करता है जब आप उस इमारत को जानते हों, लेकिन यदि आप किसी नए, अपरिचित गैरेज में जाते हैं, तो रोबोट फंस जाता है क्योंकि उसके पास उसका नक्शा नहीं होता। यह "ऑटोनॉमस वैलेट पार्किंग" (AVP) की दुनिया है, जहाँ कारें आपके लिए खुद पार्क होती हैं। लेकिन क्या होगा अगर रोबोट केवल आसपास देख सके, संकेतों को पढ़ सके, और एक इंसान की यह बात समझ सके कि "लिफ्ट के पास एक जगह ढूँढो," बिना किसी नक्शे की आवश्यकता के? यहीं पर "विज़न-लैंग्वेज नेविगेशन" (VLN) आता है। VLN को अपनी आँखों (दृष्टि/विजन) और शब्दों के साथ तर्क करने की अपने मस्तिष्क की क्षमता (भाषा) के संयोजन के माध्यम से दुनिया को समझने के लिए एक रोबोट को प्रशिक्षित करने के रूप में सोचें। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह यह है: क्या हम एक सेल्फ-ड्राइविंग कार को इतना स्मार्ट बना सकते हैं कि वह हमें सुनकर और संकेतों को देखकर एक अजीब, भूमिगत पार्किंग लॉट में नेविगेट कर सके, बिना पहले कभी देखे गए किसी पूर्व-निर्मित नक्शे के?

यह शोध पत्र एक नई प्रणाली पेश करता है जिसे VLN-AVP कहा जाता है, जो ठीक उसी समस्या को हल करने का प्रयास करती है। लेखक एक "ज़ीरो-शॉट" नेविगेशन फ्रेमवर्क प्रस्तावित करते हैं, जो एक फैंसी तरीका है यह कहने का कि सिस्टम एक बिल्कुल नए पार्किंग गैरेज को संभाल सकता है जिसे उसने पहले कभी नहीं देखा है, और यह केवल एक इंसान के प्राकृतिक भाषा निर्देशों का उपयोग करता है। एक पूर्व-निर्मित नक्शे पर निर्भर रहने के बजाय, सिस्टम एक शक्तिशाली "विज़न-लैंग्वेज मॉडल" (VLM) का उपयोग करता है—इसे एक सुपर-स्मार्ट रोबोट मस्तिष्क के रूप में समझें जो एक तस्वीर देख सकता है और एक वाक्य पढ़ सकता है ताकि यह पता लगाया जा सके कि क्या करना है। हालाँकि, लेखकों ने पाया कि रोबोट को केवल एक स्मार्ट मस्तिष्क देना पर्याप्त नहीं है; उसे भ्रमित होने से बचने के लिए एक बेहतर स्मृति (मेमोरी) की आवश्यकता है।

इसे ठीक करने के लिए, टीम ने दो अलग-अलग भागों के साथ एक हाइब्रिड मेमोरी सिस्टम बनाया। पहला, एक शॉर्ट-टर्म मेमोरी (अल्पकालिक स्मृति) है, जो रोबोट की तत्काल "वर्किंग मेमोरी" की तरह कार्य करती है। चूंकि स्मार्ट मस्तिष्क (VLM) दुनिया को बहुत तेज़ी से नहीं देखता है, इसलिए हो सकता है कि वह एक ऐसे संकेत को मिस कर दे जो तेज़ी से सामने से निकल जाए। शॉर्ट-टर्म मेमोरी हाल के संकेतों और दृश्य सुरागों की एक चलती सूची रखती है, ताकि रोबोट यह न भूल जाए कि उसने तीन सेकंड पहले "एग्जिट" का साइन देखा था। दूसरा, एक लॉन्ग-टर्म टोपोलॉजिकल मेमोरी (दीर्घकालिक टोपोलॉजिकल स्मृति) है, जो एक मानसिक स्केच की तरह है जिसे रोबोट गाड़ी चलाते समय बनाता है। हर बार जब रोबोट सफलतापूर्वक एक रास्ता या लैंडमार्क (जैसे कि एक विशिष्ट लिफ्ट) खोज लेता है, तो वह इसे अपने स्केच में जोड़ देता है। यदि रोबोट को उसी गैरेज में फिर से नेविगेट करना पड़ता है, तो वह हर बार सब कुछ शुरू से समझने के लिए स्मार्ट मस्तिष्क का उपयोग करने के बजाय, इस स्केच का उपयोग करके अधिक तेज़ी से और कुशलता से आगे बढ़ सकता है।

शोधकर्ताओं ने इस विचार का परीक्षण दो तरीकों से किया: एक हाई-फिडेलिटी कंप्यूटर सिमुलेशन में और एक वास्तविक कार के साथ एक वास्तविक भूमिगत पार्किंग गैरेज में। उन्होंने एक नया डेटासेट बनाया जिसे VLN-AVP कहा जाता है, जिसमें 10 अलग-अलग उच्च-गुणवत्ता वाले 3D पार्किंग दृश्य और 1,000 से अधिक नेविगेशन एपिसोड शामिल हैं, जो इस प्रकार के शोध के लिए अब तक का सबसे बड़ा संग्रह है।

परिणाम उत्साहजनक थे। सिमुलेशन में, VLN-AVP सिस्टम अन्य तरीकों की तुलना में काफी बेहतर था। इसने अन्य विज़न-लैंग्वेज नेविगेशन विधियों की तुलना में 25% से अधिक और अन्य ऑटोनॉमस ड्राइविंग विधियों की तुलना में 15% से अधिक सफलता दर हासिल की। वास्तविक कार के साथ वास्तविक दुनिया के परीक्षणों में भी, सिस्टम ने अच्छा प्रदर्शन किया, और "लिफ्ट हॉल के पास एक जगह ढूँढो" जैसे जटिल निर्देशों को सफलतापूर्वक नेविगेट किया और यहाँ तक कि जब एक इंसान ने इसे कहा, "नहीं, वह गलत लिफ्ट है, चलते रहो," तो इसने अपना रास्ता भी सुधारा। अध्ययन बताता है कि एक स्मार्ट भाषा मस्तिष्क को एक चतुर दो-भाग वाली मेमोरी प्रणाली के साथ जोड़कर, हम ऐसे सेल्फ-पार्किंग कारें बना सकते हैं जो बहुत अधिक लचीली हैं और जिन्हें काम पूरा करने के लिए पूर्व-निर्मित नक्शे की आवश्यकता नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →