← नवीनतम पेपर
💻 computer science

Three-Step Nav: A Hierarchical Global-Local Planner for Zero-Shot Vision-and-Language Navigation

थ्री-स्टेप नैव (Three-Step Nav) एक ज़ीरो-शॉट पदानुक्रमित योजनाकार (hierarchical planner) है जो फॉरवर्ड ग्लोबल प्लानिंग, करंट सब-गोल अलाइनमेंट और बैकवर्ड ट्रैजेक्टरी ऑडिटिंग के तीन-दृष्टिकोण प्रोटोकॉल को लागू करने के लिए मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है ताकि ड्रिफ्ट को समाप्त किया जा सके और बिना फाइन-ट्यूनिंग के R2R-CE और RxR-CE डेटासेट्स पर अत्याधुनिक प्रदर्शन प्राप्त करते हुए विजन-एंड-लैंग्वेज नेविगेशन में सुधार किया जा सके।

मूल लेखक: Wanrong Zheng, Yunhao Ge, Laurent Itti

प्रकाशित 2026-04-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wanrong Zheng, Yunhao Ge, Laurent Itti

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वॉकी-टॉकी के माध्यम से अपने एक दोस्त को एक विशाल, अपरिचित घर के माध्यम से रास्ता दिखाने की कोशिश कर रहे हैं। आप वह नहीं देख सकते जो वे देख रहे हैं, और वे वह नहीं देख सकते जहाँ आप हैं। आपको उन्हें निर्देश देने होंगे जैसे, "लाल सोफे के पास से गुजरें, बड़ी पेंटिंग के पास बाएं मुड़ें, और तब रुकें जब आपको नीला फूलदान दिखाई दे।"

रोबोटिक्स की दुनिया में, इसे विज़न-एंड-लैंग्वेज नेविगेशन (VLN) कहा जाता है। रोबोट वह दोस्त है, और निर्देश वह टेक्स्ट (पाठ) है। हाल ही में, वैज्ञानिकों ने सुपर-स्मार्ट AI दिमागों (जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स या MLLMs कहा जाता है) का उपयोग करने के लिए शुरुआत की है, जो गाइड के रूप में कार्य करते हैं। ये AI भाषा और चित्रों को समझने में बेहतरीन हैं, लेकिन जब वे बिना किसी पूर्व प्रशिक्षण के एक वास्तविक, निरंतर 3D स्थान में नेविगेट करने की कोशिश करते हैं, तो वे अक्सर रास्ता भटक जाते हैं। वे ट्रैक से भटक सकते हैं, बहुत जल्दी रुक सकते हैं, या किसी रैंडम वस्तु से विचलित हो सकते हैं जो दिलचस्प दिखती है लेकिन लक्ष्य नहीं है।

यह पेपर एक नई विधि पेश करता है जिसे थ्री-स्टेप नैव (Three-Step Nav) कहा जाता है ताकि इन गलतियों को ठीक किया जा सके। इसे एक "सुपर-पायलट" देने के रूप में सोचें जो रास्ते पर बने रहने के लिए तीन-चरणीय दिनचर्या का उपयोग करता है।

समस्या: विवरणों में खो जाना

पिछले AI गाइड उन पर्यटकों की तरह थे जो केवल अपनी नाक के सामने के नक्शे को देखते हैं। वे एक निर्णय लेते हैं, एक कदम उठाते हैं, फिर से देखते हैं, और अगला कदम तय करते हैं। एक लंबी यात्रा के दौरान, छोटी गलतियाँ जुड़ती जाती हैं (जैसे हर बार थोड़ा बाईं ओर चलना), और रोबند अंततः गलत कमरे में पहुँच जाता है। वे उन चीजों से भी आसानी से विचलित हो जाते हैं जो निर्देशों का हिस्सा नहीं हैं।

समाधान: तीन-चरणीय दिनचर्या

लेखक एक पदानुक्रमित प्रणाली (hierarchical system) प्रस्तावित करते हैं जहाँ रोबोट एक जासूस की तरह केस सुलझाने के लिए तीन अलग-अलग तरीकों से सोचने के लिए रुकता है:

1. आगे देखें (रोडमैप)
रोबोट के कदम उठाने से पहले ही, AI पूरे निर्देश और शुरुआती दृश्य को देखता है। यह एक टूर गाइड की तरह काम करता है जो नैपकिन पर एक मोटा नक्शा बना रहा हो।

  • उपमा: कल्पना कीजिए कि आप एक रोड ट्रिप की योजना बना रहे हैं। यात्रा शुरू करने से पहले, आप केवल "ड्राइव करें" नहीं सोचते। आप अपनी यात्रा को छोटे, प्रबंधनीय हिस्सों में तोड़ते हैं: "पहले, हाईवे तक पहुँचें; फिर, गैस स्टेशन पर एग्जिट लें; अंत में, ड्राइववे में मुड़ें।"
  • यह क्या करता है: AI लंबे, जटिल वाक्य को छोटे, प्रबंधनीय चेकपॉइंट्स (सब-गोल्स) की एक सूची में तोड़ देता है और बड़े लैंडमार्क्स (जैसे "लाल सोफा" या "नीला फूलदान") की पहचान करता है ताकि उन्हें एंकर के रूप में उपयोग किया जा सके।

2. अभी देखें (माइक्रो-स्टेप)
एक बार जब रोबोट के पास अपना रोडमैप होता है, तो वह चलना शुरू कर देता है। हर एक कदम पर, उसे तय करना होता है कि आगे कहाँ जाना है।

  • उपमा: यह कार चलाने जैसा है। आप अभी सड़क देख रहे हैं। आप एक मोड़ देखते हैं, आप अपने वर्तमान चेकपॉइंट से इसकी तुलना करते हैं ("क्या यह गैस स्टेशन वाला एग्जिट है?"), और आप उस ओर स्टीयरिंग करते हैं।
  • यह क्या करता है: AI वर्तमान कैमरा दृश्य को देखता है और उसकी तुलना उस विशिष्ट "सब-गोल" से करता है जिसे वह प्राप्त करने की कोशिश कर रहा है। वह सबसे अच्छा रास्ता चुनता है जो उस तात्कालिक लक्ष्य के अनुरूप हो।

3. पीछे देखें (रियलिटी चेक)
यह सबसे महत्वपूर्ण नया फीचर है। एक चेकपॉइंट पूरा होने के बाद, रोबोट केवल आगे नहीं बढ़ता है। वह रुकता है और अपनी अब तक की यात्रा की समीक्षा करता है।

  • उपमा: कल्पना कीजिए कि आपने अभी कार पार्क की है। बाहर निकलने से पहले, आप अपने GPS इतिहास को देखते हैं। "रुको, क्या मैंने वास्तव में गैस स्टेशन पर टर्न लिया, या मैं उसे मिस कर गया और आगे निकल गया? क्या मैं नीले फूलदान के पास से गुजर गया?" यदि आपको एहसास होता है कि आपसे गलती हुई है, तो आप केवल आगे नहीं बढ़ते; आप पीछे हटते हैं और मार्ग को ठीक करते हैं।
  • यह क्या करता है: AI उस पथ की समीक्षा करता है जो उसने अभी लिया है। वह पूछता है: "क्या मैंने वास्तव में निर्देश को पूरा किया? क्या मैं रास्ते से भटक गया?" यदि उत्तर "नहीं" है, तो रोबोट के पास इसे ठीक करने के लिए चार उपकरण हैं:
    • कंटीन्यू (जारी रखें): "हाँ, मैं ठीक हूँ, अगले चरण पर बढ़ें।"
    • स्टे (रुकें): "मुझे यकीन नहीं है, मुझे बिना हिले फिर से देखने दें।"
    • बैकट्रैक (पीछे लौटें): "मुझसे गलती हुई, चलो आखिरी सुरक्षित स्थान पर वापस चलते हैं।"
    • लुक अराउंड (आस-पास देखें): "मैं भ्रमित हूँ, मुझे चारों ओर घूमकर सभी दिशाओं की जांच करने दें।"

यह क्यों काम करता है

लेखकों ने इस सिस्टम का परीक्षण दो कठिन डेटासेट्स (R2R-CE और RxR-CE) पर किया है जहाँ रोबोट को निरंतर 3D वातावरण में नेविगेट करना होता है।

  • कोई प्रशिक्षण आवश्यक नहीं: सबसे अच्छी बात यह है कि इस सिस्टम को हजारों उदाहरणों के साथ "सिखाने" की आवश्यकता नहीं है। यह "जीरो-शॉट" में काम करता है, जिसका अर्थ है कि यह एक नए घर को नेविगेट करने के लिए अपने मौजूदा सामान्य ज्ञान का उपयोग कर सकता है जिसे उसने पहले कभी नहीं देखा है।
  • बेहतर परिणाम: "लुक बैकवर्ड" चेक जोड़ने से, रोबोट ने कम गलतियाँ कीं। वह आसानी से विचलित नहीं हुआ, और वह समय से पहले नहीं रुका। परीक्षणों में, इसने इस प्रकार के "नो-ट्रेनिंग" नेविगेशन के लिए अब तक के सर्वश्रेष्ठ परिणाम हासिल किए, और अन्य स्मार्ट AI गाइड्स को बड़े अंतर से पीछे छोड़ दिया।

मुख्य निष्कर्ष

पेपर का दावा है कि AI को बड़ी तस्वीर की योजना बनाने, छोटे कदमों को निष्पादित करने और अपनी गलतियों का ऑडिट करने के बीच बारी-बारी से काम करने के लिए मजबूर करके, हम अधिक विश्वसनीय रूप से जटिल, अज्ञात स्थानों में नेविगेट करने वाले रोबोट बना सकते हैं। यह एक ऐसे रोबोट को बदल देता है जो बिना किसी उद्देश्य के भटक सकता है, एक सावधान, आत्म-सुधार करने वाले खोजकर्ता में।

लेखक नोट करते हैं कि हालांकि यह कंप्यूटर सिमुलेशन में बहुत अच्छा काम करता है, वास्तविक दुनिया के रोबोटों को अभी भी शोर वाले सेंसर और चलते-फिरते अवरोधों जैसी चुनौतियों का सामना करना पड़ता है, लेकिन यह फ्रेमवर्क वहां तक पहुँचने के लिए एक मजबूत, लाइटवेट आधार प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →