← नवीनतम पेपर
💻 computer science

Towards Open Environments and Instructions: General Vision-Language Navigation via Fast-Slow Interactive Reasoning

यह शोध पत्र slow4fast-VLN का प्रस्ताव करता है, जो विजन-लैंग्वेज नेविगेशन में जनरल सीन एडेप्टेशन के लिए एक नवीन फ्रेमवर्क है, जो संचित अनुभवों पर गहन चिंतन के माध्यम से रीयल-टाइम निर्णय लेने की प्रक्रिया को निरंतर अनुकूलित करने के लिए एक गतिशील इंटरैक्टिव फास्ट-स्लो रीजनिंग मैकेनिज्म का लाभ उठाता है, जिससे अनदेखे ओपन एनवायरनमेंट में सामान्यीकरण (जनरलाइजेशन) को बढ़ाया जा सके।

मूल लेखक: Yang Li, Aming Wu, Zihao Zhang, Yahong Han

प्रकाशित 2026-03-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yang Li, Aming Wu, Zihao Zhang, Yahong Han

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर में रास्ता खोजने (नेविगेट करने) के लिए प्रशिक्षित कर रहे हैं।

पुराना तरीका ("क्लोज्ड-सेट" की समस्या):
पारंपरिक रूप से, हम रोबोट को हजारों लिविंग रूम और किचन की तस्वीरें दिखाकर प्रशिक्षित करते थे। रोबोट सीख जाता था, "ठीक है, अगर मुझे सोफा दिखे, तो मैं बाईं ओर जाता हूँ।" लेकिन फिर, हम उसी रोबोट को किसी शॉपिंग मॉल या ऑफिस बिल्डिंग में रख देते थे। वह पूरी तरह से खो जाता था। वह एक "गलियारे" (corridor) को कैसे समझता, जो मॉल के गलियारे जैसा दिखता हो, या "पॉपकॉर्न मशीन के पास नीली टोपी वाले आदमी को ढूँढो" जैसे अजीब तरह से कहे गए निर्देश को कैसे समझता, यह उसे समझ नहीं आता था।

रोबate एक ऐसे छात्र की तरह था जिसने एक विशिष्ट गणित के टेस्ट के उत्तर रट लिए थे, लेकिन जब सवाल अलग भाषा में या अलग विषय पर पूछे गए, तो वह फेल हो गया।

नया समाधान: "Slow4Fast-VLN"
यह पेपर एक नया तरीका पेश करता है जिससे रोबोट को प्रशिक्षित किया जाता है जिसे Slow4Fast कहा जाता है। यह इस बात से प्रेरित है कि मानव मस्तिष्क कैसे काम करता है, जो मनोवैज्ञानिक डैनियल काह्नमैन के एक प्रसिद्ध विचार पर आधारित है:

  • सिस्टम 1 (तेज़ सोच - Fast Thinking): यह आपकी सहज प्रवृत्ति (gut instinct) है। यह त्वरित, स्वचालित और सहज है। "मुझे एक दरवाजा दिख रहा है, मैं इसके अंदर से गुजरता हूँ।"
  • सिस्टम 2 (धीमी सोच - Slow Thinking): यह आपका गहरा विचारक है। यह धीमा, तार्किक और सावधान है। "रुको, वह दरवाजा बाथरूम की ओर जाता है, किचन की ओर नहीं। मुझे सोचना होगा कि मैं कहाँ हूँ।"

अधिकांश रोबोटों के पास केवल "सिस्टम 1" होता है। वे तुरंत प्रतिक्रिया देते हैं लेकिन नई जगहों पर गलतियाँ करते हैं। यह पेपर रोबोट को दोनों सिस्टम देता है, और सबसे महत्वपूर्ण बात यह है कि यह उन्हें एक-दूसरे से बात करना सिखाता है।

यह कैसे काम करता है: "इंटर्न" और "मेंटर"

रोबोट के नेविगेशन सिस्टम को एक कंपनी के दो कर्मचारियों के रूप में सोचें:

1. इंटर्न (तेज़ तर्क - Fast Reasoning)

  • भूमिका: यह रोबोट की आँखें और पैर हैं। यह जो कुछ भी अभी देख रहा है, उसके आधार पर तेजी से चलता है।
  • काम: यह "सोफे के पास बाएं मुड़ें" जैसे निर्देशों का पालन करता है। यह तुरंत निर्णय लेता है।
  • दोष: यदि वह किसी नई इमारत (जैसे मॉल) में खो जाता है, तो वह घबरा जाता है या गलत मोड़ ले लेता है क्योंकि उसके पास मॉल का अनुभव नहीं है। यह एक नए ड्राइवर की तरह है जो एक जटिल चौराहे को देखकर जम जाता है।

2. मेंटर (धीमा तर्क - Slow Reasoning)

  • भूमिका: यह रोबोट का "मस्तिष्क" है जो गहराई से सोचने के लिए एक शक्तिशाली AI (जैसे लार्ज लैंग्वेज मॉडल) का उपयोग करता है।
  • काम: यह रोबोट को चलाता नहीं है। इसके बजाय, यह इंटर्न की गलतियों को देखता है। जब इंटर्न खो जाता है, तो मेंटर कहता है, "हे, याद करो जब तुम उस गलियारे में भ्रमित हो गए थे? कुंजी दीवार पर नीली पेंटिंग को देखने में थी, न कि दरवाजे में।"
  • जादू: मेंटर इन सीखों को लेता है, उन्हें एक "अनुभव लाइब्रेरी" (Experience Library) में लिखता है, और फिर इंटर्न को अगली बार बेहतर करने के लिए सिखाता है।

"इंटरैक्टिव" हिस्सा (द लूप)

पुराने सिस्टमों में, मेंटर और इंटर्न अलग-अलग कमरों में काम करते थे और कभी बात नहीं करते थे। मेंटर एक कठिन समस्या को हल करता था, लेकिन इंटर्न उससे सीख नहीं पाता था।

Slow4Fast में, उनके बीच एक सीधा संपर्क है:

  1. इंटर्न एक नए मॉल में जाने की कोशिश करता है। वह भ्रमित हो जाता है।
  2. मेंटर हस्तक्षेप करता है, भ्रम का विश्लेषण करता है, और एक सामान्य नियम बनाता है (जैसे, "मॉल में, बाहर निकलने का रास्ता खोजने के लिए ऊंची छतों को देखें")।
  3. मेंटर इंटर्न के "मस्तिष्क" को इस नए नियम के साथ अपडेट करता है।
  4. इंटर्न फिर से प्रयास करता है। अब, उसे मेंटर के धीमे होने की आवश्यकता नहीं है; वह बस ऊँची छतों को देखना जानता है। वह फिर से तेज़ी से चलता है, लेकिन मेंटर के ज्ञान के साथ।

अजीब निर्देशों को संभालना

यह पेपर इस बात पर भी समाधान देता है कि लोग कैसे बात करते हैं।

  • बुनियादी निर्देश: "किचन में जाओ।"
  • यूजर स्टाइल: "हे, मुझे कुछ स्नैक्स लेने हैं, उस कमरे की ओर जाओ जहाँ फ्रिज है, तुम्हें पता है, वही वाला जिसमें नीली टाइलें हैं।"

रोबोट का "मेंटर" एक अनुवादक की तरह काम करता है। यह बिखरे हुए, मानवीय-शैली के निर्देश को लेता है और उसे साफ, बुनियादी प्रारूप में बदल देता है जिसे रोबोट समझता है, ताकि रोबोट बोलचाल की भाषा (slang) से भ्रमित न हो।

परिणाम

प्रयोगों में, इस रोबोट को घरों में प्रशिक्षित किया गया था लेकिन शॉपिंग मॉल, सिनेमाघरों और ऑफिसों में टेस्ट किया गया था।

  • Slow4Fast के बिना: रोबोट बिना किसी दिशा के भटकता रहा, लंबे चक्कर लगाता रहा और अक्सर हार मान लेता था।
  • Slow4Fast के साथ: रोबोट वास्तविक समय में अपनी गलतियों से सीखता रहा। उसने नई इमारतों में बहुत तेज़ी से और अधिक सटीकता से रास्ता खोजा। यह एक "नौसिखिया ड्राइवर" की तरह था जो, कुछ गलत मोड़ों के बाद, अचानक एक "विशेषज्ञ ड्राइवर" बन गया क्योंकि उसके मेंटर ने उसे सड़क के नियम सिखाए थे।

संक्षेप में: यह पेपर रोबोट को तेज़ (एक रिफ्लेक्स की तरह) होने के साथ-साथ बुद्धिमान (एक ऐसे इंसान की तरह जो अनुभव से सीखता है) होना सिखाता है, जिससे वे बिना खोए, वास्तविक और अप्रत्याशित दुनिया का पता लगा सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →