← नवीनतम पेपर
💻 computer science

City Navigation in the Wild: Exploring Emergent Navigation from Web-Scale Knowledge in MLLMs

यह शोध पत्र **CityNav** को प्रस्तुत करता है, जो केवल दृश्य संकेतों के माध्यम से ज्ञान-गहन, वास्तविक दुनिया के शहर के नेविगेशन को करने की मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) की क्षमता का मूल्यांकन करने के लिए एक नया बेंचमार्क है, और मॉडल्स को अपने आंतरिक संज्ञानात्मक मानचित्रों (cognitive maps) का स्पष्ट रूप से उपयोग करने के लिए प्रॉम्प्ट करने के माध्यम से प्रदर्शन में सुधार करने हेतु **Verbalization of Path (VoP)** का प्रस्ताव करता है।

मूल लेखक: Dwip Dalal, Utkarsh Mishra, Narendra Ahuja, Nebojsa Jojic

प्रकाशित 2026-02-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dwip Dalal, Utkarsh Mishra, Narendra Ahuja, Nebojsa Jojic

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक बहुत ही बुद्धिमान, बहुत अधिक पढ़ाकू व्यक्ति को टोक्यो या न्यूयॉर्क जैसे किसी विशाल, अपरिचित शहर के बीच में छोड़ दिया है। इस व्यक्ति ने हर गाइडबुक पढ़ ली है, विकिपीडिया का हर लेख देख लिया है, और इन शहरों की लाखों तस्वीरें देख ली हैं। वे अविश्वसनीय रूप से बुद्धिमान हैं, लेकिन एक पेंच है: उनके पास कोई जीपीएस (GPS), कोई गूगल मैप्स (Google Maps) नहीं है, और न ही कोई दिशा-सूचक यंत्र (compass) है। उनके पास केवल अपनी आँखें और अपनी याददाश्त है।

यही वह समस्या है जिसे यह शोध पत्र हल करने की कोशिश कर रहा है।

समस्या: "बुद्धिमान पर दिशाहीन" AI

वर्तमान AI मॉडल (जैसे ChatGPT के पीछे के मॉडल) उसी व्यक्ति की तरह हैं। वे "मल्टीमॉडल" (multimodal) हैं, जिसका अर्थ है कि वे छवियों को "देख" सकते हैं और टेक्स्ट को "पढ़" सकते हैं। हालाँकि, जब हम उनसे वास्तव में कुछ करने के लिए कहते—जैसे कि एक वास्तविक शहर में रास्ता खोजना—तो वे आमतौर पर विफल हो जाते हैं।

अधिकांश AI परीक्षण "सिम्युलेटेड" दुनिया (जैसे कि एक वीडियो गेम) में होते हैं जहाँ नियम सरल होते हैं। लेकिन वास्तविक दुनिया "जंगली" (wild) है। इसमें बंद गलियाँ, विभिन्न भाषाओं में भ्रमित करने वाले सड़क के संकेत और विशाल दूरियाँ होती हैं। अधिकांश AI एजेंट "खो जाते हैं" (lost in the sauce)—वे भूल जाते हैं कि वे अभी कहाँ से आए थे, वे लूप (loops) में फंस जाते हैं, या वे अपने लक्ष्य से भटक जाते हैं क्योंकि वे केवल अपने ठीक सामने वाले सड़क के कोने को देख रहे होते हैं।

समाधान: "पाथ का वर्बलाइजेशन" (Verbalization of Path - VoP)

शोधकर्ताओं ने AI के नेविगेशन के लिए एक नया तरीका बनाया जिसे AgentNav कहा जाता है, जो एक चतुर तकनीक का उपयोग करता है जिसे वे Verbalization of Path (VoP) कहते हैं।

इसे इस तरह सोचें:
कल्पना कीजिए कि आप एक अंधेरे जंगल में चल रहे हैं। अधिकांश AI एजेंट ऐसे लोगों की तरह हैं जो अपना सिर झुकाकर चलते हैं, केवल अपने अगले कदम को देखते हैं। वे शायद एक पेड़ देख लें, लेकिन उन्हें यह एहसास नहीं होगा कि वे उसी काई वाले पत्थर के पास तीन बार से गुजर चुके हैं।

VoP AI को एक "कथावाचक" (Narrator) में बदल देता है। केवल एक सड़क के कोने को देखने और एक दिशा चुनने के बजाय, AI को रुकने और ज़ोर से "खुद से बात करने" के लिए मजबूर किया जाता है। उसे कहना होगा:

  1. "ठीक है, मैं वर्तमान में ब्रॉडवे और कैनाल स्ट्रीट के कोने पर खड़ा हूँ।"
  2. "मेरा लक्ष्य वन वर्ल्ड ट्रेड सेंटर है, जो यहाँ से दक्षिण में है।"
  3. "मेरी योजना ब्रॉडवे पर दक्षिण की ओर चलते रहने की है जब तक कि मैं वेसी स्ट्रीट पर न पहुँच जाऊँ, फिर दाईं ओर मुड़ना है।"

AI को अपने आंतरिक मानचित्र को वर्बलाइज (शब्दों में व्यक्त) करने के लिए मजबूर करके, शोधकर्ता अनिवार्य रूप से AI को एक "मानसिक ब्लैकबोर्ड" दे रहे हैं। यह AI को अपनी योजना "भूलने" से रोकता है। यह एक ऐसे व्यक्ति के बीच का अंतर है जो बिना किसी उद्देश्य के भटक रहा है और एक ऐसे व्यक्ति के बीच का अंतर है जो निर्देशों की एक लिखित सूची का पालन कर रहा है जिसे वह लगातार चेक करता रहता है।

"मेमोरी" टूलकिट

यह सुनिश्चित करने के लिए कि AI चक्कर न खा जाए, शोधकर्ताओं ने इसे तीन विशिष्ट प्रकार के "मानसिक नोट्स" दिए:

  • जीपीएस लॉग (निर्णय का इतिहास): जहाँ भी इसने मोड़ लिया है उसकी एक सरल सूची (जैसे, "बाएँ, बाएँ, दाएँ, सीधा")।
  • "यहाँ पहले आ चुका हूँ" का अलार्म (पिछली यात्रा): यह याद रखने का एक तरीका कि, "हे, मैंने इस चौराहे पर बाएँ जाने की कोशिश की थी और यह एक बंद रास्ता था; चलिए इस बार दाएँ चलते हैं।"
  • मानसिक दिशा-सूचक (मार्कोवियन मेमोरी): इसकी वर्तमान स्थिति का एक संक्षिप्त सारांश ताकि इसे पिछले एक घंटे के हर विवरण को याद न रखना पड़े, केवल महत्वपूर्ण चीज़ों को याद रखना हो।

परिणाम: खोए हुए से स्थानीय विशेषज्ञ तक

उन्होंने इसका परीक्षण CityNav नामक एक विशाल नए डेटासेट पर किया, जिसमें न्यूयॉर्क, टोक्यो, वियना और साओ पाउलो शामिल हैं।

उन्होंने पाया कि यहाँ तक कि सबसे उन्नत AI मॉडल (जैसे GPT-4o) भी अकेले शहरों में नेविगेट करने में काफी खराब हैं। लेकिन जब उन्होंने VoP (कथावाचक विधि) का उपयोग किया, तो उनकी सफलता दर आसमान छू गई। वे लगभग पूरी तरह से खो जाने से लेकर वास्तविक दुनिया की सड़कों के माध्यम से जटिल, कई किलोमीटर लंबे मार्गों को सफलतापूर्वक नेविगेट करने तक पहुँच गए।

संक्षेप में सारांश

पेपर का बड़ा विचार: AI को केवल "वहाँ जाओ" न कहें। AI को हर बार जब वह किसी चौराहे पर पहुँचे, तो "बताओ कि तुम कहाँ हो, तुम कहाँ जा रहे हो, और तुम वहाँ कैसे पहुँचने की योजना बना रहे हो" कहें। "सोचने" को "बात करने" में बदलकर, हम एक खोए हुए पथिक को एक सक्षम नाविक में बदल देते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →