AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness
AgenticNav एक हल्का, ज़ीरो-शॉट विज़न-एंड-लैंग्वेज नेविगेशन फ्रेमवर्क पेश करता है जो VLM-एनवायरनमेंट इंटरैक्शन को एक टूल-कॉलिंग हार्नेस के रूप में पुनर्कल्पित करता है, जिससे सीखा हुआ वेपॉइंट प्रेडिक्टर बनाए बिना सीधे पिक्सेल-आधारित एक्शन सिलेक्शन, ऑन-डिमांड डेप्थ क्वेरीज़ और चयनात्मक मेमोरी रिट्रीवल प्राप्त करने के लिए सक्षम बनाया जा सके, जिससे अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक बिल्कुल नए घर में नेविगेट करना सिखा रहे हैं। आप उसे एक सरल कमांड देते हैं: "रसोई में जाओ, दाईं ओर मुड़ो, और सोफे के पास रुक जाओ।" यह विज़न-एंड-लैंग्वेज नेविगेशन (VLN) की दुनिया है। यह रोबोटिक्स की एक ऐसी शाखा है जहाँ एक एजेंट को एक ऐसे 3D स्थान में घूमने के लिए मानव भाषा और दृश्य संकेतों (visual clues) को समझना होता है जिसे उसने पहले कभी नहीं देखा है। लंबे समय तक, रोबोट्स को चलने का तरीका सीखने के लिए हजारों विशिष्ट घरों पर प्रशिक्षित करने की आवश्यकता होती थी, जिसका अर्थ था कि यदि आप उन्हें किसी दूसरे भवन में ले जाते, तो वे खो जाते। लेकिन हाल ही में, हमने "लार्ज विजन-लैंग्वेज मॉडल्स" (VLMs) विकसित किए हैं—सुपर-स्मार्ट AI दिमाग जो बिना हर कार्य के लिए पुन: प्रशिक्षित हुए पहले से ही चित्रों और शब्दों को समझ सकते हैं। बड़ा सवाल वैज्ञानिकों के सामने यह है: हम इस स्मार्ट दिमाग को रोबट के पैरों से कैसे जोड़ें? हम AI को यह कैसे तय करने दें कि उसे ठीक कहाँ कदम रखना है बिना वास्तविक दुनिया की अव्यवस्थित और निरंतर वास्तविकता में भ्रमित हुए?
यहीं पर AgenticNav नामक पेपर काम आता है। लेखक तर्क देते हैं कि AI को रोबोट से जोड़ने का पुराना तरीका एक ड्राइवर को केवल तीन पूर्व-निर्धारित सड़कों वाले मानचित्र देने जैसा था। यदि गंतव्य उन तीन सड़कों में से एक पर नहीं होता, तो ड्राइवर फंस जाता। नया तरीका, AgenticNav, खेल को पूरी तरह बदल देता है। AI को कुछ सीमित, पूर्व-अनुमोदित चालों में से चुनने के लिए मजबूर करने के बजाय, यह उसे "उपकरणों" (tools) का एक सेट देता है जिन्हें वह जब चाहे उपयोग कर सकता है। इस AI को एक रहस्यमयी खेल में जासूस की तरह समझें। खेल के माध्यम से जासूस को "बाएं जाओ," "दाएं जाओ," या "सीधे जाओ" के बीच चुनने के लिए मजबूर करने के बजाय, जासूस अब कह सकता है, "मुझे दीवार के उस विशिष्ट पिक्सेल की गहराई की जांच करने की आवश्यकता है," या "मुझे दिखाओ कि मैं कहाँ-कहाँ गया हूँ," या "मैं सीधे उस कुर्सी की ओर चलना चाहता हूँ जिसे मैं देख रहा हूँ।"
यह पेपर AgenticNav नामक एक सिस्टम पेश करता है, जो इन स्मार्ट AI दिमागों के लिए एक "हारनेस" (harness) या कंट्रोल पैनल के रूप में कार्य करता है। शोधकर्ताओं ने पाया कि AI को तीन विशिष्ट उपकरण देने से, यह पहले की तुलना में अनदेखे वातावरण में बहुत बेहतर तरीके से नेविगेट कर सका, यहाँ तक कि बिना किसी अतिरिक्त प्रशिक्षण के। पहला उपकरण है एक्शन टूल (Action Tool)। सुझाए गए स्थानों की एक छोटी सूची चुनने के बजाय, AI कैमरे के दृश्य में किसी भी पिक्सेल की ओर सीधे इशारा कर सकता है और कह सकता है, "वहाँ जाओ।" सिस्टम फिर उस पिक्सेल को एक सुरक्षित चलने वाले पथ में बदलने के लिए गणित का उपयोग करता है। दूसरा उपकरण है डेप्थ टूल (Depth Tool)। कभी-कभी AI को यह जानने की आवश्यकता होती है कि कोई चीज़ कितनी दूर है। AI को गहराई का एक विशाल, भ्रमित करने वाला 3D मैप दिखाने के बजाय, यह टूल AI को यह पूछने की अनुमति देता है, "इस विशिष्ट स्थान पर दीवार कितनी दूर है?" और एक सटीक संख्या प्राप्त करने देता है। तीसरा उपकरण है मेमोरी टूल (Memory Tool)। जैसे-जैसे रोबोट चलता है, वह एक संक्षिप्त मानचित्र बनाता है। यदि रोबोट भ्रमित हो जाता है या उसे उस संकेत को याद करने की आवश्यकता है जो उसने पहले देखा था, तो वह सिस्टम से अपनी यात्रा के हर फ्रेम को याद करने के बजाय, जो उसके दिमाग को थका सकता है, उस विशिष्ट क्षण को "याद करने" (recall) के लिए कह सकता है।
लेखकों ने इस सिस्टम का परीक्षण एक कंप्यूटर सिमुलेशन में किया जिसे R2R-CE (Habitat सिम्युलेटर का उपयोग करके) कहा जाता है और एक वास्तविक रोबोट पर भी किया। वास्तविक-विश्व सत्यापन में प्रयोगशाला, कार्यालय और बाहरी यार्ड दृश्यों को कवर करने वाले 30 विशिष्ट एपिसोड शामिल थे, जिसमें साइन पढ़ने, लंबी दूरी के नेविगेशन और सटीक लक्ष्य आगमन जैसे कार्यों पर जोर दिया गया था। उन्होंने पाया कि एक शक्तिशाली AI दिमाग (GPT-5.5) का उपयोग करते समय, उनके नए तरीके ने लक्ष्य तक पहुँचने में 55% सफलता दर हासिल की, जो पिछले सर्वश्रेष्ठ तरीके (SmartWay) से एक महत्वपूर्ण छलांग थी जिसने केवल 44% तक ही पहुँचा था। दक्षता (कि उसने सफलता और छोटे पथ के बीच कितना अच्छा संतुलन बनाया) के मामले में, उन्होंने 35.04% से 48.41% तक सुधार किया। पेपर यह सुझाव देता है कि बाधा केवल AI के दिमाग की बुद्धिमत्ता नहीं है, बल्कि यह है कि हम उसे दुनिया के साथ बातचीत करने के लिए उपकरण कैसे देते हैं। AI को अपने स्वयं के लक्ष्य चुनने और विशिष्ट जानकारी माँगने की अनुमति देकर, यह पहले की तुलना में कहीं अधिक सक्षम हो जाता है, यहाँ तक कि उन स्थानों में भी जहाँ वह पहले कभी नहीं गया है। शोधकर्ताओं ने यह भी नोट किया कि यह दृष्टिकोण विभिन्न प्रकार के AI दिमागों के साथ अच्छी तरह से काम करता है, जो यह सुझाव देता है कि यह "टूल-कॉलिंग" शैली भविष्य में रोबोट को बनाने के लिए एक आशाजनक तरीका है जो वास्तव में हमारी जटिल दुनिया को समझ सकते हैं और उसमें चल सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।