AnchorVLN: Geometry-Anchored Vision-Language Grounding Reasoning for Open-Vocabulary Navigation
यह शोध पत्र AnchorVLN को प्रस्तुत करता है, जो एक ओपन-वोकैबुलरी विजन-लैंग्वेज नेविगेशन सिस्टम है जो एक मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) सर्वर का लाभ उठाता है ताकि एक सख्त पृथक्करण लागू किया जा सके जहाँ विजन-लैंग्वेज मॉडल सिमेंटिक रीजनिंग को संभालते हैं जबकि ज्यामितीय उपकरण स्वतंत्र रूप से मेट्रिक मात्राओं को निर्धारित करते हैं, जिससे प्रत्यक्ष समन्वय अनुमान (direct coordinate estimation) की तुलना में अनदेखे वातावरणों में इंस्ट्रक्शन-फॉलोइंग सटीकता और ऑब्जेक्ट लोकलाइजेशन परिशुद्धता में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक रोबोट एक ऐसे कमरे में प्रवेश करता है जिसे उसने पहले कभी नहीं देखा है, और उसे "तस्वीर के नीचे रखे स्टूल" जैसे बोले गए विवरण के आधार पर एक विशिष्ट वस्तु खोजने का कार्य दिया गया है। दशकों तक, रोबोटों ने लेजर और कैमरों का उपयोग करके दुनिया का एक सटीक, गणितीय मानचित्र बनाने के माध्यम से इस कार्य को हल किया। फिर वे उस मानचित्र में पूर्व-निर्धारित वस्तु नामों को खोजते थे। यह "कुर्सी" या "मेज" खोजने के लिए तो अच्छा काम करता था, लेकिन जब निर्देश रचनात्मक या विशिष्ट हो जाते थे, जैसे "खिड़की के पास रखी लाल कुर्सी," तो यह विफल हो जाता था। रोबोट की शब्दावली जमी हुई थी; वह नए विवरणों को समझ नहीं सकता था। हाल के वर्षों में, शक्तिशाली आर्टिफिशियल इंटेलिजेंस मॉडल उभरे हैं जो किसी छवि को देख सकते हैं और मानव द्वारा दिए जाने वाले लगभग किसी भी विवरण को समझ सकते हैं। हालाँकि, ये मॉडल भाषा में उत्कृष्ट हैं लेकिन गणित में बहुत खराब हैं। वे आपको बता सकते हैं कि कोई वस्तु क्या है, लेकिन यदि उनसे पूछा जाए कि वह कितनी दूर है या वहां तक पहुँचने के लिए ठीक कहाँ जाना है, तो वे अक्सर गलत अनुमान लगाते हैं। यदि कोई रोबोट नेविगेट करने के लिए पूरी तरह से ऐसे मॉडल पर निर्भर रहता है, तो वह आत्मविश्वास के साथ एक ऐसे स्थान की ओर बढ़ सकता है जिसका अस्तित्व ही नहीं है, क्योंकि मॉडल ने एक ऐसी दूरी का आविष्कार कर लिया जो वास्तविक नहीं थी।
इस कार्य के पीछे के शोधकर्ताओं ने, जिन्हें AnchorVLN के रूप में जाना जाता है, इस समस्या को हल करने के लिए एक प्रणाली बनाई जो सख्ती से इस बात को अलग करती है कि रोबोट क्या जानता है और वह कैसे चलता है। उन्होंने महसूस किया कि सबसे अच्छा दृष्टिकोण यह है कि रोबोट को भाषा और वस्तुओं की पहचान संभालने के लिए आर्टिफिशियल इंटेलिजेंस का उपयोग करने दें, जबकि रोबोट के भौतिक सेंसरों को दूरी और दिशा को मापने का काम करने दें। उन्होंने एक ऐसी प्रणाली बनाई जहाँ AI एक मार्गदर्शक के रूप में कार्य करता है जो बताता है कि "क्या" देखना है, लेकिन वह कभी यह नहीं बताने की कोशिश करता कि "कितनी दूर" जाना है। इसके बजाय, प्रणाली डिजिटल उपकरणों के एक सेट का उपयोग करती है जो AI के विवरणों को रोबोट के वातावरण से प्राप्त वास्तविक लेजर डेटा का उपयोग करके भौतिक निर्देशांकों (coordinates) में अनुवादित करती है। यह सुनिश्चित करता है कि रोबोट कभी भी किसी काल्पनिक संख्या पर कार्य न करे। इस प्रणाली का परीक्षण पंद्रह अलग-अलग इनडोर दृश्यों वाले एक चैलेंज में किया गया था, जहाँ रोबोट को तीस जटिल निर्देशों का पालन करना था और वस्तुओं के स्थान के बारे में पैंतालीस प्रश्नों के उत्तर देने थे। परिणामों ने दिखाया कि जब प्रणाली ने इस कर्तव्यों के विभाजन का उपयोग किया, तो इसने 64.4 प्रतिशत बार सफलतापूर्वक निर्देशों का पालन किया। जब शोधकर्ताओं ने भौतिक दूरियों की जाँच करने वाले भाग को हटा दिया, तो सफलता दर काफी कम हो गई। इसके अलावा, जब किसी वस्तु के सटीक स्थान की ओर इशारा करने के लिए कहा गया, तो वास्तविक सेंसर डेटा का उपयोग करने वाली प्रणाली, अनुमान लगाने की कोशिश करने वाली प्रणाली की तुलना में बहुत अधिक सटीक थी, जिससे किसी वस्तु के केंद्र को खोजने में औसत त्रुटि तीन मीटर से अधिक से घटकर दो और आधा मीटर से भी कम रह गई।
इस उपलब्धि का मूल आधार रोबोट के मस्तिष्क को उसके शरीर से जोड़ने का एक नया तरीका है। शोधकर्ताओं ने एक संचार प्रोटोकॉल डिज़ाइन किया जहाँ आर्टिफिशियल इंटेलिजेंस केवल वाक्यांशों और नामों में बोल सकता है, संख्याओं में नहीं। जब रोबोट एक कमरे की तस्वीर देखता है, तो AI एक "स्टूल" की पहचान कर सकता है और उसे एक अस्थायी नाम दे सकता है, जैसे "वस्तु सात"। AI फिर सिस्टम से स्टूल को खोजने के लिए कहता है। सिस्टम AI से यह नहीं पूछता कि स्टूल कितनी दूर है। इसके बजाय, सिस्टम रोबोट के अपने लेजर स्कैनर को देखता है, जो फर्श और दीवारों तक वास्तविक दूरी को मापता है। यह लेजर डेटा में स्टूल को ढूंढता है, वास्तविक दूरी की गणना करता है, और रोबोट को उस विशिष्ट बिंदु की ओर बढ़ने के लिए कहता है। यदि AI दूरी का अनुमान लगाने की कोशिश करता है, तो सिस्टम बस उस संख्या को अनदेखा कर देता है क्योंकि जिन उपकरणों का वह उपयोग करता है, उन्हें स्वीकार करने के लिए प्रोग्राम नहीं किया गया है। यह रोबोट को गति के लिए अपने स्वयं के संवेदी डेटा पर भरोसा करने के लिए मजबूर करता है, ठीक वैसे ही जैसे एक मनुष्य दूरी का अंदाजा लगाने के लिए अपनी आँखों पर भरोसा करता है जबकि वह किसी मित्र के निर्देशों को सुन रहा होता है। रोबोट अभी भी जटिल निर्देशों को समझ सकता है, जैसे "उस कुर्सी की ओर जाओ जो टीवी के सबसे करीब है," क्योंकि सिस्टम टीवी के पास मौजूद सभी कुर्सियों की वास्तविक दूरियों की तुलना कर सकता है, बजाय इसके कि AI से गणित करने को कहा जाए।
यह दृष्टिकोण इस समस्या को भी हल करता है कि रोबोट फंस जाए या खाली स्थान की ओर बढ़ जाए। यदि AI किसी वस्तु को नहीं ढूंढ पाता है, तो सिस्टम रोबोट को अनुमान लगाने के लिए मजबूर नहीं करता है। इसके बजाय, यह रोबोट को एक नई जगह पर जाने के लिए कहता है जहाँ से उसे बेहतर दृश्य मिल सके। रोबोट फिर क्षेत्र को स्कैन करता है, और सिस्टम वस्तुओं की अपनी सूची को अपडेट करता है। यह सूची एक कमरे की बढ़ती हुई स्मृति की तरह है, जहाँ रोबोट द्वारा देखी गई प्रत्येक वस्तु को उसके वास्तविक आकार और स्थिति के साथ रिकॉर्ड किया जाता है। यदि रोबोट एक ही वस्तु को अलग कोण से देखता है, तो सिस्टम रिकॉर्ड को अधिक सटीक बनाने के लिए उसे अपडेट करता है, बजाय इसके कि एक नई, भ्रमित करने वाली प्रविष्टि बनाए। यह रोबोट को समय के साथ स्थान की विश्वसनीय समझ बनाने की अनुमति देता है, भले ही वह बिना किसी मानचित्र और कमरे के पूर्व ज्ञान के शुरू हुआ हो। शोधकर्ताओं ने पाया कि इस पद्धति ने रोबोट को उन वातावरणों में सफलतापूर्वक नेविगेट करने की अनुमति दी जहाँ वह पहले कभी नहीं गया था, बिना हर नए कमरे या हर नए प्रकार की वस्तु के लिए पुन: प्रोग्राम किए।
यह अध्ययन इस बात पर प्रकाश डालता है कि रोबोट दुनिया के साथ कैसे बातचीत करते हैं, इसमें एक मौलिक बदलाव आया है। एक एकल आर्टिफिशियल इंटेलिजेंस मॉडल से सब कुछ करने की कोशिश करने के बजाय—भाषा समझने से लेकर भौतिकी की गणना करने तक—शोधकर्ताओं ने एक ऐसी टीम बनाई जहाँ प्रत्येक भाग वही करता है जिसमें वह सर्वश्रेष्ठ है। आर्टिफिशियल इंटेलिजेंस रचनात्मकता और भाषा को संभालता है, जबकि रोबोट के सेंसर सटीकता और गति को संभालते हैं। यह श्रम का विभाजन रोबोट को आत्मविश्वासी अनुमानों के आधार पर खतरनाक गलतियाँ करने से रोकता है। चैलेंज से प्राप्त परिणाम बताते हैं कि यह विधि केवल एक सैद्धांतिक विचार नहीं है, बल्कि एक व्यावहारिक समाधान है जो वास्तविक दुनिया के परिदृश्यों में काम करता है। भाषा और गणित को अलग रखकर, रोबोट जटिल निर्देशों का पालन कर सकता है और वस्तुओं को सटीकता के उस स्तर के साथ ढूंढ सकता है जो एकल मॉडल पर निर्भर प्रणालियों के लिए पहले असंभव था। यह कार्य सुझाव देता है कि रोबोट के लिए वास्तव में अप्रत्याशित मानव दुनिया में नेविगेट करने के लिए, उन्हें कठिन संख्याओं के लिए अपनी इंद्रियों पर भरोसा करने की आवश्यकता है, जबकि उन्हें शब्दों के माध्यम से मार्गदर्शन करने के लिए आर्टिफिशियल इंटेलिजेंस का उपयोग करना चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।