NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation
NavWAM एक डिफ्यूजन-ट्रांसफॉर्मर पॉलिसी है जो भविष्य के विजुअल प्रेडिक्शन, गोल-प्रोग्रेस वैल्यू एस्टीमेशन और एक्शन जनरेशन को एक साझा लेटेंट सीक्वेंस में एकीकृत करता है, जिससे एक रोबोट बाहरी प्लानर्स या एक्शन सर्च पर निर्भर रहे बिना सीधे क्लोज्ड-लूप नेविगेशन निष्पादित करने में सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को घर में एक विशिष्ट कमरे को खोजने के लिए सिखा रहे हैं, लेकिन रोबोट केवल अपनी "आंखों" (एक कैमरे) के सामने जो कुछ भी है उसे ही देख सकता है। उसके पास कोई मानचित्र नहीं है, और वह कोनों के पीछे नहीं देख सकता। यह गोल-कंडीशन्ड विजुअल नेविगेशन (goal-conditioned visual navigation) की चुनौती है।
यहाँ कहानी है कि कैसे लेखक, दैची अज़ुमा और उनकी टीम ने NavWAM नामक एक नई प्रणाली के साथ इस समस्या को हल किया।
समस्या: "क्रिस्टल बॉल" बनाम "ड्राइवर"
अतीत में, शोधकर्ताओं ने दो अलग-अलग उपकरणों का उपयोग करके रोबोट को नेविगेट करना सिखाने की कोशिश की:
- क्रिस्टल बॉल (वर्ल्ड मॉडल): यह उपकरण यह अनुमान लगाने में माहिर है कि यदि रोबोट आगे बढ़ता है तो उसे क्या दिखाई देगा। "यदि मैं बाईं ओर मुड़ता हूँ, तो मुझे रसोई दिखाई देगी।" "यदि मैं सीधा जाता हूँ, तो मैं एक दीवार से टकरा जाऊँगा।"
- ड्राइवर (प्लानर): यह उपकरण क्रिस्टल बॉल के अनुमानों को देखता है और निर्णय लेता है, "ठीक है, रसोई अच्छी दिख रही है, इसलिए मैं बाईं ओर मुड़ूँगा।"
खामी: पेपर का तर्क है कि इन दोनों को अलग रखना अक्षम है। यह एक ऐसे यात्री की तरह है जो निर्देश चिल्लाता रहता है ("बाईं ओर मुड़ो!") जबकि ड्राइवर को रुकना, सोचना और फिर मुड़ना पड़ता है। यह एक बाधा उत्पन्न करता है। "क्रिस्टल बॉल" भविष्य की भविष्यवाणी करता है, लेकिन वह यह नहीं जानता कि वहां तक पहुँचने के लिए कार को कैसे चलाना है।
समाधान: NavWAM (द "ड्राइवर-प्रेडिक्टर")
लेखकों ने NavWAM (नेविगेशन वर्ल्ड एक्शन मॉडल) बनाया। NavWAM को एक ऐसे सुपर-ड्राइवर के रूप में सोचें जो भविष्य भी देख सकता है।
एक अलग "क्रिस्टल बॉल" और "ड्राइवर" रखने के बजाय, NavWAM इन दोनों को एक ही मस्तिष्क में मिला देता है। यह केवल यह अनुमान नहीं लगाता कि उसे क्या दिखाई देगा; यह अनुमान लगाता है कि उसे क्या दिखाई देगा, वह लक्ष्य के कितने करीब होगा, और ठीक कौन से स्टीयरिंग कमांड देने हैं—यह सब एक ही समय में।
रचनात्मक उपमा: "साझा कैनवास" (The Shared Canvas)
Nav्वWAM कैसे काम करता है इसे समझने के लिए, कल्पना कीजिए कि एक चित्रकार नौ अलग-अलग पैनलों वाले एक एकल कैनवास पर पेंटिंग कर रहा है:
- निचले पैनल (जो हम जानते हैं): ये रोबोट का वर्तमान दृश्य, वह अभी कहाँ है, और लक्ष्य की तस्वीर (जैसे, एक विशिष्ट कुर्सी की फोटो) दिखाते हैं।
- ऊपरी पैनल (जो हम भविष्यवाणी करते हैं): रोबोट इन पैनलों को दिखाने के लिए पेंट करता है:
- भविष्य में रोबोट को क्या दिखाई देगा।
- वह लक्ष्य के कितने करीब होगा।
- सबसे महत्वपूर्ण हिस्सा: वहां पहुँचने के लिए आवश्यक वास्तविक स्टीयरिंग कमांड (एक "एक्शन चंक")।
रोबोट इस कैनवास को "डिनोइजिंग" (denoising) करके सीखता है। वह भविष्य के एक अव्यवस्थित, धुंधले संस्करण से शुरू होता है और इसे तब तक साफ करता है जब तक कि उसके पास पथ, गंतव्य और उठाए जाने वाले कदमों की एक स्पष्ट तस्वीर न हो। क्योंकि "स्टीयरिंग कमांड" को भविष्य के दृश्य के साथ उसी कैनवास पर चित्रित किया गया है, इसलिए रोबोट सीख जाता है कि लक्ष्य को देखने के लिए, उसे ये विशिष्ट कार्य करने होंगे।
यह प्रतियोगिता को कैसे हराता है
पेपर में NavWAM का परीक्षण दो अन्य प्रकार के रोबोटों के विरुद्ध किया गया:
- पुराना तरीका (NWM): रोबोट भविष्य की भविष्यवाणी करता है, फिर एक जटिल, धीमी गणितीय खोज (जिसे CEM कहा जाता है) का उपयोग करके यह तय करता है कि कौन सा कार्य करना है। यह एक शतरंज खिलाड़ी की तरह है जो एक चाल चलने से पहले 100 चालों की गणना करता है।
- सीधा तरीका (OmniVLA): रोबोट बस लक्ष्य को देखता है और बिना भविष्य के बारे में सोचे अगले कदम का अनुमान लगाता है। यह एक ऐसे ड्राइवर की तरह है जो भविष्य को देखे बिना केवल सड़क पर प्रतिक्रिया देता है।
परिणाम:
- NavWAM बनाम पुराना तरीका: NavWAM बहुत तेज़ और अधिक सटीक था क्योंकि इसे जटिल खोज की गणना करने के लिए रुकने की आवश्यकता नहीं थी। उसे बस "पता था" कि क्या करना है। वह वास्तविक दुनिया के परीक्षणों में 79% बार लक्ष्य तक पहुँच गया, जबकि पुराना तरीका केवल 16% बार सफल हुआ।
- NavVM बनाम सीधा तरीका: NavWAM ने सीधे तरीके (जो बहुत बड़े, अधिक शक्तिशाली कंप्यूटर मस्तिष्क का उपयोग करता है) के समान प्रदर्शन किया, लेकिन NavWAM के पास भविष्य में क्या दिखेगा, इसकी भविष्यवाणी करने की अतिरिक्त शक्ति भी थी।
वास्तविक दुनिया का परीक्षण
टीम ने केवल कंप्यूटर सिमुलेशन में इसका परीक्षण नहीं किया। उन्होंने NavWAM को एक वास्तविक रोबोट डिआब्लो (Diablo) पर लगाया और इसे चार अलग-अलग इनडोर वातावरणों (एक कार्यालय, एक स्टोरेज रूम, एक मीटिंग रूम और एक हॉलवे) में भेजा।
- लक्ष्य: उस कमरे में ली गई एक विशिष्ट छवि को खोजना।
- परिणाम: NavWAM 24 में से 19 प्रयासों में सफलतापूर्वक लक्ष्य तक पहुँचने में सफल रहा।
- "फॉरसाइट" (पूर्वाभास) की जाँच: भले ही NavWAM को आगे बढ़ने के लिए अपनी भविष्य की भविष्यवाणियों का उपयोग करने की आवश्यकता नहीं थी (यह केवल स्टीयरिंग कमांड का उपयोग करता था), पेपर दिखाता है कि उसकी भविष्यवाणियां आश्चर्यजनक रूप से सटीक थीं। जब रोबोट ने भविष्यवाणी की कि "मैं 4 सेकंड में एक दरवाजा देखूँगा," तो उसने वास्तव में 4 सेकंड में एक दरवाजा देखा।
मुख्य निष्कर्ष
पेपर निष्कर्ष निकालता है कि एक रोबोट के बेहतर नेविगेशन के लिए, उसे केवल एक "प्रेडिक्टर" या केवल एक "ड्राइवर" नहीं होना चाहिए। उसे एक ही समय में दोनों होना चाहिए। भविष्य की भविष्यवाणी करने और उस भविष्य को बनाने के लिए आवश्यक कार्यों को एक ही चरण में सीखकर, रोबोट उन जगहों पर भी अपना रास्ता खोजने में बहुत बेहतर हो जाता है जहाँ वह पहले कभी नहीं गया है।
संक्षेप में: NavWAM रोबोट को "आगे देखते हुए चलाने" के बजाय "आगे देखना, रुकना, गणना करना और फिर चलाना" सिखाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।