Latent World Models with Monotone Planning Costs for Image-Goal Navigation
यह शोध पत्र इमेज-गोल नेविगेशन के लिए एक लेटेंट वर्ल्ड मॉडल पेश करता है जो विश्वसनीय एक्शन सीक्वेंस प्लानिंग सुनिश्चित करने के लिए एक फ्रोजन DINO एनकोडर और एक नवीन मोनोटोन कॉस्ट रैंकिंग लॉस का उपयोग करता है, जिससे GNM डेटासेट पर अत्याधुनिक प्रदर्शन और भौतिक रोबोटों पर सफल ज़ीरो-शॉट परिनियोजन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को भूलभुलैया (maze) के माध्यम से रास्ता खोजना सिखा रहे हैं, लेकिन आप उसे कोई नक्शा, जीपीएस या यहाँ तक कि दिशा-सूचक यंत्र (compass) भी नहीं दे सकते। आपके पास एकमात्र सुराग गंतव्य (destination) की एक अकेली तस्वीर है। यह इमेज-गोल नेविगेशन (image-goal navigation) की चुनौती है। इसे हल करने के लिए, रोबोट केवल फोटो देखकर अनुमान नहीं लगा सकता; उसे थोड़ा 'खयाली पुलाव पकाने वाला' (daydreamer) बनना होगा। उसे एक "वर्ल्ड मॉडल" (world model) की आवश्यकता है—एक मानसिक सिम्युलेटर जो उसे यह पूछने की अनुमति दे कि, "अगर मैं बाईं ओर एक कदम लेता हूँ, तो दुनिया कैसी दिखेगी? अगर मैं दाईं ओर मुड़ता हूँ, तो मैं कहाँ पहुँच जाऊँगा?" इन हजारों मानसिक सिमुलेशन को चलाकर, रोबोट पहिया घुमाने से पहले ही सबसे अच्छा रास्ता चुन सकता है। हालाँकि, एक पेंच है: यदि रोबोट का मानसिक सिम्युलेटर भविष्य का अनुमान लगाने में खराब है, या यदि वह एक "अच्छे" रास्ते और "बुरे" रास्ते के बीच अंतर नहीं कर सकता, तो वह खो जाएगा। रोबोट को अपने 'खयालों' (daydreams) को रैंक करने का एक तरीका चाहिए, यह सुनिश्चित करते हुए कि जो रास्ता वास्तव में फोटो तक ले जाता है, उसे उच्चतम स्कोर मिले।
यह शोध पत्र ठीक इसी समस्या पर काम करता है: एक रोबोट के मानसिक सिम्युलेटर को कैसे बनाया जाए ताकि वह न केवल भविष्य की सटीक भविष्यवाणी करे, बल्कि अपने स्वयं के अनुमानों को "ग्रेड" (grade) भी कर सके। शोधकर्ताओं ने पाया कि रोबोट को केवल अगला कदम बताने के लिए प्रशिक्षित करना पर्याप्त नहीं है। यदि रोबोट को वास्तविक डेटा (जिसे "टीचर फोर्सिंग" कहा जाता है) के आधार पर भविष्य का अनुमान लगाने के लिए प्रशिक्षित किया जाता है, तो वह बाहरी सत्य (ground truth) पर निर्भर हो जाता है और अपने स्वयं के अपूर्ण अनुमानों के आधार पर भविष्य का अनुमान लगाने में विफल रहता है। इसके अलावा, उन्होंने पाया कि एक विशिष्ट प्रकार के 'कॉन्ट्रास्टिव लर्निंग' का उपयोग करके रोबोट के भविष्यवाणियों को अधिक "विभेदक" (discriminative) बनाने की कोशिश करने से उसके मानसिक मानचित्र की ज्यामिति (geometry) बिगड़ गई, जिससे योजना बनाना कठिन हो गया। इसके बजाय, उन्होंने एक नई प्रशिक्षण विधि प्रस्तावित की जो रोबोट को अपने पिछले अनुमानों का उपयोग करके भविष्य की भविष्यवाणी करने का अभ्यास करने के लिए मजबूर करती है (ऑटोरेग्रेसिव रोलआउट) और एक विशेष नियम जोड़ती है: लक्ष्य से जितना अधिक कोई रास्ता विचलित होगा, उसे उतना ही अधिक "लागत" (cost) या दंड प्राप्त होगा। यह एक सुचारू, मोनोटोन (monotone) परिदृश्य बनाता है जहाँ रोबोट आसानी से सबसे अच्छे रास्ते की ओर फिसल सकता है।
रोबोट की 'डे ड्रीमिंग' (Daydreaming) की समस्या
एक रोबोट को लक्ष्य छवि तक पहुँचने की कोशिश करते हुए ऐसे सोचें जैसे कोई पर्वतारोही शिखर के दृश्य की केवल एक फोटो का उपयोग करके एक विशिष्ट पर्वत शिखर तक पहुँचने की कोशिश कर रहा हो। पर्वतारोही के पास कोई नक्शा, कोई दिशा-सूचक यंत्र नहीं है, और उसे यह भी नहीं पता कि वह अभी कहाँ है। उसके पास केवल अपनी आँखें और गंतव्य की एक मानसिक छवि है। वहाँ पहुँचने के लिए, पर्वतारोही को कल्पना करनी होगी: "यदि मैं उत्तर की ओर चलता हूँ, तो क्या पेड़ फोटो की तरह दिखेंगे? यदि मैं दक्षिण की ओर चलता हूँ, तो क्या मुझे एक चट्टान दिखाई देगी?"
रोबोटिक्स की दुनिया में, इस मानसिक सिमुलेशन को वर्ल्ड मॉडल (World Model) कहा जाता है। यह एक न्यूरल नेटवर्क है जो एक क्रिस्टल बॉल की तरह कार्य करता है। आप इसे कहते हैं, "यहाँ वह है जो मैं अभी देख रहा हूँ, और यह वह क्रिया है जिसे मैं करने की सोच रहा हूँ," और यह उत्तर देता है, "यहाँ वह है जो आप आगे देखेंगे।" इन भविष्यवाणियों को एक साथ जोड़कर, रोबोट अपने दिमाग में एक पूरी यात्रा का अनुकरण कर सकता है।
लेकिन यहाँ पेचीदा हिस्सा है: प्लानिंग (Planning)। केवल क्रिस्टल बॉल होने से काम नहीं चलेगा; आपको यह जानने की आवश्यकता है कि कौन सा रास्ता सबसे अच्छा है। रोबोट सैकड़ों अलग-अलग काल्पनिक रास्तों को आजमाता है। उसे उन्हें स्कोर करने के तरीके की आवश्यकता है। इस शोध पत्र में, स्कोर कोसाइन डिस्टेंस (cosine distance) पर आधारित है, जो दो छवियों (या उनके डिजिटल "फिंगरप्रिंट") के बीच समानता मापने का एक शानदार तरीका है। यदि रोबोट के मानसिक सिमुलेशन में रास्ते के अंत का दृश्य लक्ष्य फोटो के बहुत समान दिखता है, तो स्कोर अच्छा है। यदि यह लक्ष्य से बिल्कुल अलग दिखता है, तो स्कोर बुरा है।
लेखकों ने पाया कि कई मौजूदा रोबोट इस स्कोरिंग खेल में बहुत खराब हैं। वे एक कदम के लिए भविष्य की सटीक भविष्यवाणी कर सकते हैं, लेकिन जब वे दस कदम आगे की भविष्यवाणी करने की कोशिश करते हैं, तो उनकी भविष्यवाणियाँ पटरी से उतर जाती हैं। इससे भी बुरा यह है कि भले ही वे भविष्य की ठीक से भविष्यवाणी करें, लेकिन उनके द्वारा दिए गए "लागत" (cost) का संबंध अराजक हो सकता है। एक ऐसे पर्वतारोही की कल्पना करें जहाँ चट्टान की ओर जाने वाले रास्ते को "शानदार" स्कोर मिलता है, और पर्वत शिखर की ओर जाने वाले रास्ते को "भयानक" स्कोर मिलता है। पर्वतारोही सीधे किनारे से नीचे गिर जाएगा! ऐसा तब होता है जब "आप लक्ष्य से कितने दूर हैं" और "आपका स्कोर" के बीच का संबंध सुचारू या मोनोटोन (monotone) नहीं होता है।
समाधान: एक बेहतर डे ड्रीमर (Daydreamer)
लेखकों ने इसे ठीक करने के लिए एक नए प्रकार का रोबोट मस्तिष्क बनाया है। वे इसे लेटेंट वर्ल्ड मॉडल विद मोनोटोन प्लानिंग कॉस्ट्स (Latent World Model with Monotone Planning Costs) कहते हैं। आइए देखते हैं उन्होंने क्या किया।
1. जमी हुई लेंस और प्रशिक्षित मस्तिष्क
सबसे पहले, उन्होंने एक पूर्व-प्रशिक्षित "आँख" (एक फ्रोजन DINO-परिवार एनकोडर) का उपयोग किया जो छवियों को डिजिटल फिंगरप्रिंट में बदलने में बहुत अच्छी है। यह आँख नहीं बदलती; यह बस दुनिया को स्पष्ट रूप से देखती है। फिर, उन्होंने एक "मस्तिष्क" (एक प्रैटेनेबल प्रेडिक्टर) बनाया जो उन फिंगरप्रिंट्स को लेता है और अनुमान लगाता है कि रोबोट के हिलने के बाद वे कैसे दिखेंगे।
2. "अभ्यास ही पूर्णता है" प्रशिक्षण (ऑटोरेग्रेसिव रोलआउट)
अधिकांश रोबोटों को एक ऐसे छात्र की तरह प्रशिक्षित किया जाता है जो कक्षा में है जहाँ शिक्षक हर सवाल के बाद उत्तर कुंजी (answer key) देता है। इसे टीचर फोर्सिंग (teacher forcing) कहा जाता है। रोबोट वर्तमान छवि देखता है, शिक्षक कहता है "तुम बाईं ओर मुड़े," और रोबोट अगली छवि की भविष्यवाणी करता है। फिर शिक्षक तुरंत उसे सुधारता है।
समस्या यह है कि जब रोबोट वास्तविक दुनिया में होता है, तो वहाँ कोई शिक्षक नहीं होता। उसे अपने पिछले अनुमान के आधार पर अगली छवि का अनुमान लगाना होता है। यदि वह पहले कदम में एक छोटी सी गलती करता है, तो वह गलती दूसरे कदम में बड़ी हो जाती है, और दसवें कदम तक, रोबोट एक पूरी तरह से अलग दुनिया के बारे में सपने देख रहा होता है। इसे ट्रेन-टेस्ट मिसमैच (train-test mismatch) कहा जाता है।
लेखकों ने रोबोट को अपने स्वयं के अनुमानों पर 'डे ड्रीमिंग' करने का अभ्यास कराकर इसे ठीक किया। उन्होंने रोबोट को अपने स्टेप 1 के अनुमान के आधार पर स्टेप 2 की भविष्यवाणी करने, फिर स्टेप 2 के आधार पर स्टेप 3 की भविष्यवाणी करने के लिए प्रशिक्षित किया। वे इसे ऑटोरेग्रेसिव रोलआउट (autoregressive rollout) कहते हैं। यह उस छात्र की तरह है जिसे बिना उत्तर कुंजी के परीक्षा देनी पड़ती है, जिससे वह अपनी गलतियों को संभालने के लिए मजबूर होकर सीखता है। उन्होंने एक "काउंटर-करिकुलम" का भी उपयोग किया, जिसमें छोटे सपनों (2 स्टेप्स) से शुरुआत की गई और धीरे-धीरे उन्हें लंबे सपनों (8 स्टेप्स तक) में बदला गया, ताकि रोबोट अभिभूत न हो जाए।
3. "मोनोटोन कॉस्ट" नियम
बेहतर डे ड्रीमिंग के बावजूद, रोबोट को अपने रास्तों को रैंक करने के लिए एक बेहतर तरीके की आवश्यकता थी। लेखकों ने मोनोटोन कॉस्ट रैंकिंग (MCR) नामक एक नियम पेश किया।
एक पहाड़ी की कल्पना करें जहाँ नीचे का हिस्सा लक्ष्य (goal) है। आप लक्ष्य से जितने दूर होंगे, आप पहाड़ी पर उतने ही ऊपर होंगे। यह एक मोनोटोन परिदृश्य है: यदि आप लक्ष्य से दूर जाते हैं, तो आपकी "लागत" (ऊंचाई) हमेशा बढ़ती जाती है। यह कभी नीचे नहीं गिरती और फिर वापस ऊपर नहीं आती।
कई पिछले मॉडलों में, "पहाड़ी" ऊबड़-खाबड़ थी। एक रास्ता जो थोड़ा सा गलत था, वह गलती से "घाटी" (कम लागत) जैसा दिख सकता था, जिससे रोबोट को लगता था कि वह सही रास्ते पर है। लेखकों ने एक विशेष प्रशिक्षण लॉस जोड़ा जो रोबोट को यह सिखाता है: "यदि आप सही पथ से विचलित होते हैं, तो आपकी लागत बढ़नी ही चाहिए।" उन्होंने कई थोड़े से बिगड़े हुए रास्ते बनाकर यह किया और रोबोट को बताया, "आप जितना अधिक विचलित होंगे, आपका दंड उतना ही अधिक होना चाहिए।" इसने मानसिक मानचित्र को सुचारू बना दिया, जिससे रोबोट के लिए क्रॉस-एन्ट्रॉपी मेथड (CEM) का उपयोग करके सबसे निचले बिंदु (लक्ष्य) को खोजना आसान हो गया।
4. आश्चर्यजनक "नो-गो" ज़ोन
शोधकर्ताओं ने एक विचार का भी परीक्षण किया जो एक अच्छा लग रहा था: एक्शन-कॉन्ट्रास्टिव लर्निंग (Action-Contrastive Learning)। यह एक ऐसी तकनीक है जहाँ आप रोबोट को "अच्छे" और "बुरे" कार्यों के बीच अंतर करना सिखाने की कोशिश करते हैं।
हालाँकि, उन्होंने पाया कि इसका उल्टा हुआ। जब उन्होंने एक विशिष्ट प्रकार के कॉन्ट्रास्टिव ट्रेनिंग का उपयोग किया, तो इसने वास्तव में रोबोट की योजना बनाने की क्षमता को बर्बाद कर दिया। यह ऐसा था जैसे चाकू को तेज करने के लिए उसे हथौड़े से मारना; मानचित्र विकृत हो गया, और रोबोट अब लक्ष्य नहीं खोज सका। शोध पत्र स्पष्ट रूप से इस विधि को इस कार्य के लिए खारिज करता है, यह दिखाते हुए कि कभी-कभी किसी प्रतिनिधित्व को "विभेदक" (discriminative) बनाने से वह "ज्यामिति" (geometry) टूट जाती है जिसकी योजना बनाने के लिए आवश्यकता होती है।
परिणाम: एक रोबोट जो वास्तव में रास्ता खोजता है
टीम ने अपने नए रोबोट मस्तिष्क का परीक्षण GNM नामक डेटासेट पर किया। उनके परिणाम प्रभावशाली थे। उनके मॉडल ने पिछले सर्वश्रेष्ठ लेटेंट मॉडल (DINO-WM) की तुलना में ओरिएंटेशन एरर (orientation error) को 2.7 गुना कम कर दिया। सरल शब्दों में, रोबोट पहुँचते समय सही दिशा में मुड़ने में बहुत बेहतर था।
- ओरिएंटेशन एरर (AOE): उनके सर्वश्रेष्ठ मॉडल का एरर 7.63° था, जबकि पिछले सर्वश्रेष्ठ मॉडल का 20.27° था।
- डिस्प्लेसमेंट एरर (ADE): उन्होंने लक्ष्य से दूरी को भी कम किया।
इससे भी महत्वपूर्ण बात यह है कि उन्होंने एक वास्तविक भौतिक रोबोट (Clearpath Husky) पर वास्तविक दुनिया में परीक्षण किया। रोबोट ने अनदेखे इनडोर और आउटडोर वातावरण में सफलतापूर्वक नेविगेट किया, जो कि उसके प्रतिस्पर्धियों की तुलना में बहुत अधिक तार्किक और लक्ष्य-निर्देशित था। जहाँ अन्य मॉडल कभी-कभी दीवारों से टकरा जाते या जल्दी रुक जाते, यह मॉडल लक्ष्य छवि की ओर बढ़ता रहा।
यह क्यों मायने रखता है
यह शोध पत्र बताता है कि केवल एक लक्ष्य छवि का उपयोग करके प्रभावी ढंग से नेविगेट करने के लिए, रोबकों को केवल एक अच्छे प्रेडिक्टर की ही नहीं, बल्कि एक ऐसे प्रेडिक्टर की आवश्यकता है जो अपनी गलतियों को संभालने के लिए प्रशिक्षित हो और एक ऐसा स्कोरिंग सिस्टम की आवश्यकता है जो सुचारू और विश्वसनीय हो। प्रशिक्षण पद्धति (ऑटोरेग्रेसिव रोलआउट) और कॉस्ट लैंडस्केप (मोनोटोन रैंकिंग) को ठीक करके, लेखकों ने एक ऐसा सिस्टम बनाया है जो रिएक्टिव पॉलिसीज़ और पिछले वर्ल्ड मॉडल्स दोनों से बेहतर प्रदर्शन करता है।
हालाँकि, लेखक सावधानी बरतते हुए कहते हैं कि यह हर स्थिति के लिए जादुई समाधान नहीं है। उनका मॉडल स्थिर या कम ट्रैफ़िक वाले वातावरण में सबसे अच्छा काम करता है। यह चलते हुए लोगों या कारों वाले अराजक दृश्यों में परीक्षण नहीं किया गया है। लेकिन फिलहाल, यह दृष्टिकोण रोबोट को गंतव्य तक पहुँचने के लिए 'डे ड्रीमिंग' करने का रास्ता दिखाने की दिशा में एक महत्वपूर्ण कदम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।