NavOL: Navigation Policy with Online Imitation Learning
NavOL एक ऑनलाइन इमिटेशन लर्निंग फ्रेमवर्क है जो एक प्रीट्रेंड डिफ्यूजन पॉलिसी और एक ग्लोबल प्लानर का लाभ उठाता है ताकि सिम्युलेटर के भीतर विशेषज्ञ प्रक्षेप पथों (expert trajectories) को पुनरावृत्ति से एकत्र और उनसे सीखा जा सके, जिससे रिवॉर्ड इंजीनियरिंग को समाप्त किया जा सके, डिस्ट्रीब्यूशन शिफ्ट को कम किया जा सके, और सिमुलेशन एवं वास्तविक दुनिया दोनों वातावरणों में मजबूत विजुअल नेविगेशन प्रदर्शन प्राप्त किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को घर के सामान से टकराए बिना चलने का तरीका सिखा रहे हैं। यह वही मुख्य चुनौती है जिसे NavOL पेपर हल करता है।
यहाँ बताया गया है कि उन्होंने इसे कैसे हल किया, सरल उपमाओं (analogies) का उपयोग करते हुए:
समस्या: "पाठ्यपुस्तक" बनाम "वास्तविक दुनिया"
पहले, रोबट नेविगेशन प्रशिक्षण एक स्थिर पाठ्यपुस्तक का उपयोग करके ड्राइविंग टेस्ट के लिए पढ़ाई करने जैसा था।
- ऑफलाइन लर्निंग (पुराना तरीका): शोधकर्ता एक सिम्युलेटर में हजारों आदर्श ड्राइविंग पथ रिकॉर्ड करते थे, उन्हें हार्ड ड्राइव में सहेजते थे, और फिर रोबोट को उन्हें याद करने के लिए सिखाते थे।
- दोष: यदि वास्तविक दुनिया में रोबोट एक छोटी सी गलती करता है (जैसे पहिया थोड़ा जल्दी मोड़ देना), तो वह अपने द्वारा याद किए गए "परफेक्ट पाथ" से भटक जाता है। चूंकि उसने गलतियों को सुधारने का अभ्यास कभी नहीं किया था, इसलिए वह भ्रमित हो जाता है, टकरा जाता है और हार मान लेता है। इसे "डिस्ट्रीब्यूशन शिफ्ट" (distribution shift) की समस्या कहा जाता है।
- रीइन्फोर्समेंट लर्निंग (ट्रायल-एंड-एरर का तरीका): एक अन्य विधि रोबोट को लाखों बार "कोशिश और विफलता" करने देती है, इस उम्मीद में कि वह अंततः सीख जाएगा।
- दोष: यह अविश्वसनीय रूप से धीमा और अक्षम है। यह कार चलाने सीखने के लिए दीवारों से टकराने तक कोशिश करने जैसा है जब तक कि आप गलती से रुकना न सीख जाएं। आपको हर एक क्रिया के लिए एक जटिल "स्कोरिंग सिस्टम" (रिवॉर्ड्स) भी बनाना पड़ता है, जिसे सही करना कठिन होता है।
समाधान: NavOL (एक "लाइव ट्यूटर" सिस्टम)
लेखकों ने NavOL बनाया, जो एक रोबोट के साथ चलने वाले लाइव ट्यूटर जैसा है, जो एक वर्चुअल दुनिया में उसके साथ चलता है और वास्तविक समय में उसकी गलतियों को सुधारता है।
यह सिस्टम कैसे काम करता है, यहाँ चरण-दर-चरण दिया गया है:
- वर्चुअल प्लेग्राउंड: उन्होंने एक विशाल, उच्च-गति वाली वर्चुअल दुनिया बनाई (IsaacLab नामक टूल का उपयोग करके) जहाँ वे एक ही समय में 256 रोबोट चला सकते हैं। यह एक क्लासरूम की तरह है जहाँ 256 छात्र एक साथ ड्राइविंग का अभ्यास कर रहे हैं।
- "प्रिविलेज्ड" ट्यूटर: इस वर्चुअल दुनिया के भीतर, एक "गॉड-मोड" प्लानर है। यह ट्यूटर पूरे मैप को पूरी तरह से जानता है (दीवारें, फर्नीचर, लक्ष्य) और लक्ष्य तक पहुँचने का सबसे अच्छा रास्ता देख सकता है। रोबोट वास्तविक दुनिया में इस मैप को नहीं देख सकता, लेकिन ट्यूटर प्रशिक्षण के दौरान इसका उपयोग करता है।
- "रोलआउट-अपडेट" लूप (अभ्यास सत्र):
- चरण A (प्रयास): रोबोट अपने दम पर कमरे में नेविगेट करने की कोशिश करता है।
- चरण B (सुधार): हर एक स्टेप पर, "गॉड-मोड" ट्यूटर चेक करता है: "यदि रोबोट परफेक्ट होता, तो उसे अभी कहाँ होना चाहिए था?"
- चरण C (सबक): रोबोट जो उसने किया और जो ट्यूटर ने कहा कि उसे करना चाहिए था, उनके बीच तुलना करता है। वह तुरंत इस अंतर से सीखता है।
- चरण D (अपडेट): अगला कदम उठाने से पहले रोबोट का दिमाग (उसका न्यूरल नेटवर्क) तुरंत इस नए सबक के साथ अपडेट हो जाता है।
उपमा: कल्पना कीजिए कि आप साइकिल चलाना सीख रहे हैं।
- पुराना तरीका: आप किसी को पूरी तरह से साइकिल चलाते हुए देखते हैं, और फिर उसे कॉपी करने की कोशिश करते हैं। यदि आप डगमगाते हैं, तो आप गिर जाते हैं क्योंकि आपने कभी डगमगाहट को ठीक करना नहीं सीखा।
- NavOL का तरीका: आप साइकिल चला रहे हैं और एक कोच आपके बगल में दौड़ रहा है। हर बार जब आप बाईं ओर झुकते हैं, तो कोच आपको चलते समय ही वापस केंद्र की ओर धीरे से धकेलता है। आप डगमगाहट को सुधारकर अपना संतुलन बनाना सीखते हैं, न कि केवल एक वीडियो को याद करके।
यह विशेष क्यों है?
- "रिवॉर्ड" का अनुमान नहीं लगाना: रोबोट को जटिल स्कोरिंग सिस्टम की आवश्यकता नहीं है। वह बस विशेषज्ञ ट्यूटर की नकल करने की कोशिश करता है।
- गलतियों को सुधारना: क्योंकि रोबोट प्रशिक्षण के दौरान अपनी डगमगाहट को सुधारने का अभ्यास करता है, इसलिए वास्तविक दुनिया में गलती होने पर वह घबराता नहीं है।
- गति: उन्होंने 8 शक्तिशाली ग्राफिक्स कार्ड (RTX 4090s) का उपयोग किया ताकि हर घंटे 2,000 से अधिक नए सीखने के अनुभव (ट्रैजेक्टरीज) एकत्र किए जा सकें। यह एक छात्र द्वारा एक दिन में ड्राइविंग मैनुअल की पूरी लाइब्रेरी पढ़ने जैसा है।
परिणाम: सिमुलेशन से वास्तविकता तक
टीम ने इसे दो तरीकों से टेस्ट किया:
- वर्चुअल टेस्ट: उन्होंने जटिल, भीड़भाड़ वाले वर्चुअल कमरों में अन्य शीर्ष रोबोट नेविगेशन विधियों के खिलाफ NavOL को लड़ाया। NavOL लगभग हर बार जीता, लक्ष्यों तक तेजी से और अधिक सुरक्षित रूप से पहुँचा।
- वास्तविक दुनिया के टेस्ट: उन्होंने वर्चुअल दुनिया में प्रशिक्षित रोबोट को एक असली रोबोट (Unitree Go2 डॉग-रोबोट) पर लिया और उसे वास्तविक ऑफिस, जिम और हॉलवे में चलाया।
- परिणाम: NavOL के साथ प्रशिक्षित रोबोट इन अव्यवस्थों वाले वास्तविक कमरों में सफलतापूर्वक नेविगेट करने में सक्षम रहा। पुराने तरीके (NavDP) या तो फंस गए या टकरा गए।
- "जादू": रोबोट को वर्चुअल "Dingo" रोबोट पर प्रशिक्षित किया गया था लेकिन इसने असली "Go2" रोबोट पर भी पूरी तरह से काम किया। यह साबित करता है कि सीखना कैसे नेविगेट करना है के बारे में था, न कि केवल किसी विशिष्ट रोबोट के आकार को याद करने के बारे में।
सारांश में
NavOL रोबोट को चलाने का सिखाने का एक नया तरीका है। एक स्थिर मैप को याद करने या ट्रायल-एंड-एरर के माध्यम से अनुमान लगाने के बजाय, यह वास्तविक समय में रोबोट के पथ को सुधारने के लिए एक तेज़ वर्चुअल सिम्युलेटर में "लाइव ट्यूटर" का उपयोग करता है। यह रोबोट को स्मार्ट, सुरक्षित और उन अव्यवस्थों वाले वास्तविक वातावरण को संभालने में सक्षम बनाता है जिन्हें उसने पहले कभी नहीं देखा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।