PGTT: Phase-Guided Terrain Traversal for Perceptive Legged Locomotion
यह शोध पत्र PGTT को प्रस्तुत करता है, जो एक धारणा-जागरूक (perception-aware) डीप रिइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो चरण-निर्देशित पुरस्कार शेपिंग (phase-guided reward shaping) का उपयोग करता है ताकि प्रतिबंधात्मक गेट प्रायर्स (gait priors) या ब्लाइंड कंट्रोल रणनीतियों पर निर्भर रहे बिना विविध भूभागों में सुदृढ़, आकार-निरपेक्ष (morphology-agnostic) लेग्ड लोकमोशन को सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ रोबोट केवल पहियों पर नहीं चलते, बल्कि एक कुत्ते या इंसान की तरह ऊबड़-खाबड़ और असमान ज़मीन पर कूदते और उछलते हैं। यह लेग्ड रोबोटिक्स (legged robotics) का रोमांचक क्षेत्र है। लंबे समय तक, इन रोबोटों को चलाना एक छोटे बच्चे को चलना सिखाने जैसा था: आपको उन्हें बहुत सख्त नियम देने पड़ते थे, जैसे "अपना बायां पैर ठीक इतनी ऊंचाई तक उठाओ, फिर अपना दायां पैर ठीक उतनी ऊंचाई तक उठाओ।" यह काम तो करता था, लेकिन इसने रोबोटों को कठोर बना दिया और कुछ अप्रत्याशित टकराने पर वे भ्रमित हो जाते थे। फिर, वैज्ञानिकों ने रीइन्फोर्समेंट लर्निंग (Reinforcement Learning - RL) की खोज की, जो एक ऐसी विधि है जहाँ रोबोट 'ट्रायल एंड एरर' (गलतियों से सीखने) के माध्यम से सीखते हैं, ठीक वैसे ही जैसे एक वीडियो गेम का पात्र अंतराल (gaps) के ऊपर से कूदना सीखता है—हजारों बार गिरने के बाद और बेहतर होते हुए। हालाँकि, इनमें से कई "सीखने वाले" रोबोट या तो "अंधे" थे (वे अपने सामने की ज़मीन देख नहीं सकते थे) या वे अभी भी उन पुराने, कठोर नियमों में फंसे हुए थे जो उन्हें नई तरह की ज़मीन पर अनाड़ी बना देते थे। बड़ा सवाल जिसे शोधकर्ता हल करने की कोशिश कर रहे हैं, वह यह है: हम एक रोबोट को यह कैसे सिखाएं कि वह ज़मीन देखने के लिए पर्याप्त स्मार्ट हो और बिना यह बताए कि उसे हर एक जोड़ (joint) को कैसे हिलाना है, वह अपने कदमों को ढालने के लिए पर्याप्त लचीला भी हो?
यहाँ PGTT (फेज-गाइडेड टेरेन ट्रैवर्सल) आता है, जो एक नया दृष्टिकोण है जो एक आदर्श मध्य मार्ग खोजने की कोशिश करता है। पुराने "अंधे" रोबोटों को ऐसे सोचें जैसे कोई आँखें बंद करके चल रहा हो, इस उम्मीद में कि वह ठोकर नहीं खाएगा। पुराने "नियम-बद्ध" रोबोट उन नर्तकों की तरह हैं जिन्हें एक कोरियोग्राफर की सटीक स्क्रिप्ट का पालन करना होता है; यदि फर्श बदल जाता है, तो वे सुधार (improvise) नहीं कर सकते। PGTT ऐसा है जैसे रोबोट को एक लय (rhythm) के साथ नृत्य करना सिखाना, लेकिन उसे कदमों में सुधार करने की स्वतंत्रता देना।
शोधकर्ताओं ने रोबोट को "स्मार्ट आँखें" (एक लेज़र स्कैनर) दीं जो उसके ठीक सामने की ज़मीन का एक त्वरित, 3D मानचित्र बनाती है। रोबोट को विशिष्ट पैर के लक्ष्यों (foot targets) से टकराने के लिए मजबूर करने के बजाय, उन्होंने उसे एक सरल लय सिखाई: "तुम्हारे पैरों को एक लहर की तरह झूलना चाहिए।" लेकिन यहाँ असली जादू है: उन्होंने रोबोट के जोड़ों को एक सख्त पथ का पालन करने के लिए मजबूर नहीं किया। इसके बजाय, उन्होंने रोबोट को एक स्कोरकार्ड (एक रिवॉर्ड सिस्टम) दिया। यदि रोबोट अपना पैर बहुत नीचा रखता है और किसी चट्टान से टकरा जाता है, तो उसे खराब स्कोर मिलता है। यदि वह चट्टान के ऊपर से निकलने के लिए पर्याप्त ऊंचा उठता है, तो उसे अच्छा स्कोर मिलता है। रोबोट यह सीखने के लिए खुद के तरीके ढूंढ लेता है कि वह अच्छा स्कोर पाने के लिए अपने 'मांसपेशियों' को कैसे हिलाए, और वह जो कुछ भी देखता है उसके आधार पर अपने कदम की ऊंचाई को स्वचालित रूप से ढाल लेता है।
पेपर दिखाता है कि यह तरीका कंप्यूटर सिमुलेशन में अविश्वसनीय रूप से अच्छा काम करता है। जब इसे कठिन, सीढ़ी जैसे इलाके और बिखरे हुए अवरोधों पर परखा गया, तो PGTT रोबोट अन्य शीर्ष विधियों की तुलना में सीधा खड़ा रहने में बहुत अधिक सफल रहा। वास्तव में, इसने अन्य रोबोटों की तुलना में 7.5% अधिक धक्के (जैसे किसी का धक्का देना) झेला और 9% अधिक बाधाओं को पार किया। इसने केवल जीवित नहीं रखा; इसने अन्य रोबरों की तरह ही अपनी गति बनाए रखी।
टीम ने इसे एक वास्तविक रोबोट, Unitree Go2 (एक चार पैरों वाला रोबोट जो थोड़ा कुत्ते जैसा दिखता है) पर भी आजमाया। उन्होंने उसी "दिमाग" का उपयोग किया जिसे उन्होंने कंप्यूटर में प्रशिक्षित किया था, बिना किसी सेटिंग को बदले, और इसने सफलतापूर्वक वास्तविक सीढ़ियाँ चढ़ीं और वास्तविक बाधाओं के ऊपर से कूदा। उन्होंने इसे एक अन्य रोबोट, ANYmal-C पर भी परखा और यह वहां भी काम कर गया, जिससे पता चलता है कि यह "नियम-बिना-लय" वाला विचार सभी प्रकार की लेग्ड मशीनों के लिए काम कर सकता है।
हालाँकि, पेपर सावधानी से यह भी नोट करता है कि यह अभी भी हर स्थिति के लिए जादुई समाधान (magic bullet) नहीं है। वास्तविक दुनिया के परीक्षण 0.4 मीटर प्रति सेकंड की मध्यम चलने की गति पर किए गए थे क्योंकि रोबोट का लेज़र स्कैनर उच्च गति पर मानचित्र को जल्दी अपडेट करने के लिए पर्याप्त तेज़ नहीं है। इसके अलावा, जबकि रोबोट गिरने से बचने में बहुत अच्छा है, शोधकर्ताओं ने अभी तक यह नहीं मापा है कि क्या यह ऊर्जा का कुशलतापूर्वक उपयोग कर रहा है। लेकिन कुल मिलाकर, PGTT सुझाव देता है कि रोबोट को पालन करने के लिए एक सरल लय देने और विवरणों को खुद समझने की स्वतंत्रता देकर, हम ऐसी मशीनें बना सकते हैं जो मजबूत, अनुकूलनीय और वास्तविक, अनिश्चित दुनिया का सामना करने के लिए तैयार हों।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।