No More Marching: Learning Humanoid Locomotion for Short-Range SE(2) Targets
यह शोध पत्र एक नवीन कॉन्स्टलेशन-आधारित रिवॉर्ड फंक्शन के साथ एक सुदृढीकरण शिक्षण (reinforcement learning) दृष्टिकोण प्रस्तुत करता है जो मानवोइड्स को कुशलतापूर्वक और मजबूती से अल्प-दूरी के SE(2) लक्ष्य पोज तक पहुँचने में सक्षम बनाता है, जो सिमुलेशन और वास्तविक हार्डवेयर दोनों में पारंपरिक वेग-ट्रैकिंग विधियों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को चलना सिखा रहे हैं। लंबे समय तक, रोबोट को चलना सिखाने का सबसे अच्छा तरीका यह था कि उन्हें कहें, "1 मीटर प्रति सेकंड की गति से आगे बढ़ें।" यह तब बहुत अच्छा काम करता है जब रोबोट को एक पूरे मैदान को पार करने की आवश्यकता हो। लेकिन क्या होगा यदि रोबोट को कॉफी का कप उठाने के लिए बस दो कदम बाईं ओर लेने की आवश्यकता हो?
यदि आप रोबोट को "आगे बढ़ें" कहते हैं जब उसे केवल कुछ इंच चलने की आवश्यकता होती है, तो वह कुछ अजीब सा करने लगता है: वह एक ही जगह पर मार्च करता है, रुकता है, टैंक की तरह घूमता है, फिर से मार्च करता है और रुक जाता है। यह अक्षम है, भद्दा है, और बहुत अधिक ऊर्जा बर्बाद करता है। यह एक कार को पार्क करने की कोशिश करने जैसा है जहाँ आप आगे बढ़ते हैं, रुकते हैं, स्टीयरिंग को 90 डिग्री घुमाते हैं, पीछे की ओर चलते हैं, और ऐसा तब तक दोहराते हैं जब तक कि आप सही जगह पर फिट न हो जाएं।
यह पेपर मानव सदृश रोबोटों (जैसे "Digit" रोबोट) को कम दूरी कुशलतापूर्वक चलना सिखाने का एक नया तरीका पेश करता है। उन्हें मार्च करने के आदेश देने के बजाय, शोधकर्ताओं ने रोबोट को एक विशिष्ट स्थान और कोण (angle) को निशाना बनाना सिखाया, ठीक वैसे ही जैसे एक इंसान कुर्सी की ओर चलते समय करता है।
यहाँ उनके समाधान का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. समस्या: "मार्च करने वाला" रोबोट
अधिकांश रोबोट को गति कमांड (जैसे कार का क्रूज कंट्रोल) का पालन करने के लिए प्रशिक्षित किया जाता है। जब आप उनसे किसी पास के स्थान पर जाने के लिए कहते हैं, तो उन्हें स्मूथ तरीके से रुकना या मुड़ना नहीं आता। वे बस तब तक "मार्च" करते रहते हैं जब तक कि वे लक्ष्य से आगे न निकल जाएं, फिर उन्हें पीछे हटना और मुड़ना पड़ता है।
- उपमा: एक परेड में खड़े सैनिक की कल्पना करें। यदि आप उन्हें 3 फीट दूर एक स्थान पर जाने के लिए कहते हैं, तो वे शायद तीन बड़े, लयबद्ध कदम उठाएंगे, लक्ष्य से आगे निकल जाएंगे, और फिर अजीब तरह से मुड़ने की कोशिश करेंगे। यह कठोर और अप्राकृतिक है।
2. समाधान: "कॉन्स्टलेशन" (Constellation) रिवॉर्ड
शोधकर्ताओं ने रीइन्फोर्समेंट लर्निंग (पुरस्कार के साथ परीक्षण और त्रुटि/trial and error) नामक तकनीक का उपयोग किया। असली जादू यह था कि उन्होंने उस "रिवॉर्ड" (पुरस्कार) को कैसे डिजाइन किया जो रोबोट को अच्छा काम करने के लिए मिलता है।
आमतौर पर, आप एक रोबोट को सही स्थिति (position) के लिए पुरस्कार दे सकते हैं और अलग से सही दिशा (direction) के लिए पुरस्कार दे सकते हैं। लेकिन शोधकर्ताओं ने पाया कि इन दोनों के बीच संतुलन बनाना कार चलाते समय रेडियो ट्यून करने जैसा है; यह बहुत जटिल है और इससे बुरी आदतें विकसित होती हैं।
इसके बजाय, उन्होंने कॉन्स्टलेशन रिवॉर्ड का आविष्कार किया।
- उपमा: कल्पना कीजिए कि रोबोट के चारों ओर चमकते हुए, अदृश्य "हेलो" (halo) के बिंदुओं का एक समूह (जैसे सितारों का एक नक्षत्र या कॉन्स्टलेशन) तैर रहा है। लक्ष्य का भी एक समान "हेलो" है।
- यह कैसे काम करता है: रोबोट को केवल आगे बढ़ने या केवल मुड़ने के लिए पुरस्कार नहीं मिलता है। उसे इस आधार पर पुरस्कार मिलता है कि उसका "हेलो" लक्ष्य के "हेलो" से कितनी अच्छी तरह मेल खाता है।
- यदि रोबोट बहुत दूर है, तो बिंदु मेल नहीं खाते।
- यदि वह गलत दिशा में देख रहा है, तो बिंदु मेल नहीं खाते।
- यदि वह सही स्थान पर है लेकिन गलत दिशा में देख रहा है, तो भी बिंदु मेल नहीं खाते।
यह रोबोट को अपने पैरों को इस तरह चलाने के लिए मजबूर करता है कि बिंदु पूरी तरह से मिल सकें। यह स्वाभाविक रूप से उसे चलते समय ही मुड़ना सिखाता है, न कि रुककर मुड़ना। यह एक डांसर की तरह है जो किसी मुद्रा (pose) तक पहुँचने के लिए अपने पैरों और शरीर को एक साथ घुमाता है, न कि पहले एक जगह रुककर फिर घूमने की तरह।
3. परिणाम: "GoTo" कंट्रोलर
उन्होंने इस नई पद्धति का उपयोग करके Digit नामक रोबोट को प्रशिक्षित किया।
- सिमुलेशन में (वीडियो गेम): रोबोट ने पुराने "मार्चिंग" तरीकों की तुलना में आधे समय में, आधी ऊर्जा का उपयोग करके और कम कदमों में लक्ष्यों तक पहुँचना सीख लिया। यह बहुत सहज और मानव जैसा दिखता था।
- वास्तविक दुनिया में: उन्होंने इस कोड को एक वास्तविक रोबोट पर लगाया। भले ही फर्श फिसलन भरा हो और सेंसर शोर (noisy) पैदा कर रहे हों, रोबोट वीडियो गेम की तरह ही लगभग उतना ही अच्छा काम करता रहा। वह सफलतापूर्वक लक्ष्यों तक पहुँचा, मुड़ा और बिना गिरे या बिना उस अजीब "मार्च-टर्न-मार्च" वाले नृत्य के रुका।
यह क्यों महत्वपूर्ण है
यह पेपर एक व्यावहारिक समस्या का समाधान करता है। वास्तविक दुनिया के रोबोट (गोदामों, घरों या कारखानों में) को शायद ही कभी एक पूरे मैदान को पार करने की आवश्यकता होती है। उन्हें ज्यादातर बस एक डिब्बा उठाने के लिए कुछ फीट खिसकने, मुड़ने और उसे रखने की आवश्यकता होती है।
"चलते रहो" के बजाय "कॉन्स्टलेशन को मैच करो" के माध्यम से रिवॉर्ड बदलकर, रोबोट ने चपलता (agility) सीखी। उसने मार्च करने वाले सैनिक की तरह व्यवहार करना बंद कर दिया और एक ऐसे व्यक्ति की तरह व्यवहार करना शुरू कर दिया जो बस कुशलता से फ्रिज तक पहुँचना चाहता है।
संक्षेप में: उन्होंने रोबोट को मार्च करना सिखाना बंद किया और उन्हें निशाना लगाना सिखाया, जिसके परिणामस्वरूप एक ऐसा रोबोट मिला जो मानव की तरह स्वाभाविक और कुशल गति से चलता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।