Mind the Phase: Effective Rank and Representation Health in Legged Locomotion
यह शोध पत्र प्रदर्शित करता है कि लेग्ड लोक मोशन (legged locomotion) पॉलिसियों के फेज-कंडीशन्ड प्रभावी रैंक (phase-conditioned effective rank) का विश्लेषण करने से रिप्रजेंटेशन हेल्थ (representation health) में आर्किटेक्चरल बायस (architectural biases) का पता चलता है, जिसका उपयोग जॉइंट जिटर (joint jitter) को महत्वपूर्ण रूप से कम करने और सिम-टू-रियल (sim-to-real) ट्रांसफर को बेहतर बनाने के लिए किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोटिक्स के क्षेत्र में हाल ही में एक शांत क्रांति आई है, जो कठोर, पूर्व-निर्धारित निर्देशों से हटकर एक ऐसी प्रणाली की ओर बढ़ रही है जहाँ मशीनें बिल्कुल वैसे ही परीक्षण और त्रुटि (trial and error) के माध्यम से चलना सीखती हैं, जैसे एक बच्चा चलना सीखता है। 'रीइन्फोर्समेंट लर्निंग' (reinforcement learning) के रूप में जानी जाने वाली यह पद्धति रोबोट को कंप्यूटर सिमुलेशन के भीतर लाखों अभ्यास सत्र चलाकर बैकफ्लिप से लेकर ऊबड़-खाबड़ रास्तों पर चलने जैसे जटिल शारीरिक व्यवहारों को खोजने की अनुमति देती है। हालाँकि, एक निरंतर समस्या ने इस प्रगति को बाधित किया है: एक रोबोट जो आभासी दुनिया में पूरी तरह से प्रदर्शन करता है, वह वास्तविक हार्डवेयर पर रखे जाने पर अस्थिर, डगमगाता हुआ या यहाँ तक कि खतरनाक भी हो जाता है। चिकनी डिजिटल सिमुलेशन और अराजक भौतिक दुनिया के बीच के इस अंतर को पाटना कठिन रहा है, मुख्य रूप से इसलिए क्योंकि इंजीनियर रोबोट के "मस्तिष्क" के भीतर नहीं देख सकते थे कि वह क्यों विफल हो रहा है। वे रोबोट को लड़खड़ाते हुए तो देख सकते थे, लेकिन वे उस सीखने की प्रक्रिया की आंतरिक स्थिति का निदान नहीं कर सकते थे जिसके कारण वह लड़खड़ाया था।
साओ पाउलो विश्वविद्यालय के शोधकर्ताओं की एक टीम ने अब इस समस्या को देखने का एक नया तरीका प्रस्तावित किया है, जो ध्यान को रोबोट की अंतिम गतिविधियों से हटाकर उसके निर्णय लेने वाले नेटवर्क की आंतरिक संरचना पर केंद्रित करता है। उन्होंने अध्ययन किया कि कैसे चार पैरों वाले कुत्तों और दो पैरों वाले मानव सदृश (humanoids) जैसे लेगड रोबोट चलते हैं, और इसके लिए उन्होंने उनके तंत्रिका तंत्र (neural networks) के एक विशिष्ट गुण का विश्लेषण किया जिसे "प्रभावी रैंक" (effective rank) कहा जाता है। सरल शब्दों में, यह इस बात का माप है कि रोबोट का मस्तिष्क जो कुछ भी देखता है, उस पर प्रतिक्रिया देने के कितने अलग-अलग तरीके हैं। यदि मस्तिष्क स्वस्थ और लचीला है, तो वह वातावरण में होने वाले विविध सूक्ष्म परिवर्तनों के प्रति प्रतिक्रिया कर सकता है। यदि वह अस्वस्थ या "कोलैप्स्ड" (collapsed) है, तो वह केवल कुछ कठोर पैटर्न पर निर्भर होकर जड़ हो जाता है। शोधकर्ताओं ने पाया कि केवल मस्तिष्क के औसत लचीलेपन को देखना भ्रामक था। इसके बजाय, उन्होंने पाया कि रोबroट का मस्तिष्क इस आधार पर बहुत अलग व्यवहार करता है कि पैर हवा में है या जमीन को छू रहा है।
टीम ने चलने के एक कदम के दो अलग-अलग चरणों पर ध्यान केंद्रित किया: "स्विंग" (swing) चरण, जब एक पैर उठाया जाता है और आगे बढ़ाया जाता है, और "स्टेंस" (stance) चरण, जब पैर जमीन पर टिका होता है और रोबोट का भार संभालता है। इन दोनों क्षणों को अलग करके, उन्होंने एक छिपे हुए वास्तुशिल्प हस्ताक्षर (architectural signature) को उजागर किया जो डेटा को औसत करने पर अदृश्य रहता। उन्होंने पाया कि आधुनिक, उन्नत न्यूरल नेटवर्क स्वाभाविक रूप से अपने आंतरिक लचीलेपन का अधिक हिस्सा स्टेंस चरण की तुलना में स्विंग चरण के लिए आवंटित करते हैं। इसका अर्थ यह है कि जब पैर हवा में घूम रहा होता है, तो रोबोट का मस्तिष्क अधिक अनुकूलनीय और संवेदनशील होता है, जो अप्रत्याशित फिसलन या असमान जमीन के अनुसार खुद को ढालने के लिए तैयार रहता है। इसके विपरीत, पुराने, सरल नेटवर्क डिजाइन कोई ऐसा अंतर नहीं दिखाते थे; वे दोनों चरणों के साथ एक ही कठोर एकरूपता का व्यवहार करते थे। यह अंतर केवल एक सैद्धांतिक जिज्ञासा नहीं था; यह इस बात का स्पष्ट संकेतक था कि रोबोट वास्तविक दुनिया में कैसा प्रदर्शन करेगा।
शोधकर्ताओं ने इस विचार का परीक्षण करने के लिए सिमुलेशन में रोबोट को प्रशिक्षित किया और फिर उन्हें बोस्टन डायनेमिक्स स्पॉट (Boston Dynamics Spot) जैसे भौतिक मशीनों पर तैनात किया। परिणाम चौंकाने वाले थे। जिन रोबोट्स को ऐसे नेटवर्क के साथ प्रशिक्षित किया गया था जो स्विंग और स्टेंस चरणों के बीच इस स्वस्थ अंतर को बनाए रखते हैं, वे काफी अधिक सुचारू रूप से चले। जब उन्हें भौतिक रोबोट पर रखा गया, तो उन उन्नत नेटवर्क्स ने पुराने, सरल डिजाइनों की तुलना में जोड़ों में उच्च-आवृत्ति वाले कंपन, या "जिटर" (jitter), को लगभग तीन गुना कम कर दिया। यह जिटर कम करना महत्वपूर्ण है क्योंकि अत्यधिक कंपन रोबोट के मोटरों को नुकसान पहुँचा सकता है और उसकी गतिविधियों को अप्रत्याशित बना सकता है। अध्ययन बताता है कि नेटवर्क का यह आंतरिक "स्वास्थ्य", जिसे उसके वॉकिंग साइकिल के दौरान उसके लचीलेपन के वितरण द्वारा मापा जाता है, रोबोट के कंप्यूटर से बाहर निकलने से पहले ही उसकी सफलता का एक विश्वसनीय भविष्यवक्ता है।
महत्वपूर्ण रूप से, टीम ने यह भी खोजा कि बहुत अधिक लचीली प्रतिक्रियाओं का होना हमेशा अच्छी बात नहीं होती है। उन्होंने पाया कि यदि किसी रोबोट को बहुत लंबे समय तक प्रशिक्षित किया जाता है, तो इसकी आंतरिक संरचना विकृत (degenerate) हो सकती है। इन अत्यधिक प्रशिक्षित मामलों में, नेटवर्क का लचीलापन बढ़ता हुआ दिखाई दे सकता है, लेकिन स्विंग और स्टेंस चरणों के बीच का विशिष्ट, स्वस्थ अंतर गायब हो जाता है। रोबोट स्विंग चरण के दौरान अनुकूलित होने की अपनी विशेष क्षमता खो देता है, और उसकी गतिविधियाँ कम विश्वसनीय हो जाती हैं। यह निष्कर्ष इंजीनियरों को चेतावनी देता है कि वे केवल रोबोट के मस्तिष्क के लचीलेपन को अधिकतम करने की कोशिश न करें, बल्कि यह भी जाँचें कि वह लचीलापन कैसे व्यवस्थित है। प्रशिक्षण के दौरान उपयोग किए जाने वाले रिवॉर्ड सिग्नल (reward signals), जो रोबोट को बताते हैं कि वह कब अच्छा कर रहा है, अक्सर इस आंतरिक पतन का पता लगाने में विफल रहते हैं, जिससे रोबोट सीखने के ऐसे तरीके में जारी रहता है जो वास्तव में उसके वास्तविक दुनिया के प्रदर्शन को नुकसान पहुँचाता है।
इस नए नैदानिक उपकरण का उपयोग करके, जो वॉकिंग साइकिल के विशिष्ट क्षणों के दौरान रोबोट के मस्तिष्क की आंतरिक संवेदनशीलता को देखता है, इंजीनियर अब प्रशिक्षण प्रक्रिया के दौरान इन समस्याओं की पहचान और समाधान कर सकते हैं। यह अध्ययन एक व्यावहारिक तरीका प्रदान करता है ताकि यह सुनिश्चित किया जा सके कि सिमुलेशन में सीखी गई नीतियां (policies) भौतिक दुनिया की अनिश्चितताओं को संभालने के लिए पर्याप्त मजबूत हों। यह पता चला है कि एक सुचारू, विश्वसनीय रोबोट का रहस्य केवल उसके द्वारा लिए गए अंतिम कदमों में नहीं है, बल्कि इस बात में है कि उसका आंतरिक मन पैर उठाने और उसे जमीन पर रखने के बीच के नाजुक संक्रमण को संभालने के लिए कैसे संरचित है। यह अंतर्दृष्टि ऐसे रोबोट बनाने के लिए एक नया दृष्टिकोण प्रदान करती है जो न केवल जटिल कार्यों में सक्षम हैं, बल्कि हमारे रोजमर्रा के वातावरण में संचालित होने के लिए स्थिर और सुरक्षित भी हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।