Sampling Strategies for Robust Universal Quadrupedal Locomotion Policies
यह शोध पत्र विभिन्न जॉइंट गेन सैंपलिंग रणनीतियों, जिनमें प्रदर्शन-आधारित फ़िल्टरिंग और यूनिफॉर्म रैंडमाइजेशन शामिल हैं, की जांच और तुलना करता है, ताकि यूनिवर्सल क्वाड्रुपेडल लोकोमोशन के लिए एक एकल सुदृढ़ सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) नीति को प्रशिक्षित किया जा सके जो ANYmal रोबोट पर ज़ीरो-शॉट परिनियोजन के माध्यम से सिम-टू-रियल गैप को सफलतापूर्वक पाट सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कुत्ते को चलना सिखाने की कोशिश कर रहे हैं। यदि आप केवल एक छोटे से चिहुआहुआ (Chihuahua) को प्रशिक्षित करते हैं, तो वह ग्रेट डेन (Great Dane) की तरह चलना नहीं सीख पाएगा। यदि आप केवल एक ग्रेट डेन को प्रशिक्षित करते हैं, तो यदि आप अचानक उसे छोटा कर देते हैं, तो वह अपने ही पंजों में उलझकर गिर सकता है।
यह पेपर इस बारे में है कि कैसे एक कंप्यूटर दिमाग (एक AI) को विभिन्न आकारों और प्रकारों के चार पैरों वाले रोबोट्स को नियंत्रित करना सिखाया जाए, बिना हर बार रोबोट बदलने पर उस दिमाग को फिर से प्रशिक्षित किए।
यहाँ उनकी खोज का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:
समस्या: "एक आकार सबके लिए नहीं" वाला जाल (The "One-Size-Fits-None" Trap)
अधिकांश रोबोट कंट्रोलर कस्टम-मेड सूट की तरह होते हैं। यदि आप एक विशिष्ट रोबोट (मान लीजिए, 12 किलो का रोबोट) के लिए एक कंट्रोलर डिजाइन करते हैं, तो यह बहुत अच्छा काम करता है। लेकिन यदि आप उसी "सूट" को एक भारी रोबोट (जैसे, 50 किलो का रोबोट) को पहनाने की कोशिश करते हैं, तो यह बिखर जाता है।
इसे ठीक करने के लिए, वैज्ञानिक आमतौर पर रीइन्फोर्समेंट लर्निंग (RL) का उपयोग करते हैं। इसे एक वीडियो गेम के पात्र को प्रशिक्षित करने की तरह समझें, जहाँ उसे हजारों बार असफल होने दिया जाता है जब तक कि वह सही चालें न सीख ले। समस्या यह है कि यदि आप उसे केवल एक विशिष्ट शरीर के प्रकार पर प्रशिक्षित करते हैं, तो नया शरीर मिलने पर वह भ्रमित हो जाता है।
समाधान: "जिम क्लास" रणनीति (The "Gym Class" Strategy)
लेखकों ने महसूस किया कि किसी भी शरीर पर चलने वाले रोबोट को बनाने के लिए, आपको उसे एक "जिम क्लास" में प्रशिक्षित करना होगा जहाँ रोबोट का वजन, पैर की लंबाई और मांसपेशियों की ताकत लगातार बदलती रहती है।
हालाँकि, एक पेच था: आप इन सेटिंग्स को कैसे बदलते हैं?
यदि आप केवल रैंडम (random) सेटिंग्स चुनते हैं (जैसे पासा फेंकना), तो आप गलती से रोबोट को "सुपर-मसल" दे सकते हैं जो उसके जोड़ों के लिए बहुत अधिक शक्तिशाली हैं, या "कमजोर मांसपेशियां" दे सकते हैं जो उसे चला ही नहीं सकतीं। यह एक छात्र को यह बताने जैसा है कि वह ऐसे जूतों के साथ मैराथन दौड़े जो या तो सीसे (lead) के बने हों या जेली के। यह काम नहीं करेगा।
तीन रणनीतियाँ जिनका उन्होंने परीक्षण किया
टीम ने प्रशिक्षण के दौरान रोबोट की सेटिंग्स को "मिक्स अप" करने के तीन तरीकों की तुलना की:
- "गणितीय सूत्र" दृष्टिकोण (The "Math Formula" Approach): उन्होंने एक साधारण गणितीय रेखा का उपयोग करके रोबोट के वजन के आधार पर सही मांसपेशियों की ताकत का अनुमान लगाने की कोशिश की (जैसे "भारी रोबोट = मजबूत मांसपेशियां")।
- परिणाम: इसने छोटे रोबोटों के लिए ठीक काम किया, लेकिन बड़े रोबोटों के लिए बुरी तरह विफल रहा। गणितीय सूत्र ने ऐसी मांसपेशियों की ताकत का सुझाव दिया जो बहुत आक्रामक थी, जिससे रोबोट हिंसक रूप से हिलने लगा या टूट गया।
- "कुल रैंडम" दृष्टिकोण (The "Total Random" Approach): उन्होंने सब कुछ के लिए बस रैंडम नंबर चुने।
- परिणाम: यह बेहतर था, लेकिन कभी-कभी रोबलेट को "बुरा रोल" (bad roll) मिल जाता था जहाँ सेटिंग्स सीखने के लिए असंभव होती थीं।
- "स्मार्ट कोच" दृष्टिकोण (The "Smart Coach" Approach - उनका विजेता): यह उनका नया तरीका है। कल्पना कीजिए कि एक कोच छात्र को देख रहा है।
- यदि छात्र संघर्ष कर रहा है, तो कोच कहता है, "ठीक है, चलो वजन थोड़ा हल्का करते हैं ताकि तुम इसकी आदत डाल सको।"
- यदि छात्र बहुत अच्छा कर रहा है, तो कोच कहता है, "ठीक है, चलो इसे थोड़ा कठिन बनाते हैं ताकि हम देख सकें कि तुम कितनी दूर जा सकते हो।"
- उन्होंने पार्टिकल फिल्टर (Particle Filter) नामक तकनीक का भी उपयोग किया। इसे "सर्वश्रेष्ठ अभ्यास सत्रों" की एक सूची रखने के रूप में समझें। यदि वजन और मांसपेशियों की ताकत का एक निश्चित संयोजन अच्छा काम करता था, तो कोच उसे याद रखता था और हर बार शून्य से शुरू करने के बजाय उस विशिष्ट सेटअप के बदलावों को आजमाता था।
बड़ी खोज: "मांसपेशियों" की सेटिंग्स सबसे महत्वपूर्ण हैं
उनकी सबसे आश्चर्यजनक खोज PD Gains के बारे में थी। रोबोट की भाषा में, यह मूल रूप से रोबोट के जोड़ों की "कठोरता" (stiffness) या "रिफ्लेक्स" (reflex) है।
- पुराने तरीकों ने इन रिफ्लेक्सों को वजन के आधार पर गणना करने की कोशिश की। पेपर ने पाया कि यह खतरनाक था। इसने अक्सर रोबोट को इतना "कठोर" होने का निर्देश दिया कि वह अपने जोड़ों को जमीन में जोर से पटक देता, जिससे शोर और संभावित नुकसान होता।
- उनके तरीके ने महसूस किया कि रोबोट को मजबूत (robust) बनाने के लिए, आपको उसे बहुत अलग रिफ्लेक्स सेटिंग्स के साथ प्रशिक्षित करने की आवश्यकता है। आपको उसे "जेली वाले पैरों" और "स्टील वाले पैरों" के साथ चलना सिखाना होगा ताकि वास्तविक दुनिया में पहुँचने पर उसे फर्क न पड़े कि उसके पैर कैसे महसूस हो रहे हैं।
वास्तविक दुनिया का परीक्षण
उन्होंने अपने AI को, जिसे केवल सिमुलेशन (कंप्यूटर गेम्स) में दिखाया गया था, एक वास्तविक रोबोट ANYmal (जिसका वजन 50 किलो है) पर लगाया।
- परिणाम: रोबोट पूरी तरह से चला।
- "जीरो-शॉट" जादू (The "Zero-Shot" Magic): उन्होंने रोबोट को यह नहीं बताया, "हे, तुम अब 50 किलो के रोबोट हो।" रोबोट ने कभी 50 किलो के रोबोट को नहीं देखा था। वह बस इसलिए चल सका क्योंकि उसे रोबोट के हर संभव बदलाव पर प्रशिक्षित किया गया था।
- बोनस: उन्होंने रोबोट पर 13 किलो का बैकपैक भी रखा (उसे निर्माता की सीमा से अधिक भारी बना दिया), और फिर भी वह बिना गिरे चलता रहा।
सारांश
पेपर का दावा है कि एक सार्वभौमिक रोबोट वॉकर बनाने के लिए, आप रोबोट की "मांसपेशियों" को समायोजित करने के लिए केवल एक सरल गणितीय सूत्र का उपयोग नहीं कर सकते। इसके बजाय, आपको एक स्मार्ट, अनुकूलन योग्य प्रशिक्षण प्रणाली की आवश्यकता है जो कठिनाई को लगातार बदलती रहे और याद रखे कि क्या काम कर रहा था। यह एक ही AI मस्तिष्क को एक छोटे रोबोट, एक विशाल रोबोट, या भारी भार ढोने वाले रोबोट को नियंत्रित करने की अनुमति देता है, वह भी बिना पुन: प्रशिक्षण के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।