NestDex: Nested Policy Learning with Copilot Assisted Teleoperation for Dexterous Manipulation
नेस्टडेक्स (NestDex) एक नेस्टेड पॉलिसी-लर्निंग फ्रेमवर्क है जो ऑपरेटरों को रोबोटिक आर्म्स को नियंत्रित करने और क्लच के माध्यम से उच्च-स्तरीय हैंड स्किल्स चुनने की अनुमति देकर डेक्सट्रस मैनिपुलेशन डेटा संग्रह को सरल बनाता है, जिससे स्वायत्त विज़ुओमोटर पॉलिसियों को प्रशिक्षित करने के लिए विश्वसनीय प्रदर्शन (demonstrations) उत्पन्न होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोटिक हाथ का नृत्य
कल्पना कीजिए कि आप एक रोबोट को अंगूर छीलने या सुई में धागा पिरोने जैसी सूक्ष्म चीज़ करना सिखाने की कोशिश कर रहे हैं। यह केवल एक मैकेनिकल हाथ को बिंदु A से बिंदु B तक ले जाने के बारे में नहीं है; यह रोबोट की उंगलियों के बारे में है। रोबोटिक्स की दुनिया में, इसे "डेक्सट्रस मैनिपुलेशन" (dexterous manipulation) कहा जाता है। जहाँ एक मानक रोबोट ग्रिपर एक चिमटे की तरह होता है जो बस खुलता और बंद होता है, वहीं एक डेक्सट्रस हाथ में मानव हाथ की तरह कई जोड़ होते हैं, जिसके लिए वस्तुओं को बिना कुचले छूने, पकड़ने और घुमाने के लिए जटिल समन्वय की आवश्यकता होती है।
रोबots को ये कौशल सिखाने में सबसे बड़ी बाधा यह नहीं है कि रोबोट सीखने के लिए बहुत कम बुद्धिमान हैं; बल्कि यह है कि उन्हें यह कैसे करना है, यह दिखाना अविश्वसनीय रूप से कठिन है। एक रोबोट को उदाहरण द्वारा सिखाने के लिए (एक विधि जिसे इमिटेशन लर्निंग कहा जाता है), एक इंसान को रोबोट के देखते समय कार्य को पूरी तरह से सही ढंग से करना होता है। लेकिन एक डेक्सट्रस हाथ के लिए, यह एक दुःस्वप्न है। एक मानव ऑपरेटर को एक साथ रोबोट के हाथ को नियंत्रित करना होता है और एक कोमल पकड़ बनाए रखने के लिए हर एक उंगली के जोड़ का समन्वय करना होता है। यह एक हाथ से कार चलाने और दूसरे हाथ से एक जटिल पियानो सोलो बजाने की कोशिश करने जैसा है। यदि इंसान थोड़ा भी चूक जाता है, तो डेटा खराब हो जाता है, और रोबोट कुछ भी नहीं सीख पाता। यह शोध ठीक इसी समस्या का समाधान करता है: हम रोबोट को इन शानदार उंगली के करतबों को सीखना कैसे सिखा सकते हैं बिना मानव ऑपरेटर को पागल किए?
नेस्टडेक्स (NestDex) से मिलिए: रोबोट का "को-पायलट"
इस अध्ययन के पीछे के शोधकर्ताओं, जेम्स झाओ और उनकी टीम ने नेस्टडेक्स (NestDex) नामक एक नया सिस्टम पेश किया है। इसे रोबोट की उंगलियों के लिए एक "को-पायलट" देने के रूप में समझें। मानव ऑपरेटर से हर एक उंगली की हरकत को सीधे नियंत्रित करने के लिए कहने के बजाय, नेस्टडेक्स इस काम को दो भागों में विभाजित करता है। मानव ऑपरेटर अभी भी बड़े आंदोलनों को नियंत्रित करता है—हाथ को दिशा देना और यह तय करना कि कहाँ जाना है—लेकिन उंगलियों को एक स्मार्ट, पूर्व-प्रशिक्षित "इनर पॉलिसी" (inner policy) द्वारा संभाला जाता है।
कल्पना कीजिए कि आप एक उन्नत क्रूज कंट्रोल वाली कार चला रहे हैं जो जानती है कि गड्ढे के चारों ओर कैसे स्टीयर करना है। आप बस कार को "आगे बढ़ो" कहते हैं, और क्रूज कंट्रोल सवारी को सुचारू रखने के लिए स्टीयरिंग व्हील के छोटे, तीव्र समायोजन को संभालता है। नेस्टडेक्स में, मानव एक साधारण "क्लच" (एक एकल नियंत्रण) का उपयोग करके रोबोट की उंगलियों को यह बताता है कि वे एक विशिष्ट कौशल के कितने आगे होने चाहिए। यदि मानव क्लच को आगे धकेलता है, तो रोबोट की उंगलियां स्वचालित रूप से एक पूर्व-सीखे गए कौशल को निष्पादित करती हैं, जैसे कि "बोतल को पकड़ना" या "बटन दबाना"। यदि मानव इसे पीछे खींचता है, तो रोबोट उंगलियों की हरकत को रिवाइंड (पीछे) करता है। इंसान को यह जानने की ज़रूरत नहीं है कि पेपर कप को कैसे चुटकी से पकड़ना है; उन्हें बस यह जानने की ज़रूरत है कि "पिंच" कौशल शुरू करने के लिए क्लच कब दबाना है।
यह प्रणाली दो परतों में काम करती है। पहले, टीम इस "को-पायलट" पद्धति का उपयोग करके डेटा एकत्र करती है। मानव हाथ का मार्गदर्शन करता है और उंगलियों के कौशलों को चालू/बंद करता है, जिससे पूर्ण प्रदर्शनों (demonstrations) की एक लाइब्रेरी बनती है। फिर, वे पूरी तरह से कार्यभार संभालने के लिए एक अलग "आउटर पॉलिसी" (outer policy) को प्रशिक्षित करते हैं। यह आउटर पॉलिसी अंतिम कार्य के लिए रोबोट का मस्तिष्क है; यह को-पायलट के प्रदर्शनों से सीखती है लेकिन अंततः बिना किसी मानवीय सहायता या को-पायलट सिस्टम के, हाथ और उंगलियों दोनों को नियंत्रित करते हुए खुद ही पूरा काम संभाल लेती है।
संपीड़न (Compression) और स्मूथिंग (Smoothing) का जादू
नेस्टडेक्स द्वारा उपयोग की जाने वाली एक चतुर तकनीक "हैंड-एक्शन वेरिएशनल ऑटोएनकोडर" (या H-VAE) है। आप इसे रोबोट की गतिविधियों के लिए एक संपीड़न एल्गोरिदम के रूप में समझ सकते हैं। रोबोट के हाथ में 20 जोड़ होते हैं, जिसका अर्थ है कि उन्हें हिलाने के लाखों तरीके हैं। एक रोबोट को एक साथ सभी 20 नंबरों की भविष्यवाणी करना सिखाना एक छात्र को पूरे विश्वकोश को पृष्ठ दर पृष्ठ याद करने के लिए कहने जैसा है। H-VAE इन जटिल उंगली की गतिविधियों को एक छोटे, सरल "गुप्त कोड" (लेटेंट एक्शन) में संकुचित कर देता है जो रोबोट के लिए सीखना आसान होता है। जब रोबोट कार्य करने के लिए तैयार होता है, तो वह इस गुप्त कोड को वापस पूर्ण 20-जोड़ की गति में डिकोड करता है। शोध में पाया गया कि इस संपीड़न का उपयोग करने से रोबोट कच्चे, जटिल आंदोलनों को सीधे सीखने के बजाय बहुत तेज़ी से सीखता है और बेहतर प्रदर्शन करता है।
शोधकर्ताओं ने यह भी परीक्षण किया कि रोबोट वास्तविक दुनिया के भौतिकी (physics) को कैसे संभालता है, जैसे कि जब एक उंगली किसी फिसलन भरी वस्तु को छूती है। उन्होंने तीन तरीकों की तुलना की कि रोबोट कैसे चल सकता है:
- फिक्स्ड रिप्ले (Fixed Replay): एक सफल चाल के रिकॉर्ड किए गए वीडियो को बिल्कुल वैसा ही चलाना जैसा वह हुआ था।
- क्लोज्ड-लूप (बिना स्मूथिंग के) (Closed-Loop - No Smoothing): रोबोट अपनी वर्तमान स्थिति को देखता है और अगला कदम तय करता है, लेकिन यह झटकेदार, रुक-रुक कर चलने वाले तरीके से करता है।
- टेम्पोरल एनसेम्बलिंग के साथ क्लोज्ड-लूप (Closed-Loop with Temporal Ensembling): रोबोट अपनी स्थिति को देखता है, एक भविष्यवाणी करता है, लेकिन फिर उस भविष्यवाणी को अपने हालिया पिछले भविष्यवाणियों के साथ औसत (average) करता है ताकि गति को सुचारू बनाया जा सके।
परिणाम स्पष्ट थे। "फिक्स्ड रिप्ले" विधि अक्सर विफल हो गई क्योंकि यदि वस्तु उम्मीद के मुताबिक थोड़ी भी अलग तरह से हिल जाती, तो रोबोट टकरा जाता। "क्लोज्ड-लूप" विधि अधिक मजबूत थी लेकिन झटकेदार थी। "टेम्पोरल एनसेम्बलिंग" वाला तरीका विजेता रहा: यह सुचारू और अनुकूलन योग्य दोनों था। पानी की बोतल को पकड़ने के परीक्षणों में, सुचारू, अनुकूलन योग्य विधि 10 में से 9 बार सफल रही, जबकि फिक्स्ड रिप्ले केवल 10 में से 3 बार सफल हुई। यह सुझाव देता है कि रोबोट्स को नाजुक कार्यों को संभालने के लिए, उन्हें वास्तविक समय में अपनी पकड़ को समायोजित करने में सक्षम होना चाहिए और ऐसा सुचारू रूप से करना चाहिए, न कि केवल एक स्क्रिप्ट को दोहराना चाहिए।
को-पायलट से सोलो पायलट तक
टीम ने छह अलग-अलग चुनौतीपूर्ण कार्यों पर नेस्टडेक्स का परीक्षण किया, जिसमें गाजर को हिलाने के लिए चिमटे का उपयोग करने से लेकर बाइंडर में कागजात फाइल करने तक शामिल है। उन्होंने अपने "को-पायलट" सिस्टम की तुलना एक मानक पद्धति से की जहाँ इंसान सीधे उंगलियों को नियंत्रित करने की कोशिश करता है (जिसे AnyTeleop कहा जाता है)। परिणाम चौंकाने वाले थे। मानक पद्धति कई कार्यों पर पूरी तरह विफल रही, "टोस्ट प्रिपरेशन" या "बाइंडर फाइलिंग" जैसी चीजों के लिए अच्छे प्रदर्शन एकत्र करने की सफलता दर 0% रही। इसके विपरीत, नेस्टडेक्स ने सभी छह कार्यों के लिए प्रदर्शन एकत्र करने में 100% सफलता दर हासिल की।
इससे भी महत्वपूर्ण बात यह है कि शोध पत्र दिखाता है कि नेस्टडेक्स द्वारा एकत्र किया गया डेटा वास्तव में काम करता है। जब उन्होंने एक रोबोट को नेस्टडेक्स डेटा का उपयोग करके स्वतंत्र रूप से कार्य करने के लिए प्रशिक्षित किया, तो वह "टोंग्स ट्रांसफर" और "इंग्रीडिएंट ट्रांसफर" कार्यों में 100% सफल रहा। कठिन कार्यों के लिए भी, सफलता दर मानक पद्धति से प्राप्त डेटा की तुलना में काफी अधिक थी। शोध पत्र स्पष्ट रूप से इस विचार का खंडन करता है कि रोबोट को अंतिम कार्य के दौरान को-पायलट सिस्टम चलाने की आवश्यकता है; को-पायलट डेटा एकत्र करने के लिए एक उपकरण है। एक बार जब रोबोट "आउटर पॉलिसी" सीख लेता है, तो वह अपनी उंगलियों के लिए संक्षिप्त "गुप्त कोड" और सीखे गए सुचारू, अनुकूल नियंत्रण रणनीतियों का उपयोग करते हुए स्वतंत्र रूप से कार्य कर सकता है।
संक्षेप में, नेस्टडेक्स सुझाव देता है कि हमें मनुष्यों को विशेषज्ञ रोबोट उंगली-नर्तक बनने के लिए मजबूर करने की आवश्यकता नहीं है। इसके बजाय, हम उन्हें एक सरल रिमोट कंट्रोल दे सकते हैं जो स्मार्ट, पूर्व-सीखे गए उंगली कौशल को सक्रिय करता है। यह न केवल डेटा संग्रह को तेज़ और अधिक विश्वसनीय बनाता है, बल्कि ऐसे रोबोट भी तैयार करता है जो भौतिक वस्तुओं की जटिल और अस्त-व्यस्त दुनिया को बेहतर ढंग से संभाल सकते हैं। लेखकों ने पाया कि यह दृष्टिकोण न केवल डेटा संग्रह को तेज़ और अधिक विश्वसनीय बनाता है, बल्कि ऐसे रोबोट भी बनाता है जो वास्तव में अपने दम पर डेक्सट्रस कार्यों में महारत हासिल कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।