Weave: Learning Whole-Body Dexterous Loco-Manipulation from Human-Object Interactions
वीव (Weave) एक एकीकृत ढांचा है जो मानव प्रदर्शनों को कॉन्टैक्ट-अवेयर रिटारगेटिंग के माध्यम से निष्पादन योग्य संदर्भों में परिवर्तित करके और प्रशिक्षित एवं अनदेखे इंटरैक्शन परिदृश्यों दोनों में उच्च सफलता दर प्राप्त करने के लिए एक ज्योमेट्री-अवेयर पॉलिसी का उपयोग करके, मानवोन्मुखी रोबोटों के लिए संपूर्ण-शरीर दक्ष लोको-मैनिपुलेशन सीखता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक रोबोट बनाने के लिए जो मानव दुनिया में घूम सके, इंजीनियरों को समन्वय की एक ऐसी समस्या का सामना करना पड़ता है जो केवल मशीन को चलने या चीज़ों को उठाने के लिए सिखाने से कहीं अधिक जटिल है। एक रोबोट को एक ही समय में दोनों कार्य करने होंगे, अक्सर एक ऐसी वस्तु को पकड़े हुए जिसका भार उसके वजन को बदल देता है और उसके संतुलन को प्रभावित करता है। इसे 'लोको-मैनिपुलेशन' (loco-manipulation) कहा जाता है, जो एक ऐसा शब्द है जो शरीर को चलाने और साथ ही हाथों से किसी वस्तु को संचालित करने के कठिन कार्य का वर्णन करता है। एक रोबोट की सफलता के लिए, यह आवश्यक है कि वह चलने और पकड़ने को अलग-अलग कार्यों के रूप में न देखे; यदि वह अपने पैरों को समायोजित किए बिना कुर्सी की ओर हाथ बढ़ाता है, तो वह लड़खड़ा कर गिर जाएगा। यदि वह यह योजना बनाए बिना कि उसकी उंगलियां सतह को कैसे छुएंगी, मेज की ओर बढ़ता है, तो वह उसे उठाने में विफल रहेगा। चुनौती मशीन को यह समझाने में निहित है कि उसका पूरा शरीर, उसके पैरों से लेकर उसकी उंगलियों के पोरों तक, भौतिक दुनिया के साथ बातचीत करने के लिए एक एकल, संतुलित इकाई के रूप में कार्य करना चाहिए।
शोधकर्ताओं ने लंबे समय से रोबोटों को मानवीय गतिविधियों को दिखाकर उन्हें सिखाने का प्रयास किया है, जिसे 'इमिटेशन लर्निंग' (imitation learning) या अनुकरण शिक्षण कहा जाता है। हालाँकि, सीधे मनुष्य की नकल करना अक्सर विफल रहता है क्योंकि रोबोट और मनुष्यों के शरीर के आकार और उनके जोड़ों के हिलने-डुलने के तरीके अलग होते हैं। एक मनुष्य अपनी कलाई को उस तरह से घुमा सकता है जैसे एक रोबोट नहीं कर सकता, या एक रोबोट की उंगलियां मनुष्य के कोमल स्पर्श की नकल करने के लिए बहुत सख्त हो सकती हैं। इसके अलावा, रोबोट को वस्तुएं संभालने के लिए सिखाने के पिछले अधिकांश प्रयासों ने या तो शरीर की बड़ी गतिविधियों पर ध्यान केंद्रित किया या हाथों की सूक्ष्म गतिविधियों पर, लेकिन शायद ही कभी एक ही, एकीकृत प्रणाली में दोनों पर एक साथ ध्यान दिया। इस अंतर का अर्थ था कि जबकि रोबोट चल सकते थे या कप पकड़ना सीख सकते थे, वे किसी भारी वस्तु के पास जाने, उसे सुरक्षित रूप से पकड़ने और उसे कहीं और ले जाने जैसे जटिल, रोजमर्रा के कार्य करने में संघर्ष करते थे, ताकि वे उसे गिरा न दें या गिर न जाएं।
शोधकर्ताओं ने इस विशिष्ट समस्या को हल करने के लिए WEAVE नामक एक नई प्रणाली पेश की है। उनका दृष्टिकोण वास्तविक मनुष्यों द्वारा कुर्सियों, बक्सों और मेजों जैसी रोजमर्रा की वस्तुओं के साथ बातचीत करने के रिकॉर्डिंग से शुरू होता है। ये रिकॉर्डिंग उस व्यक्ति की पूरी गति को कैद करती हैं जब वे वस्तु के पास आते हैं, उसे पकड़ते हैं और उसे हिलाते हैं। शोधकर्ता फिर इन मानवीय गतिविधियों को एक ऐसे प्रारूप में अनुवादित करते हैं जिसे रोबोट समझ सके और निष्पादित कर सके। यह अनुवाद केवल एक साधारण 'कॉपी-पेस्ट' नहीं है; यह एक सावधानीपूर्वक पुनर्निर्माण है जो रोबोट की शारीरिक सीमाओं का सम्मान करता है। प्रणाली पहले गति के लुप्त हिस्सों को भरती है, जैसे कि वे कदम जो रोबोट को वस्तु के करीब पहुँचने के लिए उठाने होंगे, जो मूल मानव रिकॉर्डिंग में मौजूद नहीं थे। इसके बाद, यह रोबोट की विशिष्ट उंगलियों के अनुकूल मानव के हाथ की गतिविधियों को समायोजित करता है, यह सुनिश्चित करता है कि रोबोट की पकड़ शारीरिक रूप से संभव और वस्तु को पकड़ने के लिए पर्याप्त मजबूत हो। महत्वपूर्ण रूप से, प्रणाली इस बात पर बारीकी से ध्यान देती है कि उंगलियां वस्तु को ठीक कहाँ छूती हैं, जिससे उन संपर्क बिंदुओं को सुरक्षित रखा जा सके जो पकड़ को स्थिर बनाते हैं।
एक बार जब ये संदर्भ गतियां (reference movements) बना ली जाती हैं, तो शोधकर्ता एक एकल कंप्यूटर प्रोग्राम, या 'पॉलिसी' (policy) को उनसे सीखने के लिए प्रशिक्षित करते हैं। यह प्रोग्राम रोबोट के शरीर के हर जोड़ को नियंत्रित करने के लिए डिज़ाइन किया गया है, जिसमें उसके धड़ और पैरों के उन उन्नतीस (29) जोड़ों और उसके दो हाथों के बारह (12) जोड़ शामिल हैं। प्रत्येक प्रकार की वस्तु के लिए एक अलग प्रोग्राम प्रशिक्षित करने के बजाय, शोधकर्ताओं ने इस एक ही प्रोग्राम को एक साथ विभिन्न प्रकार की वस्तुओं और बातचीत की शैलियों पर प्रशिक्षित किया। रोबोट एक सिम्युलेटेड वातावरण (simulated environment) में सीखता है, जो एक डिजिटल दुनिया है जहाँ वह कुछ भी तोड़े बिना हजारों बार अभ्यास कर सकता है। वह संदर्भ गति को देखना सीखता है और उससे मेल खाने का प्रयास करता है, वस्तु को सुरक्षित रखने के लिए अपने संतुलन और उंगलियों के दबाव को वास्तविक समय में समायोजित करता है। प्रशिक्षण कठोर है, जिसमें रोबोट के घर्षण और वजन में यादृच्छिक परिवर्तन शामिल हैं ताकि यह सुनिश्चित हो सके कि वह अप्रत्याशित स्थितियों को संभाल सके।
इस प्रशिक्षण के परिणाम प्रभावशाली हैं। उन विशिष्ट वस्तुओं और गतिविधियों पर परीक्षण किए जाने पर, जिन्हें उसने प्रशिक्षण के दौरान देखा था, रोबोट कार्य को 92.5% बार सफलतापूर्वक पूरा करने में सफल रहा। इससे भी महत्वपूर्ण बात यह है कि इस प्रणाली ने एक मजबूत सामान्यीकरण (generalization) क्षमता दिखाई। जब शोधकर्ताओं ने रोबोट का परीक्षण उन गतिविधियों के क्रमों पर किया जिन्हें उसने पहले कभी नहीं देखा था, जिसमें उन्हीं वस्तुओं का उपयोग किया गया था लेकिन उन्हें अलग कोणों या अलग गतियों के साथ दृष्टिकोण से पकड़ा गया था, तब भी वह बिना किसी अतिरिक्त प्रशिक्षण के 65.0% बार सफल रहा। यह सुझाव देता है कि रोबोट ने केवल विशिष्ट गतिविधियों को याद करने के बजाय वस्तुओं के साथ बातचीत करने की एक सामान्य रणनीति सीखी है। शोधकर्ताओं ने इन सफल गतिविधियों का एक बड़ा डेटासेट भी जारी किया है, जो लगभग 23 घंटों की रिकॉर्ड की गई रोबोट गतिविधि के बराबर है, ताकि अन्य वैज्ञानिक यह अध्ययन कर सकें कि रोबोट भौतिक दुनिया के साथ कैसे बातचीत करना सीख सकते हैं।
यह अध्ययन इस बात पर प्रकाश डालता है कि वस्तुओं को संभालना सीखना तब सबसे प्रभावी होता है जब रोबोट एक साथ अपने पूरे शरीर का समन्वय करना सीखता है। कई अलग-अलग वस्तुओं पर एक साथ प्रशिक्षण देकर, रोबोट ने सामान्य पैटर्न खोजे, जैसे कि भारी बॉक्स उठाते समय अपने वजन को कैसे संतुलित किया जाए या ऊंचे लैंप तक पहुँचते समय अपने पैरों को कैसे स्थित किया जाए। यह एकीकृत दृष्टिकोण प्रत्येक वस्तु के लिए अलग-अलग विशेषज्ञ बनाने की तुलना में अधिक सफल रहा। शोधकर्ताओं ने पाया कि जबकि एक विशेषज्ञ किसी एक विशिष्ट वस्तु के लिए सटीक मुद्रा (pose) की नकल करने में थोड़ा बेहतर हो सकता है, वहीं सामान्यज्ञ (generalist) रोबता स्थितियों की एक विस्तृत श्रृंखला में कार्य को पूरा करने में बहुत बेहतर था। यह इंगित करता है कि किसी एक गति की पूर्ण नकल करने की तुलना में नई आकृतियों और स्थितियों के अनुकूल होने की क्षमता अधिक मूल्यवान है।
इन सफलताओं के बावजूद, शोधकर्ता अपने कार्य की सीमाओं के बारे में स्पष्ट हैं। पूरा अध्ययन एक कंप्यूटर सिमुलेशन में आयोजित किया गया था, जिसका अर्थ है कि रोबोट ने कभी भी वास्तविक दुनिया को भौतिक रूप से छुआ नहीं। प्रणाली इस पूर्ण ज्ञान पर निर्भर थी कि रोबोट और वस्तु कहाँ हैं, जो वास्तविक दुनिया में हमेशा उपलब्ध नहीं होता है जहाँ सेंसर शोर (noisy) वाले हो सकते हैं। इसके अतिरिक्त, सिमुलेशन में उपयोग किया गया रोबोट ऐसे हाथों वाला है जो पूरी तरह से लचीले नहीं हैं, जो इसके द्वारा की जा सकने वाली पकड़ की जटिलता को सीमित करता है। शोधकर्ता यह भी नोट करते हैं कि उनके सिस्टम को पालन करने के लिए क्रियाओं के एक पूर्व-नियोजित क्रम की आवश्यकता होती; इसमें अभी भी स्वयं निर्णय लेने की क्षमता नहीं है कि क्या उठाना है या इसे कहाँ ले जाना है। ये क्षेत्र के अगले चरण हैं, जहाँ भविष्य की प्रणालियों को इस भौतिक कौशल को जटिल निर्देशों को समझने और अप्रत्याशित वास्तविक दुनिया की प्रकृति में नेविगेट करने की क्षमता के साथ जोड़ने की आवश्यकता होगी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।