WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors
यह शोध पत्र WholeBodyWAM को प्रस्तुत करता है, जो एक ह्यूमनॉइड वर्ल्ड-एक्शन मॉडल है जो एक बड़े पैमाने के, विषम मोशन कॉर्पस (UniMotion-4K) का लाभ उठाकर एक हस्तांतरणीय मोशन प्रायर को प्रीट्रेन करता है, जो असिमेट्रिक मिक्सचर-ऑफ-ट्रांसफॉर्मर्स अटेंशन के माध्यम से वीडियो और एक्शन एक्सपर्ट्स के साथ एकीकृत होने पर डेटा दक्षता और डाउनस्ट्रीम मैनिपुलेशन प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक रोबोट को इंसान की तरह चलाने के लिए, इंजीनियरों को एक मौलिक समस्या का सामना करना पड़ता है: मशीन को उसके पूरे शरीर के समन्वय (coordinate) को सिखाना अविश्वसनीय रूप से कठिन है। जब कोई इंसान कप पकड़ने के लिए हाथ बढ़ाता है या कमरे में चलता है, तो वह प्रत्येक व्यक्तिगत मांसपेशी को हिलाने के बारे में नहीं सोचता; शरीर एक एकल, सुव्यवस्थित इकाई के रूप में कार्य करता है। हालाँकि, रोबोटों के लिए, प्रत्येक जोड़ और अंग को अलग से कमांड दिया जाना चाहिए, और किसी विशिष्ट रोबोट को यह कौशल सिखाने के लिए आवश्यक लाखों घंटों के अभ्यास डेटा को एकत्र करना धीमा, महंगा और अक्सर असंभव होता है। जबकि वैज्ञानिकों ने शक्तिशाली मॉडल बनाए हैं जो भाषा को समझ सकते हैं और दुनिया को देख सकते हैं, ये सिस्टम अक्सर यह अनुमान लगाने में संघर्ष करते हैं कि एक रोबोट का अपना शरीर भविष्य में कैसे हिलेगा, और इसके बजाय वे केवल वर्तमान में जो हो रहा है उस पर प्रतिक्रिया देने पर निर्भर रहते हैं। यह सीमा रोबोटों के लिए उन जटिल कार्यों को करने में कठिनाई पैदा करती है जिनमें आगे की योजना बनाने की आवश्यकता होती है, जैसे असमान जमीन पर चलते समय एक भारी बॉक्स ले जाना या संतुलन खोए बिना किसी वस्तु को उठाने के लिए घुटनों के बल बैठना।
शोधकर्ताओं की एक टीम ने इंटरनेट पर उपलब्ध मानव गति के विशाल, मुफ्त पुस्तकालय से रोबोट को सिखाकर इस चुनौती का समाधान किया है, न कि केवल रोबोट के स्वयं के महंगे प्रदर्शनों पर निर्भर रहकर। उन्होंने WHOLEBODYWAM नामक एक नई प्रणाली बनाई, जो रोबोट के शरीर के लिए एक भविष्य कहनेवाला इंजन (predictive engine) के रूप में कार्य करती है। केवल एक वीडियो देखकर और यह अनुमान लगाकर कि आगे क्या करना है, यह सिस्टम काम नहीं करता; बल्कि यह शरीर के भौतिक विज्ञान (physics) को सीखता है कि समय के साथ शरीर कैसे चलता है। इसे 'UniMotion-4K' नामक मोशन डेटा के एक विशाल संग्रह पर प्रशिक्षित किया गया था, जिसमें मानव वीडियो, विशेष 3D मोशन कैप्चर डेटासेट और अन्य ह्यूमनॉइड रोबोटों से रिकॉर्ड किए गए 4,100 घंटों से अधिक की गति शामिल है। इन सभी विभिन्न स्रोतों को गति की एक एकल, साझा भाषा में परिवर्तित करके, सिस्टम ने यह समझने की एक सामान्य "सहज बुद्धि" (intuition) विकसित की कि एक शरीर को एक मुद्रा (pose) से दूसरी मुद्रा में कैसे बदलना चाहिए। इस सहज बुद्धि को फिर एक वास्तविक ह्यूमनॉइड रोबोट में स्थानांतरित किया गया, जिससे वह अपने भविष्य के आंदोलनों का पूर्वानुमान लगाने और जटिल पूरे-शरीर के कार्यों को पहले की तुलना में कहीं अधिक कौशल और दक्षता के साथ निष्पादित करने में सक्षम हुआ।
इस कार्य का मूल आधार एक दो-चरणीय प्रशिक्षण प्रक्रिया है जो गति के सामान्य नियमों को सीखने और उन्हें एक विशिष्ट मशीन पर लागू करने के बीच अंतर करती है। पहले चरण में, सिस्टम ने लक्ष्य रोबोट के वास्तविक कमांड देखे बिना ही मानव और रोबोट की गति के विशाल डेटासेट का अध्ययन किया। इसने यह अनुमान लगाना सीखा कि कार्य के एक सरल पाठ्य विवरण (text description), जैसे कि "खिलौना उठाओ" या "घुटनों के बल बैठो", के आधार पर एक शरीर आगे क्या करेगा। इसने एक शक्तिशाली आधार तैयार किया, एक प्रेडिक्टिव प्रायर (predictive prior) जिसने मानव जैसी गति के लिए आवश्यक अंगों के समन्वित नृत्य और संतुलन को समझा। दूसरे चरण में, इस पूर्व-प्रशिक्षित ज्ञान को एक वीडियो समझ मॉड्यूल और एक एक्शन जनरेटर के साथ जोड़ा गया। इसके बाद सिस्टम को विशिष्ट रोबोट, 'TianGong 3.0' के कुछ प्रदर्शन दिखाए गए ताकि यह सीख सके कि उसके सामान्य गति संबंधी ज्ञान को उन विशिष्ट मोटर कमांड्स में कैसे बदला जाए जिनकी आवश्यकता उस रोबोट के जोड़ों को होती है। महत्वपूर्ण बात यह है कि सिस्टम केवल वर्तमान दृश्य पर प्रतिक्रिया नहीं देता; यह अपने स्वयं के शरीर की भविष्य की स्थिति की कल्पना करने के लिए अपने सीखे हुए ज्ञान का उपयोग करता है, और उस भविष्यवाणी का उपयोग वास्तविक समय में अपने कार्यों को निर्देशित करने के लिए करता है।
जब छह कठिन वास्तविक दुनिया के कार्यों पर परीक्षण किया गया, तो परिणाम चौंकाने वाले थे। रोबोट को खिलौने उठाने, कपड़े धोने की मशीन में कपड़े डालने, सोफे पर तकिया स्थानांतरित करने और मेज तक बॉक्स ले जाने जैसे कार्य करने के लिए कहा गया था। इन कार्यों के लिए रोबोट को झुकने, चलने, घुटनों के बल बैठने और वस्तुओं को संचालित करने के लिए एक साथ कार्य करने की आवश्यकता थी। नया सिस्टम मौजूदा सर्वोत्तम तरीकों से बेहतर रहा, और सभी कार्यों में सफलता दर काफी अधिक हासिल की। उदाहरण के लिए, बॉक्स ट्रांसफर कार्य में, जहाँ रोबोट को एक बॉक्स उठाना था, एक साइड टेबल तक चलना था और उसे नीचे रखना था, वहां नया सिस्टम 73.3% बार सफल रहा, जबकि अन्य दृष्टिकोणों में सफलता दर बहुत कम थी। शोधकर्ताओं ने पाया कि उन्होंने प्रारंभिक "मोशन एक्सपर्ट" को प्रशिक्षित करने के लिए जितना अधिक मोशन डेटा उपयोग किया, रोबोट का प्रदर्शन उतना ही बेहतर हुआ, जो यह दर्शाता है कि सिस्टम ने केवल विशिष्ट उदाहरणों को याद करने के बजाय वास्तव में एक स्केलेबल कौशल सीखा है। इससे भी अधिक महत्वपूर्ण बात यह है कि सिस्टम डेटा के मामले में अत्यधिक कुशल साबित हुआ; जब शोधकर्ताओं ने प्रशिक्षण के लिए उपलब्ध विशिष्ट रोबोट प्रदर्शनों की मात्रा को आधा कर दिया, तब भी विशाल मोशन डेटासेट पर पूर्व-प्रशिक्षित रोबند अन्य रोबोटों की तुलना में बेहतर प्रदर्शन करता रहा जिन्हें पूर्ण सेट के प्रदर्शनों पर प्रशिक्षित किया गया था।
इस दृष्टिकोण ने वातावरण में होने वाले परिवर्तनों को संभालने की उल्लेखनीय क्षमता भी प्रदर्शित की। जब शोधकर्ताओं ने लक्ष्य टोकरी को थोड़ा हिलाया या उन खिलौनों के रंग और आकार को बदल दिया जिन्हें रोबोट को उठाना था, तो सिस्टम ने तेजी से अनुकूलन किया, और उच्च प्रदर्शन बनाए रखा जहाँ अन्य मॉडल संघर्ष कर रहे थे। सिस्टम ने भविष्य का वीडियो उत्पन्न किए बिना यह उपलब्धि हासिल की, जो गणनात्मक रूप से महंगा और धीमा होता। इसके बजाय, इसने सीधे अपने स्वयं के जोड़ों की भविष्य की स्थिति की भविष्यवाणी की, जिससे यह लगभग 363 मिलीसेकंड में निर्णय लेने में सक्षम हुआ, जो वास्तविक समय के नियंत्रण के लिए पर्याप्त गति है। यह अध्ययन पुष्टि करता है कि हालांकि एक रोबोट मानव गतिविधियों की नकल नहीं कर सकता क्योंकि उसका शरीर अलग है, लेकिन वह अपने शरीर को चलाने के लिए एक मजबूत, भविष्य कहनेवाला (predictive) बोध विकसित करने के लिए मानव गति के विशाल पैटर्न से सीख सकता है। दुनिया में उपलब्ध मानव गति के प्रचुर डेटा का लाभ उठाकर, यह पद्धति ऐसे ह्यूमनॉइड रोबोट बनाने की दिशा में एक नया मार्ग प्रदान करती है जो न केवल जटिल कार्यों में सक्षम हैं, बल्कि उन्हें पहले की तुलना में बहुत कम प्रदर्शनों के साथ सीख भी सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।