Make Tracking Easy: Neural Motion Retargeting for Humanoid Whole-body Control
यह शोध पत्र NMR को प्रस्तुत करता है, जो एक न्यूरल मोशन रिटारगेटिंग फ्रेमवर्क है जो गैर-उत्तल अनुकूलन (non-convex optimization) को क्लस्टर्ड एक्सपर्ट रिफाइनमेंट और एक CNN-Transformer आर्किटेक्चर का उपयोग करने वाले डेटा-संचालित, डायनेमिक्स-अवेयर दृष्टिकोण से बदल देता है ताकि ह्यूमनॉइड रोबोटों के लिए उच्च-निष्ठा (high-fidelity), टकराव-मुक्त मोशन संदर्भ उत्पन्न किए जा सकें, जिससे मानव-रोबोट एम्बॉडीमेंट अंतराल को पाटा जा सके और होल-बॉडी कंट्रोल लर्निंग को त्वरित किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को इंसान की तरह नाचना सिखाना चाहते हैं। आपके पास एक पेशेवर डांसर का वीडियो है, और आप चाहते हैं कि रोबोट उसकी हर हरकत की हुबहू नकल करे। यह सुनने में सरल लगता है, लेकिन वास्तव में यह इंजीनियरों के लिए एक बड़ा सिरदर्द है।
समस्या यह है: इंसान और रोबोट अलग-अलग तरह से बने होते हैं।
- इंसान लचीली रीढ़, एक ही दिशा में मुड़ने वाले घुटनों और चपटे होने वाले पैरों के साथ होते हैं।
- रोबोट (जैसे इस पेपर में यूनिट्री G1) सख्त होते हैं, उनके जोड़ कठोर सीमाओं वाले होते हैं, और वे अपने घुटने पीछे की ओर नहीं मोड़ सकते या हवा में तैर नहीं सकते।
यदि आप केवल रोबोट को "इंसान के घुटने के कोण की नकल करने" के लिए कहते हैं, तो रोबोट अपने घुटने को 180 डिग्री मोड़ने की कोशिश कर सकता है, अपना पैर तोड़ सकता है, या गिर सकता है क्योंकि इंसान का पैर वास्तव में हवा में तैर रहा था (कैमरा डेटा की एक गड़बड़ी)।
पुराना तरीका: "गड्ढे में फंसने" की समस्या
पारंपरिक रूप से, इंजीनियर इसे मैथ ऑप्टिमाइज़ेशन (गणितीय अनुकूलन) के माध्यम से हल करने की कोशिश करते थे। उन्होंने रोबोट के शरीर को एक पहेली की तरह माना, और हर जोड़ के लिए "परफेक्ट" कोण खोजने की कोशिश की ताकि वह इंसान से मेल खा सके।
लेखक बताते हैं कि यह गणित नॉन-कॉन्वेक्स (non-convex) है।
- उपमा: कल्पना कीजिए कि आप एक विशाल, धुंधले पहाड़ों की श्रृंखला में सबसे निचले बिंदु को खोजने की कोशिश कर रहे हैं जो गहरी घाटियों से भरा है। आप आंखों पर पट्टी बांधे हुए हैं और केवल अपने पैरों के नीचे की जमीन को महसूस कर सकते हैं। यदि आप ढलान की ओर एक कदम लेते हैं, तो आप तब तक चलते रहते हैं जब तक कि आप उस घाटी के तल तक न पहुँच जाएँ।
- समस्या: आपको लग सकता है कि आपने पहाड़ का निचला हिस्सा ढूंढ लिया है, लेकिन वास्तव में आप बस एक छोटे, उथले गड्ढे (एक "लोकल ऑप्टिमम") में फंसे हुए हैं। असली तल तक पहुँचने के लिए, आपको पहले एक पहाड़ी पर चढ़ना होगा। चूंकि गणित को ऊपर चढ़ने का पता नहीं होता, इसलिए रोबोट अजीब, टूटी हुई मुद्राओं में फंस जाता है। वह अचानक अपने जोड़ों को "कूद" (jump) सकता है या अपने पैरों को अपने ही शरीर के आर-पार ले जा सकता है (सेल्फ-पेनिट्रेशन)।
नया तरीका: NMR (न्यूरल मोशन रिटारगेटिंग)
लेखक, जो नैन्जिंग यूनिवर्सिटी और हुआवेई से हैं, एक नया समाधान प्रस्तावित करते हैं जिसे NMR कहा जाता है। हर एक फ्रेम के लिए गणितीय पहेली को हल करने के बजाय, वे एक न्यूरल नेटवर्क (एक प्रकार का AI) को यह "सीखने" के लिए प्रशिक्षित करते हैं कि मानव गतिविधियों को रोबोट की गतिविधियों में कैसे अनुवादित किया जाए।
इसे इस तरह सोचें:
- पुराना तरीका: हर कदम के सटीक भौतिकी (physics) की ऑन-द-फ्लाई गणना करना।
- नया तरीका: AI को "मानव चाल X" और "रोबोट चाल Y" के हजारों उदाहरण दिखाना जब तक कि वह उन्हें अनुवादित करने के "एहसास" को न सीख ले।
उन्होंने AI को कैसे प्रशिक्षित किया: "CEPR" फैक्ट्री
यहाँ पेचीदा हिस्सा है: AI को सिखाने के लिए, आपको "मानव चाल" के साथ "सही रोबोट चाल" के सटीक उदाहरणों की आवश्यकता होती है। लेकिन हमारे पास अभी ऐसे रोबोट नहीं हैं जो इंसानों की पूरी तरह नकल कर सकें!
इसलिए, उन्होंने CEPR नामक एक तीन-चरणीय डेटा फैक्ट्री बनाई:
- फ़िल्टर (कच्चे डेटा की सफाई):
उन्होंने हजारों मानव नृत्य वीडियो लिए। उनमें से कई में गड़बड़ियाँ थीं (जैसे पैरों का फर्श में धंस जाना या लोगों का अस्वाभाविक रूप से झटका लेना)। उन्होंने खराब और असंभव चालों को बाहर निकालने के लिए एक स्मार्ट फ़िल्टर का उपयोग किया।
- उपमा: एक टैलेंट स्काउट की तरह जो उन ऑडिशन टेपों को बाहर कर देता है जहाँ गायक बेसुरा है या डांसर लड़खड़ा रहा है।
- समूहीकरण (क्लस्टरिंग):
उन्होंने एक ही रोबोट को एक साथ सब कुछ सिखाने की कोशिश नहीं की। उन्होंने समान चालों को एक साथ समूहबद्ध किया (जैसे, सभी "कूदने" वाली चालें एक ढेर में, सभी "नाचने" वाली चालें दूसरे ढेर में)।
- उपमा: पूरे स्कूल के लिए एक सामान्य शिक्षक को नियुक्त करने के बजाय, उन्होंने एक "जंपिंग कोच", एक "डांसिंग कोच" और एक "रनिंग कोच" नियुक्त किया।
- परिष्करण (द फिजिक्स जिम):
यह जादुई कदम है। उन्होंने रीइन्फोर्समेंट लर्निंग (RL) का उपयोग किया—जहाँ एक AI वीडियो गेम में परीक्षण और त्रुटि (trial and error) से सीखता है—ताकि रोबोट वास्तव में एक भौतिक सिम्युलेटर में इन समूहों में दी गई चालों की नकल करने की कोशिश कर सके।
- यदि रोबोट ने कूदने की कोशिश की और गिर गया, तो AI ने सीखा "ऐसा मत करो।"
- यदि रोबोट सफलतापूर्वक लैंड हुआ, तो उस चाल को "गोल्ड स्टैंडर्ड" उदाहरण के रूप में सहेजा गया।
- परिणाम: उन्होंने "मानव चाल" और "भौतिक रूप से पूर्ण रोबोट चाल" के 30,000 जोड़े बनाए।
अंतिम उत्पाद: "स्मार्ट ट्रांसलेटर"
एक बार जब उनके पास यह परफेक्ट डेटासेट आ गया, तो उन्होंने एक ट्रांसफॉर्मर नेटवर्क (वही तकनीक जो चैटबॉट्स के पीछे है) को अनुवादक बनने के लिए प्रशिक्षित किया।
- इनपुट: एक मानव गति (भले ही मानव डेटा थोड़ा अस्थिर या शोर वाला हो)।
- प्रक्रिया: AI गति के पूरे अनुक्रम (sequence) को देखता है, न कि केवल एक फ्रेम को। यह "ग्लोबल कॉन्टेक्स्ट" का उपयोग करता है।
- उपमा: यदि आप एक सेकंड के लिए किसी इंसान को लड़खड़ाते हुए देखते हैं, तो एक बुरा अनुवादक रोबोट को भी लड़खड़ाने पर मजबूर कर सकता है। एक स्मार्ट अनुवादक (NMR) उस लड़खड़ाहट को देखता है, समझ जाता है कि इंसान संभल रहा है, और रोबोट को इसे सुचारू बनाने के लिए निर्देशित करता है ताकि वह गिरे नहीं।
- आउटपुट: रोबोट के लिए एक सुचारू, सुरक्षित और भौतिक रूप से संभव गति।
यह क्यों महत्वपूर्ण है (परिणाम)
जब उन्होंने इसका परीक्षण Unitree G1 रोबोट (एक ह्युमनॉइड रोबोट जो इंसान जैसा दिखता है) पर किया:
- कोई "ग्लिच जंप" नहीं: रोबोट के जोड़ों ने अचानक अजीब कोणों पर झटके नहीं लिए।
- कोई "घोस्ट लेग्स" नहीं: रोबोट के पैर उसके अपने शरीर के आर-पार नहीं गए।
- बेहतर सीखना: क्योंकि रोबोट के संदर्भ मोशन (reference motions) बहुत साफ थे, रोबोट जटिल कार्यों (जैसे मार्शल आर्ट्स या नृत्य) को बहुत तेज़ी से सीखने में सक्षम रहा।
एक वाक्य में सारांश
लेखकों ने हर सेकंड की गति के लिए एक टूटे हुए गणितीय पहेली को हल करने की कोशिश करना छोड़ दिया और इसके बजाय एक "स्मार्ट ट्रांसलेटर" बनाया जिसे भौतिकी-सिम्युलेटेड जिम द्वारा प्रशिक्षित किया गया था, जिससे रोबोट सुचारू रूप से, सुरक्षित रूप से और बिना अपने शरीर को नुकसान पहुँचाए मानव चालों को सीख सका।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।