← नवीनतम पेपर
💻 computer science

Make Tracking Easy: Neural Motion Retargeting for Humanoid Whole-body Control

यह शोध पत्र NMR को प्रस्तुत करता है, जो एक न्यूरल मोशन रिटारगेटिंग फ्रेमवर्क है जो गैर-उत्तल अनुकूलन (non-convex optimization) को क्लस्टर्ड एक्सपर्ट रिफाइनमेंट और एक CNN-Transformer आर्किटेक्चर का उपयोग करने वाले डेटा-संचालित, डायनेमिक्स-अवेयर दृष्टिकोण से बदल देता है ताकि ह्यूमनॉइड रोबोटों के लिए उच्च-निष्ठा (high-fidelity), टकराव-मुक्त मोशन संदर्भ उत्पन्न किए जा सकें, जिससे मानव-रोबोट एम्बॉडीमेंट अंतराल को पाटा जा सके और होल-बॉडी कंट्रोल लर्निंग को त्वरित किया जा सके।

मूल लेखक: Qingrui Zhao, Kaiyue Yang, Xiyu Wang, Shiqi Zhao, Yi Lu, Xinfang Zhang, Wei Yin, Qiu Shen, Xiao-Xiao Long, Xun Cao

प्रकाशित 2026-04-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qingrui Zhao, Kaiyue Yang, Xiyu Wang, Shiqi Zhao, Yi Lu, Xinfang Zhang, Wei Yin, Qiu Shen, Xiao-Xiao Long, Xun Cao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को इंसान की तरह नाचना सिखाना चाहते हैं। आपके पास एक पेशेवर डांसर का वीडियो है, और आप चाहते हैं कि रोबोट उसकी हर हरकत की हुबहू नकल करे। यह सुनने में सरल लगता है, लेकिन वास्तव में यह इंजीनियरों के लिए एक बड़ा सिरदर्द है।

समस्या यह है: इंसान और रोबोट अलग-अलग तरह से बने होते हैं।

  • इंसान लचीली रीढ़, एक ही दिशा में मुड़ने वाले घुटनों और चपटे होने वाले पैरों के साथ होते हैं।
  • रोबोट (जैसे इस पेपर में यूनिट्री G1) सख्त होते हैं, उनके जोड़ कठोर सीमाओं वाले होते हैं, और वे अपने घुटने पीछे की ओर नहीं मोड़ सकते या हवा में तैर नहीं सकते।

यदि आप केवल रोबोट को "इंसान के घुटने के कोण की नकल करने" के लिए कहते हैं, तो रोबोट अपने घुटने को 180 डिग्री मोड़ने की कोशिश कर सकता है, अपना पैर तोड़ सकता है, या गिर सकता है क्योंकि इंसान का पैर वास्तव में हवा में तैर रहा था (कैमरा डेटा की एक गड़बड़ी)।

पुराना तरीका: "गड्ढे में फंसने" की समस्या

पारंपरिक रूप से, इंजीनियर इसे मैथ ऑप्टिमाइज़ेशन (गणितीय अनुकूलन) के माध्यम से हल करने की कोशिश करते थे। उन्होंने रोबोट के शरीर को एक पहेली की तरह माना, और हर जोड़ के लिए "परफेक्ट" कोण खोजने की कोशिश की ताकि वह इंसान से मेल खा सके।

लेखक बताते हैं कि यह गणित नॉन-कॉन्वेक्स (non-convex) है।

  • उपमा: कल्पना कीजिए कि आप एक विशाल, धुंधले पहाड़ों की श्रृंखला में सबसे निचले बिंदु को खोजने की कोशिश कर रहे हैं जो गहरी घाटियों से भरा है। आप आंखों पर पट्टी बांधे हुए हैं और केवल अपने पैरों के नीचे की जमीन को महसूस कर सकते हैं। यदि आप ढलान की ओर एक कदम लेते हैं, तो आप तब तक चलते रहते हैं जब तक कि आप उस घाटी के तल तक न पहुँच जाएँ।
  • समस्या: आपको लग सकता है कि आपने पहाड़ का निचला हिस्सा ढूंढ लिया है, लेकिन वास्तव में आप बस एक छोटे, उथले गड्ढे (एक "लोकल ऑप्टिमम") में फंसे हुए हैं। असली तल तक पहुँचने के लिए, आपको पहले एक पहाड़ी पर चढ़ना होगा। चूंकि गणित को ऊपर चढ़ने का पता नहीं होता, इसलिए रोबोट अजीब, टूटी हुई मुद्राओं में फंस जाता है। वह अचानक अपने जोड़ों को "कूद" (jump) सकता है या अपने पैरों को अपने ही शरीर के आर-पार ले जा सकता है (सेल्फ-पेनिट्रेशन)।

नया तरीका: NMR (न्यूरल मोशन रिटारगेटिंग)

लेखक, जो नैन्जिंग यूनिवर्सिटी और हुआवेई से हैं, एक नया समाधान प्रस्तावित करते हैं जिसे NMR कहा जाता है। हर एक फ्रेम के लिए गणितीय पहेली को हल करने के बजाय, वे एक न्यूरल नेटवर्क (एक प्रकार का AI) को यह "सीखने" के लिए प्रशिक्षित करते हैं कि मानव गतिविधियों को रोबोट की गतिविधियों में कैसे अनुवादित किया जाए।

इसे इस तरह सोचें:

  • पुराना तरीका: हर कदम के सटीक भौतिकी (physics) की ऑन-द-फ्लाई गणना करना।
  • नया तरीका: AI को "मानव चाल X" और "रोबोट चाल Y" के हजारों उदाहरण दिखाना जब तक कि वह उन्हें अनुवादित करने के "एहसास" को न सीख ले।

उन्होंने AI को कैसे प्रशिक्षित किया: "CEPR" फैक्ट्री

यहाँ पेचीदा हिस्सा है: AI को सिखाने के लिए, आपको "मानव चाल" के साथ "सही रोबोट चाल" के सटीक उदाहरणों की आवश्यकता होती है। लेकिन हमारे पास अभी ऐसे रोबोट नहीं हैं जो इंसानों की पूरी तरह नकल कर सकें!

इसलिए, उन्होंने CEPR नामक एक तीन-चरणीय डेटा फैक्ट्री बनाई:

  1. फ़िल्टर (कच्चे डेटा की सफाई):
    उन्होंने हजारों मानव नृत्य वीडियो लिए। उनमें से कई में गड़बड़ियाँ थीं (जैसे पैरों का फर्श में धंस जाना या लोगों का अस्वाभाविक रूप से झटका लेना)। उन्होंने खराब और असंभव चालों को बाहर निकालने के लिए एक स्मार्ट फ़िल्टर का उपयोग किया।
  • उपमा: एक टैलेंट स्काउट की तरह जो उन ऑडिशन टेपों को बाहर कर देता है जहाँ गायक बेसुरा है या डांसर लड़खड़ा रहा है।
  1. समूहीकरण (क्लस्टरिंग):
    उन्होंने एक ही रोबोट को एक साथ सब कुछ सिखाने की कोशिश नहीं की। उन्होंने समान चालों को एक साथ समूहबद्ध किया (जैसे, सभी "कूदने" वाली चालें एक ढेर में, सभी "नाचने" वाली चालें दूसरे ढेर में)।
  • उपमा: पूरे स्कूल के लिए एक सामान्य शिक्षक को नियुक्त करने के बजाय, उन्होंने एक "जंपिंग कोच", एक "डांसिंग कोच" और एक "रनिंग कोच" नियुक्त किया।
  1. परिष्करण (द फिजिक्स जिम):
    यह जादुई कदम है। उन्होंने रीइन्फोर्समेंट लर्निंग (RL) का उपयोग किया—जहाँ एक AI वीडियो गेम में परीक्षण और त्रुटि (trial and error) से सीखता है—ताकि रोबोट वास्तव में एक भौतिक सिम्युलेटर में इन समूहों में दी गई चालों की नकल करने की कोशिश कर सके।
  • यदि रोबोट ने कूदने की कोशिश की और गिर गया, तो AI ने सीखा "ऐसा मत करो।"
  • यदि रोबोट सफलतापूर्वक लैंड हुआ, तो उस चाल को "गोल्ड स्टैंडर्ड" उदाहरण के रूप में सहेजा गया।
  • परिणाम: उन्होंने "मानव चाल" और "भौतिक रूप से पूर्ण रोबोट चाल" के 30,000 जोड़े बनाए।

अंतिम उत्पाद: "स्मार्ट ट्रांसलेटर"

एक बार जब उनके पास यह परफेक्ट डेटासेट आ गया, तो उन्होंने एक ट्रांसफॉर्मर नेटवर्क (वही तकनीक जो चैटबॉट्स के पीछे है) को अनुवादक बनने के लिए प्रशिक्षित किया।

  • इनपुट: एक मानव गति (भले ही मानव डेटा थोड़ा अस्थिर या शोर वाला हो)।
  • प्रक्रिया: AI गति के पूरे अनुक्रम (sequence) को देखता है, न कि केवल एक फ्रेम को। यह "ग्लोबल कॉन्टेक्स्ट" का उपयोग करता है।
    • उपमा: यदि आप एक सेकंड के लिए किसी इंसान को लड़खड़ाते हुए देखते हैं, तो एक बुरा अनुवादक रोबोट को भी लड़खड़ाने पर मजबूर कर सकता है। एक स्मार्ट अनुवादक (NMR) उस लड़खड़ाहट को देखता है, समझ जाता है कि इंसान संभल रहा है, और रोबोट को इसे सुचारू बनाने के लिए निर्देशित करता है ताकि वह गिरे नहीं।
  • आउटपुट: रोबोट के लिए एक सुचारू, सुरक्षित और भौतिक रूप से संभव गति।

यह क्यों महत्वपूर्ण है (परिणाम)

जब उन्होंने इसका परीक्षण Unitree G1 रोबोट (एक ह्युमनॉइड रोबोट जो इंसान जैसा दिखता है) पर किया:

  • कोई "ग्लिच जंप" नहीं: रोबोट के जोड़ों ने अचानक अजीब कोणों पर झटके नहीं लिए।
  • कोई "घोस्ट लेग्स" नहीं: रोबोट के पैर उसके अपने शरीर के आर-पार नहीं गए।
  • बेहतर सीखना: क्योंकि रोबोट के संदर्भ मोशन (reference motions) बहुत साफ थे, रोबोट जटिल कार्यों (जैसे मार्शल आर्ट्स या नृत्य) को बहुत तेज़ी से सीखने में सक्षम रहा।

एक वाक्य में सारांश

लेखकों ने हर सेकंड की गति के लिए एक टूटे हुए गणितीय पहेली को हल करने की कोशिश करना छोड़ दिया और इसके बजाय एक "स्मार्ट ट्रांसलेटर" बनाया जिसे भौतिकी-सिम्युलेटेड जिम द्वारा प्रशिक्षित किया गया था, जिससे रोबोट सुचारू रूप से, सुरक्षित रूप से और बिना अपने शरीर को नुकसान पहुँचाए मानव चालों को सीख सका।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →