← नवीनतम पेपर
💻 computer science

Multi-Domain Motion Embedding: Expressive Real-Time Mimicry for Legged Robots

यह शोध पत्र मल्टी-डोमेन मोशन एम्बेडिंग (MDME) प्रस्तुत करता है, जो एक नवीन मोशन रिप्रजेंटेशन है जो वेवलेट-आधारित एनकोडर और संभाव्य एम्बेडिंग के माध्यम से संरचित आवधिक (periodic) और असंरचित अनावर्ती (aperiodic) विशेषताओं को एकीकृत करता है ताकि विविध ह्यूमनॉइड और क्वाड्रुपेड रोबोटों में बिना किसी प्रति-मोशन ट्यूनिंग या ऑनलाइन रिटारगेटिंग के अभिव्यंजक, वास्तविक समय, ज़ीरो-शॉट मोशन इमिटेशन को सक्षम बनाया जा सके।

मूल लेखक: Matthias Heyrman, Chenhao Li, Victor Klemm, Dongho Kang, Stelian Coros, Marco Hutter

प्रकाशित 2026-09-16
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Matthias Heyrman, Chenhao Li, Victor Klemm, Dongho Kang, Stelian Coros, Marco Hutter

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से जीवित प्राणियों की प्राकृतिक तरलता के साथ चलने के लिए संघर्ष कर रहे हैं। जबकि इंजीनियर मशीनों को सीधी रेखाओं में चलने या सीढ़ियाँ चढ़ने के लिए प्रोग्राम कर सकते हैं, उन्हें मानव के जटिल, अभिव्यंजक हाव-भाव या किसी जानवर की अनूठी चाल की नकल करने के लिए सिखाना एक कठिन चुनौती बना हुआ है। मुख्य कठिनाई अनुवाद में निहित है: एक मानव शरीर और एक रोबोट का शरीर अलग तरह से बने होते हैं, जिनमें जोड़ों की संख्या और शारीरिक सीमाएं अलग होती हैं। पारंपरिक रूप से, रोबोट को मानव की नकल करने के लिए, शोधकर्ताओं को मानव की गतिविधियों को एक ऐसे कोड में मैन्युअल रूप से फिर से लिखना पड़ता था जिसे रोबोट समझ सके, यह प्रक्रिया एक कविता को शब्द-दर-शब्द ऐसी भाषा में अनुवाद करने के समान है जिसका व्याकरण पूरी तरह से अलग हो। यह मैन्युअल अनुवाद धीमा है, अक्सर गति के प्रवाह को तोड़ देता है, और तब विफल हो जाता है जब रोबोट किसी ऐसे नए प्रकार की गति का सामना करता है जिसे उसने पहले नहीं देखा है।

ETH ज्यूरिख के शोधकर्ताओं की एक टीम ने एक नया दृष्टिकोण विकसित किया है जो इस मैन्युअल अनुवाद को पूरी तरह से दरकिनार कर देता है। उन्होंने एक ऐसी प्रणाली बनाई है जो लेग्ड (पैर वाले) रोबोट को किसी मानव या जानवर को चलते हुए देखने और बिना किसी पूर्व-लिखित स्क्रिप्ट के अपने शरीर पर उस गति को तुरंत दोहराने के तरीके को समझने की अनुमति देती है। रोबोट को केवल विशिष्ट जोड़ों के कोणों की नकल करने के बजाय गति के अंतर्निहित लय और संरचना को पहचानने के लिए सिखाकर, शोधकर्ताओं ने मशीनों को वास्तविक समय में कच्चे वीडियो और मोशन डेटा से सीखने में सक्षम बनाया। यह कार्य एक ऐसे भविष्य का सुझाव देता है जहाँ रोबोट केवल उन्हें देखकर नए कौशल सीख सकते हैं, और अपने अद्वितीय भौतिक रूपों के अनुकूल तुरंत ढल सकते हैं।

मैथियास हेरमैन और सहयोगियों के नेतृत्व में शोधकर्ताओं ने उस समस्या पर ध्यान केंद्रित किया है जिसने वर्षों से इस क्षेत्र को उलझा रखा है: गति को इस तरह से कैसे प्रस्तुत किया जाए जो चलने के स्थिर, आवर्ती पैटर्न और एक हाव-भाव के अचानक, अप्रत्याशित बदलावों दोनों को पकड़ सके। पिछले तरीकों ने अक्सर इन दोनों पहलुओं को अलग-अलग माना या सभी गतिविधियों को एक एकल, कठोर गणितीय सांचे में डालने की कोशिश की। टीम ने महसूस किया कि प्राकृतिक गति दो चीजों का मिश्रण है: संरचित, आवर्ती पैटर्न जैसे चलते समय पैरों का लयबद्ध झूलना, और असंरचित, अपरिचित परिवर्तन जैसे कि अचानक मुड़ना या हाथ हिलाना। इसे हल करने के लिए, उन्होंने 'मल्टी-डोमेन मोशन एम्बेडिंग' नामक एक प्रणाली बनाई, जो गति के लिए एक दोहरी-लेंस वाले कैमरे की तरह कार्य करती है। एक लेंस गति के दोहराव वाले, तरंग-जैसे पैटर्न पर ध्यान केंद्रित करता है, जबकि दूसरा उन अराजक, अद्वितीय विवरणों को पकड़ता है जो प्रत्येक गति को विशिष्ट बनाते हैं।

मानव मुद्रा को रोबोट कमांड में मैन्युअल रूप से अनुवाद करने के बजाय, शोधकर्ताओं ने अपने सिस्टम में सीधे कच्चे मोशन डेटा को फीड किया। यह डेटा दो स्रोतों से आया था: विभिन्न तरीकों से चलते हुए मानव अभिनेताओं की रिकॉर्डिंग और कुत्तों के दौड़ने और चलने के वीडियो। सिस्टम इस जानकारी को दो समानांतर पथों के माध्यम से संसाधित करता है। पहला पथ 'वेवलेट ट्रांसफॉर्म' नामक एक गणितीय उपकरण का उपयोग करता है ताकि गति को उसके आवृत्ति घटकों में तोड़ा जा सके। यह रोबोट को गति की "बीट" को पहचानने, एक चाल या नृत्य की लयबद्ध चक्रों को पहचानने की अनुमति देता है। दूसरा पथ एक संभाव्य एनकोडर (प्रोबेबिलिस्टिक एनकोडर) का उपयोग करता है ताकि अव्यवस्थित, गैर-दोहराव वाले विवरणों को पकड़ा जा सके, जैसे कि किसी व्यक्ति के अचानक मुड़ने का विशिष्ट तरीका या ऊबड़-खाबड़ जमीन पर कुत्ते का अपना संतुलन बनाना। सूचना के ये दो स्ट्रीम गति के एक एकल, समृद्ध विवरण में संयोजित होते हैं जिसे रोबोट समझ सकता है।

इस प्रणाली का असली परीक्षण यह था कि क्या यह बिना मानवीय हस्तक्षेप के वास्तविक दुनिया में काम कर सकती है। शोधकर्ताओं ने सुदृढीकरण लर्निंग (रीइन्फोर्समेंट लर्निंग) का उपयोग करके एक सिम्युलेटेड वातावरण में अपने रोबटों को प्रशिक्षित किया, जो एक ऐसी विधि है जहाँ रोबोट इनाम को अधिकतम करने के लिए प्रयास और त्रुटि के माध्यम से सीखता है। उन्होंने एक ह्यूमनाइड रोबोट, 'फोरियर N1' को मानव गतिविधियों की नकल करने के लिए और एक क्वाड्रुपेड (चार पैरों वाला) रोबोट, 'ANYmal D' को कुत्ते की गतिविधियों की नकल करने के लिए सिखाया। महत्वपूर्ण रूप से, उन्होंने रोबोट को कोई पूर्व-प्रसंस्कृत, अनुवादित निर्देश प्रदान नहीं किए। रोबोटों को पूरी तरह से स्वयं यह पता लगाना था कि कच्चे मानव या पशु मोशन को अपने शरीर पर कैसे मैप किया जाए। परिणाम आश्चर्यजनक थे। सिमुलेशन में, रोबोटों ने सरल चलने से लेकर जटिल, अभिव्यंजक हाव-भावों तक, विविध प्रकार की गतिविधियों को सफलतापूर्वक ट्रैक किया, जिसमें सटीकता का स्तर पिछले तरीकों से अधिक था।

यह सिद्ध करने के लिए कि सिस्टम कंप्यूटर के बाहर काम करता है, टीम ने प्रशिक्षित नीतियों को वास्तविक हार्डवेयर पर तैनात किया। ह्यूमनाइड रोबोट ने एक मानव अभिनेता का वीडियो देखा और बिना किसी मैन्युअल कोड समायोजन के, चलने, मुड़ने और संकेत देने सहित गतिविधियों की नकल करना तुरंत शुरू कर दिया। इसी तरह, क्वाड्रुपेड रोबोट ने एक कुत्ते के फुटेज को देखा और जानवर की चाल को सफलतापूर्वक पुनरुत्पादित किया। इससे भी अधिक प्रभावशाली बात यह थी कि सिस्टम ने 'जीरो-शॉट लर्निंग' का प्रदर्शन किया, जिसका अर्थ है कि यह उन गतियों को भी संभाल सकता था जो उसने पहले कभी नहीं देखी थीं। जब इसे कुत्ते की एक नई चाल के सामने प्रस्तुत किया गया जो इसके प्रशिक्षण डेटा में नहीं थी, तो रोबोट विफल नहीं हुआ; इसके बजाय, इसने गति को एक स्थिर, व्यवहार्य संस्करण में अनुकूलित किया जो इसके अपने शरीर के लिए उपयुक्त था। यह क्षमता दर्शाती है कि सिस्टम ने केवल विशिष्ट मुद्राओं की सूची को याद करने के बजाय गति के मूलभूत सिद्धांतों को सीखा है।

शोधकर्ताओं ने पुराने तरीकों के विरुद्ध भी अपने नए तरीके की तुलना की जो मैन्युअल रिटारगेटिंग पर निर्भर थे। उन्होंने पाया कि जबकि पुराने तरीके उस गति की नकल करने में थोड़े अधिक सटीक हो सकते थे जिसके लिए उन्हें प्रशिक्षित किया गया था, वे नए या अप्रत्याशित आंदोलनों के सामने बुरी तरह विफल हो गए। इसके विपरीत, नया सिस्टम अनदेखी गतिविधियों की एक विस्तृत श्रृंखला में अपना प्रदर्शन बनाए रखने में सफल रहा। अध्ययन बताता है कि रोबोट को कठोर अनुवाद फिल्टर के माध्यम से भेजने के बजाय, कच्चे डेटा से सीधे गति की संरचना सीखने देने से, मशीन को गति की बहुत गहरी समझ प्राप्त होती है। यह दृष्टिकोण इंजीनियरों को हर नई गति के लिए नियम हाथ से बनाने की आवश्यकता को समाप्त कर देता है, जिससे रोबots के लिए प्राकृतिक दुनिया में पाई जाने वाली गति की विशाल विविधता से सीखने का मार्ग प्रशस्त होता है।

सबसे महत्वपूर्ण निष्कर्षों में से एक यह था कि सिस्टम ने रोबोट और अभिनेता के बीच के अंतर को कैसे संभाला। शोधकर्ताओं ने पाया कि रोबोट ने मानव से बिल्कुल मेल खाने के लिए अपने शरीर को एक असंभव आकार में जबरदस्ती फिट करने की कोशिश नहीं की। इसके बजाय, इसने गति की व्याख्या इस तरह से की जो इसकी अपनी संरचना के लिए भौतिक रूप से संभव थी। उदाहरण के लिए, जब एक मानव अभिनेता ने एक ऐसी गतिविधि की जो रोबोट के लिए अस्थिर होती, तो सिस्टम ने रोबोट को संतुलित रखने के लिए गति को समायोजित किया, प्रभावी रूप से गति के इरादे को "पुनर्व्याख्यायित" किया न कि सटीक ज्यामिति की नकल की। इस लचीलेपन ने विभिन्न आकारों के अभिनेताओं की नकल करते समय या जटिल, गतिशील कार्यों को करते समय रोबोट को स्थिर और कार्यात्मक रहने में सक्षम बनाया।

अध्ययन ने दोहरी-एन्कोडिंग वास्तुकला के महत्व पर भी प्रकाश डाला। जब शोधकर्ताओं ने एक में से एक लेंस को हटाकर सिस्टम का परीक्षण किया, तो प्रदर्शन काफी गिर गया। रोबोट गति की पूरी रेंज को पकड़ने में संघर्ष करता, या तो चाल की लयबद्ध स्थिरता को खो देता या हाव-भाव के अद्वितीय विवरणों को पकड़ने में विफल रहता। इसने पुष्टि की कि दोनों—संरचित, तरंग-जैसे पैटर्न और असंरचित, अराजक विवरण—गति की पूर्ण समझ के लिए आवश्यक हैं। सिस्टम इसलिए काम करता है क्योंकि यह इन दोनों को पूरक के रूप में मानता है, एक का उपयोग आधार प्रदान करने के लिए और दूसरे का आवश्यक विवरण जोड़ने के लिए करता है।

अंत में, यह कार्य रोबोट के सीखने के तरीके में एक बदलाव का प्रतिनिधित्व करता है। मानव गति को रोबोट कोड में अनुवाद करने के लिए इंजीनियरों पर निर्भर रहने के बजाय, शोधकर्ताओं ने दिखाया है कि रोबोट गति को सीधे समझना सीख सकते हैं। लयबद्ध पैटर्न को कैप्चर करने की विधि और अद्वितीय विविधताओं को कैप्चर करने की विधि को जोड़कर, उन्होंने एक ऐसी प्रणाली बनाई है जो मजबूत और लचीली है। अध्ययन में प्रदर्शित रोबोटों ने केवल एक स्क्रिप्ट का पालन नहीं किया; उन्होंने गति की भाषा को समझा और अपनी आवाज़ में बोलना सीखा। यह क्षमता एक ऐसे भविष्य का सुझाव देती है जहाँ रोबोट ऑन-द-फ्लाई (मौके पर) नए कौशल सीख सकते हैं, नए वातावरण और कार्यों के अनुकूल ढल सकते हैं, और उस स्तर की सहजता के साथ काम कर सकते हैं जो पहले पहुंच से बाहर थी। शोधकर्ता निष्कर्ष निकालते हैं कि यह दृष्टिकोण रोबोटिक नियंत्रण की अगली पीढ़ी के लिए एक ठोस आधार प्रदान करता है, जहाँ अवलोकन से सीखने की क्षमता एक दुर्लभ अपवाद के बजाय एक मानक विशेषता बन जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →