← नवीनतम पेपर
💻 computer science

MuGen: Multi-Skill Generative Locomotion Controller for Humanoid Robots

यह शोध पत्र MuGen प्रस्तुत करता है, जो एक डेटा-संचालित ढांचा (framework) है जो वेक्टर-क्वांटाइज्ड ऑटोएनकोडर्स और टीचर-स्टूडेंट पॉलिसी डिस्टिलेशन का लाभ उठाकर ह्युमनॉइड रोबोट्स को विषम मोशन डेटा से विविध, अभिव्यंजक मानव-समान लोकोमोशन कौशल सीखने, प्रतिनिधित्व करने और निष्पादित करने में सक्षम बनाता है।

मूल लेखक: Yusen Feng, Xiang Wang, Heyuan Yao, Zixi Kang, Xinyu Huo, Boyang Yu, Pengyun Qiu, Ruijie Zhao, Baoquan Chen, Libin Liu

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yusen Feng, Xiang Wang, Heyuan Yao, Zixi Kang, Xinyu Huo, Boyang Yu, Pengyun Qiu, Ruijie Zhao, Baoquan Chen, Libin Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ MuGen पेपर का स्पष्टीकरण है, जिसे सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।

मुख्य विचार: रोबोट को बिना किसी स्क्रिप्ट के नाचना सिखाना

कल्पना कीजिए कि आप एक रोबोट को इंसान की तरह चलने, दौड़ने या नाचने के लिए सिखाना चाहते हैं। आमतौर पर, इंजीनियरों को रोबोट को चलाने के लिए हज़ारों जटिल नियम लिखने पड़ते हैं (जैसे "पैर को 30 डिग्री उठाएं," "वजन यहाँ संतुलित करें")। यह प्रक्रिया धीमी है, इसे सही करना कठिन है, और यदि ज़मीन एकदम सटीक नहीं है, तो रोबोट अक्सर गिर जाता है।

MuGen पेपर रोबोट को सिखाने का एक नया तरीका पेश करता है। नियम लिखने के बजाय, वे रोबोट को इंसानों को देखकर सीखने देते हैं, ठीक वैसे ही जैसे एक बच्चा अपने माता-पिता को देखकर चलना सीखता है। लेकिन उन्होंने केवल गतिविधियों की नकल नहीं कराई; उन्होंने रोबोट को गति के सार (essence) को समझने के योग्य बनाया ताकि वह कठिन रास्तों पर भी खुद से वह काम कर सके।

मूल समस्या: "शिक्षक" बनाम "छात्र"

शोधकर्ताओं को एक पेचीदा स्थिति का सामना करना पड़ा:

  1. शिक्षक (The Teacher): कंप्यूटर सिमुलेशन में, रोबोट के पास "सुपरपावर्स" होती हैं। उसे पता होता है कि वह दुनिया में कहाँ है, उसकी गति कितनी है, और ज़मीन कैसी महसूस हो रही है। वह जटिल मूव्स आसानी से सीख सकता है।
  2. छात्र (The Student): असली रोबोट (Unitree G1) के पास ये सुपरपावर्स नहीं हैं। उसके पास केवल अपने शरीर पर लगे कैमरे और सेंसर हैं। वह सिमुलेशन की तरह "बड़ी तस्वीर" (big picture) नहीं देख सकता।

यदि आप केवल "शिक्षक" (सिमुलेशन रोबोट) को लेकर असली रोबोट पर डाल देंगे, तो वह क्रैश हो जाएगा क्योंकि वह उस जानकारी पर निर्भर है जो उसके पास उपलब्ध ही नहीं है।

समाधान: एक "जादुई शब्दकोश" (The VQ-VAE)

इस समस्या को हल करने के लिए, MuGen एक चतुर तीन-चरणीय प्रक्रिया का उपयोग करता है जिसमें एक शिक्षक, एक छात्र और एक जादुई शब्दकोश शामिल है।

1. शिक्षक मूव्स सीखता है (द शेफ/रसोइया)

सबसे पहले, "शिक्षक" रोबोट एक आदर्श कंप्यूटर दुनिया में रहता है। वह मानव गति (चलना, दौड़ना, नाचना) के घंटों के डेटा को देखता है।

  • उपमा: कल्पना कीजिए कि एक मास्टर शेफ एक जटिल स्टू (stew) का स्वाद ले रहा है। नमक और काली मिर्च के हर एक दाने को याद करने के बजाय, शेफ उस स्वाद के प्रोफाइल को समझ लेता है।
  • तकनीक: रोबक एक VQ-VAE नामक सिस्टम का उपयोग करता है। इसे एक जादुई शब्दकोश की तरह समझें। यह जटिल मानवीय गतिविधियों को संक्षिप्त, सरल कोड में बदल देता है (जैसे "कोड 42" का अर्थ है "आगे चलें" या "कोड 99" का अर्थ है "उकड़ू बैठें")। यह शब्दकोश यह सुनिश्चित करता है कि रोबोट केवल वही मूव्स सीखे जो शारीरिक रूप से संभव और सुरक्षित हों।

2. छात्र शब्दकोश पढ़ना सीखता है (द अप्रेंटिस/चेला)

अब, "छात्र" रोबोट (जो वास्तविक दुनिया में जाएगा) को सीखने की आवश्यकता है। लेकिन वह शिक्षक की तरह "बड़ी तस्वीर" नहीं देख सकता।

  • उपमा: छात्र एक ऐसे प्रशिक्षु (apprentice) की तरह है जो अभी तक पूरे बर्तन का स्वाद नहीं ले सकता। इसके बजाय, मास्टर शेफ (शिक्षक) छात्र के कान में जादुई शब्दकोश से निकला कोड फुसफुसाता है। छात्र सीखता है: "जब मैं अपने शरीर को इस तरह चलते हुए महसूस करूँ, तो मुझे कोड 42 का उपयोग करना चाहिए।"
  • तकनीक: शोधकर्ता एक Teacher-Student framework का उपयोग करते हैं। शिक्षक साझा जादुई शब्दकोश का उपयोग करके छात्र का मार्गदर्शन करता है। छात्र केवल अपने शरीर के अहसास (proprioception) के माध्यम से सही "कोड" का अनुमान लगाना सीख जाता है, बिना उन सुपर-सेंसर्स के जिनकी ज़रूरत शिक्षक को होती है।

3. सुचारू हैंडओवर (द ग्रेजुएशन/दीक्षांत समारोह)

आप अचानक शिक्षक को बंद करके छात्र को चालू नहीं कर सकते; छात्र घबराकर गिर सकता है।

  • उपमा: कल्पना कीजिए कि आप किसी को साइकिल चलाना सिखा रहे हैं। आप तुरंत सीट छोड़ कर नहीं हट जाते। आप पहले पकड़ कर रखते हैं, फिर एक सेकंड के लिए छोड़ते हैं, फिर पकड़ते हैं, और धीरे-धीरे अधिक छोड़ते जाते हैं जब तक कि वे अकेले सवारी न करने लगें।
  • तकनीक: वे एक Progressive Scheduling रणनीति का उपयोग करते हैं। वे शिक्षक के नियंत्रण और छात्र के नियंत्रण को आपस में मिलाते हैं। शुरुआत में, शिक्षक 90% काम करता है। धीरे-धीरे, समय के साथ, छात्र 100% नियंत्रण संभाल लेता है। यह सुनिश्चित करता है कि सीखने की प्रक्रिया के दौरान रोबोट कभी "खोया हुआ" महसूस न करे।

उन्होंने क्या हासिल किया?

पेपर दिखाता है कि यह तरीका अविश्वसनीय रूप से अच्छा काम करता है:

  • मजबूती (Robustness): रोबोट वास्तविक Unitree G1 रोबोट पर चल सकता है, दौड़ सकता है और यहाँ तक कि नाच भी सकता है।
  • सामान्यीकरण (Generalization): यदि वे रोबोट को चलने के डेटासेट पर प्रशिक्षित करते हैं, तो वह दौड़ने या झुककर चलने का तरीका भी समझ सकता है, भले ही उसने प्रशिक्षण के दौरान उन विशिष्ट मूव्स को न देखा हो। वह केवल विशिष्ट शब्दों को नहीं, बल्कि गति की भाषा को समझता है।
  • कोई "जादुई" नियम नहीं: उन्हें रोबोट को संतुलन बनाने के लिए जटिल गणितीय समीकरण लिखने की आवश्यकता नहीं पड़ी। रोबोट ने मानव डेटा की नकल करके स्वाभाविक रूप से संतुलन बनाना सीखा।

सीमाएँ (वह क्या नहीं कर सकता)

लेखक ईमानदार हैं कि सिस्टम अभी क्या नहीं कर सकता:

  • स्थिर खड़ा होना: रोबोट बिल्कुल स्थिर खड़े होने में संघर्ष करता है। क्योंकि "जादुई शब्दकोश" को गतिमान डेटा (चलना, दौड़ना) पर प्रशिक्षित किया गया था, इसलिए जब रोबोट को कुछ न करने के लिए कहा जाता है, तो वह भ्रमित हो जाता है। वह जमने के बजाय थोड़ा हिलने या टहलने लगता है।
  • सिमुलेशन बनाम वास्तविकता: हालांकि रोबोट वास्तविक दुनिया में काम करता है, लेकिन वह अभी भी सीखने के लिए कंप्यूटर सिमुलेशन पर निर्भर है। एक आदर्श कंप्यूटर दुनिया और एक अस्त-व्यस्त वास्तविक दुनिया के बीच एक अंतर है, हालांकि उन्होंने चलने और नाचने के लिए इसे पर्याप्त रूप से पाट लिया है।

सारांश

MuGen एक रोबोट स्कूल की तरह है जहाँ एक सुपर-स्मार्ट "शिक्षक" (कंप्यूटर में) मानव वीडियो से सीखता है और उन पाठों को एक सरल कोडबुक में संकुचित करता है। एक "छात्र" (असली रोबोट) केवल अपने शरीर के सेंसर का उपयोग करके उस कोडबुक को पढ़ना सीखता है। एक कोमल और क्रमिक हैंडओवर के माध्यम से, छात्र अपने आप चलना, दौड़ना और नाचना सीख जाता है, जो यह साबित करता है कि रोबोट इंजीनियरों द्वारा हर नियम लिखे बिना, केवल इंसानों को "देखकर और नकल करके" जटिल कौशल सीख सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →