← नवीनतम पेपर
💻 computer science

Learning Multi-Modal Whole-Body Control for Real-World Humanoid Robots

यह शोध पत्र मास्कड ह्यूमनॉइड कंट्रोलर (MHC) को प्रस्तुत करता है, जो एक मल्टी-मोडल करिकुलम के माध्यम से प्रशिक्षित एक एकीकृत सीखा हुआ नियंत्रक है, जो वास्तविक दुनिया के ह्यूमनॉइड रोबोट्स को मास्कड टारगेट ट्रेजेक्टरीज पर आधारित एक एकल, लचीले इंटरफ़ेस के माध्यम से अनुकूलित प्रक्षेप पथों (ऑप्टिमाइज्ड ट्रेजेक्टरीज) से लेकर जॉयस्टिक टेलीऑपरेशन तक, विविध होल-बॉडी व्यवहार निष्पादित करने में सक्षम बनाता है।

मूल लेखक: Pranay Dugar, Aayam Shrestha, Fangzhou Yu, Bart van Marum, Alan Fern

प्रकाशित 2026-04-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pranay Dugar, Aayam Shrestha, Fangzhou Yu, Bart van Marum, Alan Fern

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को इंसान बनना सिखाने की कोशिश कर रहे हैं। सबसे बड़ी सिरदर्दी उसे यह सिखाना नहीं है कि कैसे चलें या कैसे मुक्का मारें; बल्कि उसे यह सिखाना है कि सुनना कैसे है।

आमतौर पर, रोबोट इंजीनियर अलग-अलग कार्यों के लिए अलग-अलग "कान" बनाते हैं। एक कान चलने के लिए जॉयस्टिक को सुनता है, दूसरा नाचने के लिए वीडियो को सुनता है, और तीसरा एक डिब्बा उठाने के लिए विशिष्ट निर्देशों के सेट को सुनता है। यदि रोबोट को नाचते हुए चलना है, तो आपको इन "कानों" के बीच स्विच करना पड़ता है, जो बहुत ही झंझट भरा, धीमा और त्रुटियों से भरा होता है।

यह पेपर एक नया रोबोट मस्तिष्क पेश करता है जिसे मास्क्ड ह्यूमनॉइड कंट्रोलर (MHC) कहा जाता है। इसे एक यूनिवर्सल ट्रांसलेटर के रूप में समझें जो किसी भी तरह के निर्देश को समझ सकता है, चाहे वह कितना भी अस्पष्ट या विशिष्ट क्यों न हो, और उसे सुचारू, पूर्ण-शरीर की गति में बदल सकता है।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. "खाली स्थान भरें" का खेल

मुख्य विचार मास्किंग (Masking) है। कल्पना कीजिए कि आप रोबोट को एक वर्कशीट देते हैं जिसमें एक व्यक्ति की जटिल मुद्रा (जैसे कि बॉक्सिंग पंच) का चित्र है।

  • परिदृश्य A (पूर्ण निर्देश): आप रोबोट को पूरा चित्र देते हैं। रोबोट बस उसकी हूबहू नकल करता है।
  • परिदृश्य B (आंशिक निर्देश): आप काले मार्कर से पैरों को ढक देते हैं (एक "मास्क")। आप रोबोट को केवल हाथ और धड़ दिखाते हैं। रोबोट को कहना होगा, "ठीक है, मैं देख सकता हूँ कि हाथ पंच मार रहे हैं, लेकिन मुझे नहीं पता कि पैर क्या कर रहे हैं। मैं अपने संतुलन को बनाए रखते हुए पंच मारने के लिए अपने पैरों को चलाने का सबसे अच्छा तरीका खुद ही निकाल लूँगा।"
  • परिदृश्य C (जॉयस्टिक मोड): आप हाथों और पैरों को ढक देते हैं, और केवल एक छोटा सा तीर छोड़ देते हैं जो "आगे बढ़ो" दिखाता है। रोबट यह समझ जाता है कि स्वाभाविक रूप से आगे बढ़ने के लिए अपने हाथ कैसे घुमाने हैं और कदम कैसे रखने हैं।

MHC का जादू यह है कि यह तीनों परिदृश्यों को संभालने के लिए एक ही मस्तिष्क का उपयोग करता है। इसे मोड बदलने की आवश्यकता नहीं है; यह बस देखता है कि कौन सी जानकारी गायब है और संतुलन और गति के लिए अपने सबसे अच्छे अनुमान के साथ "खाली स्थानों को भर" देता है।

2. ट्रेनिंग कैंप (द करिकुलम)

आप रोबोट को सीधे बॉक्सिंग रिंग में नहीं फेंक सकते और उम्मीद नहीं कर सकते कि वह सीख जाएगा। शोधकर्ताओं ने एक चतुर ट्रेनिंग कैंप दृष्टिकोण का उपयोग किया:

  • स्तर 1 (टॉडलर फेज - बच्चा बनने का चरण): उन्होंने रोबोट को केवल खड़ा होना और चलना सिखाया। उन्होंने उसे धीरे से धक्का दिया ताकि यह सुनिश्चित हो सके कि वह गिरे नहीं।
  • स्तर 2 (जिम्नास्ट फेज): उन्होंने कठिन धक्के जोड़े और उसे लंबे समय तक चलने के लिए प्रशिक्षित किया।
  • स्तर 3 (एक्टर फेज - अभिनेता बनने का चरण): अंत में, उन्होंने उसे "मास्क्ड" निर्देश दिए। उन्होंने उसे मानवीय गतिविधियों की नकल करना सिखाया, लेकिन कभी पैरों को छिपा दिया, कभी हाथों को, तो कभी पूरे शरीर को।

सरल से कठिन की ओर बढ़कर, रोबोट ने मजबूत (Robust) होना सीखा। उसने सीखा कि यदि उसे धक्का दिया जाता है, तो उसे केवल जम नहीं जाना चाहिए; उसे सीधा रहने के लिए अपने पैरों और हाथों को समायोजित करना चाहिए।

3. "सिम-टू-रियल" छलांग

वास्तविक दुनिया में रोबोट को प्रशिक्षित करना खतरनाक और धीमा है। यदि रोबोट गिरता है, तो वह टूट सकता है। इसलिए, शोधकर्ताओं ने पहले एक वीडियो गेम सिमुलेशन (MuJoCo) में MHC को प्रशिक्षित किया।

  • समस्या: वीडियो गेम में रोबोट एकदम सटीक होते हैं। वास्तविक रोबोट अव्यवस्थायुक्त होते हैं। उनमें घर्षण (friction), भारी बैटरी और डगमगाते जोड़ होते हैं।
  • समाधान: शोधकर्ताओं ने सिमुलेशन को "अराजक" (Chaotic) बना दिया। उन्होंने प्रशिक्षण के दौरान रोबोट का वजन, फर्श का फिसलन और मोटर की शक्ति को बेतरतीब ढंग से बदल दिया। यह एक एथलीट को तूफान में प्रशिक्षित करने जैसा है ताकि वह धूप वाले दिन दौड़ सके।
  • परिणाम: जब उन्होंने इस प्रशिक्षित मस्तिष्क को वास्तविक डिजिट V3 रोबोट (एक दो पैरों वाला रोबोट जो थोड़ा बहुत हाथ वाले चलते-फिरते कचरे के डिब्बे जैसा दिखता है) पर लगाया, तो यह काम कर गया! वह चल सकता था, बॉक्सिंग कर सकता था और यहाँ तक कि चलते हुए डिब्बा भी उठा सकता था, बिल्कुल वैसा ही जैसा उसने गेम में किया था।

4. यह क्यों महत्वपूर्ण है

इससे पहले, यदि आप चाहते थे कि एक रोबोट चले और डिब्बा उठाए, तो आपको दो अलग-अलग प्रोग्राम लिखने पड़ते थे और उम्मीद करनी पड़ती थी कि वे आपस में टकराकर क्रैश न हों।

  • पुराना तरीका: यह कार के लिए एक ड्राइवर और नक्शे के लिए एक अलग नेविगेटर होने जैसा है, और उन्हें आपस में बहस करनी पड़ती है कि प्रभारी कौन है।
  • नया तरीका (MHC): यह एक अकेले, सुपर-स्मार्ट ड्राइवर जैसा है जो नक्शा पढ़ सकता है, आपकी आवाज़ सुन सकता है और एक ही समय में सड़क को महसूस भी कर सकता है।

निचोड़

मास्क्ड ह्यूमनॉइड कंट्रोलर एक बड़ी सफलता है क्योंकि यह रोबोट को एक लचीली भाषा देता है। चाहे आप उसे जॉयस्टिक दें, वीडियो क्लिप दें, या निर्देशांकों का एक विशिष्ट सेट दें, रोबोट इरादे को समझता है और अपनी क्रियाविधि खुद तय करता है। यह उन रोबोटों की ओर एक बड़ा कदम है जो वास्तव में हमारे अस्त-व्यस्त, अप्रत्याशित वास्तविक जगत में हमारे साथ काम कर सकें, न कि केवल एक नियंत्रित कारखाने में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →