← नवीनतम पेपर
🤖 AI

Multi-Gait Learning for Humanoid Robots Using Reinforcement Learning with Selective Adversarial Motion Prior

यह शोध पत्र एक एकीकृत सुदृढीकरण शिक्षण (reinforcement learning) ढांचे के भीतर एक चयनात्मक एडवर्सरियल मोशन प्रायर (AMP) रणनीति प्रस्तुत करता है जो स्थिरता-महत्वपूर्ण गतिविधियों के लिए AMP को लागू करते हुए अत्यधिक गतिशील क्रियाओं के लिए इसे छोड़ देता है, जिससे एक ह्यूमनॉइड रोबोट को पांच विशिष्ट चालों में महारत हासिल करने में सक्षम बनाया जा सके, और इस प्रकार समान AMP दृष्टिकोणों की तुलना में बेहतर अभिसरण (convergence), ट्रैकिंग सटीकता और सिम-टू-रियल स्थानांतरण प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Yuanye Wu, Keyi Wang, Linqi Ye, Boyang Xing

प्रकाशित 2026-04-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuanye Wu, Keyi Wang, Linqi Ye, Boyang Xing

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक बेहतरीन मानव अनुकरणकर्ता (human imitator) बनने के लिए सिखा रहे हैं। आप चाहते हैं कि वह पाँच बहुत अलग काम करे: सामान्य रूप से चलना, एक सैनिक की तरह मार्च करना (गूस-स्टेप), तेज़ी से दौड़ना, सीढ़ियाँ चढ़ना और ऊँचा कूदना।

समस्या यह है कि ये क्रियाएं एक रोबोट के मस्तिष्क के लिए बहुत अलग महसूस होती हैं। चलना संतुलन बनाए रखने के बारे में है; दौड़ना विस्फोटक शक्ति के बारे में है; कूदना गुरुत्वाकर्षण को चुनौती देने के बारे में है। यदि आप एक ही सख्त नियमों का उपयोग करके उन्हें एक साथ सिखाने की कोशिश करते हैं, तो रोबोट भ्रमित हो जाएगा। वह शायद दौड़ने की तरह चलने लगेगा, या मार्च करने की तरह कूदने लगेगा।

यह शोध पत्र एक चतुर समाधान प्रस्तुत करता है: रोबोट के लिए एक "चयनात्मक कोच" (Selective Coach)।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. एकीकृत "जिम" (The Framework)

पाँच अलग-अलग रोबोट या पाँच अलग-अलग कार्यों के लिए पाँच अलग-अलग मस्तिष्क बनाने के बजाय, शोधकर्ताओं ने एक ही एकल रोबोट मस्तिष्क बनाया और उसे एक वर्चुअल जिम (सिमुलेशन) में रखा।

  • उपमा: इसे एक ऐसे अकेले अभिनेता के रूप में सोचें जिसे एक नाटक में पाँच अलग-अलग भूमिकाएँ निभानी हैं। वे अपना कॉस्ट्यूम या अपने स्क्रिप्ट स्ट्रक्चर को नहीं बदलते; वे बस अपने अंदाज और निर्देशों को बदलते हैं।
  • यह कैसे काम करता है: रोबलेट सभी पाँचों कार्यों के लिए एक ही सेंसर और एक ही "मांसपेशियों" (जोड़ों) का उपयोग करता है। केवल एक ही चीज़ बदलती है, और वह है "लक्ष्य गति" (target motion) जिसे वह कॉपी करने की कोशिश कर रहा है।

2. "चयनात्मक कोच" (The Core Innovation)

यह इस शोध पत्र का सबसे महत्वपूर्ण हिस्सा है। उन्होंने एडवर्सियल मोशन प्रायर (AMP) नामक तकनीक का उपयोग किया।

  • AMP क्या है? कल्पना कीजिए कि एक सख्त डांस इंस्ट्रक्टर एक आदर्श मानव नर्तक का वीडियो देखता है। इंस्ट्रक्टर रोबोट को देखता है और कहता है, "हे, तुम्हारा हाथ अजीब तरह से हिल रहा है! मानव वीडियो को देखो; बिल्कुल वैसा ही करो जैसा उसमें दिखाया गया है।" यह रोबोट को तेज़ी से सुचारू और प्राकृतिक हरकतें सीखने में मदद करता है।
  • समस्या: कभी-कभी, ऐसा सख्त इंस्ट्रक्टर एक बुरा विचार होता है। यदि आप रोबोट को दौड़ने या कूदने के लिए सिखा रहे हैं, तो उसे एक सामान्य मानव वीडियो की तुलना में अपने पैरों को अधिक फैलाना होगा और अधिक तेज़ी से हिलना होगा। यदि सख्त इंस्ट्रक्टर कहता रहता है, "नहीं, यह बहुत अधिक है! वापस मानव वीडियो की तरह चलो!" तो रोबोट कभी भी तेज़ नहीं दौड़ पाएगा या ऊँचा नहीं कूद पाएगा। वह एक धीमी, सुरक्षित चाल में ही फँसा रह जाएगा।

समाधान: शोधकर्ताओं ने एक चयनात्मक कोच (Selective Coach) बनाया।

  • चलने, मार्च करने और सीढ़ियाँ चढ़ने के लिए: कोच चालू (ON) है। ये स्थिर, लयबद्ध कार्य हैं। रोबोट को स्थिर और प्राकृतिक दिखने की आवश्यकता है। कोच इसे डगमगाने और गिरने से बचने में मदद करता है।
  • दौड़ने और कूदने के लिए: कोच बंद (OFF) है। रोबोट को बताया जाता है, "एक सेकंड के लिए वीडियो को भूल जाओ। बस जितनी हो सके उतनी तेज़ और ऊँची छलांग लगाओ!" यह रोबोट को उन चरम गतिविधियों (extreme movements) को खोजने की स्वतंत्रता देता है जो एक सामान्य मानव वीडियो में नहीं दिखाई दे सकतीं।

3. "ज़ीरो-शॉट" जादू (Sim-to-Real)

आमतौर पर, जब आप कंप्यूटर सिमुलेशन में एक रोबोट को प्रशिक्षित करते हैं, तो जैसे ही आप उसे वास्तविक दुनिया में रखते हैं, वह गिर जाता है क्योंकि फर्श अलग महसूस होता है, या मोटर थोड़ी कमजोर होती है।

  • उपमा: यह वीडियो गेम में बास्केटबॉल खेलने के अभ्यास करने और फिर वास्तविक NBA में खेलने की कोशिश करने जैसा है। भौतिकी (physics) अलग है।
  • सुधार: प्रशिक्षण के दौरान, शोधकर्ताओं ने सब कुछ "रैंडमाइज" (randomize) कर दिया। उन्होंने रोबोट को भारी, हल्का, फर्श फिसलन भरा, या मोटर कमजोर बना दिया। उन्होंने रोबोट के सोचने के समय में नकली देरी (fake delays) भी जोड़ दी।
  • परिणाम: क्योंकि रोबोट ने एक "अराजक" (chaotic) वर्चुअल दुनिया में अभ्यास किया, इसलिए वह बेहद मजबूत बन गया। जब उन्होंने इसे वास्तविक रोबोट पर लगाया, तो इसे किसी अतिरिक्त ट्यूनिंग की आवश्यकता नहीं थी। यह तुरंत काम करने लगा। इसे ज़ीरो-शॉट ट्रांसफर (Zero-Shot Transfer) कहा जाता है।

4. परिणाम

टीम ने इस पर एक वास्तविक रोबोट (एक 12-जोड़ वाला ह्यूमनॉइड निचला शरीर) पर परीक्षण किया और यह सभी पाँचों गतियों के लिए सफल रहा:

  • चलना और मार्च करना: रोबोट सुचारू, स्थिर था और डगमगाया नहीं (कोच "चालू" रहने के कारण)।
  • दौड़ना और कूदना: रोबोट विस्फोटक और फुर्तीला था, उसने ऐसी गति और ऊँचाई प्राप्त की जो वह तब नहीं पा सकता था यदि "कोच" उसे सामान्य सीमाओं के भीतर रहने के लिए टोकता रहता (कोच "बंद" रहने के कारण)।
  • सीढ़ियाँ चढ़ना: इसने आत्मविश्वास के साथ ऊपर और नीचे की सीढ़ियाँ चढ़ीं।

मुख्य निष्कर्ष (The Big Takeaway)

यह शोध पत्र हमें सिखाता है कि रोबोट लर्निंग में "एक ही आकार सबके लिए फिट नहीं होता" (one size does not fit all)।

  • स्थिर, सुरक्षित कार्यों के लिए, आप चीजों को व्यवस्थित रखने के लिए एक सख्त शिक्षक चाहते हैं।
  • जंगली, गतिशील कार्यों के लिए, आप छात्र को स्वतंत्र छोड़ना चाहते हैं ताकि वह प्रयोग कर सके।

यह जानकर कि कब सख्त होना है और कब स्वतंत्र छोड़ना है, उन्होंने एक ही रोबोट को पाँच पूरी तरह से अलग तरीकों से चलना सिखाया, और वह भी बिना हर नए कार्य के लिए उसे रीप्रोग्राम किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →