← नवीनतम पेपर
⚡ electrical engineering

HuMam: Humanoid Motion Control via End-to-End Deep Reinforcement Learning with Mamba

HuMam एक स्टेट-सेंट्रिक एंड-टू-एंड रिइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो ह्यूमनॉइड लोकोमोशन के लिए है, जो रोबोट स्टेट्स को फुटस्टेप टारगेट्स और एक फेज क्लॉक के साथ फ्यूज करने के लिए सिंगल-लेयर माम्बा एनकोडर का लाभ उठाता है, जिससे JVRC-1 रोबोट पर फीडफॉरवर्ड बेसलाइन्स की तुलना में बेहतर ट्रेनिंग स्थिरता, दक्षता और ऊर्जा बचत प्राप्त होती है।

मूल लेखक: Yinuo Wang, Yuanyang Qi, Jinzhao Zhou, Pengxiang Meng, Xiaowen Tao

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yinuo Wang, Yuanyang Qi, Jinzhao Zhou, Pengxiang Meng, Xiaowen Tao

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "HuMam: End-to-End Deep Reinforcement Learning with Mamba के माध्यम से ह्युमनॉइड मोशन कंट्रोल" नामक शोध पत्र का सरल, रोज़मर्रा की भाषा और रचनात्मक उपमाओं (analogies) के साथ हिंदी अनुवाद दिया गया है।

मुख्य विचार: रोबोट को बिना "ज़्यादा सोचे" चलना सिखाना

कल्प-मानिए कि आप एक रोबोट को चलना सिखाने की कोशिश कर रहे हैं। रोबोट के दो पैर, एक धड़ (torso) और पैरों में 12 जोड़ (joints) हैं। चलने के लिए, उसे अपने वजन को संतुलित करने, ज़मीन के प्रति प्रतिक्रिया देने और एक रास्ते का पालन करने के साथ-साथ इन सभी जोड़ों को पूरी तरह से तालमेल बिठाने की आवश्यकता होती है।

आमतौर पर, जब हम रोबोट को यह सिखाते हैं, तो हम एक "मस्तिष्क" (न्यूरल नेटवर्क) का उपयोग करते हैं जो वर्तमान स्थिति को देखता है और निर्णय लेता है कि आगे क्या करना है। समस्या यह है कि इनमें से कई मस्तिष्क या तो बहुत सरल होते हैं (वे महत्वपूर्ण विवरणों को छोड़ देते हैं) या बहुत भारी और धीमे होते हैं (उन्हें चलाने के लिए बहुत अधिक कंप्यूटर पावर की आवश्यकता होती है)।

इस शोध पत्र के लेखकों ने एक नया मस्तिष्क बनाया है जिसे HuMam कहा जाता है। इसका गुप्त मंत्र क्या है? उन्होंने Mamba नामक एक नए प्रकार के AI आर्किटेक्चर का उपयोग किया है।

उपमा: "स्मार्ट कंडक्टर" बनाम "अव्यवस्थित ऑर्केस्ट्रा"

रोबोट के शरीर को एक ऑर्केस्ट्रा के रूप में सोचें जिसमें 12 अलग-अलग वाद्य यंत्र (पैर के जोड़) हैं।

  • पुराना तरीका (बेसलाइन): कंडक्टर (AI) संगीत की शीट को देखता है, लेकिन वह भूल जाता है कि उसने अभी-अभी कौन से सुर बजाए थे। वह केवल वर्तमान क्षण के आधार पर अगले सुर का अनुमान लगाने की कोशिश करता है। कभी-कभी वह लय गलत कर देता है, ऑर्केस्ट्रा लड़खड़ा जाता है, और रोबोट गिर जाता है।
  • Hu-Mam का तरीका: कंडक्टर एक Mamba सिस्टम का उपयोग करता है। यह केवल एक कंडक्टर नहीं है; यह एक ऐसा कंडक्टर है जिसके पास संगीत के प्रवाह की सटीक, तात्कालिक स्मृति (memory) है। इसे हर बार शुरुआत से पूरा गाना फिर से पढ़ने की आवश्यकता नहीं है। वह जानता है कि पिछला सुर अगले सुर से कैसे जुड़ता है। यह रोबốt को एक अनाड़ी चलने वाले के बजाय, एक नर्तक की तरह सुचारू रूप से हिलने-डुलने की अनुमति देता है।

HuMam को क्या खास बनाता है?

1. "हल्का" मस्तिष्क (Mamba)

शोध पत्र का दावा है कि यह पहली बार है जब Mamba आर्किटेक्चर का उपयोग ह्युमनॉइड रोबोट के चलने को नियंत्रित करने के लिए किया गया है।

  • रूपक (Metaphor): कल्पना कीजिए कि आप मैराथन दौड़ते समय एक भारी बैकपैक (एक जटिल AI मॉडल) ले जाने की कोशिश कर रहे हैं। यह आपको धीमा कर देता है। HuMam एक "Mamba" लेयर का उपयोग करता है, जो एक हल्के, हाई-टेक बैकपैक की तरह है। यह सभी आवश्यक जानकारी रखता है लेकिन इसका वजन लगभग शून्य है। इसका मतलब है कि रोबोट तेज़ी से सोच सकता है और कम बैटरी पावर का उपयोग कर सकता है।

2. "छह-बिंदु स्कोरकार्ड" (रिवॉर्ड शेपिंग)

रोबोट को सिखाने के लिए, कंप्यूटर उसे सही काम करने के लिए अंक (रिवॉर्ड्स) देता है। लेखकों ने एक विशिष्ट "स्कोरकार्ड" बनाया है जिसमें छह आइटम हैं:

  1. झटका न दें: ज़मीन पर अपने पैर को कोमल रखें।
  2. सुचारू रूप से झूलें: अपने पैरों को बेतहाशा न लात मारें।
  3. लक्ष्य पर पहुँचें: ठीक वहीं कदम रखें जहाँ आपने योजना बनाई थी।
  4. सीधे खड़े रहें: अपना सिर ऊपर और पीठ सीधी रखें।
  5. सही ऊंचाई बनाए रखें: न तो बहुत नीचे झुकें और न ही बहुत ऊंचे खड़े हों।
  6. लड़खड़ाएं नहीं: अपने ऊपरी शरीर को स्थिर रखें।

रोबोट इस कार्ड पर उच्चतम संभव स्कोर प्राप्त करने की कोशिश करता है। क्योंकि Mamba मस्तिष्क इन बिंदुओं को जोड़ने में बहुत अच्छा है, इसलिए रोबोट एक दूसरे के लिए त्याग किए बिना एक साथ छह लक्ष्यों को संतुलित करना सीख जाता है।

परिणाम: तेज़, सुचारू और हरित (Greener)

शोधकर्ताओं ने कंप्यूटर सिमुलेशन में JVRC-1 नामक एक आभासी रोबोट पर HuMam का परीक्षण किया। उन्होंने इसकी तुलना एक मानक रोबोट मस्तिष्क (बेसलाइन) से की जिसमें Mamba का उपयोग नहीं किया गया था। यहाँ क्या हुआ:

  • तेज़ी से सीखना: Hu-Mam ने चलना बहुत तेज़ी से सीखा। समान कौशल स्तर तक पहुँचने के लिए इसे अन्य रोबोट की तुलना में 13% से 42% कम अभ्यास प्रयासों की आवश्यकता पड़ी।
    • उपमा: यदि पुराने रोबोट को चलने में माहिर होने के लिए 100 घंटे अभ्यास करने की आवश्यकता थी, तो Hu-M को केवल 60 घंटों की आवश्यकता थी।
  • अधिक स्थिर: पुराने रोबोट का सीखना "झटकेदार" था—कभी-कभी वह बहुत अच्छा हो जाता था, और अचानक खराब हो जाता था। Hu-M सुसंगत था।
    • उपमा: पुराना रोबोट एक ऐसे छात्र की तरह था जो एक दिन परीक्षा में अव्वल आता था और अगले दिन फेल हो जाता था। Hu-M उस छात्र की तरह था जो हर बार 'A' ग्रेड प्राप्त करता था।
  • ऊर्जा कुशल: यह एक बड़ी बात है। Hu-M ने समान दूरी तय करने के लिए कम बिजली का उपयोग किया।
    • उपमा: पुराना रोबोट एक गैस की खपत करने वाली SUV की तरह था जो इंजन को ज़ोर से चालू करती है। Hu-M एक हाइब्रिड कार की तरह है जो शांति से चलती है। "स्टैंडिंग" टेस्ट में, Hu-M ने केवल सीधा खड़े रहने के लिए 39% कम शक्ति का उपयोग किया।
  • सुचारू जोड़: इसके जोड़ों (कूल्हे, घुटने, टखने) में झटकेदार बल कम था।
    • उपमा: पुराने रोबोट के जोड़ एक जंग लगे कब्ज़े की तरह आवाज़ करते थे; Hu-M के जोड़ एक अच्छी तरह से तेल लगे दरवाज़े की तरह चलते थे।

निष्कर्ष

यह शोध पत्र तर्क देता है कि इस नए "Mamba" मस्तिष्क का उपयोग करके, उन्होंने एक रोबोट कंट्रोलर बनाया है जो है:

  1. हल्का (कम कंप्यूटर पावर का उपयोग करता है)।
  2. स्मार्ट (तेज़ी से और लगातार सीखता है)।
  3. ग्रीन/पर्यावरण के अनुकूल (कम ऊर्जा का उपयोग करता है)।

उन्होंने सफलतापूर्वक सिद्ध किया है कि रोबोट को अच्छी तरह से चलाने के लिए आपको एक विशाल, भारी कंप्यूटर मस्तिष्क की आवश्यकता नहीं है। कभी-कभी, एक हल्का, कुशल "Mamba" मस्तिष्क ही रोबोट को कमरे में नाचने के लिए पर्याप्त होता है।

नोट: शोध पत्र पूरी तरह से कंप्यूटर सिमुलेशन (आभासी रोबोट) पर केंद्रित है। यह दावा नहीं करता है कि इसे अभी तक वास्तविक, भौतिक रोबोट पर टेस्ट किया गया है, हालांकि यह उल्लेख करता है कि यह भविष्य के कार्य के लिए एक लक्ष्य है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →