← नवीनतम पेपर
⚡ electrical engineering

Accelerating and Scaling MPC-Guided Reinforcement Learning for Humanoid Locomotion and Manipulation

यह शोध पत्र MPC-RL प्रस्तुत करता है, जो एक सेंट्रॉइडल-डायनामिक्स MPC रिवॉर्ड फॉर्मूलेशन को πn\pi^nMPC के साथ जोड़कर ह्यूमनॉइड लोकोमोशन और मैनिपुलेशन प्रशिक्षण को त्वरित और स्केल करता है, जहाँ πn\pi^nMPC एक नवीन पैरेलल-इन-होराइजन GPU सॉल्वर है जो कंस्ट्रक्शन ओवरहेड को समाप्त करता है और कुशल, कंस्ट्रेंट-अवेयर सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) को सक्षम बनाता है।

मूल लेखक: Junheng Li, Liang Wu, Sergio A. Esteban, Lizhi Yang, Ján Drgoňa, Aaron D. Ames

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junheng Li, Liang Wu, Sergio A. Esteban, Lizhi Yang, Ján Drgoňa, Aaron D. Ames

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चलना और भारी वस्तुओं को धकेलना सिखा रहे हैं। आपके पास इसे करने के दो मुख्य तरीके हैं:

  1. "जिम कोच" (रीइन्फोर्समेंट लर्निंग - Reinforcement Learning): आप रोबोट को एक वीडियो गेम सिम्युलेटर में लाखों रैंडम मूवमेंट्स आज़माने देते हैं। यह प्रयास और त्रुटि (trial and error) से सीखता है, और अंततः यह समझ जाता है कि बिना गिरे कैसे चलना है। यह कठिन और अनुकूलन योग्य (adaptable) होने में बहुत अच्छा है, लेकिन इसे बुनियादी बातें सीखने में बहुत समय लग सकता है, और कभी-कभी यह कुछ "बुरी आदतें" सीख लेता है जो अजीब या अक्षम दिखती हैं।

  2. "फिजिक्स प्रोफेसर" (मॉडल प्रेडिक्टिव कंट्रोल - Model Predictive Control): आप रोबकार को भौतिकी (physics) के सख्त समीकरण देते हैं। यह गणना करता है कि संतुलन बनाए रखने के लिए उसे अपने द्रव्यमान के केंद्र (center of mass) और पैरों को कहाँ रखना चाहिए। यह बहुत सटीक और सुरक्षित है, लेकिन यह गणना करने में धीमा है और कठोर है, जिससे वास्तविक दुनिया की अव्यवस्था या अप्रत्याशित स्थितियों में इसे संघर्ष करना पड़ता है।

यह पेपर MPC-RL नामक एक नई विधि पेश करता है जो दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को जोड़ता है। इसे ऐसे समझें जैसे आप "जिम कोच" छात्र के लिए "फिजिक्स प्रोफेसर" को एक प्रशिक्षण कोच (training coach) के रूप में नियुक्त कर रहे हैं, लेकिन केवल अभ्यास के दौरान, वास्तविक खेल के दौरान नहीं।

मुख्य विचार: एक स्मार्ट ट्रेनिंग गाइड

रोबोट को शून्य से चलना सिखाने के बजाय, यह सिस्टम "फिजिक्स प्रोफेसर" (MPC) का उपयोग करके एक परफेक्ट रोडमैप तैयार करता है कि रोबोट को वास्तव में कैसे चलना चाहिए। यह सीधे रोबोट को नियंत्रित नहीं करता है; इसके बजाय, जब रोबोट इस रोडमैप का पालन करता है, तो यह उसे एक "रिवॉर्ड" (जैसे गोल्ड स्टार) देता है।

समय के साथ, रोबोट (रीइन्फोर्समेंट लर्निंग का उपयोग करके) इस परफेक्ट रोडमैप की नकल करने में इतना माहिर हो जाता है कि वह अंततः अपने आप में एक विशेषज्ञ बन जाता है। प्रशिक्षण समाप्त होने के बाद, रोबोट "फिजिक्स प्रोफेसर" को भूल जाता है और अपने दम पर चलता है, जो वास्तविक दुनिया के झटकों और धक्कों को संभालने के लिए तैयार है।

उन्होंने दो बड़ी समस्याओं को हल किया

1. "ट्रैफिक जाम" की समस्या (गति/Speed)
आमतौर पर, एक रोबोट के लिए परफेक्ट रोडमैप की गणना करने के लिए फिजिक्स इंजन से पूछना धीमा होता है। यदि आप एक साथ हजारों रोबोटों के लिए ऐसा करने की कोशिश करते हैं (जो तेज़ प्रशिक्षण के लिए आवश्यक है), तो कंप्यूटर चोक हो जाता है। यह एक-एक करके लाखों गणितीय समस्याओं को हल करने की कोशिश करने जैसा है; इसमें अनंत समय लगता है।

  • उनका समाधान (π\pinMPC): उन्होंने π\pinMPC नामक एक विशेष टूल बनाया। कल्पना कीजिए कि एक विशाल फैक्ट्री असेंबली लाइन है जहाँ, एक समय में एक गणितीय समस्या हल करने के बजाय, कंप्यूटर ग्राफिक्स कार्ड (GPU) पर हजारों समस्याओं को एक साथ (simultaneously) हल करता है। उन्होंने हर बार गणित की समस्या को "बनाने" (construction-free) की आवश्यकता को भी हटा दिया, जिससे सिस्टम बिना मेमोरी खत्म किए अविश्वसनीय रूप से तेज़ चल सका। यह प्रशिक्षण को व्यावहारिक बनाने के लिए पर्याप्त तेज़ बनाता है।

2. "बहुत अधिक जानकारी" की समस्या (आत्मविश्वास/Confidence)
"फिजिक्स प्रोफेसर" अगले कदम की भविष्यवाणी करने में बहुत अच्छा है, लेकिन इसकी भविष्यवाणियाँ जितनी दूर की होती हैं, उतनी ही धुंधली होती जाती हैं (जैसे एक महीने बाद के मौसम की भविष्यवाणी करने की कोशिश करना)। यदि आप रोबोट को पूरे भविष्य के लिए रोडमैप का बहुत सख्ती से पालन करने के लिए कहते हैं, तो वह "धुंधले" हिस्सों से भ्रमित हो सकता है।

  • उनका समाधान (कॉन्फिडेंस वेटिंग/Confidence Weighting): उन्होंने रोबोट को यह सिखाया कि वह दूरी के आधार पर रोडमैप पर अलग-अलग भरोसा करे।
    • निकट अवधि (अगला कदम): "इसका ठीक से पालन करो! मुझे 100% यकीन है।"
    • दूर की अवधि (भविष्य के कदम): "यह एक अच्छा सामान्य दिशा है, लेकिन अगर थोड़ा भटक जाओ तो तनाव मत लो।"
      यह "टैपर्ड" (तुलनात्मक) विश्वास रोबोट को छोटी-छोटी बातों में उलसे बिना बड़े चित्र (big picture) को सीखने में मदद करता है।

उन्होंने क्या हासिल किया?

शोधकर्ताओं ने एक ह्यूमनॉइड रोबोट (एक रोबोट जो इंसान जैसा दिखता है और चलता है) पर दो मुख्य क्षेत्रों में परीक्षण किया:

  • चलना (Walking): रोबोट ने मानक तरीकों से प्रशिक्षित रोबकारों की तुलना में अधिक तेज़ी से और अधिक स्थिरता से चलना सीखा। यह ज़ोर से धक्का दिए जाने पर (जैसे किसी ने उसे धक्का दिया हो) भी खुद को संभाल सकता था और बिना गिरे चलना जारी रख सकता था। इसने भारी जैकेट पहनकर या भार ढोते हुए चलने को भी संभाला।
  • भारी चीजों को धकेलना (Loco-Manipulation): यह सबसे बड़ी उपलब्धि है। उन्होंने रोबोट को एक कार्ट (गाड़ी) को धकेलना सिखाया।
    • परिणाम: रोबोट ने 290 किलोग्राम (639 पाउंड) वजन वाली कार्ट को सफलतापूर्वक धकेला।
    • पैमाना: वह कार्ट रोबोट के अपने वजन का 829% थी। इसे समझने के लिए, यदि आपका वजन 150 पाउंड है, तो इस रोबोट ने एक ऐसी कार्ट को धकेला जो उसके वजन के 1,243 पाउंड (लगभग एक छोटी कार या ग्रैंड पियानो के वजन के बराबर) के बराबर थी।

निचोड़ (The Bottom Line)

यह पेपर दिखाता है कि प्रशिक्षण के दौरान "फिजिक्स-आधारित" रोडमैप देने के लिए एक तेज़, पैरेलल कंप्यूटर सॉल्वर का उपयोग करके, आप रोबोट को पहले की तुलना में बहुत बेहतर और तेज़ी से चलना और भारी वस्तुएं धकेलना सिखा सकते हैं। रोबोट गति के "फिजिक्स" को जल्दी सीख जाता है, फिर एक मजबूत, स्वतंत्र कार्यकर्ता बन जाता है जिसे वास्तविक समय में गणित करने के लिए कंप्यूटर की आवश्यकता नहीं होती है।

संक्षेप में: उन्होंने एक सुपर-फास्ट ट्रेनिंग कोच बनाया जो रोबोट को "परफेक्ट पाथ" दिखाकर चलने और भारी भार धकेलने में मदद करता है, जिसके परिणामस्वरूप एक रोबोट अपने वजन से लगभग 10 गुना वजन वाली कार्ट को धकेल सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →