← नवीनतम पेपर
💻 computer science

Imitating and Finetuning Model Predictive Control for Robust and Symmetric Quadrupedal Locomotion

यह शोध पत्र एक इमिटेटिंग एंड फाइनट्यूनिंग मॉडल प्रिडिक्टिव कंट्रोल (IFM) फ्रेमवर्क प्रस्तावित करता है जो चुनौतीपूर्ण भूभागों पर मजबूत, सममित और ऊर्जा-कुशल क्वाड्रुपेडल लोकोमोशन प्राप्त करने के लिए एक पारंपरिक MPC विशेषज्ञ नीति को इमिटेशन लर्निंग और डीप रिइन्फोर्समेंट लर्निंग के साथ जोड़ता है।

मूल लेखक: Donghoon Youm, Hyunyoung Jung, Hyeongjun Kim, Jemin Hwangbo, Hae-Won Park, Sehoon Ha

प्रकाशित 2026-05-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Donghoon Youm, Hyunyoung Jung, Hyeongjun Kim, Jemin Hwangbo, Hae-Won Park, Sehoon Ha

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक चार पैरों वाले रोबोट कुत्ते को दौड़ना, बाधाओं के ऊपर से कूदना और फिसलन भरे फर्श पर बिना गिरे चलना सिखाने की कोशिश कर रहे हैं। यह एक अविश्वसनीय रूप से कठिन काम है क्योंकि रोबोट को अपने पैरों के जटिल पैटर्न के साथ खुद को पूरी तरह संतुलित करना होता है।

यह शोध पत्र एक नई शिक्षण विधि पेश करता है जिसे IFM (इमिटेटिंग एंड फाइनट्यूनिंग मॉडल प्रेडिक्टिव कंट्रोल) कहा जाता है। IFM को एक तीन-चरणीय प्रशिक्षु कार्यक्रम (apprenticeship program) के रूप में समझें जो दो दुनियाओं के सर्वश्रेष्ठ गुणों को जोड़ता है: एक सख्त, गणित-आधारित शिक्षक और एक रचनात्मक, प्रयास-और-त्रुटि (trial-and-error) वाला छात्र।

यह प्रक्रिया इस प्रकार काम करती है, सरल उपमाओं का उपयोग करते हुए:

चरण 1: "सख्त गणित शिक्षक" (विशेषज्ञ)

सबसे पहले, शोधकर्ता उन्नत गणित (मॉडल प्रेडिक्टिव कंट्रोल या MPC) का उपयोग करके एक "परफेक्ट" कंट्रोलर बनाते हैं।

  • उपमा: एक बुद्धिमान लेकिन कठोर शतरंज के ग्रैंडमास्टर की कल्पना करें जो हर संभावित चाल की गणना पूरी तरह से करता है। यह ग्रैंडमास्टर जानता है कि भौतिकी के समीकरणों के आधार पर रोबोट को वास्तव में कैसे चलना चाहिए।
  • समस्या: यह ग्रैंडमास्टर बहुत धीमा है। अगले कदम की गणना करने के लिए, कंप्यूटर को भारी गणित करना पड़ता है जिसमें वास्तविक समय में प्रतिक्रिया देने के लिए बहुत अधिक समय लगता है। साथ ही, यदि रोबोट किसी अप्रत्याशित चीज़ (जैसे केले के छिलके या चलते हुए कन्वेयर बेल्ट) पर कदम रखता है, तो ग्रैंडमास्टर के सख्त नियम विफल हो सकते हैं क्योंकि वे उस विशिष्ट अजीब स्थिति के लिए प्रोग्राम नहीं किए गए थे।

चरण 2: "शैडो स्टूडेंट" (इमिटेशन लर्निंग)

इसके बाद, वे एक न्यूरल नेटवर्क (एक प्रकार का AI मस्तिष्क) को ग्रैंडमास्टर की नकल करने के लिए प्रशिक्षित करते हैं।

  • उपमा: वे ग्रैंडमास्टर के साथ एक छात्र को कमरे में रखते हैं। छात्र ग्रैंडमास्टर की चालों को देखता है और बिल्कुल वैसा ही करने की कोशिश करता है। इसे "इमिटेशन लर्निंग" कहा जाता है।
  • परिणाम: छात्र ग्रैंडमास्टर की सटीक, सममित (symmetric) और कुशल चलने की शैली को सीख जाता है। लेकिन ग्रैंडमास्टर के विपरीत, छात्र एक सरल AI है जो तुरंत निर्णय ले सकता है (बहुत तेज़)। हालांकि, छात्र अभी भी केवल एक नकल है; यदि स्थिति नाटकीय रूप से बदल जाती है, तो छात्र अभी भी फंस सकता है।

चरण 3: "एडवेंचर कैंप" (रीइन्फोर्समेंट लर्निंग)

अंत में, वे इस छात्र को कठिन इलाकों (ऊबड़-खाबड़ चट्टानों, फिसलन भरी बर्फ, चलती हुई बेल्ट) के साथ एक "ट्रेनिंग कैंप" में अकेले अभ्यास करने के लिए भेजते हैं।

  • उपमा: शून्य से शुरुआत करने के बजाय, छात्र पहले से ही अच्छी तरह से चलना जानता है। अब, उन्हें एक चुनौती दी जाती है: "बिना गिरे चलते हुए कन्वेयर बेल्ट को पार करें।" छात्र अलग-अलग चीजें आजमाता है। यदि वह फिसलता है, तो वह सीखता है। यदि वह सफल होता है, तो उसे "अच्छा काम किया" का इनाम मिलता है।
  • जादू: क्योंकि छात्र के पास (चरण 2 से) एक अच्छा आधार था, उन्हें बुनियादी बातों को सीखने के लिए हजारों घंटों के प्रयास-और-त्रुटि की आवश्यकता नहीं होती है। उन्हें बस वास्तविक दुनिया को संभालने के लिए अपने कौशल को "फाइनट्यून" करने की आवश्यकता है।

यह पुराने तरीकों से बेहतर क्यों है?

  1. गति बनाम बुद्धि: मूल "गणित शिक्षक" बुद्धिमान था लेकिन धीमा था। नया "छात्र" लगभग उतना ही बुद्धिमान है लेकिन 15 गुना तेजी से सोच सकता है। इसका मतलब है कि रोबोट झटकों और फिसलन पर तुरंत प्रतिक्रिया दे सकता है।
  2. बेहतर चलने की शैली: यदि आप केवल एक रोबोट को शून्य से सीखने देते हैं (जिसे "वैनिला RL" कहा जाता है), तो वह अक्सर अजीब, झटकेदार या असममित तरीके से चलना सीख जाता है (जैसे एक नशे में धुत व्यक्ति लड़खड़ाता है)। यह काम तो कर सकता है, लेकिन यह अक्षम है और वास्तविक हार्डवेयर पर लागू करना कठिन है। IFM विधि यह सुनिश्चित करती है कि रोब dalam "सुंदर" चलने की शैली बनाए रखे जो उसने गणित शिक्षक से सीखी थी, ताकि वह सममित और ऊर्जा-कुशल बनी रहे।
  3. कम "रिवॉर्ड शेपिंग": आमतौर पर, रोबोट को सिखाने के लिए प्रोग्रामर को दर्जनों विशिष्ट नियम (रिवॉर्ड्स) लिखने की आवश्यकता होती है, जैसे "अपना पैर बहुत ऊपर न उठाएं" या "अपनी पीठ सीधी रखें।" यह उबाऊ है और इसे सही करना कठिन है। क्योंकि IFM एक अच्छे शिक्षक के साथ शुरू होता है, रोबोट पहले से ही अच्छी मुद्रा (posture) जानता है। शोधकर्ताओं को केवल कठिन इलाकों के माध्यम से रोबोट को मार्गदर्शन देने के लिए कुछ सरल नियमों की आवश्यकता थी।

परिणाम

टीम ने इस परीक्षण को मिनी चीता नामक एक वास्तविक रोबोट पर किया।

  • बाधाएं: रोबोट सफलतापूर्वक 7.5 सेमी ऊंचे स्टेप (लगभग एक मोटी किताब की ऊंचाई) के ऊपर से कूद सका, जिसे अन्य तरीके करने में विफल रहे।
  • फिसलन भरे फर्श: यह बिना गिरे एक बहुत ही कम घर्षण वाली सतह (जैसे केले के छिलके) पर चल सका, जबकि पुराना गणित-आधारित कंट्रोलर फिसल जाता और क्रैश हो जाता।
  • चलती हुई जमीन: यह एक चलते हुए कन्वेयर बेल्ट पर चल सका, संतुलन बनाए रखने के लिए अपने कदमों को पूरी तरह से समायोजित कर सका।

संक्षेप में: यह शोध पत्र एक ऐसी विधि प्रस्तावित करता है जहाँ आप पहले गणित का उपयोग करके रोबोट को चलने का "परफेक्ट" तरीका सिखाते हैं, फिर उस परफेक्ट स्टाइल की नकल करने के लिए एक AI को सिखाते हैं, और अंत में उस AI को कठिन इलाकों में अभ्यास करने के लिए छोड़ देते हैं ताकि वह एक मजबूत, तेज़ और सुंदर धावक बन सके। यह एक मास्टर डांसर को सिखाने, फिर उस छात्र को उनका रूटीन सिखाने और फिर उस छात्र को ट्रैम्पोलिन पर नृत्य करने के लिए भेजने जैसा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →