← नवीनतम पेपर
💻 computer science

Dynamic Policy Learning for Legged Robot with Simplified Model Pretraining and Model-Homotopy-Inspired Transfer

यह शोधपत्र लेग्ड रोबोट्स के लिए एक डायनेमिक पॉलिसी लर्निंग फ्रेमवर्क प्रस्तुत करता है जो सरल सिंगल-रिजिड-बॉडी प्रीट्रेनिंग को मॉडल-होमोटॉपी-प्रेरित कंटिन्यूएशन स्ट्रैटेजी के साथ जोड़ता है ताकि रिड्यूस्ड-ऑर्डर मॉडल्स से फुल-बॉडी डायनेमिक्स और वास्तविक दुनिया के परिनियोजन में फ्लिप और वॉल-असिस्टेड मैन्युवर्स जैसे जटिल डायनेमिक व्यवहारों को कुशलतापूर्वक स्थानांतरित और परिष्कृत किया जा सके।

मूल लेखक: Dongyun Kang, Min-Gyu Kim, Tae-Gyu Song, Hajun Kim, Sehoon Ha, Hae-Won Park

प्रकाशित 2026-06-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dongyun Kang, Min-Gyu Kim, Tae-Gyu Song, Hajun Kim, Sehoon Ha, Hae-Won Park

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कुत्ते को बैकफ्लिप करना या दीवार से कूदना सिखाने की कोशिश कर रहे हैं। यदि आप बस रोबोट को कह देते हैं, "खुद समझ लो," तो वह आमतौर पर टकरा जाता है, बेतहाशा घूमने लगता है, या हार मान लेता है। यह साइकिल चलाना सीखने के लिए किसी को खाई से नीचे फेंकने जैसा है; कार्य बहुत जटिल है, और रोबोट को यह नहीं पता कि शुरुआत कहाँ से करनी है।

यह शोध पत्र एक चतुर नए तरीके को प्रस्तुत करता है जिससे इन रोबोटों को सिखाया जा सकता है, जिसे लेखक "कंटीन्यूएशन-बेस्ड लर्निंग फ्रेमवर्क" (continuation-based learning framework) कहते हैं। यह कैसे काम करता है, यहाँ रोजमर्रा के उदाहरणों का उपयोग करके सरल चरणों में बताया गया है:

1. समस्या: "मॉडल गैप" (The Model Gap)

रोबोट भारी, जटिल मशीनें हैं जिनमें कई चलते हुए पुर्जे (पैर, जोड़, मोटर) होते हैं। कंप्यूटर में इस सब को पूरी तरह से सिम्युलेट करना धीमा और नियंत्रित करना कठिन होता है।

  • पुराना तरीका: वैज्ञानिक अक्सर पहले रोबोट को सिखाने के लिए एक "सरलीकृत मॉडल" का उपयोग करते हैं। कल्पना कीजिए कि आप एक रोबोट को उसके कार्टून संस्करण का उपयोग करके सिखा रहे हैं—बिना पैरों वाला एक अकेला तैरता हुआ ब्लॉक। इस पर सीखना आसान है, लेकिन जब आप उस ज्ञान का उपयोग वास्तविक, भारी रोबोट पर करने की कोशिश करते हैं, तो यह विफल हो जाता है क्योंकि भौतिकी (physics) पूरी तरह से अलग होती है। इस अंतर को "मॉडल गैप" कहा जाता है।
  • चुनौती: आप जो कुछ भी रोबोट ने "कार्टून दुनिया" में सीखा है, उसे बिना गिरे "वास्तविक दुनिया" में कैसे ले जाएं?

2. समाधान: एक "क्रमिक संक्रमण" (The Homotopy Path)

कार्टून से सीधे वास्तविक रोबोट पर जाने के बजाय, लेखकों ने एक स्लाइडिंग स्केल (या एक "कंटीन्यूएशन पाथ") बनाया है जो धीरे-धीरे कार्टून को वास्तविक चीज़ में बदल देता है।

इसे मैराथन के लिए प्रशिक्षण लेने जैसा समझें:

  • चरण 1 (सरलीकृत मॉडल): आप एक समतल, नरम ट्रेडमिल पर चलना सीखने से शुरुआत करते हैं। यह "सिंगल रिजिड बॉडी" (SRB) मॉडल है। रोबोट अपने शरीर को चलाने और जमीन से धक्का देने का मूल विचार सीख जाता है, लेकिन भारी पैरों या जटिल जोड़ों की उलझन के बिना। यह अपने जूतों या इलाके की चिंता किए बिना दौड़ने की लय सीखने जैसा है।
  • चरण 2 (जादुई पुल): यही इस शोध का सबसे बड़ा नवाचार है। सीधे वास्तविक रोबोट पर स्विच करने के बजाय, सिस्टम धीरे-धीरे सिमुलेशन में "वजन" और "जटिलता" जोड़ना शुरू कर देता है।
    • कल्पना कीजिए कि शुरुआत में रोबोट के पैर हीलियम गुब्बारों से बने हैं (बहुत हल्के)।
    • जैसे-जैसे रोबोट बेहतर होता जाता है, गुब्बारों में धीरे-धीरे पानी भरा जाता है, जिससे पैर भारी और भारी होते जाते हैं।
    • साथ ही, कुल वजन को समान रखने के लिए रोबोट का मुख्य शरीर (धड़) हल्का होता जाता है।
    • इस प्रक्रिया के अंत तक, वे "गुब्बारे वाले पैर" वास्तविक, भारी धातु के पैरों में बदल जाते हैं, और रोबोट पूरे समय उनके साथ अभ्यास कर रहा होता है।

इस क्रमिक परिवर्तन को "मॉडल-होमोटॉपी-इंस्पायर्ड ट्रांसफर" (Model-Homotopy-Inspired Transfer) कहा जाता है। यह एक वीडियो गेम की तरह है जहाँ कठिनाई स्तर-दर-स्तर बढ़ती है, न कि खिलाड़ी को तुरंत सबसे कठिन बॉस फाइट में झोंक दिया जाता है।

3. उन्होंने क्या हासिल किया?

शोधकर्ताओं ने इसका परीक्षण एक वास्तविक क्वाड्रुपेड रोबोट (एक चार पैरों वाला रोबोट) और कंप्यूटर सिमुलेशन में किया। उन्होंने इसे कुछ बहुत ही शानदार मूव्स सिखाए:

  • बैकफ्लिप्स और साइडफ्लिप्स: रोबोट ने हवा में खुद को सिकोड़ना और घूमना सीखा।
  • वॉल-असिस्टेड मैन्युवर्स (Wall-Assisted Maneuvers): रोबोट ने ऊँचा कूदने या तेजी से मुड़ने के लिए दीवार से धक्का देना सीखा, जिसमें दीवार का उपयोग स्प्रिंगबोर्ड के रूप में किया गया।

परिणाम:

  • तेजी से सीखना: रोबोट ने ये करतब बहुत तेजी से सीखे, बजाय इसके कि वे इसे शुरुआत से सिखाने की कोशिश करते या सीधे वास्तविक भौतिकी पर कूद जाते।
  • अधिक स्थिरता: क्योंकि रोबोट ने "स्लाइडिंग स्केल" पर अभ्यास किया था, इसलिए भौतिकी बदलने पर वह भ्रमित नहीं हुआ। उसने अपना संतुलन बेहतर बनाए रखा।
  • वास्तविक दुनिया में सफलता: उन्होंने सफलतापूर्वक इन सीखे हुए मूव्स को एक भौतिक रोबोट (Unitree Go1) पर लागू किया। रोबोट वास्तव में बैकफ्लिप कर सका और वास्तविक फर्श पर दौड़ सका, जबकि अन्य तरीकों के परिणामस्वरूप अक्सर रोबोट टकरा जाता या अपनी पीठ के बल गिर जाता।

सारांश

संक्षेप में, शोध पत्र कहता है: रोबोट को एक साथ जटिल कलाबाजी सिखाने की कोशिश न करें। पहले, उसे अपने सरल, सरलीकृत संस्करण पर बुनियादी बातें सिखाएं। फिर, सिमुलेशन को धीरे-धीरे और सुचारू रूप से वास्तविक रोबोट जैसा बनाने के लिए "अपग्रेड" करें, जिससे रोबोट को चरण-दर-चरण अनुकूलन करने दें। यह तरीका एक पुल के रूप में कार्य करता है, जिससे रोबोट अपनी कुशलता को सरल दुनिया से जटिल वास्तविक दुनिया में बिना बिखरे ले जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →