← नवीनतम पेपर
🤖 machine learning

Pretraining in Actor-Critic Reinforcement Learning for Robot Locomotion

यह शोध पत्र रोबोटिक लोकोमोशन के लिए एक प्रीट्रेनिंग-फाइनट्यूनिंग प्रतिमान (पैराडाइम) प्रस्तावित करता है जो एक प्रोप्रियोसेप्टिव इनवर्स डायनेमिक्स मॉडल (PIDM) को प्रशिक्षित करने के लिए एक टास्क-अग्नोस्टिक एक्सप्लोरेशन रणनीति का लाभ उठाता है, जिसका उपयोग फिर PPO जैसे एक्टर-क्रिटिक एल्गोरिदम को वॉर्म-स्टार्ट करने के लिए किया जाता है, जिसके परिणामस्वरूप विविध रोबोटिक एम्बॉडिमेंट्स में सैंपल एफिशिएंसी और टास्क परफॉरमेंस में महत्वपूर्ण सुधार होता है।

मूल लेखक: Jiale Fan, Andrei Cramariuc, Tifanny Portela, Marco Hutter

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiale Fan, Andrei Cramariuc, Tifanny Portela, Marco Hutter

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कुत्ते को चलना, दौड़ना, कूदना और सीढ़ियां चढ़ना सिखाने की कोशिश कर रहे हैं।

पुराना तरीका: "खाली स्लेट" वाली समस्या
परंपरागत रूप से, जब इंजीनियर किसी रोबोट को नया कौशल सिखाना चाहते थे, तो वे बिल्कुल शून्य से शुरुआत करते थे। यह एक बच्चे को स्कीइंग के जूते पहनाकर यह कहने जैसा है कि, "जाओ और सीखो कि पहाड़ से स्कीइंग कैसे करते हैं।" बच्चा (रोबोट) यह भी नहीं जानता कि उसके पैर क्या हैं, वे कितने भारी हैं, या गुरुत्वाकर्षण कैसे काम करता है। उसे सब कुछ शुरू से सीखना पड़ता है: संतुलन कैसे बनाना है, जमीन को कैसे धकेलना है, और कैसे गिरना नहीं है। इसमें बहुत लंबा समय लगता है, लाखों अभ्यास प्रयासों की आवश्यकता होती है (जो महंगा और धीमा है), और अक्सर रोबce अच्छा होने से पहले बहुत बार गिर जाता है।

नया विचार: "स्मार्ट बूटकैंप"
यह शोध पत्र एक स्मार्ट तरीका प्रस्तावित करता है। शून्य से शुरू करने के बजाय, वे रोबोट को किसी विशिष्ट कौशल जैसे कि स्कीइंग या दौड़ने का प्रयास करने से पहले एक "वार्म-अप" सत्र देते हैं।

इसे इस तरह समझें: रोबोट के मैराथन दौड़ने की कोशिश करने से पहले, हम उसे एक सामान्य जिम क्लास में भेजते हैं। इस जिम क्लास में, रोबोट यह नहीं सीखता कि दौड़ कैसे लगानी है। इसके बजाय, वह केवल अपने शरीर की बुनियादी बातें सीखता है:

  • "मेरे पैर भारी हैं।"
  • "अगर मैं बहुत ज़ोर से धक्का दूँगा, तो मैं फिसल सकता हूँ।"
  • "अगर मैं बहुत आगे झुक गया, तो मैं गिर जाऊँगा।"
  • "जब मैं अपने अंगों को हिलाता हूँ, तो मेरे जोड़ कैसे चलते हैं।"

इसे प्रीट्रेनिंग (Pretraining) कहा जाता है। रोबोट डेटा का एक विशाल भंडार एकत्र करता है जहाँ वह बिना किसी विशिष्ट लक्ष्य के केवल अपने स्वयं के मूवमेंट को एक्सप्लोर करता है। वह अपने शरीर के भौतिक विज्ञान (उसकी 'एम्बॉडमेंट') को सीखता है।

गुप्त नुस्खा: "बॉडी मैप" (PIDM)
शोधकर्ताओं ने एक विशेष न्यूरल नेटवर्क बनाया जिसे प्रोपियोसेप्टिव इनवर्स डायनेमिक्स मॉडल (PIDM) कहा जाता है।

  • प्रोपियोसेप्टिव (Proprioceptive) का अर्थ है "यह जानना कि आपके शरीर के अंग कहाँ हैं।"
  • इनवर्स डायनेमिक्स (Inverse Dynamics) एक फैंसी तरीका है यह कहने का: "यदि मैं अपना पैर इस तरह हिलाना चाहता हूँ, तो मुझे कितना बल लगाने की आवश्यकता है?"
    "जिम क्लास" (प्रीट्रेनिंग) के दौरान, रोबमाट यह अनुमान लगाना सीखता है: "यदि मैं अपना पैर इस तरह हिलाता हूँ, तो मेरा शरीर अगली बार कहाँ होगा?" यह अपने शरीर के भौतिक विज्ञान का एक मानसिक मानचित्र (Mental Map) बनाता है।

जादुई ट्रिक: "हेड स्टार्ट"
एक बार जब रोबोट के पास यह "बॉडी मैप" आ जाता है, तो वे इसे फेंकते नहीं हैं। इसके बजाय, वे इस मैप को रोबोट के दिमाग में इंस्टॉल कर देते हैं इससे पहले कि वह वास्तविक कार्यों (जैसे दौड़ना या चढ़ना) को सीखना शुरू करे।

  • प्रीट्रेनिंग के बिना: रोबोट एक खाली दिमाग के साथ शुरुआत करता है। उसे हर बार नया कौशल सीखने के लिए यह फिर से सीखना पड़ता है कि "मेरा पैर भारी है" और "ऊपर जाने के लिए मुझे नीचे की ओर धकेलना होगा।"
  • प्रीट्रेनिंग के साथ: रोबोट के पास पहले से ही "बॉडी मैप" इंस्टॉल होता है। वह पहले से ही जानता है कि उसका शरीर कैसे काम करता है। अब, उसे केवल विशिष्ट ट्रिक (जैसे, "ठीक है, अब मुझे तेज़ दौड़ना है" या "अब मुझे दीवार के ऊपर से कूदना है") सीखने की आवश्यकता है।

परिणाम: तेज़ और बेहतर
उन्होंने तीन अलग-अलग प्रकार के रोबोटों (दो कुत्ते जैसे रोबोट और एक मानव जैसा रोबोट) पर नौ अलग-अलग कार्यों (चलना, चढ़ना, कूदना, आदि) के माध्यम से इस परीक्षण किया।

परिणाम प्रभावशाली थे:

  1. तेज़ सीखना: रोबोट 37% तेज़ी से सीखे। उन्हें कुशल होने के लिए कम अभ्यास प्रयासों की आवश्यकता पड़ी क्योंकि उन्होंने बुनियादी भौतिकी को फिर से सीखने में समय बर्बाद नहीं किया।
  2. बेहतर प्रदर्शन: रोबोट अपने कार्यों में 7% बेहतर रहे। क्योंकि वे अपने शरीर की ठोस समझ के साथ शुरू हुए थे, इसलिए वे अपने आंदोलनों को अधिक सटीकता से परिष्कृत (Fine-tune) कर सके।

उपमा सारांश

  • पुराना तरीका: एक छात्र को पहले दिन ही बिना किसी पूर्व शिक्षा के गणित का टेस्ट देना। वह संघर्ष करता है, असफल होता है, और उसे पकड़ने में वर्षों लग जाते हैं।
  • नया तरीका: छात्र को पहले बुनियादी गणित (जोड़, घटाव, ज्यामिति) की ठोस नींव देना। फिर, जब वह उन्नत कैलकुलस टेस्ट देता है, तो उसे यह फिर से सीखने की आवश्यकता नहीं होती कि संख्या क्या है; वह पूरी तरह से जटिल समस्याओं को हल करने पर ध्यान केंद्रित कर सकता है।

यह क्यों मायने रखता है
यह तरीका रोबोटिक शरीरों के लिए एक "यूनिवर्सल ट्रांसलेटर" की तरह है। एक बार जब आप रोबोट कुत्ते को उसके अपने शरीर के भौतिक विज्ञान पर प्रशिक्षित कर लेते हैं, तो आप उसी ज्ञान का उपयोग उसे चलने, दौड़ने या सीढ़ियाँ चढ़ने के लिए सिखाने के लिए कर सकते हैं। आपको हर नए काम के लिए उसे शुरू से फिर से प्रशिक्षित करने की आवश्यकता नहीं है। यह रोबोट को सिखाना बहुत सस्ता, तेज़ और अधिक कुशल बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →