← नवीनतम पेपर
🤖 AI

Skill Composition for Legged Robot Reinforcement Learning

यह शोध पत्र यह तर्क देता है कि स्वतंत्र, विशिष्ट उप-नीतियों (sub-policies) के विश्वसनीय संयोजन को एक अलग शोध समस्या के रूप में मानना, खंडित रोबोट कौशल को एक सत्यापन योग्य, विस्तार योग्य और सुरक्षित संग्रह में बदलने के लिए आवश्यक है जिसे उच्च-स्तरीय योजनाकारों (planners) द्वारा प्रभावी ढंग से प्रबंधित किया जा सके।

मूल लेखक: Daniel Gigliotti, Flavio Maiorana, Fabio Patrizi, Luca Iocchi

प्रकाशित 2026-09-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daniel Gigliotti, Flavio Maiorana, Fabio Patrizi, Luca Iocchi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

चलने, दौड़ने या चढ़ने वाले रोबोट अब केवल काल्पनिक सपने नहीं रह गए हैं; वे एक वास्तविकता बनते जा रहे हैं, जो 'डीप रिइन्फोर्समेंट लर्निंग' नामक एक विधि द्वारा संचालित हैं। इस दृष्टिकोण में, एक कंप्यूटर प्रोग्राम सिमुलेशन के भीतर परीक्षण और त्रुटि (ट्रायल एंड एरर) के माध्यम से एक रोबोट को नियंत्रित करना सीखता है, और अंततः पार्कौर या ऊबड़-खाबड़ रास्तों पर नेविगेट करने जैसे जटिल आंदोलनों में महारत हासिल कर लेता है। इस सफलता की कुंजी रोबोट को एक बार में एक विशिष्ट कार्य करने के लिए प्रशिक्षित करना रहा है, जैसे कि आगे की ओर चलना या गेंद को किक मारना। ये विशिष्ट नियंत्रक (कंट्रोलर्स) प्रशिक्षण में तेज़ और बहुत विश्वसनीय होते हैं क्योंकि वे एक संकीर्ण समस्या पर ध्यान केंद्रित करते हैं। हालाँकि, एक बड़ी बाधा अभी भी बनी हुई है: इन अलग-अलग कौशलों को सहजता से एक साथ कैसे काम कराया जाए। यदि किसी रोबोट को चलना है और फिर कूदना है, तो केवल "चलने" वाले कंट्रोलर से "कूदने" वाले कंट्रोलर पर स्विच करना अक्सर विफल हो जाता है। रोबोट अचानक रुक सकता है, जिससे वह अपनी गति खो देता है जो उसने बनाई थी, या वह गिर सकता है क्योंकि जंप कंट्रोलर उम्मीद करता है कि रोबोट स्थिर खड़ा हो, न कि गतिशील। चुनौती केवल कौशलों की एक लाइब्रेरी होने की नहीं है, बल्कि यह समझने की है कि रोबोट के संतुलन को बिगाड़े बिना या उसकी ऊर्जा बर्बाद किए बिना एक कौशल से दूसरे कौशल पर नियंत्रण कैसे सौंपा जाए।

सपिएन्ज़ा यूनिवर्सिटी ऑफ रोम के शोधकर्ता तर्क देते हैं कि इस हैंडओवर प्रक्रिया को, जिसे वे "कंपोजिशन" कहते हैं, इसे एक गंभीर वैज्ञानिक समस्या के रूप में माना जाना चाहिए, न कि केवल एक तकनीकी विवरण के रूप में जिसे आते-जाते ठीक किया जा सके। वे प्रस्ताव देते हैं कि एक विशाल मस्तिष्क बनाने के बजाय जो एक साथ सब कुछ कर सके, या कार्यों को बदलने के लिए रोबोट को रोकने के बजाय, हमें ऐसे सिस्टम बनाने चाहिए जहाँ स्वतंत्र विशेषज्ञ सुरक्षित रूप से संयोजित किए जा सकें। वे इसके दो मुख्य तरीके पहचानते हैं। पहला है "ब्लेंडिंग" (मिश्रण), जहाँ रोबोट की क्रियाएं दो कौशलों का एक सुचारू मिश्रण होती हैं जो एक ही समय में हो रही हैं, जैसे कि एक चलने वाला विशेषज्ञ और एक किक मारने वाला विशेषज्ञ मिलकर काम कर रहे हों। दूसरा है "ब्रिजिंग" (सेतु बनाना), जहाँ एक अस्थायी, विशेषीकृत कंट्रोलर एक पल के लिए नियंत्रण लेता है ताकि अगले कौशल के लिए रोबोट को तैयार किया जा सके। यह ब्रिज सुनिश्चित करता है कि भले ही रोबोट स्विच की आवश्यकता के समय एक अराजक स्थिति में हो, उसे एक ऐसी स्थिति में निर्देशित किया जा सके जहाँ अगला कौशल सफलतापूर्वक कार्यभार संभाल सके।

इन विचारों का परीक्षण करने के लिए, टीम ने एक ह्यूमनायड रोबोट के लिए एक प्रणाली बनाई जो बिना रुके एक गलियारे में चल सकता है और फिर कूद सकता है। चलने के कौशल को रोबोट को आगे बढ़ाने के लिए प्रशिक्षित किया गया था, और कूदने के कौशल को स्थिर अवस्था से प्रशिक्षित किया गया था। पारंपरिक सेटअप में, यदि रोबोट दौड़ते समय कूदने की कोशिश करता है, तो जंप कंट्रोलर विफल हो जाएगा क्योंकि उसने पहले कभी चलते हुए रोबोट को नहीं देखा है। शोधकर्ताओं ने इसे एक "ब्रिज" बनाकर हल किया। यह ब्रिज एक अल्पकालिक कंट्रोलर है जो कूदने का निर्णय लिए जाने के क्षण में सक्रिय होता है। इसका एकमात्र काम रोबोट को, जो वर्तमान में गतिशील है, उसे एक ऐसी स्थिति में ले जाना और झुकाव (क्रौचिंग) की स्थिति में लाना है जिसे जंप स्किल संभाल सके, और यह सब करते हुए उस आगे की गति को बनाए रखना है जो रोबोट ने बनाई थी। परिणाम यह है कि रोबोट सीधे चलने से कूदने में परिवर्तित हो जाता है, और कूदने के लिए अपनी गति का उपयोग करता है, न कि पहले रुकने के लिए। इसे सिमुलेशन में प्रदर्शित किया गया जहाँ रोबोट ने सफलतापूर्वक चलने से कूदने में संक्रमण किया, और पूरे ट्रांज़िशन के दौरान अपनी गति और संतुलन बनाए रखा।

शोधकर्ताओं ने एक अलग कार्य का उपयोग करके ब्लेंडिंग दृष्टिकोण का भी अन्वेषण किया: गेंद को किक मारना। यहाँ, उन्होंने चलने के कौशल को किक मारने के कौशल के साथ जोड़ा। दोनों के बीच स्विच करने के बजाय, उन्होंने दोनों क्रियाओं को मिलाने के लिए एक छोटे नेटवर्क का उपयोग किया। सिस्टम ने यह सीखा कि जब रोबोट गेंद से दूर हो तो मुख्य रूप से चलने के कौशल पर निर्भर रहना है, और जैसे-जैसे वह करीब आता है, धीरे-धीरे किक मारने के कौशल की ओर शिफ्ट होना है। इसने रोबोट को गेंद के पास पहुँचते समय स्वाभाविक रूप से अपनी चाल और शरीर की स्थिति को समायोजित करने की अनुमति दी, न कि किक मारने के लिए रुकने की। शोधकर्ताओं ने पाया कि मूल चलने और कूदने के कौशलों को अपरिवर्तित और स्थिर रखकर, और केवल उन छोटे नेटवर्क्स को प्रशिक्षित करके जो उन्हें मिलाने या स्विच करने का निर्णय लेते हैं, वे पूरे रोबोट को शुरू से फिर से प्रशिक्षित किए बिना जटिल व्यवहार बना सकते हैं।

उनके कार्य का एक महत्वपूर्ण हिस्सा यह विचार है कि कौशल को बदलने का निर्णय एक अलग, समझने योग्य घटक द्वारा किया जाना चाहिए, जैसे कि एक प्लानर या एक सरल नियम-आधारित प्रणाली, न कि एक ब्लैक-बॉक्स न्यूरल नेटवर्क द्वारा जो अप्रत्याशित निर्णय लेता है। निर्णय लेने वाले (डिसीजन-मेकर) को क्रिया करने वाले (एक्शन-टेकर) से अलग करके, और एक ब्रिज का उपयोग करके कठिन ट्रांज़िशन को संभालने के लिए, शोधकर्ताओं का मानना है कि रोबलों को अधिक सुरक्षित और विश्वसनीय बनाया जा सकता है। यदि एक प्लानर निर्णय लेता है कि रोबोट को कूदना चाहिए, तो उसे इस बात की जटिल भौतिकी जानने की आवश्यकता नहीं है कि रोबोट को कूदने की स्थिति में कैसे लाया जाए; उसे बस कूदने के लिए कहना है। ब्रिज उस कठिन हिस्से को संभालता है जो रोबोट को तैयार करने के लिए आवश्यक है। यह दृष्टिकोण कौशलों की एक ऐसी लाइब्रेरी की अनुमति देता है जो समय के साथ बढ़ सकती है, पुराने कौशलों को तोड़े बिना नए व्यवहार जोड़ सकती है। हालांकि वर्तमान परिणाम सिमुलेशन और विशिष्ट परीक्षण मामलों पर आधारित हैं, यह कार्य एक ऐसे पथ का सुझाव देता है जिससे रोबोट को ऐसे निर्माण किया जा सके जो सब कुछ एक साथ सीखने के बजाय, सरल और विश्वसनीय कौशलों को जोड़कर लंबी, जटिल प्रक्रियाओं को संभाल सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →