← नवीनतम पेपर
🤖 AI

Reinforcement Learning Enabled Adaptive Multi-Task Control for Bipedal Soccer Robots

यह शोध पत्र एक मॉड्यूलर सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) ढांचे का प्रस्ताव करता है जो ओपन-लूप ऑसिलेटर्स को फीडबैक रेसिडुअल रणनीतियों और एक पोस्चर-ड्रिवन स्टेट मशीन के साथ एकीकृत करता है ताकि द्विपद (बायपेडल) सॉकर रोबोट्स को गतिशील वातावरण में स्थिर बॉल हैंडलिंग और तीव्र स्वायत्त पतन रिकवरी सक्षम करने के लिए अनुकूल बहु-कार्य नियंत्रण प्राप्त करने में सक्षम बनाया जा सके।

मूल लेखक: Yulai Zhang, Yinrong Zhang, Ting Wu, Linqi Ye

प्रकाशित 2026-04-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yulai Zhang, Yinrong Zhang, Ting Wu, Linqi Ye

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि टिनकर (Tinker) नाम का एक छोटा सा, दो पैरों वाला रोबोट एक अस्त-व्यस्त, बिखरे हुए कमरे में फुटबॉल खेलने की कोशिश कर रहा है। फुटबॉल खेलना इंसानों के लिए भी कठिन है, लेकिन एक रोबोट के लिए यह भौतिक विज्ञान (physics) का एक दुस्वप्न है: उसे बिना गिले चलना होता है, एक चलती हुई गेंद को ढूँढना होता है, उसे किक मारनी होती है, और अगर वह गिर भी जाता है, तो उसे बिना किसी की मदद के तुरंत वापस खड़ा होना होता है।

यह शोध पत्र इस बारे में है कि कैसे टिनकर को यह सब अपने आप करने के लिए सिखाया जाए, जिसका उपयोग करने के लिए एक विशेष प्रकार के "दिमाग" का उपयोग किया जाता है जिसे सुदृढीकरण सीखना (Reinforcement Learning - RL) कहते हैं। हर एक चाल को हाथ से प्रोग्राम करने के बजाय, शोधकर्ताओं ने रोबोट को गलती और सुधार (trial and error) के माध्यम से सीखने दिया, ठीक वैसे ही जैसे एक पिल्ला गेंद पकड़ना सीखता है।

यहाँ इसका सरल विवरण दिया गया है कि उन्होंने इसे कैसे सफल बनाया, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: एक साथ बहुत कुछ करना

कल्पना कीजिए कि आप जुगलबंदी (juggling) करते हुए, गाना गाते हुए और एक कुत्ते से बचते हुए कमरे के आर-पार जाने की कोशिश कर रहे हैं। यदि आप तीनों चीजें एक ही समय में शून्य से सीखने की कोशिश करेंगे, तो आप तुरंत लड़खड़ाकर गिर जाएंगे।

शोधकर्ताओं को समझ आया कि एक रोबट को फुटबॉल खेलने और साथ ही चलने के लिए सिखाना बहुत भ्रमित करने वाला था। रोबोट का "दिमाग" मिश्रित संकेत प्राप्त कर रहा था: क्या मुझे अपने पैरों को संतुलित करना चाहिए? या क्या मुझे गेंद को देखना चाहिए?

2. समाधान: एक "रिदम सेक्शन" और एक "सोलोइस्ट"

इसे ठीक करने के लिए, उन्होंने रोबोट के दिमाग को दो अलग-अलग हिस्सों में विभाजित किया, जैसे कि एक बैंड:

  • रिदम सेक्शन (द ऑसिलेटर): यह हिस्सा एक ड्रमर की तरह है। इसे गेंद या खेल की परवाह नहीं है; यह बस एक स्थिर ताल बनाए रखता है। यह स्वचालित रूप से बुनियादी "चलने की लय" उत्पन्न करता है। यह एक मेट्रोनोम की तरह है जो रोबोट के पैरों को बताता है, "कदम, कदम, कदम।" यह सुनिश्चित करता है कि रोबट चलना कभी न भूले।
  • सोलोइस्ट (द आरएल ब्रेन): यह हिस्सा एक जैज़ संगीतकार की तरह है। यह लय को सुनता है लेकिन इसमें शानदार बदलाव जोड़ता है। यह तय करता है, "ठीक है, गेंद उस तरफ है, मुझे बाईं ओर झुकने की जरूरत है," या "मुझे जोर से किक मारनी होगी।"

जादू: रोबोट की अंतिम गति लय (चलना) और सोलोइस्ट के सुधार (गेंद के लिए समायोजन) का मिश्रण है। यह रोबोट को स्मार्ट बनाते हुए भी स्थिर रखता है।

3. "स्विच" तंत्र: दो अलग-अलग प्लेबुक

सबसे बड़ी चुनौती यह है कि जब रोबोट गिर जाता है तो क्या होता है। जब आप फर्श पर लेटे हों, तो आप "फुटबॉल प्लेबुक" का उपयोग नहीं कर सकते; आपको "वापस उठने वाली प्लेबुक" की आवश्यकता होती है।

शोधकर्ताओं ने एक पोस्चर-ड्रिवन स्विच (एक स्मार्ट लाइट स्विच की तरह) बनाया:

  • परिदृश्य A (खड़े होना): रोबोट गेंद देखता है। वह स्विच को बॉल नेटवर्क पर घुमा देता है। वह इस बात को नजरअंदाज कर देता है कि वह गिर सकता है और पूरी तरह से गेंद को खोजने और किक मारने पर ध्यान केंद्रित करता है।
  • परिदृश्य B (गिरना): रोबोट के आंतरिक सेंसर (जैसे मानव कान का आंतरिक हिस्सा) पता लगाते हैं कि वह बहुत अधिक झुक रहा है। क्लिक! स्विच तुरंत रिकवरी नेटवर्क पर बदल जाता है। गेंद को भुला दिया जाता है। एकमात्र लक्ष्य खड़ा होना है।
  • परिदृश्य C (वापस पैरों पर आना): जैसे ही रोबोट फिर से सीधा खड़ा हो जाता है, स्विच वापस बॉल नेटवर्क पर चला जाता है, और वह तुरंत खेल फिर से शुरू कर देता है।

यह रोबोट को भ्रमित होने से रोकता है। वह जमीन पर होने के दौरान गेंद को किक मारने की कोशिश कभी नहीं करता; वह पहले केवल खड़े होने पर ध्यान केंद्रित करता है।

4. प्रशिक्षण विधि: "ट्रेनिंग व्हील्स"

गिरने के बाद खड़े होने के लिए रोबोट को सिखाना अविश्वसनीय रूप से कठिन है। यदि आप इसे बस फर्श पर फेंक देंगे, तो यह शायद कभी सीख नहीं पाएगा।

शोधकर्ताओं ने करिकुलम लर्निंग (Curriculum Learning) नामक एक तकनीक का उपयोग किया, जो साइकिल चलाने के "ट्रेनिंग व्हील्स" (सहायक पहियों) की तरह है:

  1. स्तर 1: जब रोबक गिरता है, तो कंप्यूटर उसे ऊपर उठाने में मदद करने के लिए एक "जादुई हाथ" देता है। यह आसान है।
  2. स्तर 2: जैसे-जैसे रोबोट बेहतर होता है, कंप्यूटर धीरे-धीरे "जादुई हाथ" को हटा देता है, जिससे उसे कम मदद मिलती है।
  3. स्तर 3: अंततः, रोबोट को पूरी तरह से अपने दम पर खड़ा होना पड़ता है।

यह चरण-दर-चरण दृष्टिकोण ने रोबोट को हताश (या एक खराब "लर्निंग लूप" में फंसने) से बचाया और उसे तेजी से कौशल में महारत हासिल करने की अनुमति दी।

5. परिणाम: द अल्टीमेट सॉकर बॉट

एक आभासी दुनिया (Unity नामक वीडियो गेम सिमुलेशन) में प्रशिक्षण के बाद, उन्होंने रोबोट का परीक्षण किया। यहाँ हुआ:

  • गति: जब रोबोट गिरा, तो वह 0.7 सेकंड से भी कम समय में वापस खड़ा हो गया। यह मानव पलक झपकने की गति से भी तेज है!
  • चपलता: वह तंग कोनों में भी गेंद को ढूंढ सकता था और उसे सीधे गोल में किक मार सकता था।
  • सुगमता: "फुटबॉल खेलने" और "उठने" के बीच का स्विच इतना सहज था कि आप रोबोट की हिचकिचाहट को देख भी नहीं सकते थे।

बड़ी तस्वीर

यह शोध पत्र दिखाता है कि एक जटिल समस्या को छोटे, प्रबंधनीय टुकड़ों में तोड़कर (चलना बनाम खेलना बनाम उबरना) और उन्हें प्रबंधित करने के लिए एक स्मार्ट "स्विच" का उपयोग करके, हम बहुत अधिक मजबूत और मानवीय गतिविधियों वाले रोबोट बना सकते हैं।

यह एक बच्चे को साइकिल चलाना सिखाने जैसा है: पहले, आप उसे संतुलन बनाना सिखाते हैं (ऑसिलेटर), फिर आप उसे स्टीयरिंग करना सिखाते हैं (आरएल), और यदि वह गिर जाता है, तो आपके पास वापस आने के लिए एक विशिष्ट दिनचर्या होती है (रिकवरी नेटवर्क)। एक बार जब वे इन तीनों में महारत हासिल कर लेते हैं, तो वे कहीं भी सवारी कर सकते हैं, यहाँ तक कि ऊबड़-खाबड़ सड़कों पर भी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →