← नवीनतम पेपर
💻 computer science

Learning Agile Striker Skills for Humanoid Soccer Robots from Noisy Sensory Input

यह शोधपत्र एक चार-चरणीय सुदृढीकरण शिक्षण (reinforcement learning) ढांचे को प्रस्तुत करता है जो ग्राउंड ट्रुथ डेटा के साथ एक शिक्षक नीति (teacher policy) को प्रशिक्षित करके और इसे सिम-टू-रियल अंतराल को पाटने के लिए बाधा-युक्त सुदृढीकरण शिक्षण (constrained RL) और यथार्थवादी शोर मॉडलिंग के माध्यम से अनुकूलित छात्र नीति (student policy) में संकलित (distill) करके, मानव सदृश सॉकर रोबोटों को शोर युक्त संवेदी इनपुट और बाहरी विक्षोभों के तहत मजबूत, निरंतर बॉल-किकिंग निष्पादित करने में सक्षम बनाता है।

मूल लेखक: Zifan Xu, Myoungkyu Seo, Dongmyeong Lee, Hao Fu, Jiaheng Hu, Jiaxun Cui, Yuqian Jiang, Zhihan Wang, Anastasiia Brund, Joydeep Biswas, Peter Stone

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zifan Xu, Myoungkyu Seo, Dongmyeong Lee, Hao Fu, Jiaheng Hu, Jiaxun Cui, Yuqian Jiang, Zhihan Wang, Anastasiia Brund, Joydeep Biswas, Peter Stone

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को फुटबॉल खेलना सिखा रहे हैं। विशेष रूप से, आप चाहते हैं कि वह मैदान में दौड़कर जाए, चलती हुई गेंद को पहचाने और उसे सीधे गोल में किक मारे। अब, कल्पना कीजिए कि आप यह सब तब कर रहे हैं जब रोबोट एक पैर पर संतुलन बना रहा है, उसकी "आंखें" धुंधली हैं, और उसका दिमाग कभी-कभी जो देखता है उसे प्रोसेस करने में धीमा हो जाता है। यही वह चुनौती है जिसे यह शोध पत्र (paper) हल करता है।

यूनिवर्सिटी ऑफ टेक्सस एट ऑस्टिन और सोनी एआई (Sony AI) के शोधकर्ताओं ने एक ऐसा प्रशिक्षण सिस्टम विकसित किया है जो एक अनाड़ी रोबोट को एक ऐसे "स्ट्राइकर" में बदल देता है जो इन अव्यवस्थित, वास्तविक दुनिया की स्थितियों को संभाल सके। उन्होंने इसे कैसे किया, इसे सरल उपमाओं (analogies) के माध्यम से यहाँ समझाया गया है।

मुख्य समस्या: "धुंधली आंखों वाला" एथलीट

एक आदर्श वीडियो गेम में, रोबोट को पता होता है कि गेंद कहाँ है और उसकी गति कितनी है। वास्तविक दुनिया में, कैमरे शोर (noisy) पैदा करते हैं, डेटा में देरी होती है, और गेंद एक पल के लिए ओझल हो सकती है। यदि आप रोबोट को केवल पूर्ण जानकारी के साथ सिखाते हैं, तो वह कंप्यूटर से बाहर कदम रखते ही विफल हो जाएगा।

इस शोध पत्र का लक्ष्य एक ह्यूमनॉइड रोबोट को निरंतरता (दौड़ना, किक मारना, मुड़ना, फिर से दौड़ना) के साथ फुटबॉल किक करना सिखाना था, भले ही उसका संवेदी इनपुट (sensory input) अपूर्ण हो।

समाधान: एक चार-चरणीय "स्कूल" प्रणाली

सब कुछ एक साथ सिखाने के बजाय, टीम ने एक चार-चरणीय प्रशिक्षण पाइपलाइन बनाई। इसे एक स्पोर्ट्स एकेडमी की तरह समझें जिसमें "विशेषाधिकार प्राप्त कोच" (Privileged Coach) से लेकर "वास्तविक दुनिया के खिलाड़ी" (Real-World Player) तक एक सख्त प्रगति क्रम है।

चरण 1: विशेषाधिकार प्राप्त कोच (लंबी दूरी का पीछा करना)

सबसे पहले, वे एक "शिक्षक" (Teacher) रोबोट को प्रशिक्षित करते हैं। इस रोबोट के पास सुपरपावर्स हैं: यह बिना किसी धुंधलेपन या देरी के गेंद और गोल को पूरी तरह देख सकता है।

  • कार्य: शिक्षक सीखता है कि दूर से गेंद की ओर कैसे दौड़ना है, चाहे वह कहीं से भी शुरू हो।
  • ट्रिक: वे शिक्षक का संतुलन बिगाड़ देते हैं (उसे धक्का देकर या गेंद को हिलाकर) ताकि उसे यह सीखने में मदद मिले कि कैसे खुद को संभालना है और दौड़ना जारी रखना है। यह एक कोच की तरह है जो ट्रम्पोलिन पर अभ्यास करता है ताकि यह सीख सके कि जमीन हिलने पर भी सीधा कैसे खड़ा रहना है।

चरण 2: सटीक किक (दिशात्मक किकिंग)

उसी "शिक्षक" रोबोट को अब किक मारना सिखाया जाता है।

  • कार्य: यह पैर को घुमाना, गेंद को हिट करना और गोल की ओर निशाना लगाना सीखता है।
  • ट्रिक: चरण 1 की तरह ही, वे रोबोट को किक मारने की कोशिश के दौरान धक्का देते रहते हैं। यह रोबोट को यह सीखने के लिए मजबूर करता है कि यदि वह थोड़ा असंतुलित है या गेंद अजीब तरह से चल रही है, तो भी सटीक किक कैसे मारी जाए।

चरण 3: छात्र सीखता है (डिस्टिलेशन/Distillation)

अब कठिन हिस्सा आता है। वे एक "छात्र" (Student) रोबोट को पेश करते हैं। यह रोबोट सामान्य है: इसकी दृष्टि धुंधली है, अपडेट धीमे हैं, और कभी-कभी गेंद इसकी दृष्टि से गायब हो जाती है (जैसे जब वह पैर के पीछे चली जाती है)।

  • विधि: छात्र, शिक्षक की नकल करने की कोशिश करता है। लेकिन यहाँ एक पेच है: छात्र को DAgger नामक तकनीक का उपयोग करके प्रशिक्षित किया जाता है।
  • उपमा: कल्पना कीजिए कि एक छात्र ड्राइवर अपने मास्टर से सीख रहा है। मास्टर बिल्कुल सही ड्राइव करता है, लेकिन छात्र गलतियाँ करता है। जब छात्र गाड़ी मोड़ता है, तो मास्टर केवल "फिर से कोशिश करो" नहीं कहता; मास्टर उस सटीक क्षण में स्टीयरिंग संभाल लेता है ताकि छात्र को उसकी विशिष्ट गलती के लिए सही चाल दिखा सके। छात्र न केवल मास्टर के आदर्श पथ से सीखता है, बल्कि अपनी गलतियों से उबरने के तरीके से भी सीखता है।

चरण 4: अंतिम पॉलिश (अनुकूलन/Adaptation)

शिक्षक की नकल करने के बाद भी, छात्र रोबोट अभी भी थोड़ा झटकेदार (jittery) था। वह बहुत तीखे, झटकेदार मोड़ लेता था या बहुत ज्यादा किक मारता था क्योंकि वह अपने सेंसरों के "शोर" (noise) से भ्रमित था।

  • समाधान: शोधकर्ताओं ने एक विशेष "कन्स्ट्रेंड आरएल" (Constrained RL) एल्गोरिदम का उपयोग किया।
  • उपमा: एक सख्त जिम कोच की तरह सोचें जो कहता है, "आप तेज़ दौड़ सकते हैं, लेकिन आप अपना घुटना नहीं मोड़ सकते।" रोबोट को सीखने की अनुमति है, लेकिन यदि वह बहुत अधिक झटकेदार या असुरक्षित हरकतें करता है, तो उसे दंडित किया जाता है। यह रोबोट की गति को सुचारू बनाता है, जिससे वह एक प्राकृतिक एथलीट की तरह दिखता है न कि किसी ग्लिच वाले वीडियो गेम कैरेक्टर की तरह।

परिणाम: सिमुलेशन से वास्तविकता तक

टीम ने इस प्रणाली का परीक्षण दो तरीकों से किया:

  1. कंप्यूटर में (सिमुलेशन): उन्होंने रोबोट को हजारों अलग-अलग परिदृश्यों में डाला। "धुंधली आंखों" के बावजूद, रोबोट ने गेंद को गोल में 79.5% बार किक मारा।
  2. वास्तविक दुनिया में: उन्होंने इस कोड को Booster T1 नामक एक असली रोबोट पर लागू किया।
    • परिणाम: रोबोट ने विभिन्न स्थितियों में गोल करने की 66.7% सफलता दर हासिल की।
    • दक्षता: रोबोट ऊर्जा के मामले में भी स्मार्ट होना सीख गया। यदि गेंद गोल के करीब थी, तो उसने ऊर्जा बचाने के लिए धीरे से किक मारी। यदि वह दूर थी, तो उसने ज़ोर से किक मारी।

यह क्यों महत्वपूर्ण है

शोध पत्र निष्कर्ष निकालता है कि यह "शिक्षक-छात्र" दृष्टिकोण, "कन्स्ट्रेंड आरएल" (सख्त कोच) के साथ मिलकर, आवश्यक है। अंतिम पॉलिशिंग चरण के बिना, रोबोट वास्तविक दुनिया में काम करने के लिए बहुत अधिक झटकेदार होगा। "शोर" वाले प्रशिक्षण के बिना, रोबोट कंप्यूटर से बाहर निकलते ही विफल हो जाएगा।

संक्षेप में: उन्होंने एक रोबोट को फुटबॉल स्ट्राइकर बनना सिखाया—पहले उसे पूर्ण दृष्टि के साथ अभ्यास करने दिया, फिर उसे अपनी गलतियों से सीखते हुए खराब दृष्टि के साथ अभ्यास करने के लिए मजबूर किया, और अंत में उसकी गतिविधियों को सुचारू बनाने के लिए कोचिंग दी ताकि वह अपने ही पैरों में उलझकर गिर न जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →