← नवीनतम पेपर
💻 computer science

Vision-Based Dribbling for Humanoid Soccer via Privileged Representation Learning

यह शोधपत्र एक एकीकृत सुदृढीकरण शिक्षण (reinforcement learning) ढांचे का प्रस्ताव करता है जो एक नीति (policy) में एक टेम्पोरल डेप्थ एनकोडर को समाहित करता है ताकि एक मानवोचित रोबोट (humanoid robot) को ऑनबोर्ड डेप्थ अवलोकनों से सीधे स्थिर और गतिशील विरोधियों के विरुद्ध मजबूत, विजन-आधारित सॉकर ड्रिबलिंग सीखने में सक्षम बनाया जा सके, जिससे स्पष्ट अवस्था अनुमान (state estimation) या विशेषाधिकार प्राप्त जानकारी पर निर्भर किए बिना उच्च सफलता दर प्राप्त की जा सके।

मूल लेखक: Flavio Maiorana, Valerio Spagnoli, Eugenio Bugli, Flavio Volpi, Daniele Affinita, Vincenzo Suriani, Daniele Nardi, Luca Iocchi

प्रकाशित 2026-07-15
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Flavio Maiorana, Valerio Spagnoli, Eugenio Bugli, Flavio Volpi, Daniele Affinita, Vincenzo Suriani, Daniele Nardi, Luca Iocchi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक रोबोटिक सॉकर खिलाड़ी की कल्पना कीजिए जो हाई-टेक चश्मे पहने हुए मैदान में गेंद को ड्रिबल करने की कोशिश कर रहा है। अब, कल्पना कीजिए कि इसके सिर में कोई सुपरकंप्यूटर नहीं है जो गेंद और दुश्मनों की सटीक गति और स्थिति जानता हो, बल्कि इस रोबोट को अपने ही चश्मे से वीडियो फीड देखकर सब कुछ समझना है, और वह भी गिरते हुए खुद को संभालने की कोशिश के बीच। यह उस रोमांचक चुनौती के बारे में है जिसे इस शोध पत्र में संबोधित किया गया है।

शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जहाँ एक ह्यूमनॉइड रोबोट "देखने" और "चलने" को एक बड़े मस्तिष्क में जोड़कर सॉकर बॉल को ड्रिबल करना सीखता है। आमतौर पर, रोबोटों को एक रिले रेस की तरह बनाया जाता है: एक टीम गेंद का पता लगाती है, जानकारी दूसरी टीम को भेजती है जो रास्ता तय करती है, और तीसरी टीम पैरों को चलाती है। लेकिन लेखक तर्क देते हैं कि यह पुराना तरीका किसी ऐसी कार को चलाने जैसा है जिसमें आप केवल किसी और द्वारा बनाए गए नक्शे को देख रहे हों; यदि नक्शा थोड़ा भी गलत है या गेंद एक पल के लिए छिप जाती है, तो ड्राइवर दुर्घटनाग्रस्त हो जाता है। इसके बजाय, उन्होंने रोबोट को धारणा (perception) और नियंत्रण (control) को एक साथ सीखना सिखाया, जैसे कोई इंसान हर डगमगाहट के भौतिकी (physics) की गणना करने के बजाय संतुलन महसूस करके साइकिल चलाना सीखता है।

इस रोबोट को सिखाने के लिए, उन्होंने एक चतुर दो-चरणीय प्रशिक्षण शिविर का उपयोग किया। पहले, उन्होंने रोबोट को एक वीडियो गेम सिमुलेशन में अभ्यास करने दिया जहाँ उसके पास "चीट कोड्स" (जिसे विशेषाधिकार प्राप्त जानकारी या privileged information कहा जाता है) थे। उसे ठीक-ठीक पता था कि गेंद और दुश्मन कहाँ थे, भले ही वे किसी दीवार के पीछे क्यों न हों। रोबट ने इस 'चीट-मोड' में पूरी तरह से ड्रिबल करना सीखा, यह महारत हासिल की कि कैसे गेंद को करीब रखा जाए और बाधाओं से बचा जाए। फिर, दूसरे चरण में, उन्होंने चीट कोड्स छीन लिए। उन्होंने एक विशेष "विज़न एनकोडर" (vision encoder)—इसे एक छात्र ट्यूटर समझें—को प्रशिक्षित किया ताकि वह उसी डेप्थ-कैमरा वीडियो को देख सके जो वास्तविक दुनिया में रोबोट देखेगा और अनुमान लगा सके कि "चीट कोड" नंबर क्या रहे होंगे। रोबोट के मस्तिष्क ने फिर इन अनुमानों का उपयोग निर्णय लेने के लिए किया, प्रभावी रूप से केवल अपनी आँखों का उपयोग करके खेल खेलना सीख लिया।

इस प्रशिक्षण के परिणाम प्रभावशाली थे, लेकिन कुछ विशिष्ट सीमाओं के साथ। जब रोबोट खाली मैदान में खेला जिसमें गेंद चुराने की कोशिश करने वाला कोई नहीं था, तो वह एक आदर्श सितारा था, और 100% बार सफल रहा। जब उन्होंने इसके रास्ते में एक स्थिर बाधा (जैसे शंकु या दीवार) जोड़ी, तो इसने अभी भी शानदार काम किया, 96% बार सफल रहा और लक्ष्य तक पहुँचने में केवल थोड़ा अधिक समय लिया।

हालाँकि, कहानी तब बदल जाती है जब रोबोट का सामना एक चलते हुए दुश्मन से होता है। जब एक दूसरे रोबोट को गेंद का पीछा करने और उसे मारकर दूर करने के लिए प्रोग्राम किया गया, तो सफलता दर गिरकर 46% रह गई। इन सिमुलेशन में, रोबोट या तो गिर गया या उसने गेंद खो दी, और वह 68% बार प्रतिद्वंद्वी से टकरा गया। लेखकों का सुझाव है कि जबकि रोबोट अकेले देखने और चलने में बहुत अच्छा है, असली चुनौती एक जीवित, चलते हुए प्रतिद्वंद्वी के प्रति प्रतिक्रिया देना है जो सक्रिय रूप से हस्तक्षेप करने की कोशिश कर रहा है। रोबोट की आँखें ठीक काम कर रही थीं—वह अभी भी गेंद और दुश्मन को काफी हद तक देख सकता था—लेकिन "मस्तिष्क" को यह समझने की आवश्यकता थी कि बिना गिरे एक चलते हुए लक्ष्य से कैसे बचा जाए, जो अभी भी एक निर्माणाधीन कार्य है।

यह याद रखना महत्वपूर्ण है कि यह सब बूस्टर टी1 (Booster T1) नामक एक विशिष्ट रोबोट मॉडल का उपयोग करते हुए एक कंप्यूटर सिमुलेशन के भीतर हुआ। लेखक सावधानी से कहते हैं कि यह भविष्य के लिए एक मजबूत आधार है, लेकिन उन्होंने अभी तक इसे वास्तविक मैदान पर एक वास्तविक रोबोट पर टेस्ट नहीं किया है। वे प्रस्ताव देते हैं कि वीडियो फीड से सीखने और संतुलन बनाए रखने के तरीके से रोबोट को सिखाना एक आशाजनक मार्ग है, लेकिन फिलहाल, रोबोट अभी भी एक वर्चुअल क्लासरूम में एक बहुत ही प्रतिभाशाली छात्र है, जो विश्व कप के लिए पूरी तरह तैयार नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →