Learning Athletic Humanoid Tennis Skills from Imperfect Human Motion Data
यह शोध पत्र LATENT को प्रस्तुत करता है, जो एक ऐसा सिस्टम है जो मानव गति के अपूर्ण और खंडित डेटा को प्रिमिटिव स्किल्स (primitive skills) के लिए प्रायर्स (priors) के रूप में उपयोग करके, ह्यूमनॉइड रोबोट्स को मजबूत और स्वाभाविक टेनिस कौशल सीखने में सक्षम बनाता है, जिन्हें फिर यूनिट्री जी1 (Unitree G1) रोबोट पर स्थिर मल्टी-शॉट रैलियों को प्राप्त करने के लिए परिष्कृत और संयोजित किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को पेशेवर टेनिस खेलना सिखाने की कोशिश कर रहे हैं। सबसे बड़ी समस्या? हमारे पास इस बात का सटीक वीडियो फुटेज नहीं है कि इंसान वास्तव में इसे कैसे करते हैं।
असली टेनिस मैच अराजक होते हैं। खिलाड़ी बहुत लंबी दूरी तय करते हैं, बिजली जैसी तेजी से बल्ला घुमाते हैं, और उनकी कलाइयां ऐसे मुड़ती हैं जिन्हें कैमरों के साथ सटीक रूप से रिकॉर्ड करना बेहद कठिन होता है। एक रोबोट को नकल करने के लिए एक पूर्ण, लंबे टेनिस मैच को रिकॉर्ड करने की कोशिश करना वैसा ही है जैसे 50 फीट की दूरी से एक हिलते हुए, कम-रिज़ॉल्यूशन वाले कैमरे से हमिंगबर्ड (hummingbird) के पंखों की फड़फड़ाहट को फिल्माने की कोशिश करना। आपको सामान्य विचार तो मिल जाता है, लेकिन बारीकियां धुंधली रह जाती हैं।
यह शोध पत्र LATENT नामक एक प्रणाली पेश करता है (जिसका अर्थ है Learns Athletic humanoid TEnnis skills from imperfect human motion daTa)। LATENT को एक प्रतिभाशाली कुकिंग इंस्ट्रक्टर (रसोइया शिक्षक) के रूप में समझें जो एक रोबोट शेफ को केवल एक आदर्श रेसिपी दिखाकर नहीं सिखाता, बल्कि उसे काटने, चलाने और पलटने के कुछ रफ स्केच दिखाकर सिखाता है, और फिर रोबोट को बाकी चीजें खुद समझने देता है।
यह कैसे काम करता है, यहाँ सरल चरणों में दिया गया है:
1. "रफ स्केच" डेटा (अपूर्ण गति)
एक पूरा टेनिस मैच फिल्माने के बजाय, शोधकर्ताओं ने पांच शौकिया खिलाड़ियों से एक छोटे कमरे में बुनियादी चालें करने के लिए कहा:
- फोरहैंड (forehand) कैसे घुमाएं।
- बैकहैंड (backhand) कैसे करें।
- साइड में कैसे खिसकें (shuffle)।
- दौड़ने के लिए पैर कैसे क्रॉस करें।
उन्होंने इन छोटी क्लिप्स को रिकॉर्ड किया। यह डेटा "अपूर्ण" है क्योंकि:
- यह धुंधला है: कैमरे कलाई की छोटी, तेज़ गतिविधियों को पूरी तरह से कैप्चर नहीं कर सके।
- यह अधूरा है: क्लिप्स यह नहीं दिखातीं कि इन चालों का उपयोग गेंद मारने के लिए कैसे किया जाए; वे केवल चालों को ही दिखाती हैं।
2. "गुप्त भाषा" (Latent Action Space)
रोबोट को इन चालों को सीखने की आवश्यकता है, लेकिन यदि वह धुंधली कलाई की गतिविधियों की हुबहू नकल करने की कोशिश करेगा, तो वह विफल हो जाएगा। इसलिए, शोधकर्ताओं ने एक "गुप्त भाषा" (एक लेटेंट स्पेस) बनाई।
कल्पना कीजिए कि रोबट के पास "मूव कार्ड्स" (चालों के कार्ड) का एक पुस्तकालय है।
- सटीक मांसपेशियों के निर्देशांकों (coordinates) को याद करने के बजाय, रोबोट एक ऐसा कार्ड चुनने के बारे में सीखता है जो कहता है "एक फोरहैंड स्विंग करें।"
- रोबोट जानता है कि यह कार्ड आमतौर पर एक अच्छा स्विंग कराता है, लेकिन वह यह भी जानता है कि उस कार्ड का "कलाई वाला हिस्सा" थोड़ा अस्पष्ट है।
3. "कोच का सुधार" (High-Level Policy)
यही जादुई हिस्सा है। रोबोट के पास एक हाई-लेवल कोच (AI मस्तिष्क) है जो खेल को देखता है।
- कोच लाइब्रेरी से सही "मूव कार्ड" चुनता है (जैसे, "गेंद की ओर दौड़ें और फोरहैंड स्विंग करें")।
- महत्वपूर्ण बात यह है कि कोच को धुंधले हिस्सों को ठीक करने की अनुमति है। यदि "मूव कार्ड" कहता है "कलाई को इस तरह घुमाएं," लेकिन गेंद तेजी से आ रही है, तो कोच कहता है, "वास्तव में, इसे जोर से मारने के लिए कलाई को अधिक घुमाएं।"
शोधकर्ताओं ने एक विशेष नियम बनाया जिसे "लेटेंट एक्शन बैरियर" कहा जाता है। इसे एक सुरक्षा जाल के रूप में समझें। यह कोच को बताता है: "आप कलाई को ठीक कर सकते हैं, लेकिन पागलपन न करें। इंसान की प्राकृतिक शैली के करीब रहें।" यह रोबोट को अजीब, झटकेदार, रोबोट जैसी हरकतें बनाने से रोकता है जो अप्राकृतिक दिखती हैं।
4. "ट्रेनिंग कैंप" (Sim-to-Real Transfer)
असली इंसान के खिलाफ खेलने से पहले, रोबोट एक वीडियो गेम सिमुलेशन में प्रशिक्षण लेता है। लेकिन वीडियो गेम परफेक्ट नहीं होते। यह सुनिश्चित करने के लिए कि रोबोट वास्तविक दुनिया में कदम रखते समय भ्रमित न हो, शोधकर्ताओं ने सिमुलेशन को अराजक (chaotic) बनाया:
- उन्होंने रोबोट के जोड़ों को रैंडम तरीके से फिसलन भरा या चिपचिपा बना दिया।
- उन्होंने टेनिस बॉल को भारी या हल्का बना दिया।
- उन्होंने रोबोट की दृष्टि में "स्टैटिक" (शोर/धुंधलापन) जोड़ दिया ताकि वह गेंद को पूरी तरह से न देख सके।
यह एक तैराक को उबड़-खाबड़ पानी, भारी वजन और धुंधले चश्मे के साथ पूल में प्रशिक्षित करने जैसा है। जब वे अंततः शांत, स्पष्ट समुद्र (वास्तविक दुनिया) में पहुँचते हैं, तो उन्हें ऐसा लगता है जैसे वे बहुत धीमी गति में तैर रहे हैं क्योंकि वे इतने अच्छी तरह से तैयार हैं।
परिणाम
जब उन्होंने इस सिस्टम को Unitree G1 रोबोट (एक असली, चलने वाला रोबोट) पर लगाया, तो परिणाम आश्चर्यजनक थे:
- रोबोट एक मानव खिलाड़ी के साथ रैली (गेंद को आपस में मारना) कर सकता था।
- यह 30 मील प्रति घंटे से अधिक की गति से आती गेंदों को मार सकता है।
- यह स्वाभाविक रूप से चला, जिससे वह एक मशीन के बजाय एक एथलीट की तरह लगा।
यह क्यों मायने रखता है
इससे पहले, रोबोट को खेल सिखाने के लिए या तो परफेक्ट डेटा या असंभव भौतिकी (जैसे रोबोट के पास अनंत शक्ति होना) की आवश्यकता होती थी। LATENT यह सिद्ध करता है कि आप एक रोबोट को एथलीट बनने के लिए अपूर्ण, अव्यवस्थित, मानवीय डेटा का उपयोग करके सिखा सकते हैं, बशर्ते आप रोबोट को अंतराल भरने और अपनी गलतियों को सुधारने का एक स्मार्ट तरीका दें।
यह किसी पेंटिंग की पिक्सेल-दर-पिक्सेल नकल करने (जो विफल हो जाता है यदि मूल धुंधला है) बनाम एक कलाकार को पेंटिंग की तकनीक सिखाने, उन्हें अभ्यास करने देने और फिर कैनवास के अनुसार अपने ब्रश स्ट्रोक को समायोजित करने देने के बीच का अंतर है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।