MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation
MotionWAM एक वास्तविक समय का फाउंडेशन वर्ल्ड एक्शन मॉडल है जो इंटरमीडिएट वीडियो डिनोइजिंग फीचर्स का लाभ उठाकर समन्वित मोशन टोकन की भविष्यवाणी करके ह्यूमनॉइड्स के लिए होल-बॉडी लोको-मैनिपुलेशन कंट्रोल को एकीकृत करता है, जिससे पारंपरिक पदानुक्रमित नीतियों की गति और निरंतरता की सीमाओं को दूर किया जा सकता है और जटिल कार्यों में विजन-लैंग्वेज-एक्शन बेसलाइन्स से काफी बेहतर प्रदर्शन किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को इंसान जैसा सहायक बनने के लिए सिखा रहे हैं। आमतौर पर, हम रोबोटों को दो अलग-अलग चरणों में सिखाते हैं: पहले, हम उनके "दिमाग" (ऊपरी शरीर) को चीजें पकड़ना सिखाते हैं, और फिर हम उनके "पैरों" (निचले शरीर) को चलना और संतुलन बनाए रखना सिखाते हैं। समस्या यह है कि ये दोनों हिस्से आपस में ठीक से बात नहीं कर पाते। दिमाग कहता है, "वह कप उठाओ," और पैर बस कहते हैं, "ठीक है, मैं तुम्हें गिरने से बचाने के लिए आगे बढ़ूँगा।" वे फुटबॉल किक मारने या पेडल पर पैर रखने जैसे काम नहीं कर सकते क्योंकि पैरों को केवल "बैलेंस वाले कामों" तक ही सीमित रखा गया है।
MotionWAM एक नया रोबोटिक दिमाग है जो इसे ठीक करता है। यह पूरे शरीर को एक एकल, समन्वित टीम के रूप में मानकर काम करता है। यह कैसे काम करता है, यहाँ कुछ सरल उपमाओं का उपयोग करके बताया गया है:
1. "मूवी डायरेक्टर" बनाम "स्क्रिप्ट राइटर"
अधिकांश रोबोट के दिमाग स्क्रिप्ट राइटर की तरह होते हैं। वे एक तस्वीर और एक वाक्य (जैसे "बॉक्स उठाओ") को देखते हैं और पिछले अनुभवों के आधार पर अगले कदम का अनुमान लगाने की कोशिश करते हैं। वे वास्तव में यह नहीं समझते कि भौतिकी (physics) कैसे काम करती है या चीजें समय के साथ कैसे चलती हैं।
MotionWAM अलग है। यह एक मूवी डायरेक्टर की तरह है जिसने हजारों घंटों की फिल्में देखी हैं। रोबोट को क्या करना है, यह बताने से पहले, यह अगले कुछ सेकंड की फिल्म कैसी दिखेगी, इसका एक त्वरित "मानसिक सिमुलेशन" (mental simulation) चलाता है।
- ट्रिक: पूरी फिल्म के दृश्य के पूरी तरह से तैयार होने का इंतज़ार करने के बजाय (जिसमें बहुत समय लगता है), MotionWAM दृश्य के स्केच को देखता है जब वह बनाया जा रहा होता है। यह उस स्केच से भविष्य की गति का "अहसास" (vibe) पकड़ लेता है और तुरंत रोबोट को बताता है कि कैसे हिलना है। यही कारण है कि यह वास्तविक समय (real-time) में सोचने के लिए पर्याप्त तेज़ है।
2. "यूनिफाइड रिमोट कंट्रोल" (एकल रिमोट कंट्रोल)
पुराने सिस्टम में, रोबोट के पास दो रिमोट थे: एक हाथों के लिए और एक पैरों के लिए। पैर वाला रिमोट बहुत सरल था और उसे केवल सीधा चलना या मुड़ना ही पता था।
- MotionWAM का नवाचार: यह पूरे शरीर के लिए एक ही सिंगल रिमोट कंट्रोल का उपयोग करता है। जब रोबोट को फुटबॉल किक मारनी होती है, तो "किक" का कमांड केवल पैर के लिए नहीं होता; यह एक एकल निर्देश है जो हाथों को संतुलन बनाने, धड़ (torso) को झुकने और पैर को घुमाने का निर्देश देता है। यह रोबोट को पेडल पर पैर रखने या बॉल किक करने जैसे काम करने की अनुमति देता है, जो पुराने "दो-रिमोट" वाले सिस्टम नहीं कर सकते थे क्योंकि वे यह नहीं समझते थे कि पैर भी कार्य का हिस्सा हो सकते हैं, न कि केवल संतुलन का।
3. "थ्री-स्टेज ट्रेनिंग कैंप" (तीन चरणों वाला प्रशिक्षण शिविर)
रोबोट को इस तरह सिखाना कठिन है, इसलिए शोधकर्ताओं ने तीन-चरणीय प्रशिक्षण शिविर का उपयोग किया:
- चरण 1 (द मूवी बफ): उन्होंने रोबोट को मानव के दृष्टिकोण से (जैसे सिर पर लगा GoPro) हजारों घंटों के वीडियो दिखाए। रोबोट ने अभी तक हिलना नहीं सीखा था; उसने केवल यह सीखा कि चलते समय दुनिया कैसी दिखती है। उसने "दृष्टि की भौतिकी" (physics of vision) सीखी।
- चरण 2 (द ट्रांसलेटर): उन्होंने रोबोट को उन मूवी स्किल्स को वास्तविक रोबोटिक गतिविधियों में अनुवाद करना सिखाया। उन्होंने विभिन्न प्रकार के रोबोटिक शरीरों के डेटा का उपयोग किया ताकि यह सुनिश्चित हो सके कि रोबोट "हिलने" के सामान्य विचार को समझता है, न कि केवल एक विशिष्ट शरीर के आकार को।
- चरण 3 (द स्पेशल फोर्सेज): अंत में, उन्होंने VR चश्मे के माध्यम से एक मानव ऑपरेटर के मार्गदर्शन में रोबोट को विशिष्ट कार्य (जैसे कार्ट लोड करना या बोर्ड पोंछना) दिए। यहीं पर रोबोट ने अपने मूवी ज्ञान को वास्तविक, कठिन कार्यों पर लागू करना सीखा।
परिणाम
जब उन्होंने नौ कठिन कार्यों (जैसे फुटबॉल किक मारना, कार्ट लोड करना या कपड़े धोना) पर MotionWAM का परीक्षण किया, तो यह एक बड़ी सफलता रही:
- गति: यह वास्तविक समय में (प्रति सेकंड लगभग 5 बार) सोचने के लिए पर्याप्त तेज़ है, जो एक रोबोट के लिए बिना गिरे सीधे खड़े रहने के लिए आवश्यक है।
- सफलता दर: यह 76% कार्यों में सफल रहा, जबकि पिछले सर्वश्रेष्ठ रोबोट दिमाग केवल 44% समय ही सफल हो पाते थे।
- "किक" फैक्टर: सबसे बड़ी जीत उन कार्यों में मिली जिनमें पैरों के संपर्क की आवश्यकता थी। पुराने रोबोट गेंद के चारों ओर चलने की कोशिश करते थे; MotionWAM ने वास्तव में उसे किक मारी।
निष्कर्ष
MotionWAM यह साबित करता है कि यदि आप रोबोट को एक "मूवी डायरेक्टर" जैसा दिमाग देते हैं जो समझता है कि दुनिया कैसे चलती है, और आप उसे एक एकीकृत योजना के साथ अपने पूरे शरीर को नियंत्रित करने देते हैं, तो वह चलने और पकड़ने को अलग-अलग समस्याओं के रूप में मानने वाले रोबोटों की तुलना में जटिल, मानवीय कार्यों को बहुत बेहतर तरीके से कर सकता है।
सीमाएँ: पेपर में उल्लेख किया गया है कि इसका परीक्षण एक विशिष्ट रोबोट मॉडल (Unitree G1) पर किया गया था और यदि रोबोट अपने हाथ में पकड़ी गई वस्तु को देखने की दृष्टि खो देता है (क्योंकि कैमरा उसके सिर पर है), तो वह भ्रमित हो सकता है और काम करना बंद कर सकता है। इसका परीक्षण अभी अन्य रोबोटिक शरीरों पर नहीं किया गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।