SelfWAM: A Self-Grounded Unified World Action Model for Fast Robot Control
SelfWAM एक एकीकृत विश्व क्रिया मॉडल (unified world action model) है जो रोबोट के सेल्फ-मास्क (self-masks) पर आधारित होकर क्रियाओं और एक्शन-कंडीशन्ड भविष्य के अवलोकनों (action-conditioned future observations) की संयुक्त रूप से भविष्यवाणी करके रोबोट पॉलिसी लर्निंग को बेहतर बनाता है, जिससे यह सुनिश्चित होता है कि भविष्यवाणियाँ विशिष्ट क्रिया परिणामों को दर्शाती हैं और साथ ही तेज़ इन्फरेंस गति भी बनाए रखती हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखा रहे हैं। आप उसे एक इंसान द्वारा टमाटर काटने का वीडियो दिखाते हैं। एक साधारण रोबोट केवल टमाटर और चाकू की तस्वीर को याद कर सकता है और फिर हाथ की गतिविधियों की नकल करने की कोशिश कर सकता है। लेकिन यहाँ पेचीदा बात यह है: यदि रोबोट केवल तस्वीर को देखता है, तो वह वास्तव में यह नहीं समझ पाता कि टमाटर क्यों हिल रहा है। वह यह नहीं जानता कि यदि वह चाकू को अधिक जोर से दबाता है, तो टमाटर तेजी से कटता है, या यदि वह गलत दिशा में धक्का देता है, तो टमाटर मेज से लुढ़क जाता है।
यह रोबोटिक्स में "वर्ल्ड एक्शन मॉडल्स" (World Action Models) की चुनौती है। ये विशेष AI मस्तिष्क हैं जो यह अनुमान लगाने की कोशिश करते हैं कि रोबोट के अभी कुछ करने के आधार पर भविष्य कैसा दिखेगा। इन्हें रोबोट की "कल्पना" के रूप में सोचें। यदि एक रोबोट भविष्य की कल्पना कर सकता है, तो वह बेहतर योजना बना सकता है। लेकिन लंबे समय तक, इनकी कल्पनाएँ थोड़ी दिवास्वप्न जैसी थीं: वे कुछ सेकंड में दृश्य कैसा दिख सकता है, इसका अनुमान तो लगा सकते थे, लेकिन वे उन विशिष्ट गतिविधियों से जुड़ने में बहुत अच्छे नहीं थे जो रोबमा ने वास्तव में की थीं। वे एक फिल्म देखते हुए उसके अंत का अनुमान लगाने जैसे थे, बिना यह जाने कि पात्रों ने अभी क्या किया। मुख्य सवाल वैज्ञानिकों के लिए यह है: हम एक रोबोट को भविष्य की कल्पना विशेष रूप से उसके अपने कार्यों के परिणामस्वरूप कैसे सिखा सकते हैं, ताकि वह न केवल यह सीख सके कि क्या हुआ, बल्कि यह भी कि उसके अपने शरीर ने चीजों को कैसे प्रभावित किया?
यहाँ SelfWAM आता है, जो एक नया दृष्टिकोण है जो रोबोट के लिए एक "आत्म-जागरूक" कल्पना कोच की तरह कार्य करता है। इस कार्य के पीछे के शोधकर्ताओं ने महसूस किया कि पिछले तरीके एक महत्वपूर्ण कड़ी को छोड़ रहे थे: रोबोट को अपने विशिष्ट आंदोलनों को देखे गए दृश्यों से जोड़ने के लिए मजबूर नहीं किया जा रहा था। इसे ठीक करने के लिए, उन्होंने एक ऐसा सिस्टम बनाया जो रोबोट को एक साथ दो चीजों पर ध्यान केंद्रित करने के लिए मजबूर करता है: दृश्य का भविष्य का वीडियो, और उस दृश्य के माध्यम से गुजरते हुए उसके अपने शरीर की एक "भूतिया" रूपरेखा।
SelfWAM कैसे काम करता है, इसे एक सरल उदाहरण से समझते हैं। कल्पना कीजिए कि आप जुग्लिंग (juggle) करना सीख रहे हैं। एक मानक AI किसी को जुग्लिंग करते हुए देखकर यह अनुमान लगाने की कोशिश कर सकता है कि गेंदें आगे कहाँ जाएँगी। लेकिन वह गेंदों के रंग या बैकग्राउंड की दीवार से विचलित हो सकता है। SelfWAM अलग है। यह रोबोट को उसके अभी किए गए मूव का एक विशेष "साफ" प्रतिलिपि देता है—जैसे कि फेंकने का एक सटीक, शोर-मुक्त ब्लूप्रिंट—और उस ब्लूप्रिंट का उपयोग करके भविष्य की भविष्यवाणी करता है। महत्वपूर्ण रूप से, यह रोबोट को एक "सेल्फ-मास्क" (self-mask) की भविष्यवाणी करने के लिए भी कहता है, जो कि उसके अपने हाथों और बाहों के चलते हुए एक ब्लैक-एंड-व्हाइट सिल्हूट (silhouette) है।
यह सिल्हूट इतना महत्वपूर्ण क्यों है? इसे एक स्पॉटलाइट की तरह सोचें। यदि आप जुग्लिंग के भविष्य की भविष्यवाणी करने की कोशिश करते हैं, तो बैकग्राउंड की दीवार और रोशनी में बदलाव केवल 'शोर' (noise) हैं; वे यह नहीं बताते कि जुग्लिंग सफल होगी या नहीं। लेकिन रोबोट के अपने हाथों की गति? वही वास्तविक संकेत है। रोबोट को भविष्य के दृश्य की भविष्यवाणी करने के लिए प्रशिक्षित करके (बैकग्राउंड के अव्यवस्थित विवरणों को छोड़कर), रोबोट "मैंने यह मूव किया" और "इसके बाद यह हुआ" के बीच एक बहुत गहरा संबंध सीखता है।
लेख बताता है कि यह बिना रोबोट को धीमा किए कैसे काम करता है। प्रशिक्षण चरण के दौरान, रोबोट को मूव्स और भविष्य के दृश्यों के बीच संबंध सीखने में मदद करने के लिए क्रिया का "साफ" ब्लूप्रिंट देखने को मिलता है। लेकिन जब रोबोट वास्तव में वास्तविक दुनिया में काम कर रहा होता है (इन्फरेंस), तो उसे भविष्य के वीडियो या सिल्हूट उत्पन्न करने की आवश्यकता नहीं होती है। वह बस अपने मस्तिष्क के उस हल्के हिस्से का उपयोग करता है जिसने मूव्स को सीखा है। यह एक छात्र की तरह है जो आरेखों के साथ विस्तृत अध्ययन गाइड का उपयोग करके परीक्षा के लिए पढ़ता है, लेकिन परीक्षा के दिन, उन्हें केवल तथ्यों को जल्दी से याद करने की आवश्यकता होती है। भारी काम भविष्य की भविष्यवाणी करना केवल अभ्यास के दौरान होता है, वास्तविक काम के दौरान नहीं।
शोधकर्ताओं ने इस विचार का परीक्षण दो मुख्य तरीकों से किया। पहले, उन्होंने RoboTwin 2.0 नामक एक जटिल कंप्यूटर सिमुलेशन का उपयोग किया, जिसमें दो-हाथों वाला रोबोट 50 से अधिक विभिन्न कार्य करता है। उन्होंने पाया कि SelfWAM इन कार्यों में पिछले तरीकों की तुलना में बेहतर था, विशेष रूप से तब जब बैकग्राउंड को बदला या रैंडमाइज किया गया था (जैसे फर्नीचर बदलना या लाइट बदलना)। इसने औसतन लगभग 92.6% की सफलता दर हासिल की, जो अन्य शीर्ष मॉडलों से बेहतर थी। दूसरा, उन्होंने लैब में एक वास्तविक, भौतिक रोबोटिक आर्म पर इसे आजमाया। उन्होंने इसे चार विशिष्ट कार्य दिए, जैसे कप को स्टैंड पर रखना या पेन को कप में डालना। SelfWAM 95% प्रयासों में सफल रहा, जिसने अन्य तरीकों को पछाड़ दिया।
शायद सबसे रोमांचक खोज यह है कि इस "सुपर-इमेजिनेशन" ने रोबोट को धीमा नहीं किया। पेपर दिखाता है कि अगले मूव पर निर्णय लेने में लगने वाला समय 1% से भी कम बढ़ा (विशेष रूप से 0.97%)। इसका मतलब है कि रोबोट स्मार्ट तो बन रहा है, लेकिन सुस्त नहीं। इसके अलावा, जब शोधकर्ताओं ने रोबोट की "कल्पना" का परीक्षण किया, तो उन्होंने पाया कि SelfWAM भविष्य की भविष्यवाणी करने में बहुत बेहतर था। यदि उन्होंने रोबोट को अपना हाथ थोड़ा ऊपर उठाने के लिए कहा, तो रोबोट की कल्पना ने हाथ को ऊपर जाते हुए सही ढंग से दिखाया। पुराने मॉडल अक्सर भ्रमित हो जाते थे और क्रिया बदलने पर भी अपनी भविष्यवाणियों में बहुत कम बदलाव दिखाते थे।
संक्षेप में, SelfWAM सुझाव देता है कि रोबोट की कल्पना को उसके अपने शरीर की गति में स्थापित करके—उसे दुनिया के माध्यम से अपने स्वयं के "साये" को विज़ुअलाइज़ करना सिखाकर—वह एक बहुत बेहतर शिक्षार्थी बन जाता है। वह यह समझने में सक्षम होता है कि रोबोट ने क्या किया और संयोग से क्या हुआ। परिणाम यह है कि एक रोबोट तेज़, अधिक सटीक और परिवेश में होने वाले परिवर्तनों के प्रति अधिक मजबूत होता है, जबकि निर्णय लेने की गति को लगभग समान बनाए रखता है। यह एक ऐसे रोबोट की ओर एक कदम है जो केवल दुनिया के प्रति प्रतिक्रिया नहीं देता, बल्कि वास्तव में यह समझता है कि उसके अपने कार्य उसे कैसे आकार देते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।