GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions
GeniWorld रोबोटिक मैनिपुलेशन के लिए एक सामान्यीकरण योग्य इंटरैक्टिव वर्ल्ड मॉडल है जो अनदेखे वातावरणों में मजबूत ज़ीरो-शॉट सामान्यीकरण प्राप्त करने के लिए URDF-आधारित विज़ुअल एक्शन रिप्रजेंटेशन और डिकपल्ड किनेमैटिक्स का लाभ उठाता है, जो डाउनस्ट्रीम रोबोट प्रदर्शन को बेहतर बनाने के लिए एक स्केलेबल पॉलिसी इवैल्यूएटर और डेटा जनरेटर के रूप में कार्य करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखाने की कोशिश कर रहे हैं, जैसे तौलिया मोड़ना या एक कटोरा उठाना। रोबोटिक्स की दुनिया में, यह एक बच्चे को साइकिल चलाना सिखाने जैसा है। आप उन्हें एक बार साइकिल दिखा सकते हैं, लेकिन यदि आप साइकिल को दूसरे कमरे में ले जाते हैं, दीवारों का रंग बदल देते हैं, या सीट पर एक नया खिलौना रख देते हैं, तो बच्चा भ्रमित हो सकता है और गिर सकता है। यह वह बड़ी समस्या है जिसे वैज्ञानिक हल करने की कोशिश कर रहे हैं: हम ऐसे रोबोट कैसे बनाएं जो इतने स्मार्ट हों कि हर नई स्थिति के लिए उन्हें फिर से प्रशिक्षित किए बिना, वास्तविक दुनिया की अव्यवस्था और अनिश्चितता को संभाल सकें?
इसे करने के लिए, शोधकर्ता अक्सर "वर्ल्ड मॉडल" (world model) नामक चीज़ का उपयोग करते हैं। एक वर्ल्ड मॉडल को रोबोट की कल्पना के रूप में समझें। केवल वर्तमान में जो दिख रहा है उस पर प्रतिक्रिया देने के बजाय, रोबंतु अपनी कल्पना का उपयोग यह अनुमान लगाने के लिए करता है कि यदि वह अपना हाथ एक निश्चित तरीके से हिलाता है, तो आगे क्या होगा। यह एक वीडियो गेम खेलने जैसा है जहाँ आप गेम को पॉज़ कर सकते हैं, अपने दिमाग में एक चाल आज़मा सकते हैं, और वास्तव में करने से पहले देख सकते हैं कि क्या आप किसी दीवार से टकराते हैं। हालाँकि, अधिकांश वर्तमान "इमेजिनेशन मशीनें" (कल्पना करने वाली मशीनें) थोड़ी अनाड़ी हैं। वे अक्सर भौतिकी (physics) को गलत समझ लेती हैं, या वे पृष्ठभूमि बदलने पर भ्रमित हो जाती हैं, क्योंकि वे रोबोट की गति को अमूर्त संख्याओं (abstract numbers) का उपयोग करके समझने की कोशिश करती हैं जो वास्तविक दुनिया की तरह नहीं दिखतीं।
यहीं पर GeniWorld नामक एक नया प्रोजेक्ट काम आता है। इसके पीछे के शोधकर्ताओं ने एक बेहतर कल्पना मशीन बनाने की इच्छा जताई—एक ऐसी जो केवल कुछ अभ्यास सत्रों से सीख सके और पूरी तरह से नए, अव्यवस्थपूर्ण वातावरण को संभालने के लिए सक्षम हो सके। वे केवल यह नहीं चाहते थे कि रोबोट अनुमान लगाए; वे चाहते थे कि रोबोट अपनी आँखों के सामने अपनी गतिविधियों को स्पष्ट रूप से "देख" सके।
"विजुअल एक्शन्स" (दृश्य क्रियाओं) का जादू
GeniWorld का असली रहस्य वह है जिसे लेखक "विजुअल एक्शन्स" कहते हैं। आमतौर पर, जब हम किसी रोबोट को हिलने के लिए कहते हैं, तो हम उसे संख्याओं की एक सूची देते हैं (जैसे "हाथ को 5 सेंटीमीटर ऊपर उठाएं, 10 डिग्री घुमाएं")। समस्या यह है कि ये संख्याएँ अमूर्त हैं; वे रोबोट या कमरे की तरह नहीं दिखतीं। यह किसी को केवल यह बताने की कोशिश करने जैसा है कि उसे कितने कदम चलने चाहिए, बिना कभी उन्हें वह नृत्य दिखाए।
GeniWorld इस खेल को बदल देता है और उन संख्याओं को गति के चित्रों में बदल देता है। रोबोट की भविष्य की भविष्यवाणी करने से पहले ही, सिस्टम रोबोट के निर्देश लेता है और उन्हें एक दृश्य अनुक्रम (visual sequence) के रूप में प्रस्तुत करता है—अनिवार्य रूप से रोबोट के कंकाल के हिलने का एक वीडियो, लेकिन बिना पृष्ठभूमि या वस्तुओं के। यह रोबोट के हाथ का एक भूतिया, पारदर्शी संस्करण स्क्रीन पर प्रोजेक्ट करने जैसा है।
इस "भूतिया वीडियो" को वर्ल्ड मॉडल में फीड करके, रोबोट गति के दिखने और गति के परिणाम के बीच संबंध बनाना सीखता है। यह मॉडल को यह समझने में मदद करता है कि "जब हाथ इस तरह चलता है, तो कटोरा उस तरह हिलता है," भले ही कटोरा अलग रंग का हो या मेज किसी दूसरे कमरे में हो। शोधकर्ताओं ने पाया कि भौतिकी को सही रखने के मामले में यह तरीका कच्चे नंबरों का उपयोग करने की तुलना में बहुत बेहतर है।
"इमेजिनेशन" (कल्पना) परीक्षण
यह काम कर रहा है या नहीं, यह देखने के लिए टीम ने GeniWorld को परीक्षणों की एक श्रृंखला से गुज़ारा। उन्होंने मॉडल को केवल कुछ वस्तुओं वाली एक बहुत ही साधारण, साफ मेज पर प्रशिक्षित किया। फिर, उन्होंने इसे कठिन परिस्थितियों में डाल दिया: उन्होंने इसका परीक्षण रैंडम वस्तुओं, अलग रोशनी और बिखरी हुई पृष्ठभूमि वाली मेजों पर किया—ऐसे परिदृश्य जो रोबोट ने पहले कभी नहीं देखे थे।
परिणाम प्रभावशाली थे। जबकि अन्य मॉडल अजीबोगरीब गड़बड़ियाँ (जैसे वस्तुओं का गायब होना या रोबोट के हाथ का ठोस मेज के आर-पार निकल जाना) दिखाने लगते हैं, GeniWorld शांत रहा। इसने अराजक, "आउट-ऑफ-डिस्ट्रीब्यूशन" दृश्यों में क्या होगा, इसका सफलतापूर्वक पूर्वानुमान लगाया। वास्तव में, जब उन्होंने देखा कि उनकी भविष्यवाणियाँ वास्तविकता के कितने करीब थीं, तो Geniगत ने अपने प्रतिस्पर्धियों की तुलना में काफी बेहतर स्कोर किया, और पूरी तरह से रैंडमाइज्ड वातावरण में भी उच्च सटीकता बनाए रखी।
एक सुपरचार्ज्ड ट्रेनिंग ग्राउंड
लेकिन शोधकर्ता केवल एक अच्छा प्रेडिक्टर (पूर्वानुमान लगाने वाला) बनाने तक ही सीमित नहीं रहे। उन्होंने एक दूसरा सवाल पूछा: क्या यह कल्पना मशीन वास्तव में रोबोट को तेज़ी से सीखने में मदद कर सकती है?
वास्तविक दुनिया में, डेटा एकत्र करना महंगा और धीमा है। आपको कैमरे लगाने होते हैं, वस्तुओं को हिलाना पड़ता है और रोबोट को हजारों बार चलाना पड़ता है। GeniWorld एक शॉर्टकट प्रदान करता है। टीम ने दिखाया कि वे वास्तविक दुनिया के बहुत कम डेटा (केवल 25 उदाहरण प्रति कार्य) का उपयोग कर सकते हैं और GeniWorld का उपयोग सैकड़ों नए, विविध प्रशिक्षण परिदृश्य उत्पन्न करने के लिए कर सकते हैं। वे मॉडल को बता सकते हैं, "कल्पना करो कि मेज बिखरी हुई है," या "कल्पना करो कि कटोरा एक अजीब जगह पर है," और मॉडल एक वास्तविक दिखने वाला वीडियो बना देगा कि वह कैसा दिखेगा।
जब उन्होंने इन जेनरेट किए गए वीडियो का उपयोग रोबोट पॉलिसी को प्रशिक्षित करने के लिए किया, तो रोबोट नई स्थितियों को संभालने में बहुत बेहतर हो गया। वह केवल उन 25 उदाहरणों को याद नहीं कर रहा था जो उसने देखे थे; उसने एक अव्यवस्थपूर्ण दुनिया में काम करने के सिद्धांतों को सीख लिया था। डेटा बताता है कि वास्तविक दुनिया के अभ्यास को इस "सिंथेटिक इमेजिनेशन" (कृत्रिम कल्पना) के साथ जोड़ने से रोबोट काफी अधिक मजबूत हो जाता है, जिससे उसे उन कार्यों में सफलता मिलती है जिन्हें उसने पहले कभी नहीं देखा, जैसे कि रैंडम बिखराव या अलग रोशनी की स्थितियों से निपटना।
यह क्यों महत्वपूर्ण है
GeniWorld की खूबसूरती यह है कि यह रोबोट के कठोर गणित और वास्तविक दुनिया की तरल, अराजक प्रकृति के बीच के अंतर को पाटता है। रोबोट को उसकी क्रियाओं को केवल संख्याओं के बजाय दृश्य कहानियों के रूप में "देखने" के लिए सिखाकर, यह एक अधिक विश्वसनीय कल्पना बनाता है। इसका मतलब है कि जल्द ही हमें ऐसे रोबोट देखने को मिल सकते हैं जो केवल आदर्श प्रयोगशालाओं में काम नहीं करते, बल्कि वास्तव में हमारे बिखरे हुए किचन, हमारे अव्यवस्थित गैरेज और हमारे अनिश्चित घरों में मदद कर सकते हैं, जो केवल कुछ ही उदाहरणों से सीखते हैं और मौके पर खुद को ढाल लेते हैं। यह उन रोबोटों की ओर एक कदम है जो केवल आदेशों का पालन नहीं करते, बल्कि वास्तव में उस दुनिया को समझते हैं जिसमें वे चल रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।