VisualPatchWorld: Code World Models as Latent Structured Representations for Planning
विजुअलपैट्चवर्ल्ड (VisualPatchWorld) वर्ल्ड मॉडल्स के निर्माण के लिए एक नवीन दृष्टिकोण पेश करता है, जो गतिकी (dynamics) को निष्पादन योग्य कोड (executable code) के रूप में प्रस्तुत करता है, जिसे गुणात्मक जांच (qualitative probing) के माध्यम से चुना जाता है और डेटा से फिट किया जाता है ताकि व्याख्या योग्य, संपादन योग्य और अत्यधिक प्रभावी नियोजन (planning) सक्षम हो सके जो मौजूदा कोड-आधारित बेसलाइन्स से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक बिखरे हुए कमरे में रास्ता खोजने, एक कप उठाने और बिना गिराए उसमें पेय डालने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। इसके लिए, रोबोट को एक "वर्ल्ड मॉडल" (विश्व मॉडल) की आवश्यकता होगी—दुनिया कैसे काम करती है, इसका एक मानसिक मानचित्र। यह एक वीडियो गेम इंजन की तरह है जो रोबोट के मस्तिष्क के भीतर चल रहा है। यदि रोबोट जानना चाहता है कि यदि वह एक कुर्सी को धक्का देता है तो क्या होगा, तो वह केवल अनुमान नहीं लगा सकता; उसे पहले अपने दिमाग में उस धक्के का अनुकरण (सिमुलेशन) करना होगा।
लंबे समय तक, वैज्ञानिकों ने इन मानसिक मानचित्रों को दो बहुत अलग तरीकों से बनाने की कोशिश की है। पहला तरीका एक अत्यंत बुद्धिमान लेकिन रहस्यमय छात्र को प्रशिक्षित करने जैसा है। आप रोबोट को चीजों के होने के हजारों वीडियो दिखाते हैं, और वह एक छिपे हुए, गणितीय स्थान में पैटर्न खोजकर भविष्य की भविष्यवाणी करना सीख जाता है। यह अनुमान लगाने में बहुत अच्छा है, लेकिन यदि यह कोई गलती करता है, तो कोई नहीं जानता कि क्यों हुआ—यह एक ब्लैक बॉक्स की तरह है जहाँ नियम अदृश्य होते हैं। दूसरा तरीका एक विस्तृत, मैनुअल ब्लूप्रिंट बनाने जैसा है। इंजीनियर कोड में भौतिकी के हर एक नियम (गुरुत्वाकर्षण, घर्षण, टकराव) को लिखते हैं। यह बहुत स्पष्ट और ठीक करने में आसान है, लेकिन दुनिया के हर संभावित कमरे या वस्तु के लिए ब्लूप्रिंट लिखना अविश्वसनीय रूप से कठिन है। बड़ा सवाल यह है: क्या हम दोनों दुनियाओं का सर्वश्रेष्ठ प्राप्त कर सकते हैं? क्या हम रोबोट को वीडियो देखकर दुनिया के नियम सीखने में सक्षम बना सकते हैं, लेकिन अंत में एक रहस्यमय ब्लैक बॉक्स के बजाय स्पष्ट, पठनीय निर्देशों का एक सेट प्राप्त कर सकते हैं?
यह बिल्कुल वही है जिसे "विजुअलपैचवर्ल्ड" (VisualPatchWorld) संबोधित करता है। शोधकर्ता, जियाक्सिन बाई और जियाक्सुआन जियोंग, एक नया तरीका प्रस्तावित करते हैं जो दुनिया के नियमों को कोड के रूप में मानता है। रोबोट को एक छिपे हुए गणितीय स्थान में भविष्य का अनुमान लगाने देने के बजाय, वे इसे एक सरल, निष्पादन योग्य (executable) प्रोग्राम लिखने के लिए प्रशिक्षित करते हैं जो यह वर्णन करता है कि वस्तुएं कैसे चलती हैं। कल्पना कीजिए कि आप एक रोबोट को एक ढलान पर लुढ़कती गेंद का वीडियो देखने के लिए कहते हैं और फिर उससे एक छोटा पायथन स्क्रिप्ट लिखने के लिए कहते हैं जो कहता है, "यदि गेंद एक ढलान पर है, तो उसकी गति में वृद्धि करें।"
टीम का दृष्टिकोण दो चतुर चरणों में काम करता है। पहले, रोबोट कुछ त्वरित, "सक्रिय जांच" (active probes) चलाता है—जैसे एक जासूस किसी संदिग्ध की थ्योरी का परीक्षण करने के लिए उसे उकसाता है। यह आंदोलन के नियमों के विभिन्न प्रकारों को आज़माता है (जैसे, "क्या वस्तु बर्फ पर फिसलने की तरह फिसल रही है, या रेत पर चिपकने की तरह चिपक रही है?") ताकि नियम के गुणात्मक आकार का पता लगाया जा सके। एक बार जब यह नियम का सही "कच्चा खाका" (sketch) चुन लेता है, तो दूसरा चरण रोबोट द्वारा रिकॉर्ड किए गए वीडियो देखकर विशिष्ट नंबरों (जैसे कि वह कितनी तेजी से फिसलती है) को भरना है। परिणाम एक कोड का टुकड़ा है जिसे रोबोट एक मिनी-सिम्युलेटर की तरह चला सकता है। वह कोड को देख सकता है, उसे समझ सकता है, और अपने अगले कदमों की योजना बनाने के लिए उसका उपयोग कर सकता है।
परिणाम काफी उत्साहजनक हैं। चार अलग-अलग कार्यों पर परीक्षण किए जाने पर—जैसे भूलभुलैया में रास्ता खोजना, किसी वस्तु तक पहुँचना, चीजों को धकेलना और क्यूब्स को एक के ऊपर एक रखना—उनके तरीके, जिसे विजुअलपैचवर्ल्ड (VPW) कहा जाता है, ने प्लानिंग में 69.0% सफलता दर हासिल की। यह एक महत्वपूर्ण उछाल है, जो पिछले सर्वोत्तम कोड-आधारित तरीकों को 23.5 प्रतिशत अंक से पीछे छोड़ देता है। सबसे बड़े सुधार उन कार्यों में हुए जहाँ आंदोलन के प्रकार को जानना महत्वपूर्ण था। उदाहरण के लिए, एक कार्य में जहाँ रोबोट के हाथ को किसी चीज़ तक पहुँचना था, पुराने तरीके केवल 8% बार सफल हुए, लेकिन VPW 72% तक पहुँच गया। एक कार्य में जिसमें ब्लॉक को धकेलना शामिल था, पिछले कोड तरीके लगभग शून्य सफलता के करीब थे, जबकि VPW ने 22% हासिल किया।
हालाँकि, पेपर सावधानीपूर्वक यह नोट करता है कि यह अभी भी हर चीज़ के लिए पूर्ण समाधान नहीं है। जबकि रोबोट का स्वयं-लिखित कोड ने नेविगेशन और पकड़ने के लिए एक पूर्ण भौतिकी इंजन के लगभग बराबर प्रदर्शन किया, यह जटिल धकेलने वाले कार्यों में संघर्ष करता रहा जहाँ चीजें आपस में टकराती हैं और उछलती हैं। इसे ठीक करने के लिए, लेखक एक "हाइब्रिड" दृष्टिकोण का सुझाव देते हैं: रोबोट के कोड को प्लानिंग का भारी काम करने दें, लेकिन फिर रोबोट के वास्तव में हिलने से पहले शीर्ष कुछ सर्वश्रेष्ठ योजनाओं की एक पूर्ण भौतिकी इंजन के साथ दोबारा जाँच करें। यह छोटी सी जाँच शेष अंतर को लगभग समाप्त कर देती है।
अंततः, यह पेपर सुझाव देता है कि हमें एक रहस्यमय AI जो अनुमान लगाता है और एक कठोर इंजीनियर जो हर नियम को हाथ से लिखता है, के बीच चयन करने की आवश्यकता नहीं है। रोबोट को पहले दुनिया की संरचना सीखने और फिर विवरण भरने के लिए प्रशिक्षित करके, हम ऐसे वर्ल्ड मॉडल बना सकते हैं जो न केवल जटिल कार्यों की योजना बनाने के लिए पर्याप्त शक्तिशाली हैं, बल्कि इतने स्पष्ट भी हैं कि मनुष्य उन्हें पढ़ सकें, समझ सकें और यदि वे गलत हो जाएं तो उन्हें ठीक कर सकें। यह उन रोबोटों की ओर एक कदम है जो केवल यह नहीं जानते कि कैसे हिलना है, बल्कि वास्तव में उस खेल के नियमों को भी समझा सकते हैं जो वे खेल रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।