Enfold: Folding World-Generator Computation into Predictive Representations for Efficient Embodied Control
एन्फोल्ड (Enfold) एक नवीन ढांचा है जो विश्व-जनरेटिव मॉडलों की बहु-स्तरीय कम्प्यूटेशनल प्रक्रिया को केवल वर्तमान दृश्य और भाषाई संदर्भ से अनुमानित एक भविष्य कहनेवाला प्रतिनिधित्व (predictive representation) में संकुचित करता है, जिससे एम्बोडीड एजेंटों को भविष्य के प्रक्षेप पथों (trajectories) को प्रत्येक चरण पर साकार करने की आवश्यकता के बिना, भविष्य-जनरेटिव संरचना को आंतरिक रूप से आत्मसात करके, काफी कम विलंबता के साथ सुदृढ़ नियंत्रण प्राप्त करने में सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखा रहे हैं। इसे करने का पुराना तरीका यह था कि रोबोट को एक क्रिस्टल बॉल दी जाती थी। अपना एक हाथ भी हिलाने से पहले, रोबोट उस क्रिस्टल बॉल का उपयोग करके भविष्य का एक पूर्ण, हाई-डेफिनिशन वीडियो बनाता था: ब्रेड को कटते हुए देखना, चीज़ को लोफ पर फिसलते हुए देखना, और प्लेट को नीचे रखते हुए देखना। इस पूरे वीडियो को अपने मन में देखने के बाद ही रोबोट तय करता था कि आगे क्या करना है। यह कार चलाने के लिए सड़क का पूरा वीडियो देखने जैसा है, इससे पहले कि आप स्टीयरिंग व्हील घुमाएँ। यह शक्तिशाली तो है, लेकिन यह अविश्वसनीय रूप से धीमा और गणनात्मक रूप से महंगा है, जैसे कि बाएं या दाएं मुड़ने का निर्णय लेने के लिए ही एक ब्लॉकबस्टर फिल्म को रेंडर करने की कोशिश करना।
यह शोध पत्र रोबोटिक्स और आर्टिफिशियल इंटेलिजेंस के क्षेत्र से आता है, जो विशेष रूप से "वर्ल्ड मॉडल्स" (world models) पर केंद्रित है। एक वर्ल्ड मॉडल अनिवार्य रूप से एक ऐसा AI है जो यह सीखता है कि भौतिक दुनिया कैसे काम करती है। लेखक जिस मुख्य विचार के साथ खेल रहे हैं वह है "प्रेडिक्टिव रिप्रेजेंटेशन्स" (predictive representations)। इसे एक पूरी फिल्म की स्क्रिप्ट रटने और कहानी के नियमों को समझने के बीच के अंतर के रूप में सोचें। आपको पूरी फिल्म दोबारा देखने की आवश्यकता नहीं है कि यदि आप एक गिलास गिराते हैं, तो वह टूट जाएगा; आपको बस गुरुत्वाकर्षण और भंगुरता (fragility) के भौतिकी को समझने की आवश्यकता है। लेखक एक बड़ा सवाल पूछते हैं: क्या हम एक रोबोट को भविष्य की पूरी, भारी वीडियो जनरेट किए बिना भविष्य की संरचना को समझना सिखा सकते हैं?
यह शोध पत्र Enfold नामक एक नई विधि पेश करता है। नाम "अनफोल्डिंग" (भविष्य को खोलना, जो पुराने, धीमे तरीके करते हैं) और वर्तमान क्षण में उस भविष्य के ज्ञान को "एनफोल्ड" (enfold - समाहित करना) करने का एक खेल है। रोबमा के भविष्य का पूर्ण वीडियो बनाने के बजाय, Enfold एक "प्रेडिक्टिव एनकोडर" को भविष्य के दिखने वाले कंप्यूटेशन को आत्मसात करने के लिए प्रशिक्षित करता है।
यह कैसे काम करता है: शोधकर्ता एक शक्तिशाली "टीचर" AI (एक वीडियो जनरेटर) का उपयोग करते हैं जो भविष्य की कल्पना करने में बहुत कुशल है। जैसे ही यह टीचर AI भविष्य में क्या होने वाला है, इसका वीडियो प्रोसेस करता है, यह कई आंतरिक चरणों से गुजरता है, दृश्य, वस्तुओं और उनकी अंतःक्रियाओं को व्यवस्थित करता है। Enfold इन आंतरिक चरणों को देखता है और केवल वर्तमान चित्र और रोबोट के निर्देश का उपयोग करके उन्हें प्रेडिक्ट (अनुमानित) करना सीखता है। यह एक मास्टर शेफ को जटिल व्यंजन बनाते हुए देखने वाले छात्र की तरह है। छात्र को हर बार सैंडविच बनाने के लिए पूरा व्यंजन शुरू से बनाने की कोशिश करने के बजाय, वे शेफ की आंतरिक "मसल मेमोरी" और "किचन लॉजिक" को सीखते हैं। वे पैन की वर्तमान स्थिति के आधार पर अगले चरण का अनुमान लगाना सीख जाते हैं, बिना अपने दिमाग में पूरे भोजन का सिमुलेशन किए।
शोध पत्र पाता है कि यह दृष्टिकोण गति और दक्षता के मामले में गेम-चेंजर है। परीक्षणों में, Enfold रोबोट पिछले स्टेट-ऑफ-द-आर्ट मेथड 'Fast-WAM' की तुलना में 3.7 गुना तेज़ निर्णय लेने में सक्षम था, और इसके अनुकूलित संस्करण Enfold-Flash ने 10.1 गुना अधिक गति दिखाई। इतनी तेज़ होने के बावजूद, इसने अपनी बुद्धिमत्ता नहीं खोई; वास्तव में इसने जटिल कार्यों पर थोड़ा बेहतर प्रदर्शन किया, एक बेंचमार्क पर 97.8% सफलता दर और दूसरे पर 91.77% हासिल की।
महत्वपूर्ण रूप से, यह शोध पत्र इस विचार के विरुद्ध तर्क देता है कि बुद्धिमान रूप से कार्य करने के लिए एक रोबोट को पूर्ण वीडियो उत्पन्न करना ही चाहिए। वे दिखाते हैं कि भविष्य के जेनेरेटिव कंप्यूटेशन को एक संक्षिप्त प्रतिनिधित्व में "एनफोल्ड" करके, रोबोट अभी भी अनुकूलित हो सकता है यदि दुनिया बदल जाए। उदाहरण के लिए, यदि कोई इंसान प्लेट को उठाने के दौरान उसे हटा देता है, तो Enfold केवल एक पूर्व-रिकॉर्डेड स्क्रिप्ट नहीं चलाता; यह नई वास्तविकता के आधार पर भविष्य की तुरंत पुनर्गणना करता है और अपने कार्यों को समायोजित करता है। लेखक सुझाव देते हैं कि यह साबित करता है कि रोबोट ने दुनिया की एक लचीली, भविष्यवाणात्मक समझ सीखी है, न कि केवल एक निश्चित पथ को रटा है।
संक्षेप में, Enfold सुझाव देता है कि हमें रोबोट को नियंत्रित करने के लिए पूरा भविष्य रेंडर करने की आवश्यकता नहीं है। हमें बस रोबोट को भविष्य के लॉजिक को अपनी जेब में रखने के लिए सिखाना है, जिससे वह तुरंत और अनुकूल रूप से कार्य कर सके, जिससे एक धीमी, वीडियो-रेंडरिंग प्रक्रिया एक बिजली जैसी तेज़, सहज निर्णय प्रक्रिया में बदल जाती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।