← नवीनतम पेपर
💻 computer science

Enfold: Folding World-Generator Computation into Predictive Representations for Efficient Embodied Control

एन्फोल्ड (Enfold) एक नवीन ढांचा है जो विश्व-जनरेटिव मॉडलों की बहु-स्तरीय कम्प्यूटेशनल प्रक्रिया को केवल वर्तमान दृश्य और भाषाई संदर्भ से अनुमानित एक भविष्य कहनेवाला प्रतिनिधित्व (predictive representation) में संकुचित करता है, जिससे एम्बोडीड एजेंटों को भविष्य के प्रक्षेप पथों (trajectories) को प्रत्येक चरण पर साकार करने की आवश्यकता के बिना, भविष्य-जनरेटिव संरचना को आंतरिक रूप से आत्मसात करके, काफी कम विलंबता के साथ सुदृढ़ नियंत्रण प्राप्त करने में सक्षम बनाया जा सके।

मूल लेखक: Weili Zeng, Yitong Xing, Fulong Liu, Chengqun Yang, Antao Xiang, Feng Tian, Jingnan Gao, Jisong Cai, Xin Wang, Xiaomin Wu, Yao Mu, Yichao Yan

प्रकाशित 2026-07-30
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Weili Zeng, Yitong Xing, Fulong Liu, Chengqun Yang, Antao Xiang, Feng Tian, Jingnan Gao, Jisong Cai, Xin Wang, Xiaomin Wu, Yao Mu, Yichao Yan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखा रहे हैं। इसे करने का पुराना तरीका यह था कि रोबोट को एक क्रिस्टल बॉल दी जाती थी। अपना एक हाथ भी हिलाने से पहले, रोबोट उस क्रिस्टल बॉल का उपयोग करके भविष्य का एक पूर्ण, हाई-डेफिनिशन वीडियो बनाता था: ब्रेड को कटते हुए देखना, चीज़ को लोफ पर फिसलते हुए देखना, और प्लेट को नीचे रखते हुए देखना। इस पूरे वीडियो को अपने मन में देखने के बाद ही रोबोट तय करता था कि आगे क्या करना है। यह कार चलाने के लिए सड़क का पूरा वीडियो देखने जैसा है, इससे पहले कि आप स्टीयरिंग व्हील घुमाएँ। यह शक्तिशाली तो है, लेकिन यह अविश्वसनीय रूप से धीमा और गणनात्मक रूप से महंगा है, जैसे कि बाएं या दाएं मुड़ने का निर्णय लेने के लिए ही एक ब्लॉकबस्टर फिल्म को रेंडर करने की कोशिश करना।

यह शोध पत्र रोबोटिक्स और आर्टिफिशियल इंटेलिजेंस के क्षेत्र से आता है, जो विशेष रूप से "वर्ल्ड मॉडल्स" (world models) पर केंद्रित है। एक वर्ल्ड मॉडल अनिवार्य रूप से एक ऐसा AI है जो यह सीखता है कि भौतिक दुनिया कैसे काम करती है। लेखक जिस मुख्य विचार के साथ खेल रहे हैं वह है "प्रेडिक्टिव रिप्रेजेंटेशन्स" (predictive representations)। इसे एक पूरी फिल्म की स्क्रिप्ट रटने और कहानी के नियमों को समझने के बीच के अंतर के रूप में सोचें। आपको पूरी फिल्म दोबारा देखने की आवश्यकता नहीं है कि यदि आप एक गिलास गिराते हैं, तो वह टूट जाएगा; आपको बस गुरुत्वाकर्षण और भंगुरता (fragility) के भौतिकी को समझने की आवश्यकता है। लेखक एक बड़ा सवाल पूछते हैं: क्या हम एक रोबोट को भविष्य की पूरी, भारी वीडियो जनरेट किए बिना भविष्य की संरचना को समझना सिखा सकते हैं?

यह शोध पत्र Enfold नामक एक नई विधि पेश करता है। नाम "अनफोल्डिंग" (भविष्य को खोलना, जो पुराने, धीमे तरीके करते हैं) और वर्तमान क्षण में उस भविष्य के ज्ञान को "एनफोल्ड" (enfold - समाहित करना) करने का एक खेल है। रोबमा के भविष्य का पूर्ण वीडियो बनाने के बजाय, Enfold एक "प्रेडिक्टिव एनकोडर" को भविष्य के दिखने वाले कंप्यूटेशन को आत्मसात करने के लिए प्रशिक्षित करता है।

यह कैसे काम करता है: शोधकर्ता एक शक्तिशाली "टीचर" AI (एक वीडियो जनरेटर) का उपयोग करते हैं जो भविष्य की कल्पना करने में बहुत कुशल है। जैसे ही यह टीचर AI भविष्य में क्या होने वाला है, इसका वीडियो प्रोसेस करता है, यह कई आंतरिक चरणों से गुजरता है, दृश्य, वस्तुओं और उनकी अंतःक्रियाओं को व्यवस्थित करता है। Enfold इन आंतरिक चरणों को देखता है और केवल वर्तमान चित्र और रोबोट के निर्देश का उपयोग करके उन्हें प्रेडिक्ट (अनुमानित) करना सीखता है। यह एक मास्टर शेफ को जटिल व्यंजन बनाते हुए देखने वाले छात्र की तरह है। छात्र को हर बार सैंडविच बनाने के लिए पूरा व्यंजन शुरू से बनाने की कोशिश करने के बजाय, वे शेफ की आंतरिक "मसल मेमोरी" और "किचन लॉजिक" को सीखते हैं। वे पैन की वर्तमान स्थिति के आधार पर अगले चरण का अनुमान लगाना सीख जाते हैं, बिना अपने दिमाग में पूरे भोजन का सिमुलेशन किए।

शोध पत्र पाता है कि यह दृष्टिकोण गति और दक्षता के मामले में गेम-चेंजर है। परीक्षणों में, Enfold रोबोट पिछले स्टेट-ऑफ-द-आर्ट मेथड 'Fast-WAM' की तुलना में 3.7 गुना तेज़ निर्णय लेने में सक्षम था, और इसके अनुकूलित संस्करण Enfold-Flash ने 10.1 गुना अधिक गति दिखाई। इतनी तेज़ होने के बावजूद, इसने अपनी बुद्धिमत्ता नहीं खोई; वास्तव में इसने जटिल कार्यों पर थोड़ा बेहतर प्रदर्शन किया, एक बेंचमार्क पर 97.8% सफलता दर और दूसरे पर 91.77% हासिल की।

महत्वपूर्ण रूप से, यह शोध पत्र इस विचार के विरुद्ध तर्क देता है कि बुद्धिमान रूप से कार्य करने के लिए एक रोबोट को पूर्ण वीडियो उत्पन्न करना ही चाहिए। वे दिखाते हैं कि भविष्य के जेनेरेटिव कंप्यूटेशन को एक संक्षिप्त प्रतिनिधित्व में "एनफोल्ड" करके, रोबोट अभी भी अनुकूलित हो सकता है यदि दुनिया बदल जाए। उदाहरण के लिए, यदि कोई इंसान प्लेट को उठाने के दौरान उसे हटा देता है, तो Enfold केवल एक पूर्व-रिकॉर्डेड स्क्रिप्ट नहीं चलाता; यह नई वास्तविकता के आधार पर भविष्य की तुरंत पुनर्गणना करता है और अपने कार्यों को समायोजित करता है। लेखक सुझाव देते हैं कि यह साबित करता है कि रोबोट ने दुनिया की एक लचीली, भविष्यवाणात्मक समझ सीखी है, न कि केवल एक निश्चित पथ को रटा है।

संक्षेप में, Enfold सुझाव देता है कि हमें रोबोट को नियंत्रित करने के लिए पूरा भविष्य रेंडर करने की आवश्यकता नहीं है। हमें बस रोबोट को भविष्य के लॉजिक को अपनी जेब में रखने के लिए सिखाना है, जिससे वह तुरंत और अनुकूल रूप से कार्य कर सके, जिससे एक धीमी, वीडियो-रेंडरिंग प्रक्रिया एक बिजली जैसी तेज़, सहज निर्णय प्रक्रिया में बदल जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →