← नवीनतम पेपर
🤖 AI

World Models for Embodied Intelligence: From Plausible to Controllable to Actionable

यह शोध पत्र एम्बोडीड इंटेलिजेंस (embodied intelligence) में वर्ल्ड मॉडल्स के मूल्यांकन के लिए एक नए ढांचे का प्रस्ताव करता है जो दृश्य निष्ठा (visual fidelity) से ध्यान हटाकर प्रशंसनीय (Plausible), नियंत्रणीय (Controllable) और क्रियाशील (Actionable) क्षमताओं के तीन-स्तरीय पदानुक्रम पर केंद्रित करता है, और यह तर्क देता है कि वास्तविक मूल्य उन भविष्यवाणियों में निहित है जो कार्य-प्रासंगिक संरचना को पकड़ती हैं, हस्तक्षेप के प्रभावों को दर्शाती हैं, और क्लोज्ड-लूप एजेंट व्यवहार में मापने योग्य सुधार करती हैं।

मूल लेखक: Nanjie Yao, Hao Wang, Chong Cheng, Zhikang Chen, Wenzhe Li, Jiafei Lyu, Li Shen, Peilin Zhao, Zongqing Lu, Gao Huang, Steven Hoi, Dacheng Tao, Deheng Ye

प्रकाशित 2026-09-16
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nanjie Yao, Hao Wang, Chong Cheng, Zhikang Chen, Wenzhe Li, Jiafei Lyu, Li Shen, Peilin Zhao, Zongqing Lu, Gao Huang, Steven Hoi, Dacheng Tao, Deheng Ye

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रोबोट एक कप उठाने की कोशिश कर रहा है। उसके हाथ सिरेमिक को छूने से पहले ही, एक मानव मस्तिष्क पहले से ही कप के वजन, सतह के घर्षण और हैंडल के हल्के प्रतिरोध का अनुमान लगा चुका होता है। यह मानसिक सिमुलेशन हमें तुरंत अपनी पकड़ को समायोजित करने की अनुमति देता है, जिससे गिरने से पहले ही उसे रोका जा सके। दशकों से, आर्टिफिशियल इंटेलिजेंस बनाने वाले वैज्ञानिक मशीनों को भी भविष्य देखने की यही क्षमता देने का प्रयास कर रहे हैं। वे इन आंतरिक सिमुलेशन को "वर्ल्ड मॉडल्स" (विश्व मॉडल) कहते हैं। विचार सरल है: यदि कोई मशीन यह मानसिक चित्र बना सकती है कि कार्य करने पर दुनिया कैसे बदलती है, तो वह बेहतर योजना बना सकती है, गलतियों से बच सकती है और तेजी से सीख सकती है। हालाँकि, एक नया दृष्टिकोण सुझाव देता है कि इन मानसिक चित्रों को केवल यथार्थवादी बनाना ही पर्याप्त नहीं है। एक मॉडल एक रोबोटिक हाथ के हिलने का एक सुंदर, फोटो-यथार्थवादी वीडियो तो बना सकता है, फिर भी यह समझने में विफल हो सकता है कि वह हाथ वास्तव में कप को गिरा देगा। एक वर्ल्ड मॉडल का वास्तविक मूल्य इस बात में नहीं है कि उसके अनुमान कितने सुंदर दिखते हैं, बल्कि इस बात में है कि क्या वे अनुमान मशीन को बेहतर निर्णय लेने में मदद करते हैं।

हांगकांग यूनिवर्सिटी ऑफ साइंस एंड टेक्नोलॉजी, सिंघुआ यूनिवर्सिटी और नानयांग टेक्नोलॉजिकल यूनिवर्सिटी सहित संस्थानों के शोधकर्ताओं द्वारा किया गया एक व्यापक नया सर्वेक्षण इन प्रणालियों के बारे में हमारी सोच को पुनर्गठित करता है। इन मॉडलों को उनके जटिल कंप्यूटर कोड या विशिष्ट कार्यों के आधार पर वर्गीकृत करने के बजाय, लेखक उन्हें मापने का एक नया तरीका प्रस्तावित करते हैं जो इस पर आधारित है कि वे वास्तव में क्या कर सकते हैं। वे क्षमता की एक तीन-चरणीय सीढ़ी पेश करते हैं। सबसे नीचे "प्लॉसिबल" (विश्वसनीय) मॉडल है। यह स्तर तब संतुष्ट होता है जब मशीन समय के साथ दुनिया की एक सुसंगत कहानी बनाए रख सकती है। यदि एक रोबोट एक ब्लॉक को हिलाता है, तो एक प्लॉसिबल मॉडल याद रखता है कि ब्लॉक अभी भी वहीं है और गायब नहीं हुआ है या उसका आकार नहीं बदला है। यह ज्यामिति और भौतिकी के बुनियादी नियमों को बरकरार रखता है, जिससे यह सुनिश्चित होता है कि मानसिक चित्र निरर्थक न हो जाए।

अगली सीढ़ी "कंट्रोलेबल" (नियंत्रणीय) मॉडल है। यहाँ मशीन कारण और प्रभाव को समझना सीखती है। मॉडल के लिए केवल दुनिया को देखना ही काफी नहीं है; इसे यह समझना होगा कि उसके अपने कार्य उस दुनिया को कैसे बदलते हैं। यदि रोबोट एक ब्लॉक को बाईं ओर धकेलता है, तो एक कंट्रोलेबल मॉडल भविष्यवाणी करता है कि ब्लॉक बाईं ओर जाएगा, और दृश्य में कुछ और अचानक नहीं बदलेगा। यदि रोबोट इसे दाईं ओर धकेलता है, तो भविष्यवाणी तदनुसार बदलनी चाहिए। शोधकर्ता इस बात पर जोर देते हैं कि एक मॉडल वास्तव में तभी कंट्रोलेबल है जब वह विभिन्न कार्यों के बीच अंतर कर सके और प्रत्येक क्रिया द्वारा किए गए विशिष्ट, मापने योग्य अंतर को दिखा सके। यह एक महत्वपूर्ण कदम है क्योंकि यह मशीन को निष्क्रिय अवलोकन से सक्रिय समझ की ओर ले जाता है।

सीढ़ी का शीर्ष "एक्शनेबल" (कार्रवाई योग्य) मॉडल है। यह अंतिम लक्ष्य है: एक ऐसी प्रणाली जहाँ मानसिक सिमुलेशन सीधे वास्तविक दुनिया में रोबोट के प्रदर्शन में सुधार करता है। एक एक्शन योग्य मॉडल केवल भविष्य की भविष्यवाणी नहीं करता है; यह एक बेहतर रास्ता चुनने, एक नया कौशल तेजी से सीखने या गलती से उबरने के लिए उस भविष्यवाणी का उपयोग करता है। उदाहरण के लिए, यदि एक रोबोट कमरे में नेविगेट कर रहा है और उसकी योजना किसी टकराव की ओर ले जाती है, तो एक एक्शन योग्य मॉडल वास्तविक टकराव से पहले ही सिमुलेशन में खतरे को पहचान लेगा, जिससे वह एक सुरक्षित मार्ग पर स्विच कर सकेगा। सर्वेक्षण बताता है कि जबकि कई वर्तमान प्रणालियाँ 'प्लॉसिबल' होने में अच्छी हैं, और कुछ 'कंट्रोलेबल' बन रही हैं, बहुत कम ने पूरी तरह से 'एक्शन योग्य' चरण में महारत हासिल की है जहाँ सिमुलेशन विश्वसनीय रूप से जटिल, वास्तविक दुनिया के कार्यों में मापने योग्य सफलता की ओर ले जाता है।

शोधकर्ताओं ने यह भी मानचित्रित किया है कि ये मॉडल रोबोट के मस्तिष्क के बाकी हिस्सों के साथ कैसे परस्पर क्रिया करते हैं। उन्होंने चार मुख्य तरीके पहचाने हैं जिनसे एक वर्ल्ड मॉडल मशीन को सुधारने में मदद कर सकता है। पहला, यह बेहतर डेटा एकत्र करने में मदद कर सकता है, यह सुझाव देकर कि आगे कौन से प्रयोग किए जाने चाहिए। दूसरा, यह एक निर्णायक (जज) के रूप में कार्य कर सकता है, जो यह स्कोर करता है कि कोई योजना कितनी अच्छी तरह काम करेगी इससे पहले कि रोबोट उसे आजमाए। तीसरा, यह एक प्रशिक्षण मैदान के रूप में कार्य कर सकता है, जिससे रोबोट एक सुरक्षित, आभासी वातावरण में लाखों बार अभ्यास कर सके। अंत में, यह एक सुरक्षा जाल (सेफ्टी नेट) के रूप में कार्य कर सकता है, जो लगातार रोबोट के कार्यों की उसकी भविष्यवाणियों के विरुद्ध जांच करता है और हस्तक्षेप करता है यदि वास्तविकता योजना से अलग होने लगती है।

इस ढांचे को रोबोटिक्स के विविध कार्यों पर लागू किया गया, जैसे कि वस्तुओं को उठाने जैसा सूक्ष्म हेरफेर, कार चलाना, या अज्ञात इमारतों के माध्यम से नेविगेट करना। सर्वेक्षण प्रकट करता है कि विभिन्न कार्यों के लिए अलग-अलग प्रकार के "ग्राउंडिंग" (आधार) की आवश्यकता होती है। एक कप उठाने वाले रोबोट को घर्षण और वजन जैसे भौतिक बलों को समझने की आवश्यकता होती है। एक स्वयं चलने वाली कार को अन्य वाहनों के इरादों और सड़क की ज्यामिति को समझने की आवश्यकता होती है। एक चलने वाले रोबोट को संतुलन और इलाके (टेरेन) को समझने की आवश्यकता होती है। लेखक तर्क देते हैं कि एक मॉडल जो एक कार्य के लिए अच्छा काम करता है, वह दूसरे कार्य के लिए विफल हो सकता है यदि वह उस वातावरण के विशिष्ट नियमों को नहीं समझता है।

प्रगति के बावजूद, यह शोध पत्र महत्वपूर्ण बाधाओं को रेखांकित करता है। एक प्रमुख चुनौती लंबे समय तक मानसिक चित्र को सुसंगत बनाए रखना है। यदि एक रोब dalam कमरे में काफी देर तक घूमता है, तो उसका आंतरिक मानचित्र भटक सकता है, जिससे वस्तुएं गलत स्थानों पर दिखाई देने लगती हैं। एक अन्य चुनौती यह परीक्षण करना है कि क्या मॉडल वास्तव में कारण और प्रभाव को समझता है, या केवल अपने प्रशिक्षण डेटा से पैटर्न को याद करता है। शोधकर्ता यह भी बताते हैं कि कई वर्तमान प्रणालियाँ तेज़ गति वाले कार्यों के लिए बहुत धीमी हैं, और यह सत्यापित करना कठिन है कि वास्तविक दुनिया में तैनात करने से पहले एक मॉडल वास्तव में सुरक्षित है या नहीं।

सर्वेक्षण निष्कर्ष निकालता है कि क्षेत्र को अपना ध्यान बदलने की आवश्यकता है। केवल इस बात का जश्न मनाने के बजाय कि एक उत्पन्न वीडियो कितना यथार्थवादी दिखता है, समुदाय को इस बात को प्राथमिकता देनी चाहिए कि क्या भविष्यवाणियाँ बेहतर, सुरक्षित और अधिक कुशल व्यवहार की ओर ले जाती हैं। इन तीन क्षमताओं—प्लाव्सिबिलिटी (विश्वसनीयता), कंट्रोल (नियंत्रण), और एक्शनैबिलिटी (कार्रवाई योग्यता)—के इर्द-गिर्द क्षेत्र को व्यवस्थित करके, लेखक अगली पीढ़ी की एम्बॉडीड इंटेलिजेंस (देहधारित बुद्धिमत्ता) के लिए एक स्पष्ट रोडमैप प्रदान करते हैं। लक्ष्य अब केवल एक ऐसी मशीन बनाना नहीं है जो भविष्य की कल्पना कर सके, बल्कि एक ऐसी मशीन बनाना है जो उस कल्पना का उपयोग वर्तमान में बुद्धिमानी से कार्य करने के लिए कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →