← नवीनतम पेपर
💻 computer science

Masked Visual Actions for Unified World Modeling

यह शोध पत्र मास्क्ड विज़ुअल एक्शन्स (Masked Visual Actions) को प्रस्तुत करता है, जो एक एकीकृत पिक्सेल-स्पेस नियंत्रण इंटरफ़ेस है जो दृश्य के भीतर संस्थाओं के आंशिक रूप से प्रकट किए गए प्रक्षेप पथों (trajectories) के रूप में क्रियाओं का प्रतिनिधित्व करके रोबोटिक हेरफेर के लिए फॉरवर्ड डायनेमिक्स प्रेडिक्शन और इनवर्स प्लानिंग दोनों को करने के लिए वीडियो मॉडल का लाभ उठाता है।

मूल लेखक: Hadi Alzayer, Wenlong Huang, Haonan Chen, Christopher Luey, Lvmin Zhang, Maneesh Agrawala, Gordon Wetzstein, Li Fei-Fei, Yilun Du, Jiajun Wu, Jia-Bin Huang

प्रकाशित 2026-07-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hadi Alzayer, Wenlong Huang, Haonan Chen, Christopher Luey, Lvmin Zhang, Maneesh Agrawala, Gordon Wetzstein, Li Fei-Fei, Yilun Du, Jiajun Wu, Jia-Bin Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कोई नया काम करना सिखाने की कोशिश कर रहे हैं, जैसे कि सैंडविच बनाना या फ्रिज खोलना। अतीत में, वैज्ञानिकों को रोबोट की भाषा बोलनी पड़ती थी, जो अक्सर संख्याओं की एक भ्रमित करने वाली सूची होती थी जो उसके जोड़ों (joints) को बताती थी कि कैसे हिलना है। यह एक फिल्म को निर्देशित करने के लिए केवल अभिनेताओं को निर्देशांकों (coordinates) का एक स्प्रेडशीट भेजने जैसा था। लेकिन हाल ही में, एक नए प्रकार का "सुपर-ऑब्जर्वर" उभरा है: वीडियो मॉडल। ये एआई सिस्टम हैं जिन्हें लाखों घंटों के वीडियो पर प्रशिक्षित किया गया है, इसलिए उनमें दुनिया के काम करने के तरीके के बारे में एक अविश्वसनीय, लगभग जादुई अंतर्ज्ञान है। वे जानते हैं कि यदि आप एक कप को धक्का देते हैं, तो वह फिसलता है; यदि आप एक अंडा गिराते हैं, तो वह टूट जाता है; और यदि आप हाथ हिलाते हैं, तो हवा चलती है। वे हमारे पास मौजूद लगभग किसी भी अन्य उपकरण की तुलना में हमारे दृश्य जगत के भौतिकी (physics) को बेहतर समझते हैं। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह यह है: क्या हम इस "सुपर-ऑब्जर्वर" का उपयोग केवल दुनिया को देखने के लिए ही नहीं, बल्कि उसे नियंत्रित करने के लिए भी कर सकते हैं? क्या हम उससे संख्याओं के बजाय चित्रों में बात कर सकते हैं, जिससे वह भविष्य की कल्पना कर सके और हमें बता सके कि क्या करना है?

यह बिल्कुल वही है जो शोध पत्र "मास्क्ड विजुअल एक्शन्स फॉर यूनिफाइड वर्ल्ड मॉडलिंग" (Masked Visual Actions for Unified World Modeling) तलाशता है। शोधकर्ताओं ने, जो स्टैनफोर्ड और हार्वर्ड जैसे शीर्ष विश्वविद्यालयों की एक टीम है, एक चतुर तरीका विकसित किया है जिससे आप इन वीडियो मॉडल्स के साथ "मास्क्ड विजुअल एक्शन्स" नामक विधि का उपयोग करके बात कर सकते हैं। इसे "खाली स्थान भरने" के खेल या ताश के पत्तों के साथ एक जादू के खेल की तरह समझें। आमतौर पर, जब आप चाहते हैं कि एक वीडियो मॉडल आपको दिखाए कि आगे क्या होगा, तो आप उसे एक शुरुआती चित्र देते हैं और पूछते हैं, "आगे क्या होता है?" लेकिन यहाँ, शोधकर्ता मॉडल को एक विशेष निर्देश देते हैं: "यह शुरुआती चित्र है, और यहाँ एक रोबोटिक हाथ के हिलने का एक भूतिया, अर्ध-पारदर्शी रूपरेखा (outline) है। अब, आप बाकी दृश्य को पूरा करें।"

जादू इसलिए होता है क्योंकि मॉडल चीजों के बीच परस्पर क्रिया (interaction) को समझने में इतना अच्छा है कि वह एक ही मस्तिष्क के साथ दो अलग-अलग भूमिकाएँ निभा सकता है। पहला, यह एक फॉरवर्ड मॉडल (Forward Model) के रूप में कार्य करता है। यदि आप इसे रोबोट को चलते हुए दिखाते हैं, तो यह भविष्यवाणी करता है कि शेष दुनिया वास्तव में कैसे प्रतिक्रिया देगी। यह एक निर्देशक को स्टंटमैन के कूदने का स्टोरीबोर्ड दिखाने जैसा है, और एआई तुरंत उस वीडियो को उत्पन्न करता है क्योंकि स्टंटमैन ने कार से टक्कर मारी है। यह रोबोटों को वास्तव में कुछ भी करने से पहले भविष्य की "कल्पना" करने की अनुमति देता है, जिससे उन्हें वास्तविक दुनिया की वस्तुओं को तोड़े बिना अपने मूव्स की योजना बनाने में मदद मिलती है।

दूसरा, और शायद और भी आश्चर्यजनक रूप से, यह एक इनवर्स मॉडल (Inverse Model) के रूप में कार्य कर सकता है। यह इसके विपरीत जादू का खेल है। रोबोट को चलते हुए दिखाने के बजाय, आप मॉडल को वह परिणाम दिखाते हैं जिसे आप चाहते हैं—जैसे कि एक कप मेज पर एक विशिष्ट स्थान तक फिसल रहा है। आप एआई को बताते हैं, "मैं चाहता हूँ कि कप यहाँ समाप्त हो," और मॉडल वह गतिविधियाँ निकाल लेता है जो इसे करने के लिए आवश्यक हैं। यह एक शेफ से पूछने जैसा है, "मुझे एक पूरी तरह से पका हुआ स्टेक चाहिए," और शेफ तुरंत उस तक पहुँचने के लिए सटीक रेसिपी और खाना पकाने के चरण लिख देता है, भले ही उसने पहले कभी वह विशिष्ट स्टेक न पकाया हो।

टीम ने इस विचार का परीक्षण डेटा की आश्चर्यजनक रूप से कम मात्रा का उपयोग करके किया—वास्तविक रोबोटों और कंप्यूटर सिमुलेशन से वीडियो क्लिप्स के केवल 15 घंटे। उन्होंने एक विशाल, प्री-ट्रेन्ड वीडियो मॉडल लिया और उसे इस नए तरीके से संवाद करने के लिए एक त्वरित "फाइन-ट्यूनिंग" सत्र (जिसे LoRA फाइन-ट्यूनिंग कहा जाता है) दिया। परिणाम प्रभावशाली थे। अपने परीक्षणों में, मॉडल उच्च सटीकता के साथ यह भविष्यवाणी कर सका कि एक रोबोट रसोई में वस्तुओं के साथ कैसे व्यवहार करेगा। यह भविष्य की कल्पना करने में इतना अच्छा था कि जब उन्होंने इसका उपयोग रोबोट के मूव्स की योजना बनाने के लिए किया, तो सफलता दर काफी बढ़ गई, जो अनुमान लगाने की तुलना में कभी-कभी 26% तक अधिक थी।

इस खोज का एक सबसे रोमांचक हिस्सा यह है कि यह उन रोबोटों पर भी कितनी अच्छी तरह काम करता है जिन्हें इसने पहले कभी नहीं देखा है। अधिकांश रोबोट कंट्रोलर कस्टम-मेड चाबियों की तरह होते हैं; वे केवल एक विशिष्ट लॉक (एक विशिष्ट रोबोट) में फिट होते हैं। यदि आप रोबोट का आकार या आकार बदलते हैं, तो कंट्रोलर टूट जाता है। लेकिन क्योंकि यह नया तरीका "संख्याओं" के बजाय "चित्रों" में बात करता है, इसलिए यह एक सार्वभौमिक कुंजी (universal key) की तरह है। जब उन्होंने एक पूरी तरह से अलग प्रकार के रोबोट (R1-Pro नामक दो-हाथ वाला रोबोट) पर परीक्षण किया जो उनके प्रशिक्षण डेटा में नहीं था, तो मॉडल भ्रमित नहीं हुआ या गलत जानकारी (hallucinate) नहीं दी। इसने सहजता से सीखा कि फ्रिज खोलने या माइक्रोवेव बंद करने के लिए नए रोबट को कैसे चलाना है, जबकि अन्य विधियाँ पूरी तरह से विफल हो गईं।

शोधकर्ताओं ने यह भी दिखाया कि यह "कल्पना" कितनी विश्वसनीय है। जब उन्होंने मॉडल से ब्लॉक को स्टैक करने या दराज खोलने की कोशिश करने वाले रोबोट के परिणाम की भविष्यवाणी करने के लिए कहा, तो "कल्पना की गई" सफलता दर वास्तविक दुनिया की सफलता दर के लगभग पूरी तरह से मेल खाती थी ( 0.982 के सहसंबंध के साथ)। इसका मतलब है कि मॉडल एक भरोसेमंद सिम्युलेटर है। इसका उपयोग यह मूल्यांकन करने के लिए किया जा सकता है कि क्या रोबोट की योजना काम करेगी या नहीं, इससे पहले कि रोबोट एक मांसपेशी भी हिलाए, जिससे समय बचता है और दुर्घटनाओं को रोका जा सकता है।

संक्षेप में, यह शोध पत्र मानव अंतर्ज्ञान और रोबोटिक क्रिया के बीच के अंतर को पाटने का एक नया तरीका सुझाता है। रोबोट की गतिविधियों को दृश्य पहेलियों (visual puzzles) के रूप में मानकर, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जो लचीली, कुशल और भौतिक दुनिया को समझने में आश्चर्यजनक रूप से अच्छी है। यह केवल रोबोटों को चलाने के बारे में नहीं है; यह उन्हें अपने कार्यों के परिणामों के बारे में "सपना" देखने का एक तरीका देने के बारे में है, जिससे वे तेजी से और सुरक्षित रूप से सीख सकें। हालाँकि मॉडल पूर्ण नहीं है और अभी भी उस वीडियो मॉडल की सीमाओं पर निर्भर है जिस पर यह बना है, यह एक ऐसे भविष्य का द्वार खोलता है जहाँ रोबोट वीडियो देखकर और अपने दिमाग में योजना बनाकर सीख सकते हैं, ठीक वैसे ही जैसे हम करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →