JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling
JEPA-WAM एक प्रीट्रेन्ड V-JEPA स्पेस पर आधारित एक लेटेंट वर्ल्ड एक्शन मॉडल पेश करता है जो एक साझा प्रेडिक्टर के माध्यम से स्थानिक रूप से संरचित भविष्य के पूर्वानुमान और निरंतर एक्शन जनरेशन को एकीकृत करता है, जिससे बड़े पैमाने पर पॉलिसी प्रीट्रेनिंग की आवश्यकता के बिना रोबोटिक मैनिपुलेशन बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को खाना बनाना सिखा रहे हैं। आप बस उसे एक शेफ का प्याज काटते हुए वीडियो दिखा सकते हैं और कह सकते हैं, "ऐसा करो।" लेकिन अगर रोबोट केवल उस विशिष्ट वीडियो के सटीक रूप को याद कर लेता है, तो वह घबरा सकता है यदि शेफ ने अलग टोपी पहनी हो या रसोई की रोशनी बदल गई हो। यह विज़न-लैंग्वेज-एक्शन (VLA) मॉडलों की चुनौती है: वे परिचित सेटिंग्स में निर्देशों का पालन करने में माहिर हैं, लेकिन वे तब लड़खड़ा जाते हैं जब दुनिया उनके प्रशिक्षण के दौरान दिखने वाले दृश्य से थोड़ी अलग होती है।
इसे ठीक करने के लिए, वैज्ञानिकों ने रोबोटों को "प्रेडिक्टर" (भविष्यवाणी करने वाला) बनने के लिए सिखाने की कोशिश की है। केवल प्रतिक्रिया देने के बजाय, रोबोट यह कल्पना करने की कोशिश करता है कि आगे क्या होगा। यदि वह अनुमान लगा सकता है कि "यदि मैं इस कप को धकेलता हूँ, तो यह मेज से फिसल जाएगा," तो वह बेहतर योजना बना सकता है। हालाँकि, एक ऐसा रोबोट बनाना जो भविष्य के पूर्ण, हाई-डेफिनिशन वीडियो उत्पन्न कर सके, ऐसा करने के लिए एक छात्र को अगला कदम तय करने के लिए पूरा उपन्यास लिखने के लिए कहने जैसा है—इसमें बहुत अधिक समय और कंप्यूटिंग शक्ति लगती है। इसलिए, शोधकर्ताओं ने एक शॉर्टकट की तलाश की: एक "लेटेंट" (सुप्त) मॉडल जो पूरे चित्र को बनाने के बजाय भविष्य के विचार की भविष्यवाणी करता है। लेकिन यहाँ एक पेंच है: इनमें से कई शॉर्टकट या तो बहुत अधिक विवरण खो देते हैं या भविष्यवाणी और क्रिया को दो अलग, असंबद्ध कार्यों के रूप में देखते हैं।
यह JEPA-WAM की ओर ले जाता है, जो एक नया दृष्टिकोण है जो रोबोटों को हर एक फ्रेम बनाने में उलझे बिना समय के प्रवाह को "महसूस" करना सिखाने की कोशिश करता है। यह एक सरल प्रश्न पूछता है: क्या हम एक रोबोट को यह समझने के लिए सिखा सकते हैं कि दुनिया कैसे बदलती है, और उस समझ का उपयोग करके बेहतर तरीके से हिलना-डुलना सिखा सकते हैं, और यह सब एक सुचारू गति में हो सकता है?
रोबोट का "समय-बोध" शॉर्टकट
JEPA-WAM से मिलिए। इसे एक ऐसे रोबोट के रूप में सोचें जो केवल वर्तमान की फोटो नहीं देखता और अगले फोटो का अनुमान नहीं लगाता; बल्कि, वह दोनों के बीच के संबंध को सीखता है।
कल्पना कीजिए कि आप एक जादू का खेल देख रहे हैं। एक जादूगर एक लाल गेंद को बॉक्स में रखता है, और फिर एक नीली गेंद बाहर निकालता है। एक मानक रोबोट केवल "लाल गेंद → नीली गेंद" को याद रखेगा। लेकिन JEPA-WAM एक जासूस की तरह है जो परिवर्तन को नोटिस करता है: "लाल गेंद गायब हो गई, बॉक्स हिला, और एक नीली गेंद प्रकट हुई।" वह केवल पहले और बाद को नहीं, बल्कि बदलाव की कहानी को सीखता है।
शोधकर्ताओं ने इस सिस्टम को V-JEPA नामक एक प्री-ट्रेंड "विज़न ब्रेन" पर बनाया है। आप V-JEPA को एक ऐसे रोबोट के रूप में देख सकते हैं जिसने लाखों वीडियो देखे हैं और सीख लिया है कि वस्तुएं कैसे चलती हैं और परस्पर क्रिया करती हैं। JEPA-WAM इस मस्तिष्क को लेता है और इसमें एक विशेष "टाइम-ट्रैवल" मॉड्यूल जोड़ता है।
यहाँ जादू का कमाल है: रोबोट को भविष्य का धुंधला वीडियो बनाने के लिए कहने के बजाय (जो धीमा और महंगा है), JEPA-WAM रोबोट से एक जॉइंट मैप (संयुक्त मानचित्र) की भविष्यवाणी करने के लिए कहता है। कल्पना कीजिए कि आप अभी रसोई की एक फोटो लेते हैं और पाँच सेकंड बाद की रसोई की एक फोटो लेते हैं, और उन्हें एक के ऊपर एक रखते हैं। JEPA-WAM शून्य से भविष्य की फोटो बनाने की कोशिश नहीं करता है। इसके बजाय, यह दोनों स्टैक्ड (एक के ऊपर एक रखी) तस्वीरों के बीच के अंतर को देखता है और यह भविष्यवाणी करना सीखता है कि पिक्सेल ठीक कैसे खिसके। यह सीखता है कि "कप दो इंच बाईं ओर चला गया" और "दराज खुल गई," जिससे यह भी सुरक्षित रहता है कि चीजें कहाँ हुईं।
साझा मस्तिष्क: एक प्रेडिक्टर, दो काम
JEPA-WAM का सबसे चतुर हिस्सा यह है कि यह अपने मस्तिष्क का उपयोग कैसे करता है। कई पुराने सिस्टमों में, भविष्य की भविष्यवाणी करने वाला हिस्सा और रोबोट के हाथों को चलाने वाला हिस्सा ऐसे था जैसे दो अलग लोग एक दीवार के माध्यम से बात कर रहे हों। एक भविष्य का अनुमान लगाता था, और दूसरा सुनने की कोशिश करता था।
JEPA-WAM एक शेयर्ड प्रेडिक्टर (साझा प्रेडिक्टर) का उपयोग करता है। एक ही, सुपर-स्मार्ट छात्र की कल्पना करें जो एक परीक्षा दे रहा है।
- कार्य A: छात्र वर्तमान दृश्य को देखता है और भविष्यवाणी करता है कि दुनिया कैसे बदलेगी ("समय-बोध")।
- कार्य B: छात्र उसी समझ का उपयोग करके यह तय करता है कि रोबोट के हाथ कैसे चलाने हैं ("क्रिया")।
क्योंकि छात्र एक ही समय में दोनों कार्य कर रहा है, भविष्य की भविष्यवाणी करना सीखना सीधे इस बात को आकार देता है कि छात्र कैसे निर्णय लेता है। शोध पत्र सुझाव देता है कि यह गहरा जुड़ाव रोबोट को बहुत स्मार्ट बनाता है। यह एक नर्तक की तरह है जो केवल कदमों को याद नहीं करता बल्कि संगीत की लय को भी समझता है; गति स्वाभाविक रूप से बहती है क्योंकि भविष्यवाणी और क्रिया एक ही समझ से उत्पन्न होते हैं।
क्या यह वास्तव में काम करता है?
शोधकर्ताओं ने इस विचार का परीक्षण तीन अलग-अलग दुनियाओं में किया: एक मानक वीडियो गेम सिमुलेशन, एक अधिक अराजक सिमुलेशन जिसमें यादृच्छिक वस्तुएं थीं, और एक लैब में वास्तविक रोबोट आर्म।
सिमुलेशन में:
LIBERO-Plus नामक एक बेंचमार्क पर, जो यह परीक्षण करता है कि रोबोट वातावरण में बदलाव (जैसे अलग रोशनी या वस्तुओं की स्थिति) को कितनी अच्छी तरह संभालते हैं, JEPA-WAM ने 79.2% का स्कोर किया। यह उन रोबोटों में सबसे अच्छा परिणाम था जिन्हें भारी मात्रा में रोबोट डेटा पर प्री-ट्रेन नहीं किया गया था। इससे भी अधिक प्रभावशाली बात यह है कि जब उन्होंने इस "टाइम-सेन्स" ट्रिक को एक पहले से ही शक्तिशाली रोबोट ब्रेन π0.5 पर लागू किया, तो स्कोर 84.5% से बढ़कर 86.3% हो गया। यह सुझाव देता है कि स्मार्ट रोबोट भी और स्मार्ट हो सकते हैं यदि वे समय के प्रवाह की भविष्यवाणी करना सीख लें।
वास्तविक दुनिया में:
टीम ने अपने रोबोट को एक वास्तविक लैब में ले जाकर, जहाँ एक डुअल-आर्म सेटअप (दो रोबोट हाथ मिलकर काम कर रहे हैं) था, परीक्षण किया। उन्होंने इसे ब्लॉक स्टैक करने, फल प्लेट पर रखने या दराज खोलने जैसे कार्य दिए।
- जब सेटअप बिल्कुल अपेक्षित था (In-Distribution): JEPA-WAM ने लगभग 59.8% स्कोर किया।
- जब उन्होंने बैकग्राउंड के साथ छेड़छाड़ की या वस्तुओं को इधर-उधर कर दिया (Out-of-Distribution): JEPA-WAM ने फिर भी 54.2% हासिल किया।
- इसकी तुलना में, एक मानक रोबोट (π0) का स्कोर, जब वातावरण बदला, तो 51.8% से गिरकर डगमगाते हुए 22.5% पर आ गया।
यह दर्शाता है कि JEPA-WAM बहुत अधिक मजबूत (robust) है। यह केवल एक विशिष्ट दृश्य को याद नहीं करता है; यह वस्तुओं के हिलने के तर्क को सीखता है, ताकि यह आश्चर्यों को संभाल सके।
यह क्या नहीं है (और यह क्या खारिज करता है)
पेपर सावधानी से यह स्पष्ट करता है कि JEPA-WAM क्या नहीं है।
- यह एक वीडियो जनरेटर नहीं है। यह भविष्य का नया, हाई-डेफिनिशन वीडियो बनाने की कोशिश नहीं करता है। लेखक तर्क देते हैं कि हर पिक्सेल को उत्पन्न करने की कोशिश करना बहुत महंगा है और रोबोट को नियंत्रित करने के लिए अक्सर अनावश्यक भी है।
- यह केवल अंतिम अवस्था (final state) की भविष्यवाणी करने के बारे में नहीं है। शोधकर्ताओं ने एक संस्करण का परीक्षण किया जो "वर्तमान" छवि के बिना केवल "भविष्य" की छवि को देखता था, और इसने खराब प्रदर्शन किया (77.3% बनाम 79.2%)। यह साबित करता है कि "अभी" और "बाद में" के बीच के संबंध को समझना केवल अंत परिणाम का अनुमान लगाने से अधिक महत्वपूर्ण है।
- यह हर चीज़ के लिए कोई जादुई समाधान (magic bullet) नहीं है। लेखक नोट करते हैं कि यदि एक ही दृश्य एक विशिष्ट निर्देश के आधार पर दो बहुत अलग परिणाम देता है (जैसे, "कप को धक्का दें" बनाम "कप को खींचें"), तो मॉडल संघर्ष कर सकता है क्योंकि यह भाषा-विशिष्ट लक्ष्यों के बजाय विजुअल परिवर्तनों पर ध्यान केंद्रित करता है।
निष्कर्ष
JEPA-WAM सुझाव देता है कि रोबोटों को अधिक अनुकूलन योग्य बनाने का रहस्य केवल उन्हें अधिक डेटा या बड़ा मस्तिष्क देना नहीं है, बल्कि उन्हें समय के प्रवाह को इस तरह समझने के लिए सिखाना है जो सीधे उनके कार्यों को सूचित करे। एक साझा मस्तिष्क का उपयोग करके कि दुनिया कैसे बदलती है और कैसे हिलना-डुलना है, रोबोट एक कुशल मानव की तरह बन जाता है जो घबराने के बजाय एक अस्त-व्यस्त रसोई के अनुकूल ढल सकता है।
सिमुलेशन और वास्तविक दुनिया के परीक्षणों में मापे गए परिणाम बताते हैं कि यह "संयुक्त भविष्यवाणी" (joint prediction) दृष्टिकोण एक शक्तिशाली तरीका है जिससे ऐसे रोबोट बनाए जा सकते हैं जो वास्तविक दुनिया की अप्रत्याशित प्रकृति को संभाल सकें। हालांकि यह हर संभव कार्य के लिए पूरी तरह से हल नहीं हुआ है, लेकिन यह रोबोटों को केवल आज्ञाकारी ही नहीं, बल्कि वास्तव में अनुकूलन योग्य बनाने का एक आशाजनक नया मार्ग प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।