VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
VLA-JEPA एक नवीन प्रीट्रेनिंग फ्रेमवर्क है जो विजन-लैंग्वेज-एक्शन मॉडल्स को एक लीकेज-मुक्त लेटेंट स्टेट प्रेडिक्शन मैकेनिज्म के माध्यम से सुदृढ़ डायनेमिक्स एब्स्ट्रैक्शंस सीखने के लिए नियोजित करके उन्नत करता है, जिससे सिमुलेटेड और वास्तविक दुनिया के मैनिपुलेशन कार्यों में बेहतर सामान्यीकरण और मजबूती प्राप्त करने के लिए अपीयरेंस बायस और न्यूसेंस मोशन पर विजय प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को खाना बनाना सिखाने की कोशिश कर रहे हैं। आपके पास दो विकल्प हैं:
पुराना तरीका: आप रोबोट को शेफ के खाना बनाने के हजारों वीडियो दिखाते हैं, लेकिन रोबोट को सब कुछ देखने देते हैं—शेफ का एप्रन, रसोई की टिमटिमाती लाइटें, बैकग्राउंड का संगीत और बर्तन से उठता हुआ धुआं। रोबोट यह अनुमान लगाने की कोशिश करता है कि अगला कदम क्या होगा, यह देखते हुए कि पिक्सेल (छवि के छोटे बिंदु) कैसे बदल रहे हैं।
नया तरीका (VLA-JEPA): आप रोबोट को वीडियो दिखाते हैं, लेकिन रोबोट को धुएं और रोशनी को अनदेखा करना सिखाते हैं। इसके बजाय, आप उसे क्रिया की कहानी समझना सिखाते हैं: "हाथ ने चाकू पकड़ा, फिर चाकू सेब को छुआ।"
यह पेपर, VLA-JEPA, एक नया तरीका (विकल्प 2) पेश करता है जो रोबोट को बहुत अधिक स्मार्ट, मजबूत और प्रशिक्षित करने में आसान बनाता है। यहाँ सरल उपमाओं का उपयोग करके इसका विवरण दिया गया है।
समस्या: रोबोट विचलित हो रहा है
वर्तमान रोबोट जो इंटरनेट वीडियो से सीखते हैं, वे अक्सर तीन मुख्य "दिमागी गड़बड़ियों" (brain glitches) से जूझते हैं:
"पिक्सेल का जाल" (The Pixel Trap): कल्पना कीजिए कि एक रोबोट दरवाजा खोलने के बारे में सीख रहा है। यदि वह पिक्सेल पर ध्यान केंद्रित करता है, तो वह सोच सकता है, "आह, दरवाजा तब खुलता है जब रोशनी बदलती है," या "दरवाजा तब खुलता है जब बैकग्राउंड की दीवार हिलती है।" वह गलत चीज़ सीख जाता है। यह एक छात्र की तरह है जो वास्तविक उत्तरों के बजाय टेस्ट पेपर के फॉन्ट साइज को रट लेता है।
"लीकी बकेट" (The Leaky Bucket): कई वर्तमान प्रणालियों में, रोबोट को क्रिया का अनुमान लगाने के दौरान "भविष्य" (अगले कुछ सेकंड का वीडियो) में झांकने की अनुमति होती है। यह एक छात्र को परीक्षा देते समय उत्तर कुंजी (answer key) देने जैसा है। रोबोट भविष्य को याद करके नकल करना सीख जाता है, बजाय इसके कि वह यह समझे कि वहां कैसे पहुँचना है।
"जटिल रेसिपी" (The Complex Recipe): इन समस्याओं को ठीक करने के लिए, वैज्ञानिक पहले जटिल, बहु-चरणीय प्रशिक्षण पाइपलाइन बनाते थे (जैसे केक बनाना, फिर उस पर फ्रॉस्टिंग करना, फिर सजावट करना, फिर फ्रॉस्टिंग को ठीक करना)। यह धीमा, नाजुक और सही करना कठिन था।
समाधान: VLA-JEPA (द "सीक्रेट एजेंट" मेथड)
लेखक VLA-JEPA का प्रस्ताव करते हैं, जिसका अर्थ है विज़न-लैंग्वेज-एक्शन जॉइंट-एम्बेडिंग प्रेडिक्टिव आर्किटेक्चर। इसे एक "सीक्रेट एजेंट" प्रशिक्षण कार्यक्रम के रूप में समझें।
1. "आंखों पर पट्टी" वाला प्रेडिक्टर (कोई लीकेज नहीं)
पुराने तरीके में, रोबोट क्रिया का अनुमान लगाने के लिए वर्तमान और भविष्य दोनों को देखता था।
VLA-JEPA में, रोबोट भविष्य के संबंध में आंखों पर पट्टी बांधकर रखता है।
- सेटअप: रोबोट वर्तमान दृश्य देखता है (जैसे, हाथ में कप पकड़े हुए)।
- लक्ष्य: इसे अनुमान लगाना है कि अगली दृश्य की अमूर्त अवधारणा (abstract idea) कैसी दिखेगी (जैसे, "कप ऊपर की ओर बढ़ रहा है")।
- ट्रिक: "भविष्य" केवल एक अलग, फ्रीज्ड "टीचर" मॉडल को दिखाया जाता है जो लक्ष्य उत्तर बनाता है। छात्र रोबोट भविष्य के वीडियो फ्रेम को सीधे कभी नहीं देख पाता। उसे स्वयं गति के तर्क को समझना पड़ता है। यह उसे नकल करने से रोकता है।
2. "अमूर्त मानचित्र" (Latent Space)
पिक्सेल-दर-पिक्सेल अगली तस्वीर के सटीक रूप की भविष्यवाणी करने के बजाय, रोबोट एक मानसिक मानचित्र (जिसे "लेटेंट स्पेस" कहा जाता है) की भविष्यवाणी करता है।
- उपमा: कल्पना कीजिए कि आप गाड़ी चला रहे हैं। आपको यह जानने के लिए कि आप बाएं मुड़ रहे हैं, हर पेड़ के पत्तों के सटीक रंग की भविष्यवाणी करने की आवश्यकता नहीं है। आपको बस "बाएं मुड़ने" की अवधारणा जानने की आवश्यकता है।
- यह कैसे मदद करता है: यदि कैमरा हिलता है, या सूरज बादल के पीछे चला जाता है, तो "पिक्सेल" तेजी से बदलते हैं। लेकिन रोबोट के हाथ के हिलने की "अवधारणा" वैसी ही रहती है। तस्वीर के बजाय अवधारणा (मैप) की भविष्यवाणी करने से, रोबोट कैमरा शेक और बैकग्राउंड के शोर से मुक्त हो जाता है।
3. "दो-चरण" वाली रेसिपी
अतीत की जटिल बहु-चरणीय प्रशिक्षण प्रक्रियाओं के बजाय, VLA-JEPA एक सरल दो-चरणीय प्रक्रिया का उपयोग करता है:
- प्रीट्रेनिंग (Pretraining): रोबोट लाखों मानव वीडियो (जैसे खाना बनाना, सफाई करना, खेलना) देखता है और ऊपर बताए गए "आंखों पर पट्टी" वाले तरीके का उपयोग करके "क्रिया के भौतिकी" (physics of action) को सीखता है। वह सीखता है कि वस्तुएं कैसे चलती हैं और परस्पर क्रिया करती हैं, बिना यह जाने कि रोबलेट के विशिष्ट मोटर्स अभी कैसे काम करेंगे।
- फाइन-ट्यूनिंग (Fine-tuning): इसके बाद रोबोट को विशिष्ट रोबोट डेटा का एक छोटा हिस्सा दिखाया जाता है ताकि वह उन "अवधारणाओं" को वास्तविक मोटर गतिविधियों में बदलना सीख सके।
परिणाम: यह क्यों मायने रखता है
पेपर का परीक्षण ब्लॉक को स्टैक करने, वस्तुओं को हिलाने और भूलभुलैया (mazes) में नेविगेट करने जैसे कार्यों के लिए रोबोट पर किया गया।
- बेहतर सामान्यीकरण (Better Generalization): जब उन्होंने लाइटिंग, बैकग्राउंड या कैमरा एंगल बदला, तो VLA-JEPA काम करता रहा। पुराने रोबोट अक्सर रुक जाते थे क्योंकि उनकी "पिक्सेल मेमोरी" टूट जाती थी।
- वास्तविक दुनिया की समझ (Real-World Smarts): वास्तविक दुनिया के परीक्षणों में, VLA-JEPA ने "रिपीटेड ग्रैस्पिंग" (Repeated Grasping) नामक एक ट्रिक सीखी। यदि कोई रोबोट किसी वस्तु को गिरा देता है, तो वह जानता है कि अपने ग्रिपर को खोलना है और फिर से प्रयास करना है। क्यों? क्योंकि उसने प्रशिक्षण वीडियो में मनुष्यों को ऐसा करते देखा था। अन्य रोबोट, जिन्हें केवल पूर्ण (perfect) रोबोट डेटा पर प्रशिक्षित किया गया था, विफल होने पर क्या करना है यह नहीं जानते थे।
- सरलता: इसने पिछले तरीकों की तुलना में बहुत सरल प्रशिक्षण प्रक्रिया के साथ ये परिणाम प्राप्त किए।
बड़ी तस्वीर (The Big Picture)
VLA-JEPA एक रोबोट को केवल वीडियो के फ्रेम्स को रटने के बजाय, वीडियो की कहानी समझने के लिए सिखाने जैसा है। रोबोट को नकल करने से रोककर (भविष्य में झांकने से रोककर) और उसे बिखरे हुए पिक्सेल के बजाय अमूर्त अवधारणाओं में सोचने के लिए मजबूर करके, लेखकों ने एक ऐसा रोबोट बनाया है जो अधिक मजबूत है, तेजी से सीखता है, और वास्तविक दुनिया की अव्यवस्थित और अप्रत्याशित स्थितियों को बहुत बेहतर तरीके से संभाल सकता है।
यह एक ऐसे रोबोट के बीच का अंतर है जो कहता है, "मैंने एक लाल वर्ग को चलते देखा," और एक ऐसे रोबोट के बीच जो कहता है, "मैं समझता हूँ कि हाथ वस्तु को बाईं ओर ले जा रहा है।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।