WA-JEPA: Rethinking the Video JEPA Paradigm for World-Action Modeling in Autonomous Driving
यह शोध पत्र WA-JEPA प्रस्तुत करता है, जो एक नवीन वर्ल्ड-एक्शन मॉडल है जो हाइब्रिड फ्यूचर-मास्क्ड प्री-ट्रेनिंग और कंडीशनल फ्लो मैचिंग का उपयोग करके संभावित भविष्य के लैटेंट्स (latents) उत्पन्न करने के माध्यम से वीडियो JEPA प्रतिमान (paradigm) पर पुनर्विचार करता है, जिससे NAVSIM और HUGSIM जैसे बेंचमार्क पर स्वायत्त ड्राइविंग प्लानिंग (autonomous driving planning) में अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
सेल्फ-ड्राइविंग कारें लंबे समय से एक मॉड्यूलर दृष्टिकोण पर निर्भर रही हैं, जहाँ सॉफ़्टवेयर का एक हिस्सा सड़क को देखता है, दूसरा निर्णय लेता है कि क्या करना है, और तीसरा वाहन को नियंत्रित करता है। यह अलगाव अक्सर गलतियों के संचय का कारण बनता है, जैसे कि 'टेलीफोन गेम' में संदेश हर मोड़ पर विकृत हो जाता है। इसे हल करने के लिए, शोधकर्ता एंड-टू-एंड सिस्टम विकसित कर रहे हैं जो कैमरा छवियों से सीधे स्टीयरिंग कमांड तक गाड़ी चलाना सीखते हैं, बिल्कुल एक मानव चालक की तरह जो किसी स्थिति को देखता है और बिना चरणों में तोड़े प्रतिक्रिया देता है। हालाँकि, ये सिस्टम दुर्लभ या जटिल परिदृश्यों में संघर्ष करते हैं क्योंकि उनमें वास्तव में यह सोचने की क्षमता की कमी होती है कि आगे क्या होगा। वे वर्तमान को स्पष्ट रूप से देखते हैं लेकिन भविष्य की कल्पना करने में उन्हें कठिनाई होती है, जो सुरक्षित नेविगेशन के लिए आवश्यक है।
एक आशाजनक नया दिशा "वर्ल्ड मॉडल्स" (विश्व मॉडल) शामिल करती है, जो ऐसे कंप्यूटर प्रोग्राम हैं जिन्हें यह अनुमान लगाने के लिए प्रशिक्षित किया जाता है कि एक दृश्य समय के साथ कैसे बदलेगा। वीडियो के अगले कुछ सेकंड का पूर्वानुमान लगाकर, ये मॉडल ट्रैफ़िक की गतिशीलता को समझ सकते हैं और अपनी चालों की योजना बनाने के लिए उस दूरदर्शिता का उपयोग कर सकते हैं। फिर भी, अनुसंधान में उपयोग की जाने वाली शक्तिशाली वीडियो भविष्यवाणी तकनीकों और स्वायत्त ड्राइविंग की विशिष्ट आवश्यकताओं के बीच एक महत्वपूर्ण अंतर बना हुआ है। मौजूदा कई विधियाँ वीडियो के लापता हिस्सों को यादृच्छिक रूप से भरने की कोशिश करती हैं, जो अतीत को समझने के लिए तो अच्छा है लेकिन भविष्य की भविष्यवाणी करने के लिए खराब है। अन्य विधियाँ दुनिया के सरलीकृत, संकुचित प्रतिनिधित्व पर निर्भर करती हैं जिनमें जटिल निर्णय लेने के लिए बहुत अधिक विवरण खो जाता है। चुनौती एक ऐसा सिस्टम बनाने की रही है जो सड़क के समृद्ध, विस्तृत वास्तविकता को भी समझ सके और अपने कार्यों के मार्गदर्शन के लिए विश्वसनीय और संभावित भविष्य उत्पन्न कर सके।
अफ़ारी इंटेलिजेंट ड्राइव और कई विश्वविद्यालयों के शोधकर्ताओं ने एक विशिष्ट आर्किटेक्चर जिसे "वीडियो जॉइंट एम्बेडिंग प्रेडिक्टिव आर्किटेक्चर" या V-JEPA कहा जाता है, को फिर से सोचकर इस समस्या का समाधान किया है। यह तकनीक बिना मानवीय लेबल की आवश्यकता के वीडियो से गहरे, अर्थपूर्ण पैटर्न सीखने के लिए डिज़ाइन की गई है, लेकिन अपने मूल रूप में, यह वीडियो के बीच के हिस्सों को पूरा करने के लिए बनाया गया था न कि समय में आगे देखने के लिए। टीम ने महसूस किया कि एक कार के लिए खुद चलाने के लिए, उसे केवल खाली जगहों को भरने के बजाय आगे देखना आवश्यक है। उन्होंने WA-JEPA नामक एक नई प्रणाली विकसित की, जो V-JEPA की शक्तिशाली सीखने की क्षमताओं को विशेष रूप से ड्राइविंग कार्य के लिए अनुकूलित करती है। वीडियो के लापता हिस्सों का यादृच्छिक अनुमान लगाने के बजाय, उनका मॉडल वर्तमान सड़क को देखने और ठीक से यह भविष्यवाणी करने के लिए प्रशिक्षित है कि भविष्य में दृश्य कैसा दिखेगा, और साथ ही यह भी तय करता है कि कार को क्या करना चाहिए।
उनके नवाचार का मूल यह है कि वे मॉडल को समय के बारे में सोचना कैसे सिखाते हैं। प्रशिक्षण के पहले चरण में, सिस्टम को कार के कई कैमरों से वीडियो फ्रेम का एक क्रम दिखाया जाता है। फिर इसे अंतिम दृश्य क्षण के बाद आने वाले भविष्य के फ्रेमों की कल्पना करने के लिए कहा जाता है। पिछली विधियों के विपरीत, जो वीडियो के बीच में एक गायब फ्रेम का अनुमान लगाने की कोशिश करती हैं, यह मॉडल सख्ती से आगे देखने के लिए मजबूर है, जिससे यह ट्रैफ़िक के कारण-और-प्रभाव संबंधों को सीखता है। इन भविष्यवाणियों को अधिक यथार्थवादी बनाने के लिए, शोधकर्ताओं ने एक मानक गणितीय दृष्टिकोण को बदलकर "फ्लो मैचिंग" नामक तकनीक का उपयोग किया। यह मॉडल को भविष्य की संभावनाओं का एक सुचारू, निरंतर पथ उत्पन्न करने की अनुमति देता है, न कि केवल एक स्थिर परिणाम का अनुमान लगाने की। यह महत्वपूर्ण है क्योंकि भविष्य शायद एक निश्चित बिंदु नहीं है; यह संभावनाओं की एक श्रृंखला है जिसके माध्यम से कार को नेविगेट करना होता है।
दूसरे चरण में, शोधकर्ताओं ने इस भविष्य-देखने की क्षमता को सीधे कार के नियंत्रणों से जोड़ा। उन्होंने एक एकल, एकीकृत प्रणाली बनाई जो सड़क के भविष्य के स्वरूप और कार की भविष्य की क्रियाओं, दोनों की भविष्यवाणी एक साथ करती है। इन दोनों कार्यों को एक साथ प्रशिक्षित करके, मॉडल यह सीखता है कि दुनिया कैसे बदलती है, यह सीधे तौर पर इस बात से जुड़ा है कि कार कैसे चलती है। यदि कार मुड़ती है, तो दृश्य एक विशिष्ट तरीके से बदलता है; यदि कार रुकती है, तो दुनिया अलग तरह से व्यवहार करती है। यह गहरा जुड़ाव यह सुनिश्चित करता है कि मॉडल केवल दुनिया को देखता ही नहीं है, बल्कि यह भी समझता है कि उसकी अपनी क्रियाएं उस दुनिया को कैसे आकार देती हैं। परिणाम एक ऐसा सिस्टम है जो कोई भी कदम उठाने से पहले अपने मन में भविष्य का अनुकरण करके जटिल ट्रैफ़िक स्थितियों के बारे में तर्क कर सकता है।
टीम ने NAVSIM नामक एक मानक बेंचमार्क पर अपने नए सिस्टम का परीक्षण किया, जो स्वायत्त वाहनों द्वारा नेविगेट करने की क्षमता का मूल्यांकन करने के लिए वास्तविक दुनिया के ड्राइविंग डेटा का उपयोग करता है। NAVSIM-v2 टेस्ट पर, WA-JEPA ने 91.7 का स्कोर प्राप्त किया, जो मौजूदा सर्वश्रेष्ठ एंड-टू-एंड ड्राइविंग विधियों और अन्य वर्ल्ड-मॉडल दृष्टिकोणों को पछाड़ देता है। यह सुधार इंगित करता है कि सिस्टम टक्करों से बचने और यातायात नियमों का पालन करने में बेहतर है। शायद इससे भी अधिक प्रभावशाली बात यह है कि शोधकर्ताओं ने मॉडल का परीक्षण एक पूरी तरह से अलग, क्लोज्ड-लूप सिम्युलेटर HUGSIM पर किया, जिसमें उस विशिष्ट वातावरण पर कोई अतिरिक्त प्रशिक्षण नहीं दिया गया था। इस ज़ीरो-शॉट टेस्ट में, जहाँ कार को लगातार गाड़ी चलानी थी और वास्तविक समय में अपनी गलतियों पर प्रतिक्रिया देनी थी, WA-JEB ने 0.4462 का उच्च स्कोर प्राप्त किया, जो अन्य सभी विधियों से काफी आगे है। यह सुझाव देता है कि भविष्य की भविष्यवाणी करने और कार्यों की योजना बनाने की क्षमता एक मजबूत समझ बनाती है जो नई और अनदेखी स्थितियों में अच्छी तरह से स्थानांतरित होती है।
निष्कर्ष बताते हैं कि बेहतर स्वायत्त ड्राइविंग की कुंजी अधिक सेंसर या अधिक जटिल नियम जोड़ने में नहीं है, बल्कि सिस्टम को भविष्य की अधिक सटीक रूप से कल्पना करना सिखाने में है। केवल गायब वीडियो डेटा को पूरा करने के बजाय सक्रिय रूप से यह अनुमान लगाने पर ध्यान केंद्रित करके, और इस भविष्यवाणी को सीधे कार के निर्णयों से जोड़कर, शोधकर्ताओं ने एक ऐसा मॉडल बनाया है जो दूरदर्शिता की अधिक मानवीय समझ के साथ गाड़ी चलाता है। यह दृष्टिकोण दृश्य दुनिया को समझने और कार्रवाई करने के बीच के अंतर को पाटता है, जिससे ऐसे वाहनों का मार्ग प्रशस्त होता है जो वास्तविक दुनिया की सड़कों की अप्रत्याशित प्रकृति को अधिक विश्वास और सुरक्षा के साथ संभाल सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।