← नवीनतम पेपर
🤖 AI

WA-JEPA: Rethinking the Video JEPA Paradigm for World-Action Modeling in Autonomous Driving

यह शोध पत्र WA-JEPA प्रस्तुत करता है, जो एक नवीन वर्ल्ड-एक्शन मॉडल है जो हाइब्रिड फ्यूचर-मास्क्ड प्री-ट्रेनिंग और कंडीशनल फ्लो मैचिंग का उपयोग करके संभावित भविष्य के लैटेंट्स (latents) उत्पन्न करने के माध्यम से वीडियो JEPA प्रतिमान (paradigm) पर पुनर्विचार करता है, जिससे NAVSIM और HUGSIM जैसे बेंचमार्क पर स्वायत्त ड्राइविंग प्लानिंग (autonomous driving planning) में अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Xinlin Wang, Yujiao Xiang, Yuheng Zhou, Jingqi Wang, Minqing Huang, Jiajie Huang, Dongxu Wei, Tingguang Zhou, Xiyang Wang, Gong Chen, Zhi Xu, Feiyang Tan, Hangning Zhou, Mu Yang

प्रकाशित 2026-08-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinlin Wang, Yujiao Xiang, Yuheng Zhou, Jingqi Wang, Minqing Huang, Jiajie Huang, Dongxu Wei, Tingguang Zhou, Xiyang Wang, Gong Chen, Zhi Xu, Feiyang Tan, Hangning Zhou, Mu Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

सेल्फ-ड्राइविंग कारें लंबे समय से एक मॉड्यूलर दृष्टिकोण पर निर्भर रही हैं, जहाँ सॉफ़्टवेयर का एक हिस्सा सड़क को देखता है, दूसरा निर्णय लेता है कि क्या करना है, और तीसरा वाहन को नियंत्रित करता है। यह अलगाव अक्सर गलतियों के संचय का कारण बनता है, जैसे कि 'टेलीफोन गेम' में संदेश हर मोड़ पर विकृत हो जाता है। इसे हल करने के लिए, शोधकर्ता एंड-टू-एंड सिस्टम विकसित कर रहे हैं जो कैमरा छवियों से सीधे स्टीयरिंग कमांड तक गाड़ी चलाना सीखते हैं, बिल्कुल एक मानव चालक की तरह जो किसी स्थिति को देखता है और बिना चरणों में तोड़े प्रतिक्रिया देता है। हालाँकि, ये सिस्टम दुर्लभ या जटिल परिदृश्यों में संघर्ष करते हैं क्योंकि उनमें वास्तव में यह सोचने की क्षमता की कमी होती है कि आगे क्या होगा। वे वर्तमान को स्पष्ट रूप से देखते हैं लेकिन भविष्य की कल्पना करने में उन्हें कठिनाई होती है, जो सुरक्षित नेविगेशन के लिए आवश्यक है।

एक आशाजनक नया दिशा "वर्ल्ड मॉडल्स" (विश्व मॉडल) शामिल करती है, जो ऐसे कंप्यूटर प्रोग्राम हैं जिन्हें यह अनुमान लगाने के लिए प्रशिक्षित किया जाता है कि एक दृश्य समय के साथ कैसे बदलेगा। वीडियो के अगले कुछ सेकंड का पूर्वानुमान लगाकर, ये मॉडल ट्रैफ़िक की गतिशीलता को समझ सकते हैं और अपनी चालों की योजना बनाने के लिए उस दूरदर्शिता का उपयोग कर सकते हैं। फिर भी, अनुसंधान में उपयोग की जाने वाली शक्तिशाली वीडियो भविष्यवाणी तकनीकों और स्वायत्त ड्राइविंग की विशिष्ट आवश्यकताओं के बीच एक महत्वपूर्ण अंतर बना हुआ है। मौजूदा कई विधियाँ वीडियो के लापता हिस्सों को यादृच्छिक रूप से भरने की कोशिश करती हैं, जो अतीत को समझने के लिए तो अच्छा है लेकिन भविष्य की भविष्यवाणी करने के लिए खराब है। अन्य विधियाँ दुनिया के सरलीकृत, संकुचित प्रतिनिधित्व पर निर्भर करती हैं जिनमें जटिल निर्णय लेने के लिए बहुत अधिक विवरण खो जाता है। चुनौती एक ऐसा सिस्टम बनाने की रही है जो सड़क के समृद्ध, विस्तृत वास्तविकता को भी समझ सके और अपने कार्यों के मार्गदर्शन के लिए विश्वसनीय और संभावित भविष्य उत्पन्न कर सके।

अफ़ारी इंटेलिजेंट ड्राइव और कई विश्वविद्यालयों के शोधकर्ताओं ने एक विशिष्ट आर्किटेक्चर जिसे "वीडियो जॉइंट एम्बेडिंग प्रेडिक्टिव आर्किटेक्चर" या V-JEPA कहा जाता है, को फिर से सोचकर इस समस्या का समाधान किया है। यह तकनीक बिना मानवीय लेबल की आवश्यकता के वीडियो से गहरे, अर्थपूर्ण पैटर्न सीखने के लिए डिज़ाइन की गई है, लेकिन अपने मूल रूप में, यह वीडियो के बीच के हिस्सों को पूरा करने के लिए बनाया गया था न कि समय में आगे देखने के लिए। टीम ने महसूस किया कि एक कार के लिए खुद चलाने के लिए, उसे केवल खाली जगहों को भरने के बजाय आगे देखना आवश्यक है। उन्होंने WA-JEPA नामक एक नई प्रणाली विकसित की, जो V-JEPA की शक्तिशाली सीखने की क्षमताओं को विशेष रूप से ड्राइविंग कार्य के लिए अनुकूलित करती है। वीडियो के लापता हिस्सों का यादृच्छिक अनुमान लगाने के बजाय, उनका मॉडल वर्तमान सड़क को देखने और ठीक से यह भविष्यवाणी करने के लिए प्रशिक्षित है कि भविष्य में दृश्य कैसा दिखेगा, और साथ ही यह भी तय करता है कि कार को क्या करना चाहिए।

उनके नवाचार का मूल यह है कि वे मॉडल को समय के बारे में सोचना कैसे सिखाते हैं। प्रशिक्षण के पहले चरण में, सिस्टम को कार के कई कैमरों से वीडियो फ्रेम का एक क्रम दिखाया जाता है। फिर इसे अंतिम दृश्य क्षण के बाद आने वाले भविष्य के फ्रेमों की कल्पना करने के लिए कहा जाता है। पिछली विधियों के विपरीत, जो वीडियो के बीच में एक गायब फ्रेम का अनुमान लगाने की कोशिश करती हैं, यह मॉडल सख्ती से आगे देखने के लिए मजबूर है, जिससे यह ट्रैफ़िक के कारण-और-प्रभाव संबंधों को सीखता है। इन भविष्यवाणियों को अधिक यथार्थवादी बनाने के लिए, शोधकर्ताओं ने एक मानक गणितीय दृष्टिकोण को बदलकर "फ्लो मैचिंग" नामक तकनीक का उपयोग किया। यह मॉडल को भविष्य की संभावनाओं का एक सुचारू, निरंतर पथ उत्पन्न करने की अनुमति देता है, न कि केवल एक स्थिर परिणाम का अनुमान लगाने की। यह महत्वपूर्ण है क्योंकि भविष्य शायद एक निश्चित बिंदु नहीं है; यह संभावनाओं की एक श्रृंखला है जिसके माध्यम से कार को नेविगेट करना होता है।

दूसरे चरण में, शोधकर्ताओं ने इस भविष्य-देखने की क्षमता को सीधे कार के नियंत्रणों से जोड़ा। उन्होंने एक एकल, एकीकृत प्रणाली बनाई जो सड़क के भविष्य के स्वरूप और कार की भविष्य की क्रियाओं, दोनों की भविष्यवाणी एक साथ करती है। इन दोनों कार्यों को एक साथ प्रशिक्षित करके, मॉडल यह सीखता है कि दुनिया कैसे बदलती है, यह सीधे तौर पर इस बात से जुड़ा है कि कार कैसे चलती है। यदि कार मुड़ती है, तो दृश्य एक विशिष्ट तरीके से बदलता है; यदि कार रुकती है, तो दुनिया अलग तरह से व्यवहार करती है। यह गहरा जुड़ाव यह सुनिश्चित करता है कि मॉडल केवल दुनिया को देखता ही नहीं है, बल्कि यह भी समझता है कि उसकी अपनी क्रियाएं उस दुनिया को कैसे आकार देती हैं। परिणाम एक ऐसा सिस्टम है जो कोई भी कदम उठाने से पहले अपने मन में भविष्य का अनुकरण करके जटिल ट्रैफ़िक स्थितियों के बारे में तर्क कर सकता है।

टीम ने NAVSIM नामक एक मानक बेंचमार्क पर अपने नए सिस्टम का परीक्षण किया, जो स्वायत्त वाहनों द्वारा नेविगेट करने की क्षमता का मूल्यांकन करने के लिए वास्तविक दुनिया के ड्राइविंग डेटा का उपयोग करता है। NAVSIM-v2 टेस्ट पर, WA-JEPA ने 91.7 का स्कोर प्राप्त किया, जो मौजूदा सर्वश्रेष्ठ एंड-टू-एंड ड्राइविंग विधियों और अन्य वर्ल्ड-मॉडल दृष्टिकोणों को पछाड़ देता है। यह सुधार इंगित करता है कि सिस्टम टक्करों से बचने और यातायात नियमों का पालन करने में बेहतर है। शायद इससे भी अधिक प्रभावशाली बात यह है कि शोधकर्ताओं ने मॉडल का परीक्षण एक पूरी तरह से अलग, क्लोज्ड-लूप सिम्युलेटर HUGSIM पर किया, जिसमें उस विशिष्ट वातावरण पर कोई अतिरिक्त प्रशिक्षण नहीं दिया गया था। इस ज़ीरो-शॉट टेस्ट में, जहाँ कार को लगातार गाड़ी चलानी थी और वास्तविक समय में अपनी गलतियों पर प्रतिक्रिया देनी थी, WA-JEB ने 0.4462 का उच्च स्कोर प्राप्त किया, जो अन्य सभी विधियों से काफी आगे है। यह सुझाव देता है कि भविष्य की भविष्यवाणी करने और कार्यों की योजना बनाने की क्षमता एक मजबूत समझ बनाती है जो नई और अनदेखी स्थितियों में अच्छी तरह से स्थानांतरित होती है।

निष्कर्ष बताते हैं कि बेहतर स्वायत्त ड्राइविंग की कुंजी अधिक सेंसर या अधिक जटिल नियम जोड़ने में नहीं है, बल्कि सिस्टम को भविष्य की अधिक सटीक रूप से कल्पना करना सिखाने में है। केवल गायब वीडियो डेटा को पूरा करने के बजाय सक्रिय रूप से यह अनुमान लगाने पर ध्यान केंद्रित करके, और इस भविष्यवाणी को सीधे कार के निर्णयों से जोड़कर, शोधकर्ताओं ने एक ऐसा मॉडल बनाया है जो दूरदर्शिता की अधिक मानवीय समझ के साथ गाड़ी चलाता है। यह दृष्टिकोण दृश्य दुनिया को समझने और कार्रवाई करने के बीच के अंतर को पाटता है, जिससे ऐसे वाहनों का मार्ग प्रशस्त होता है जो वास्तविक दुनिया की सड़कों की अप्रत्याशित प्रकृति को अधिक विश्वास और सुरक्षा के साथ संभाल सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →