← नवीनतम पेपर
💻 computer science

MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving

MAPLE एक स्केलेबल, सिम्युलेटर-मुक्त फ्रेमवर्क है जो विजन-लैंग्वेज-एक्शन मॉडल्स के लेटेंट स्पेस में सुपरवाइज्ड फाइन-ट्यूनिंग और डाइवर्सिटी रिवार्ड्स के साथ रिइन्फोर्समेंट लर्निंग के माध्यम से रिएक्टिव, मल्टी-एजेंट क्लोज्ड-लूप ट्रेनिंग को सक्षम करके एंड-टू-एंड ऑटोनॉमस ड्राइविंग को बढ़ाता है।

मूल लेखक: Rajeev Yasarla, Deepti Hegde, Hsin-Pai Cheng, Shizhong Han, Yunxiao Shi, Meysam Sadeghigooghari, Hanno Ackermann, Litian Liu, Pranav Desai, Fatih Porikli, Mohammad Ghavamzadeh, Hong Cai

प्रकाशित 2026-05-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rajeev Yasarla, Deepti Hegde, Hsin-Pai Cheng, Shizhong Han, Yunxiao Shi, Meysam Sadeghigooghari, Hanno Ackermann, Litian Liu, Pranav Desai, Fatih Porikli, Mohammad Ghavamzadeh, Hong Cai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। वर्तमान के अधिकांश तरीके एक वीडियो लेसन की तरह हैं जहाँ आप एक आदर्श ड्राइवर का वीडियो दिखाते हैं और कहते हैं, "जो देखो, बिल्कुल वैसा ही करो।" यह एक शांत दिन पर तो अच्छा काम करता है, लेकिन अगर वास्तविक दुनिया में कोई अप्रत्याशित मोड़ आ जाए—जैसे कि अचानक कोई पैदल यात्री सामने आ जाए या कोई दूसरा ड्राइवर आपकी राह काट दे—तो रोबोट घबरा जाता है क्योंकि उसने कभी प्रतिक्रिया देने का अभ्यास नहीं किया है। वह केवल एक स्क्रिप्ट का पालन करना जानता है।

यह शोध पत्र MAPLE पेश करता है, जो सेल्फ-ड्राइविंग कारों को प्रशिक्षित करने का एक नया तरीका है जो एक वीडियो लेसन के बजाय एक वीडियो गेम सिमुलेशन की तरह है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "स्क्रिप्टेड" ड्राइवर

वर्तमान सेल्फ-ड्राइविंग AI मॉडल एक "ओपन-लूप" तरीके से प्रशिक्षित होते हैं। वे घंटों के लॉग किए गए ड्राइविंग डेटा को देखते हैं जहाँ अन्य कारें और पैदल यात्री बस उनके पूर्व-रिकॉर्ड किए गए रास्तों का पालन करते हैं। AI मुख्य कार की नकल करना सीखता है लेकिन बाकी सभी को स्थिर दृश्य (static scenery) की तरह मानता है।

  • उपमा: कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं जहाँ दुश्मन केवल कार्डबोर्ड के कटआउट हैं जो एक निश्चित ट्रैक पर चलते हैं। आप उनसे बचने में महारत हासिल कर लेते हैं। लेकिन वास्तविक दुनिया में, दुश्मन जीवित होते हैं; वे आप पर प्रतिक्रिया देते हैं। यदि आप अपने "कार्डबोर्ड दुश्मन" वाले कौशल का उपयोग करके वास्तविक गेम खेलने की कोशिश करेंगे, तो आप दुर्घटनाग्रस्त हो जाएंगे।

2. समाधान: "लेटेंट स्पेस" प्ले (Latent Space Play)

MAPLE इस समस्या को हल करता है ताकि AI एक ऐसा खेल खेल सके जहाँ हर कोई जीवित है और एक-दूसरे के प्रति प्रतिक्रिया दे रहा है। हालाँकि, हर सेकंड के प्रशिक्षण के लिए पूरी दुनिया का एक हाई-डेफिनिशन 3D सिमुलेशन चलाना अविश्वसनीय रूप से धीमा और महंगा है (जैसे कि एक फिल्म को रीयल-टाइम में रेंडर करना)।

इसके बजाय, MAPLE प्रशिक्षण को "लेटेंट स्पेस" (Latent Space) में करता है।

  • उपमा: "लेटेंट स्पेस" को AI के "सपनों की दुनिया" या "आंतरिक विचार प्रक्रिया" के रूप में सोचें। एक कार के बाएं मुड़ने की फोटो-रियलिस्टिक इमेज रेंडर करने के बजाय, AI एक संक्षिप्त, अमूर्त "टोकन" (डिजिटल सारांश) के साथ काम करता है जो कहता है, "कार X गति पर बाएं मुड़ रही है।"
  • MAPLE सेल्फ-ड्राइविंग कार (ईगो) और अन्य ट्रैफिक एजेंटों (पैदल यात्री, अन्य कारें) को इस "सपनों की दुनिया" में भविष्य के परिदृश्यों को स्टेप-दर-स्टेप खेलने देता है। वे बिना एक भी पिक्सेल वीडियो बनाए एक-दूसरे की चालों पर प्रतिक्रिया देते हैं। यह प्रशिक्षण को अविश्वसनीय रूप से तेज़ और स्केलेबल बनाता है।

3. प्रशिक्षण प्रक्रिया: दो चरण

यह पेपर इस "ड्रीम प्लेयर" को एक वास्तविक दुनिया के ड्राइवर में बदलने के लिए दो-चरणीय प्रशिक्षण प्रक्रिया का वर्णन करता है:

चरण 1: "शैडो प्रैक्टिस" (सुपरवाइज्ड फाइन-ट्यूनिंग)
सबसे पहले, AI इस सपनों की दुनिया में वास्तविक मानव ड्राइवरों के मूव्स को कॉपी करने का अभ्यास करता है। यह सड़क के बुनियादी नियम सीखता है और यह अनुमान लगाना सीखता है कि अन्य कारें कहाँ जा सकती हैं।

  • उपमा: यह एक ड्राइविंग छात्र की तरह है जो एक प्रो ड्राइवर को देख रहा है और सिम्युलेटर में उनके स्टीयरिंग व्हील मूवमेंट की नकल करने की कोशिश कर रहा है, लेकिन सिम्युलेटर में अन्य कारें भी वास्तविक रूप से हिलने के लिए सीख रही हैं।

चरण 2: "टूर्नामेंट" (रीइन्फोर्समेंट लर्निंग)
एक बार जब AI बुनियादी बातें जान लेता है, तो यह "टूर्नामेंट" चरण में प्रवेश करता है। यहाँ, AI को न केवल इंसानों की नकल करने के लिए, बल्कि निम्नलिखित के लिए पुरस्कृत किया जाता है:

  • सुरक्षा (Safety): दुर्घटना न होना।
  • प्रगति (Progress): गंतव्य तक पहुँचना।
  • विविधता (Diversity): यह एक प्रमुख नवाचार है। AI को अलग-अलग ड्राइविंग शैलियों को आज़माने के लिए प्रोत्साहित किया जाता है। कभी इसे सतर्क (जैसे दादी माँ की ड्राइविंग) होना चाहिए, और कभी आक्रामक (जैसे रेस कार ड्राइवर) होना चाहिए।
  • उपमा: कल्पना कीजिए कि एक चेस (शतरंज) AI। यदि वह केवल उन चालों को खेलता है जो उसने एक किताब में देखी हैं, तो वह एक नए प्रतिद्वंद्वी से हार जाएगा। लेकिन यदि वह अपने आप के खिलाफ हजारों गेम खेलता है, जिसमें अलग-अलग रणनीतियाँ (कुछ जोखिम भरी, कुछ सुरक्षित) शामिल हैं, तो वह किसी भी प्रतिद्वंद्वी को संभालने के लिए सीखता है। MAPLE ड्राइविंग के लिए ऐसा ही करता है, AI को जटिल ट्रैफिक स्थितियों को संभालने के नए और सुरक्षित तरीके खोजने के लिए प्रोत्साहित करता है जो उसने मूल डेटा में कभी नहीं देखे होंगे।

4. परिणाम: एक स्मार्ट ड्राइवर

लेखकों ने MAPLE का परीक्षण Bench2Drive नामक एक बेंचमार्क पर किया, जो यह परीक्षण करने का एक कठिन तरीका है कि एक कार जटिल, इंटरैक्टिव सिटी ड्राइविंग को कितनी अच्छी तरह संभालती है।

  • परिणाम: MAPLE ने सभी अन्य तरीकों की तुलना में सर्वश्रेष्ठ परिणाम (State-of-the-Art) प्राप्त किए। इसने पहले के मॉडलों की तुलना में अधिक सुरक्षित रूप से चलाया, बिना दुर्घटनाग्रस्त हुए अधिक रूट पूरे किए, और ट्रिकी स्थितियों (जैसे मर्ज करना या रास्ता देना) को बहुत बेहतर ढंग से संभाला।
  • क्यों? क्योंकि इसने केवल एक स्क्रिप्ट को याद नहीं किया; इसने सीखा कि कैसे अन्य रिएक्टिव एजेंटों के साथ एक रिएक्टिव, क्लोज्ड-लूप वातावरण में "खेलना" है।

सारांश

MAPLE एक प्रशिक्षण ढांचा (framework) है जो सेल्फ-ड्राइविंग कारों को ड्राइविंग परिदृश्यों के बारे में "सपना" दिखाकर प्रशिक्षित करता है जहाँ वे अन्य वास्तविक, रिएक्टिव एजेंटों के साथ बातचीत करते हैं। इस तेज़, अमूर्त "ड्रीम स्पेस" में अभ्यास करके और AI को उसकी ड्राइविंग शैली के लिए सुरक्षित, प्रभावी और विविध होने के लिए पुरस्कृत करके, यह एक ऐसा रोबोट ड्राइवर बनाता है जिसके वास्तविक दुनिया की अप्रत्याशित अराजकता के सामने दुर्घटनाग्रस्त होने की संभावना बहुत कम होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →