← नवीनतम पेपर
💻 computer science

Planning-Oriented End-to-End Autonomous Driving: Architectures, Evaluation, and Emerging Paradigms

यह सर्वेक्षण सरल प्रतिगमन (regression) से लेकर नियोजन-उन्मुख (planning-oriented) प्रणालियों तक एंड-टू-एंड स्वायत्त ड्राइविंग के विकास की समीक्षा करता है, जो चार प्रमुख अक्षों के माध्यम से आर्किटेक्चर और मूल्यांकन प्रोटोकॉल को संश्लेषित करता है और यह तर्क देता है कि महत्वपूर्ण अंतर केवल मध्यवर्ती विशेषताओं का उपयोग करने के बजाय ऐसी प्रतिनिधि (representations) सीखने में निहित है जो सुरक्षित, व्यवहार्य और मानव-अनुरूप नियोजन सुनिश्चित करती हैं।

मूल लेखक: Yanchen Guan, Xingcheng Liu, Bin Rao, Chengyue Wang, Guofa Li, Yunjian Li, Lishengsa Yue, Zhiyong Cui, Chengzhong Xu, Zhenning Li

प्रकाशित 2026-08-21
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yanchen Guan, Xingcheng Liu, Bin Rao, Chengyue Wang, Guofa Li, Yunjian Li, Lishengsa Yue, Zhiyong Cui, Chengzhong Xu, Zhenning Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

दशकों तक, सेल्फ-ड्राइविंग कार का सपना एक सरल विचार पर आधारित था: समस्या को छोटे, प्रबंधनीय टुकड़ों में तोड़ना। पहले, एक कंप्यूटर सड़क को देखता और कारों तथा पैदल यात्रियों जैसी वस्तुओं की पहचान करता। इसके बाद, वह अनुमान लगाता कि वे वस्तुएं कहाँ जा रही हैं। अंत में, एक अलग कंप्यूटर यह तय करता कि उनसे बचने के लिए स्टीयरिंग और त्वरण (एक्सेलेरेशन) कैसे किया जाए। यह मॉड्यूलर दृष्टिकोण हमें शुरुआत करने के लिए पर्याप्त रूप से काम कर गया, लेकिन इसने चरणों के बीच नाजुक 'हैंड-ऑफ' (एक चरण से दूसरे में कार्य सौंपना) की समस्या पैदा कर दी। यदि पहले चरण ने एक छोटी सी गलती की, तो अगला चरण उसे ठीक करने का तरीका नहीं जान पाता, जिससे भ्रम या खतरा पैदा हो सकता था। इसे हल करने के लिए, शोधकर्ताओं ने ऐसे सिस्टम बनाने शुरू किए जो एक निरंतर प्रवाह में गाड़ी चलाना सीख सकें, जो कैमरा छवियों को सीधे स्टीयरिंग कमांड में बदल सकें। ये शुरुआती संस्करण प्रभावशाली थे, लेकिन वे अक्सर तब संघर्ष करते थे जब कार को ऐसी स्थिति का सामना करना पड़ता था जिसे उसने पहले नहीं देखा था, या जब ड्राइवर को भारी ट्रैफिक में मर्ज होने जैसे जटिल निर्णय लेने की आवश्यकता होती थी। प्रश्न केवल मानव स्टीयरिंग की नकल करने से बदलकर इस बात पर केंद्रित हो गया कि एक मशीन अराजक दुनिया के माध्यम से एक सुरक्षित और सुगम पथ की योजना कैसे बना सकती है।

शोधकर्ताओं की एक टीम द्वारा किया गया एक नया सर्वेक्षण इस क्षेत्र के विकास और इसकी भविष्य की दिशा का एक स्पष्ट मानचित्र प्रस्तुत करता है। उनका तर्क है कि सेल्फ-ड्राइविंग तकनीक में सबसे महत्वपूर्ण प्रगति अब सिस्टम से संरचना को हटाने के बारे में नहीं है, बल्कि यह है कि उस संरचना को कैसे सीखा और परखा जाता है। शोधकर्ताओं ने सैकड़ों अध्ययनों की समीक्षा की ताकि यह दिखाया जा सके कि आधुनिकतम सिस्टम केवल मानवीय गतिविधियों की नकल नहीं करते; वे दुनिया के आंतरिक प्रतिनिधित्व (इंटरनल रिप्रेजेंटेशन) बनाने के लिए सीखते हैं जो उन्हें भविष्य की योजना बनाने में मदद करते हैं। केवल कार के सामने जो तुरंत दिख रहा है उस पर प्रतिक्रिया देने के बजाय, ये सिस्टम विभिन्न संभावित भविष्यों की कल्पना करना, जोखिमों को तौलना और एक ऐसा मार्ग चुनना सीखते हैं जो सभी को सुरक्षित रखते हुए मार्ग का पालन करता है। टीम ने पाया कि इन कारों को परखने का पुराना तरीका—केवल यह देखना कि कंप्यूटर का पथ एक वीडियो पर रिकॉर्ड किए गए मानव पथ से मेल खाता है या नहीं—अब पर्याप्त नहीं है। एक कार शांत दिन पर किसी इंसान के मार्ग की पूरी तरह से नकल कर सकती है, लेकिन जब कोई बच्चा सड़क पर दौड़कर आता है, तो वह पूरी तरह विफल हो सकती है। शोधकर्ता इस बात पर जोर देते हैं कि वास्तविक सफलता के लिए कार का परीक्षण इस तरह से करना आवश्यक है जो उसे अपनी गलतियों और दूसरों के कार्यों के प्रति प्रतिक्रिया करने के लिए मजबूर करे, ठीक वैसे ही जैसे एक वास्तविक चालक करता है।

यह सर्वेक्षण साधारण नकल से लेकर परिष्कृत योजना (सोफिस्टिकेटेड प्लानिंग) तक की यात्रा को दर्शाता है। शुरुआती सिस्टम उन छात्रों की तरह थे जिन्होंने एक विशिष्ट मार्ग को रट लिया था; यदि सड़क थोड़ी भी बदल जाती, तो वे भटक जाते थे। नए तरीकों ने सड़क की ज्यामिति और अन्य ड्राइवरों के इरादों को समझना सीख लिया है। वे स्ट्रक्चर्ड डेटा का उपयोग करते हैं, जैसे कि वेक्टराइज्ड मैप्स जो लेन और यातायात नियमों को स्पष्ट रेखाओं और आकारों के रूप में दर्शाते हैं, न कि केवल धुंधली तस्वीरों के रूप में। यह कार को स्थान और सुरक्षा के बारे में अधिक प्रभावी ढंग से तर्क करने की अनुमति देता है। शोधकर्ता बताते हैं कि सबसे उन्नत सिस्टम अब विशेषज्ञों की एक टीम की तरह मिलकर काम करते हैं। सिस्टम का एक हिस्सा इस बात पर ध्यान केंद्रित कर सकता है कि पैदल यात्री कहाँ कदम रखेगा, जबकि दूसरा हिस्सा कार के प्रक्षेपवक्र (ट्रैजेक्टरी) की योजना बना सकता है, और तीसरा हिस्सा यह जांच सकता है कि क्या योजना यातायात नियमों का पालन करती है। महत्वपूर्ण बात यह है कि ये हिस्से अलग-अलग मॉड्यूल नहीं हैं, बल्कि अंतिम लक्ष्य: एक सुरक्षित यात्रा के लिए मिलकर प्रशिक्षित किए गए हैं। अध्ययन दिखाता है कि जब इन सिस्टम्स को बेहतर पर्यवेक्षण (सुपरविजन) के साथ प्रशिक्षित किया जाता है—जैसे कि उन विशेषज्ञों से सीखना जो सड़क के छिपे हुए विवरणों को जानते हैं या सिम्युलेटेड वातावरण में अभ्यास करना जहाँ वे सुरक्षित रूप से गलतियाँ कर सकते हैं—तो वे बहुत अधिक मजबूत हो जाते हैं।

हालाँकि, शोधकर्ता यह भी बताते हैं कि कंप्यूटर सिमुलेशन में इन सिस्टम्स की क्षमता और वास्तविक सड़क पर उनकी क्षमता के बीच एक बड़ा अंतर है। कई अध्ययन 'ओपन-लूप' परीक्षणों के आधार पर सफलता का दावा करते हैं, जहाँ कार वास्तव में दुनिया के साथ संवाद करने के बजाय मानव चालक के रिकॉर्ड किए गए वीडियो का अनुसरण करती है। सर्वेक्षण का तर्क है कि यह सुरक्षा का एक भ्रामक पैमाना है। एक कार जो वीडियो पर एकदम सही दिखती है, वह वास्तव में गाड़ी चलाते समय और अप्रत्याशित ड्राइवरों का सामना करते समय ठप हो सकती है या दुर्घटनाग्रस्त हो सकती है। लेखक सुझाव देते हैं कि क्षेत्र को 'क्लोज्ड-लूप मूल्यांकन' की ओर बढ़ना चाहिए, जहाँ कार एक ऐसे सिमुलेशन में चलती है जो उसके कार्यों के प्रति प्रतिक्रिया करता है, या वास्तविक दुनिया के परीक्षणों में जो कठिन परिदृश्यों को कैप्चर करते हैं। वे उन सिस्टम्स के उदय पर भी ध्यान देते हैं जो कार को दुनिया समझने में मदद करने के लिए भाषा का उपयोग करते हैं। ये सिस्टम एक साइन पढ़ सकते हैं या पुलिस अधिकारी के हाथ के इशारे को समझ सकते हैं, लेकिन शोधकर्ता चेतावनी देते हैं कि शब्दों में निर्णय समझाने की क्षमता यह गारंटी नहीं देती कि निर्णय स्वयं सुरक्षित है। भाषा को वास्तविक ड्राइविंग क्रिया से मजबूती से जुड़ा होना चाहिए, न कि केवल बाद में जोड़ा गया एक फैंसी स्पष्टीकरण।

आगे देखते हुए, शोधकर्ता कई चुनौतियों की पहचान करते हैं जिन्हें व्यापक उपयोग से पहले हल किया जाना चाहिए। एक प्रमुख मुद्दा अनिश्चितता है। एक अच्छा ड्राइवर जानता है कि वह कब अनिश्चित है और धीमा हो जाता है; सर्वेक्षण का सुझाव है कि सेल्फ-ड्राइविंग सिस्टम को यह पहचानने में बेहतर होना चाहिए कि वे कब भ्रमित हैं और मदद के लिए पूछना चाहिए या एक सुरक्षित मोड में स्विच करना चाहिए। एक अन्य चुनौती दुर्लभ घटनाओं का "लॉन्ग टेल" (long tail) है। अधिकांश ड्राइविंग परिचित सड़कों पर होती है, लेकिन दुर्घटनाएं अक्सर असामान्य स्थितियों में होती हैं, जैसे कि गलत दिशा में चलती कार या रास्ता अवरुद्ध करता हुआ तूफान। सर्वेक्षण इन दुर्लभ परिदृश्यों का परीक्षण करने और सिस्टम को बिना घबराए उन्हें संभालने के लिए प्रशिक्षित करने के बेहतर तरीकों का आह्वान करता है। अंत में, शोधकर्ता पारदर्शिता और पुनरुत्पादकता (reproducibility) की आवश्यकता पर जोर देते हैं। बहुत से अध्ययन सत्यापित करना कठिन है क्योंकि कोड या डेटा साझा नहीं किया जाता है, या क्योंकि परीक्षण के तरीके छिपे हुए होते हैं। उनका तर्क है कि इस तकनीक को आगे बढ़ाने के लिए, समुदाय को इन सिस्टम्स का परीक्षण और तुलना करने के मानक तरीकों पर सहमत होना चाहिए, जिससे यह सुनिश्चित हो सके कि सुरक्षा के दावे ठोस और दोहराने योग्य साक्ष्यों पर आधारित हैं।

इस कार्य का अंतिम निष्कर्ष यह है कि सेल्फ-ड्राइविंग कारों का भविष्य इस बात में नहीं है कि सिस्टम को मानव मस्तिष्क जैसा बनाया जाए, बल्कि इसे अधिक विश्वसनीय और जवाबदेह बनाने में है। शोधकर्ता प्रस्तावित करते हैं कि हमें इन सिस्टम्स को उनके न्यूरल नेटवर्क की परतों की संख्या से नहीं, बल्कि इस आधार पर आंकना चाहिए कि वे कठिन परिस्थितियों में कितनी अच्छी तरह से सुरक्षित यात्रा की योजना बना सकते हैं। उनका सुझाव है कि अगली पीढ़ी की तकनीक में विशाल डेटा से सीखने की क्षमता और सख्त सुरक्षा जाँचों का संयोजन होगा जो यह सुनिश्चित करेगा कि कार कभी भी ऐसा जोखिम न ले जिसे वह संभाल न सके। योजना, कठोर परीक्षण और स्पष्ट मानकों पर ध्यान केंद्रित करके, यह क्षेत्र एक ऐसे भविष्य के करीब पहुँच रहा है जहाँ सेल्फ-ड्राइविंग कारें केवल एक नवीनता (novelty) नहीं, बल्कि हमारे दैनिक जीवन का एक विश्वसनीय हिस्सा होंगी। आगे का मार्ग धैर्य और सत्य के प्रति प्रतिबद्धता की मांग करता है, यह सुनिश्चित करते हुए कि उठाया गया हर कदम केवल इस बात से नहीं मापा जाता कि कार कितनी तेज चलती है, बल्कि इस बात से कि वह कितनी सुरक्षित रूप से वहाँ पहुँचती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →