← नवीनतम पेपर
🤖 AI

Imitation Learning for Autonomous Driving in CARLA

यह शोध पत्र CARLA में विशेषज्ञ प्रदर्शनों के 236,882 विंडोज़ पर प्रशिक्षित एक कॉम्पैक्ट मल्टीमॉडल बिहेवियरल क्लोनिंग पॉलिसी प्रस्तुत करता है जो प्रशिक्षण और अनदेखे मार्गों दोनों पर बिना किसी टक्कर के घंटों तक सफलतापूर्वक स्वायत्त रूप से ड्राइविंग करती है, जो प्रभावी क्लोज्ड-लूप प्रदर्शन और नए वातावरणों में गुणात्मक स्थानांतरण को प्रदर्शित करती है।

मूल लेखक: Jordy Kieto

प्रकाशित 2026-09-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jordy Kieto

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कार को खुद से गाड़ी चलाना सिखाने का सपना लंबे समय से एक सरल, सहज विचार पर आधारित रहा है: यदि कोई मशीन एक विशेषज्ञ ड्राइवर को देख सकती है और उसके हर कदम की नकल कर सकती है, तो वह अंततः अपने आप गाड़ी चलाना सीख जानी चाहिए। यह दृष्टिकोण, जिसे इमिटेशन लर्निंग (अनुकरण सीखना) कहा जाता है, स्टीयरिंग, ब्रेकिंग और त्वरण की जटिल चुनौती को एक पैटर्न-मैचिंग अभ्यास के रूप में देखता है। एक कंप्यूटर वीडियो और सेंसर डेटा के घंटों के फुटेज को देखता है, और यह सीखने की कोशिश करता है कि जो वह देख रहा है, उसके आधार पर अगला कदम क्या होना चाहिए। कठिनाई 'देखने' और 'करने' के बीच के अंतर में निहित है। जब एक इंसान गाड़ी चलाना सीखता है, तो वह एक लूप में अभ्यास करता है; यदि वह थोड़ा सा मार्ग से भटक जाता है, तो वह उसे सुधारता है और उस सुधार से सीखता है। हालाँकि, केवल आदर्श उदाहरणों पर प्रशिक्षित एक मशीन ने कभी यह नहीं देखा होता कि गलती करने पर क्या होता है। यदि वह थोड़ा भी भटकती है, तो वह ऐसी स्थिति में पहुँच जाती है जिसे विशेषज्ञ ने कभी प्रदर्शित नहीं किया था, और बिना किसी मार्गदर्शक के, वह छोटी सी त्रुटि दुर्घटना में बदल सकती है। शोधकर्ता जिस प्रश्न का सामना कर रहे हैं, वह यह है कि क्या एक सिस्टम आदर्श ड्राइविंग के एक स्थिर पुस्तकालय (स्टैटिक लाइब्रेरी) से इतना सीख सकता है कि वह अकेले ड्राइविंग की अव्यवst और अप्रत्याशित वास्तविकता को संभाल सके।

CARLA नामक एक परिष्कृत ड्राइविंग सिम्युलेटर का उपयोग करते हुए एक हालिया अध्ययन में, जॉर्डी कीटो नामक एक शोधकर्ता ने ठीक इसी प्रश्न की खोज की। लक्ष्य एक नए प्रकार का कंप्यूटर मस्तिष्क बनाना नहीं था, बल्कि यह देखना था कि एक अपेक्षाकृत सरल, संक्षिप्त प्रणाली एक सावधानीपूर्वक क्यूरेट किए गए विशेषज्ञ ड्राइविंग लाइब्रेरी से कितनी वास्तविक ड्राइविंग कौशल प्राप्त कर सकती है। शोधकर्ता ने एक पॉलिसी बनाई—कार के लिए निर्देशों का एक सेट—जो कैमरे से प्राप्त छवियों के प्रवाह, लेजर स्कैनर द्वारा बनाए गए बर्ड्स-आई व्यू मैप और आगामी सड़क निर्देशों की सूची को देख सकती थी। इस प्रणाली को एक बार में पांच सेकंड का इतिहास खिलाकर, टीम ने इसे विशेषज्ञ ड्राइवर के थ्रॉटल, ब्रेक और स्टीयरिंग व्हील की गतिविधियों की भविष्यवाणी करने के लिए प्रशिक्षित किया। प्रशिक्षण डेटा एक अद्वितीय स्रोत से आया था: एक व्यवस्थित प्रक्रिया जिसने हजारों छोटी ड्राइविंग क्लिप्स उत्पन्न कीं, जिससे यह सुनिश्चित हुआ कि कार ने सीधी सड़कों, बाएं मोड़ों और दाएं मोड़ों का एक संतुलित मिश्रण देखा, न कि केवल आसान, सीधे रास्तों को जो अक्सर ड्राइविंग लॉग में हावी रहते हैं।

इस प्रयोग के परिणाम आश्चर्यजनक रूप से मजबूत थे। लगभग साढ़े तीन घंटे की इन सत्यापित ड्राइविंग क्लिप्स पर प्रशिक्षित होने के बाद, पॉलिसी को सिम्युलेटर में अपने आप चलाने के लिए रखा गया, जिसमें कोई मानव नहीं था और न ही हस्तक्षेप करने के लिए कोई सुरक्षा जाल था। इस क्लोज्ड-लूप टेस्ट में, जहाँ कार द्वारा लिया गया हर मोड़ यह निर्धारित करता था कि वह आगे क्या देखेगी, सिस्टम ने उन्हीं सड़कों पर घंटों तक गाड़ी चलाई जिन पर उसे प्रशिक्षित किया गया था, और उन पूरी तरह से अलग सड़कों पर भी चला जो उसने पहले कभी नहीं देखी थीं। इसने घुमावों को संभाला, चौराहों का प्रबंधन किया और बिना किसी टक्कर के अपने लेन के भीतर रहा। शायद सबसे उल्लेखनीय बात यह है कि सिस्टम ने बड़ी गलतियों से उबरने की क्षमता दिखाई। जब कार को सड़क से बहुत दूर या गलत दिशा में रखा गया—ऐसी स्थितियाँ जिन्हें उसे ठीक करने के लिए स्पष्ट रूप से नहीं सिखाया गया था—तो वह अक्सर खुद को वापस चलाने योग्य सतह पर लाने और अपनी यात्रा फिर से शुरू करने में सफल रही। यह रिकवरी इसलिए हुई क्योंकि सिस्टम ने कभी भी अपने प्रशिक्षण डेटा में "रिकवरी" का प्रदर्शन नहीं देखा था; इसने बस प्रशिक्षण के दौरान सीखी गई छोटी सुधारों से सामान्यीकरण (जनरलाइजेशन) किया था।

हालाँकि, अध्ययन देखे गए तथ्यों और सिद्ध किए गए तथ्यों के बीच अंतर करने में सावधान है। यहाँ वर्णित ड्राइविंग उपलब्धियाँ पूरी तरह से एक कंप्यूटर सिमुलेशन के भीतर हुई थीं, जो पैदल यात्रियों, ट्रैफिक लाइटों या अप्रत्याशित मौसम से मुक्त एक नियंत्रित वातावरण है। सिस्टम की सफलता काफी हद तक एक "विशेषाधिकार प्राप्त" जानकारी पर निर्भर थी: सिम्युलेटर के आंतरिक मानचित्र द्वारा प्रदान किया गया लेन मार्कर्स का एक सटीक, पूर्व-गणना किया गया पथ, जिसे कार देख सकती थी लेकिन एक वास्तविक ड्राइवर के पास उसी तरह से पहुंच नहीं होगी। शोधकर्ताओं ने स्पष्ट रूप से उल्लेख किया कि हालांकि कार ने अच्छा प्रदर्शन किया, लेकिन उन्होंने यह दावा नहीं किया कि उन्होंने वास्तविक दुनिया में ड्राइविंग की समस्या को हल कर लिया है। उन्होंने यह भी बताया कि टर्न (मोड़) संभालने की क्षमता अभी भी सबसे चुनौतीपूर्ण हिस्सा थी, जिसमें मुड़ने की त्रुटियां सीधे चलने की त्रुटियों की तुलना में अधिक बार हुईं। यह अध्ययन एक शक्तिशाली प्रदर्शन के रूप में कार्य करता है कि एक सरल प्रणाली, जिसे उच्च-गुणवत्ता वाले, विविध डेटा से खिलाया गया है, सिमुलेशन में लंबे समय तक स्वायत्त रूप से गाड़ी चलाने में सक्षम हो सकती है, लेकिन यह खुले मार्ग के लिए एक तैयार उत्पाद घोषित करने से पीछे हटता है।

इस कार्य का महत्व विशिष्ट कंप्यूटर आर्किटेक्चर में कम और तैयारी की पद्धति में अधिक है। शोधकर्ता ने डेटा को प्राथमिक चर (वेरिएबल) के रूप में माना, जो मैनुअल ड्राइविंग के एक छोटे, अव्यवस्थित सेट से एक कठोर, स्वचालित प्रक्रिया की ओर बढ़ा जिसने प्रत्येक प्रशिक्षण क्लिप को उत्पन्न और सत्यापित किया। यह सुनिश्चित करके कि प्रशिक्षण डेटा ने विशिष्ट युद्धाभ्यास को कवर किया और इसमें शुरुआती स्थितियों में मामूली, यादृच्छिक बदलाव शामिल थे, सिस्टम ने एक मानक डेटासेट की तुलना में स्थितियों की एक विस्तृत श्रृंखला को संभालने के लिए सीखा। अध्ययन निष्कर्ष निकालता है कि जबकि ऑफलाइन प्रशिक्षण—एक स्थिर लाइब्रेरी से सीखना—एक ऐसा ड्राइवर तैयार कर सकता है जो एक लूप में अच्छा काम करता है, वास्तविक सक्षमता की परीक्षा अप्रत्याशित स्थितियों को संभालने की क्षमता बनी रहती है। शोधकर्ताओं ने अपना सारा कोड, डेटा और प्रशिक्षित मॉडल जारी कर दिया है, ताकि अन्य लोग इन निष्कर्षों का परीक्षण कर सकें, रिकवरी दरों को अधिक सटीकता से माप सकें, और यह पता लगा सकें कि इस सफलता का कितना हिस्सा विशेषाधिकार प्राप्त मानचित्र जानकारी बनाम सड़क की दृश्य समझ पर निर्भर करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →