← नवीनतम पेपर
💻 computer science

End2Race: An End-to-End Learning Framework for Multi-Vehicle Autonomous Racing

यह शोध पत्र End2Race को प्रस्तुत करता है, जो मल्टी-व्हीकल ऑटोनॉमस रेसिंग के लिए एक एंड-टू-एंड लर्निंग फ्रेमवर्क है, जो सब-मिलीसेकंड इन्फरेंस लेटेंसी प्राप्त करता है और हेड-टू-हेड प्रतियोगिताओं में मजबूत सामान्यीकरण, उच्च गति और अनुकूलन योग्य ओवरटेकिंग प्रदर्शित करके मौजूदा नियम-आधारित और सिंगल-व्हीकल लर्निंग विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Zhijie Qiao, Haowei Li, Zhong Cao, Henry X. Liu

प्रकाशित 2026-09-17
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhijie Qiao, Haowei Li, Zhong Cao, Henry X. Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

स्वयं-चालित कारों (self-driving cars) की दुनिया को अक्सर एक सीधी राजमार्ग पर एक शांत यात्रा के रूप में कल्पित किया जाता है, जहाँ वाहन को केवल एक स्टॉप साइन या पैदल यात्री को पहचानने की आवश्यकता होती है। लेकिन एक स्वायत्त प्रणाली (autonomous system) की बुद्धिमत्ता का असली परीक्षण एक रेस ट्रैक की उथल-पुथल में होता है। यहाँ, वाहन उच्च गति पर चलते हैं, और एक गतिशील वातावरण में एक-दूसरे के प्रति लगातार प्रतिक्रिया करते हैं जहाँ एक सेकंड के सौवें हिस्से की देरी भी एक सफल ओवरटेक और दुर्घटना के बीच का अंतर हो सकती है। महंगी वास्तविक कारों को नष्ट करने के जोखिम के बिना इस उच्च-दांव वाले वातावरण का अध्ययन करने के लिए, शोधकर्ता 'F1Tenth' नामक एक छोटे पैमाने के प्लेटफॉर्म का उपयोग करते हैं। ये वास्तविक कार के आकार का दसवां हिस्सा होते हैं, जो सेंसर से लैस होते हैं जो रडार की तरह अपने परिवेश को स्कैन करते हैं, जिससे वे 18 मीटर प्रति सेकंड की गति के करीब की गति पर ट्रैक पर नेविगेट कर पाते हैं। चुनौती केवल तेज़ गाड़ी चलाने की नहीं है, बल्कि यह निर्णय लेने की भी है कि कब गति बढ़ानी है, कब धीमी करनी है, और किसी प्रतिद्वंद्वी वाहन को बिना छुए कैसे आगे निकलना है।

वर्षों से, इन रेसिंग प्रतियोगिताओं में सबसे सफल रणनीतियाँ कठोर, पूर्व-निर्धारित नियमों पर निर्भर रही हैं। इंजीनियर दौड़ शुरू होने से पहले ट्रैक का एक डिजिटल मानचित्र बनाते हैं, और कार के चलने के लिए एक आदर्श रेखा (perfect line) की गणना करते हैं। हालाँकि यह एक ज्ञात ट्रैक पर अच्छी तरह काम करता है, लेकिन जैसे ही कार एक नए लेआउट या ऐसे प्रतिद्वंद्वी का सामना करती है जो अपेक्षित पथ का पालन नहीं करता है, यह विफल हो जाता है। अन्य विधियाँ उस चीज़ पर तुरंत प्रतिक्रिया करने की कोशिश करती हैं जो कार अभी देख रही है, लेकिन उनमें एक सुचारू युक्ति (maneuver) की योजना बनाने के लिए दूरदर्शिता की कमी होती है, जिससे ड्राइविंग झटकेदार और अस्थिर हो जाती है। एक तीसरा दृष्टिकोण मशीन लर्निंग का उपयोग करता है, जहाँ एक कंप्यूटर विशेषज्ञों को देखकर या परीक्षण और त्रुटि (trial and error) के माध्यम से सीखता है। हालाँकि, इनमें से अधिकांश लर्निंग सिस्टम का परीक्षण केवल अकेले गाड़ी चलाने वाली एकल कारों पर किया गया है, या वे वास्तविक समय में प्रतिक्रिया देने के लिए बहुत धीमे रहे हैं, जिससे उन्हें प्रतिस्पर्धी होने के लिए बहुत कम गति पर गाड़ी चलाने के लिए मजबूर होना पड़ा। अंतराल बना हुआ था: किसी ने भी सफलतापूर्वक एक कंप्यूटर को उच्च गति पर दूसरे कार के विरुद्ध आमने-सामने रेस करने और तुरंत प्रतिक्रिया करने के लिए नहीं सिखाया था।

इस अंतर को पाटने के लिए, शोधकर्ताओं ने 'End2Race' नामक एक नई प्रणाली पेश की। यह फ्रेमवर्क एक स्वायत्त कार को वास्तविक समय में दूसरे वाहन को ओवरटेक करना सिखाने के लिए डिज़ाइन किया गया है, जो एक ऐसी सीखने की प्रक्रिया का उपयोग करता है जो इस तरह की नकल करती है जैसे एक मानव चालक सीख सकता है: पहले एक विशेषज्ञ को देखकर और फिर अपने आप अभ्यास करके। शोधकर्ताओं ने एक आभासी प्रशिक्षण मैदान तैयार किया जहाँ एक कार, जिसे 'ईगो वाहन' (ego vehicle) कहा जाता है, को एक प्रतिद्वंद्वी के साथ जोड़ा गया है। उन्होंने 720 विशिष्ट परिदृश्य बनाए जहाँ प्रतिद्वंद्वी विभिन्न पथों और विभिन्न गतियों पर चलता है, जिससे सीखने वाली कार को एक अंतराल खोजने, उसमें जाने और सुरक्षित रूप से आगे निकलने का तरीका पता लगाने के लिए मजबूर किया जा सके। यह प्रणाली ट्रैक के पूर्व-निर्मित मानचित्र पर निर्भर नहीं करती है; इसके बजाय, यह पूरी तरह से अपने सेंसरों के कच्चे डेटा और अपने स्वयं के इंजन की गति के आधार पर गाड़ी चलाना सीखती है।

इस प्रणाली का मूल एक न्यूरल नेटवर्क है, जो एक प्रकार का कंप्यूटर प्रोग्राम है जिसे पैटर्न पहचानने के लिए डिज़ाइन किया गया है, और इसे अविश्वसनीय रूप से तेज़ बनाया गया था। स्वायत्त रेसिंग की दुनिया में, समय को मिलीसेकंड में मापा जाता है, और एक सेकंड के एक अंश की देरी भी कार को मोड़ चूकने या टकराने का कारण बन सकती है। शोधकर्ताओं ने अपने नेटवर्क को एक मिलीसेकंड से भी कम समय में निर्णय लेने के लिए इंजीनियर किया, जो दौड़ के तीव्र परिवर्तनों के साथ तालमेल बिठाने के लिए पर्याप्त तेज़ गति है। इस नेटवर्क को प्रशिक्षित करने के लिए, उन्होंने पहले 'बिहेवियरल क्लोनिंग' (behavioral cloning) नामक एक विधि का उपयोग किया, जहाँ कंप्यूटर ने स्टीयरिंग और गति सीखने के लिए 720 आठ-सेकंड के विशेषज्ञ प्रदर्शनों का विश्लेषण किया। हालाँकि, केवल विशेषज्ञ की नकल करना पर्याप्त नहीं था, क्योंकि विशेषज्ञ कभी-कभी गलतियाँ करता था या चलते हुए प्रतिद्वंद्वी की अप्रत्याशित प्रकृति के अनुकूल होने में विफल रहता था। इसे ठीक करने के लिए, टीम ने फिर कंप्यूटर को इन परिदृश्यों में खुद के खिलाफ 500 बार दौड़ने दिया, जिसमें 'रीइन्फोर्समेंट लर्निंग' (reinforcement learning) नामक तकनीक का उपयोग किया गया। इस चरण में, कार को तेज़ी से आगे बढ़ने के लिए पुरस्कृत किया गया और टकराने (crash) के लिए दंडित किया गया, जिससे उसे अपनी रणनीतियों को परिष्कृत करने और उन स्थितियों को संभालने का तरीका सीखने में मदद मिली जो विशेषज्ञ ने कभी नहीं देखी थीं।

इस प्रशिक्षण के परिणाम चौंकाने वाले थे। जब इसे एक ऐसे ट्रैक पर टेस्ट किया गया जिसे इसने पहले कभी नहीं देखा था, तो सीखी हुई कार 8.5 मीटर प्रति सेकंड से अधिक की औसत गति से चल सकती थी, जो पिछले लर्निंग-आधारित तरीकों की तुलना में काफी तेज़ है जो अक्सर 3 मीटर प्रति सेकंड से कम की गति तक सीमित थे। इससे भी महत्वपूर्ण बात यह है कि जब इसे एक प्रतिद्वंद्वी के खिलाफ आमने-सामने की रेस में रखा गया, तो नया सिस्टम लगभग 97 प्रतिशत प्रयासों में प्रतिद्वंद्वी को ओवरटेक करने में सफल रहा, जबकि इसकी सुरक्षा रिकॉर्ड लगभग 98 प्रतिशत बनी रही। यह प्रदर्शन पुराने नियम-आधारित सिस्टम और अन्य लर्निंग विधियों की तुलना में बहुत बेहतर था, जो या तो बार-बार टकराते थे या प्रतिद्वंद्वी को पार करने में विफल रहते थे। सिस्टम विभिन्न प्रतिद्वंद्वियों के अनुकूल होने में सक्षम सिद्ध हुआ, यहाँ तक कि तब भी जब वे प्रतिद्वंद्वी ऐसे तरीकों से चलते थे जो कंप्यूटर ने पहले कभी नहीं देखे थे, जैसे कि बाधाओं से बचने के लिए एक अलग एल्गोरिदम का उपयोग करना।

शोधकर्ताओं ने यह भी जांचा कि कार वास्तव में निर्णय कैसे लेती है। एक परिदृश्य में, कार आगे एक धीमी प्रतिद्वंद्वी को देखती है, अंतराल के साथ संरेखित होने के लिए सुचारू रूप से एक तरफ हटती है, और फिर पास करने के लिए त्वरित (accelerate) होती है। दूसरे में, वह एक तीखे मोड़ से पहले नियंत्रण बनाए रखने के लिए थोड़ा ब्रेक लगाती है, और फिर जैसे ही वह वक्र (curve) से बाहर निकलती है, तेज़ी से आगे बढ़ती है, जो कि पेशेवर मानव रेसर द्वारा उपयोग की जाने वाली तकनीकों की नकल करता है। सिस्टम पूर्ण नहीं था; उन दुर्लभ मामलों में जहाँ दोनों कारें अगल-बगल होने के दौरान ट्रैक अचानक संकरा हो जाता था, कार टकरा जाती थी क्योंकि वह ट्रैक के भविष्य के आकार का पूर्वानुमान नहीं लगा सकती थी। हालाँकि, ये विफलताएँ अन्य विधियों की तुलना में बहुत कम बार हुईं, और समग्र प्रदर्शन ने प्रदर्शित किया कि कार ने एक मजबूत, अनुकूलन योग्य ड्राइविंग शैली सीख ली है।

यह कार्य यह सुझाव देता है कि स्वायत्त रेसिंग का भविष्य, और संभावित रूप से उच्च-गति स्वायत्त ड्राइविंग के मामले में, उन प्रणालियों में निहित है जो स्थिर नियमों के बजाय अनुभव से सीख सकती हैं। एक तेज़, कुशल न्यूरल नेटवर्क और दो-चरणीय प्रशिक्षण प्रक्रिया को जोड़कर, शोधकर्ताओं ने दिखाया कि एक मशीन एक ऐसे स्तर की गति और सुरक्षा के साथ जटिल, गतिशील इंटरैक्शन को नेविगेट करना सीख सकती है जो पहले अप्राप्य था। सिस्टम को यह जानने के लिए मानचित्र की आवश्यकता नहीं है कि कहाँ जाना है; इसे बस दुनिया को देखने, यातायात के प्रवाह को समझने और पलक झपकते ही प्रतिक्रिया करने की आवश्यकता है। जैसे-जैसे शोधकर्ता इस प्रणाली को अन्य टीमों के खिलाफ वास्तविक दुनिया की प्रतियोगिताओं में परीक्षण करने की तैयारी कर रहे हैं, इसके निहितार्थ रेस ट्रैक से परे भी हैं, जो इस बात की एक झलक देते हैं कि कैसे स्वायत्त वाहन एक दिन साझा सड़कों की अप्रत्याशित उथल-पुथल को आत्मविश्वास और कौशल के साथ संभाल सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →