Designing Versatile Samples for Learned Trajectory Scoring
यह शोध पत्र लॉग किए गए मानव प्रक्षेपवक्रों (trajectories) के पार्श्व (lateral) और अनुदैर्ध्य (longitudinal) विक्षोभों (perturbations) के माध्यम से सूचनात्मक प्रशिक्षण नमूने उत्पन्न करके सीखे गए प्रक्षेपवक्र स्कोरिंग को बढ़ाने की एक विधि प्रस्तुत करता है, जो NAVSIM डेटासेट पर DiffusionDrive और MeanFuser जैसे फ्रोजन जनरेटिव प्लानर्स के प्रदर्शन में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
स्वायत्त वाहनों (ऑटोनॉमस व्हीकल्स) को एक मौलिक चुनौती का सामना करना पड़ता है जो केवल सड़क देखने से कहीं अधिक है। जबकि शुरुआती प्रणालियों ने आगे के एक एकल, आदर्श पथ की गणना करने की कोशिश की, वास्तविक दुनिया का ड्राइविंग इतना सीधा नहीं होता है। एक चौराहे के पास पहुँच रही कार को कई संभावनाओं को तौलना पड़ता है: बाएँ मुड़ना, सीधे जाना, या शायद किसी पैदल यात्री के लिए रुकना। यह अनिश्चितता, जिसे मल्टीमोडैलिटी (multimodality) कहा जाता है, का अर्थ है कि एक सुरक्षित ड्राइविंग सिस्टम केवल एक उत्तर आउटपुट नहीं कर सकता; इसे संभावित मार्गों का एक छोटा सेट उत्पन्न करना चाहिए और फिर उनमें से सबसे अच्छा चुनना चाहिए। यह चयन प्रक्रिया महत्वपूर्ण है। यदि सिस्टम एक ऐसा पथ चुनता है जो सुरक्षित दिखता है लेकिन वास्तव में फुटपाथ के बहुत करीब है या आगे चल रही कार के बहुत करीब है, तो इसका परिणाम यातायात उल्लंघन या टक्कर हो सकता है। एक बाल-बाल बचने (near-miss) और एक आपदा के बीच अंतर करने की क्षमता, जो अक्सर मात्र कुछ सेंटीमीटर से अलग होती है, एक सुगम यात्रा और एक खतरनाक विफलता के बीच का अंतर है।
पर्ड्यू यूनिवर्सिटी और बॉश आर्टिफिशियल इंटेलिजेंस सेंटर के शोधकर्ताओं ने कंप्यूटर को इन महत्वपूर्ण विकल्पों को चुनने का तरीका सिखाने का एक नया तरीका विकसित किया है। उनका काम "स्कोरर" (scorer) पर केंद्रित है, जो वह सॉफ्टवेयर हिस्सा है जो संभावित पथों की एक सूची को रैंक करने और विजेता चुनने के लिए जिम्मेदार है। उन्होंने पाया कि इन स्कोरर्स को प्रशिक्षित करने का मानक तरीका उन्हें सबसे कठिन स्थितियों के लिए तैयार नहीं छोड़ रहा था। एक विशेष प्रशिक्षण डेटासेट बनाकर, जो वाहनों को जानबूझकर सुरक्षा की सीमा तक धकेलता है, वे इन प्रणालियों के प्रदर्शन को जटिल ड्राइविंग परिदृश्यों में काफी बेहतर बनाने में सक्षम रहे।
समस्या का मूल कारण यह है कि इन प्रणालियों को वर्तमान में कैसे सिखाया जाता है। अधिकांश स्वायत्त ड्राइविंग नीतियां दो चरणों में काम करती हैं। पहले, एक "प्लानर" (planner) सड़क को देखता है और संभावित प्रक्षेप पथों (trajectories) का एक समूह बनाता है, जो आमतौर पर लगभग बीस होते हैं। ये वे विकल्प हैं जो कार ले सकती है। दूसरा, एक "स्कोरर" इस सूची की समीक्षा करता है और निष्पादित करने के लिए एकल सबसे अच्छा पथ चुनता है। शोधकर्ताओं ने पाया कि प्लानर स्पष्ट दुर्घटनाओं से बचने में काफी अच्छे हैं, इसलिए उनके विकल्पों की सूची आमतौर पर सुरक्षित, आरामदायक ड्राइविंग के इर्द-गिर्द केंद्रित होती है। वे शायद ही कभी ऐसे पथ शामिल करते हैं जो सड़क के किनारे के बहुत करीब हों या किसी अन्य कार के ठीक पीछे हों। यह स्कोरर के लिए एक ब्लाइंड स्पॉट (blind spot) बना देता है। क्योंकि प्रशिक्षण डेटा में इन जोखिम भरे, सीमा-धकेलने वाले परिदृश्यों के उदाहरणों की कमी है, इसलिए स्कोरर कभी यह नहीं सीख पाता कि एक पथ जो केवल उल्लंघन के करीब है और जो वास्तव में नियम का उल्लंघन करता है, उनके बीच अंतर कैसे किया जाए। यह एक छात्र को पानी के तापमान को केवल गुनगुने नमूनों को दिखाकर सिखाने जैसा है; वे कभी भी गर्म और ठंडे के बीच अंतर नहीं सीख पाएंगे यदि वे कभी भी दोनों चरमों को महसूस नहीं करेंगे।
इसे ठीक करने के लिए, टीम ने कृत्रिम रूप से गायब "एज केसेस" (edge cases) बनाने के लिए एक विधि डिजाइन की। उन्होंने रिकॉर्ड किए गए दृश्य में एक मानव चालक द्वारा लिए गए वास्तविक पथ से शुरुआत की और फिर व्यवस्थित रूप से उसे दो विशिष्ट दिशाओं में धकेला। पहले दिशा में, उन्होंने पथ को बगल की ओर स्थानांतरित किया, जिससे वह सड़क के किनारे के करीब आता गया जब तक कि उसने सीमा पार नहीं कर ली। दूसरे दिशा में, वे कार को उसके पथ पर आगे ले गए, जिससे वह सामने वाली गाड़ी के करीब आती गई जब तक कि वह उससे टकरा न जाए। इसे छोटे, क्रमिक चरणों में करके, उन्होंने सुरक्षित 'बाल-बाल बचने' से लेकर स्पष्ट उल्लंघन तक के परिदृश्यों की एक सीढ़ी बनाई। इन सिंथेटिक पथों को एक सिम्युलेटर में डाला गया ताकि यह देखा जा सके कि सड़क के नियम वास्तव में उन्हें कैसे आंकते हैं। इस प्रक्रिया ने सकारात्मक और नकारात्मक उदाहरणों का एक समृद्ध सेट तैयार किया जो मूल प्लानर ने अपने आप कभी नहीं बनाया होता।
शोधकर्ताओं ने इस नए प्रशिक्षण डेटा को एक आधुनिक स्कोरिंग सिस्टम से जोड़ा जो 'ट्रांसफॉर्मर' नामक एक प्रकार के न्यूरल नेटवर्क पर आधारित है, जो अनुक्रमों (sequences) और संबंधों को समझने में उत्कृष्ट है। उन्होंने इस सेटअप का परीक्षण दो अलग-अलग, पूर्व-मौजूदा प्लानिंग सिस्टम का उपयोग करके किया जिन्हें पूरी तरह से अपरिवर्तित छोड़ दिया गया था। एक सिस्टम ने कैमरों और लेजर स्कैनर दोनों का उपयोग किया, जबकि दूसरे ने केवल कैमरों पर भरोसा किया। दोनों मामलों में, स्कोरर को नए, संवर्धित डेटासेट पर अलग से प्रशिक्षित किया गया जबकि प्लानर स्थिर (frozen) रहा। परिणाम आश्चर्यजनक थे। जब सिस्टम का परीक्षण वास्तविक दुनिया के ड्राइविंग दृश्यों के एक बड़े बेंचमार्क पर किया गया, तो नए स्कोरर ने लगातार सुरक्षित पथ चुने। कैमरा-ओनली सिस्टम पर, समग्र प्रदर्शन स्कोर 89.5 से बढ़कर 90.4 हो गया। कैमरों और लेजर दोनों वाले सिस्टम पर, यह 88.3 से बढ़कर 90.1 हो गया।
सुधार सभी ड्राइविंग पहलुओं में एक समान नहीं था, जिसने ठीक से बताया कि नए प्रशिक्षण डेटा ने क्या हासिल किया। सिस्टम टक्करों से बचने और चलने योग्य क्षेत्र के भीतर रहने में काफी बेहतर हो गया, जो सबसे महत्वपूर्ण सुरक्षा कारक हैं। वास्तव में, शोधकर्ताओं ने पाया कि लाभ मुख्य रूप से इन सुरक्षा मेट्रिक्स में केंद्रित थे। सिस्टम प्रगति और लेन-कीपिंग (lane-keeping) में थोड़ा कम आक्रामक हो गया, जो एक ऐसा समझौता है जिसे स्कोरिंग सिस्टम सुरक्षा सुनिश्चित करने के लिए स्वीकार करता है। यह सुझाव देता है कि नए प्रशिक्षण डेटा ने सफलतापूर्वक स्कोरर को यह प्राथमिकता देना सिखाया कि जब गति या आराम और नियम के उल्लंघन के बीच संघर्ष हो, तो नियम उल्लंघन से बचने को प्राथमिकता दी जाए।
यह सिद्ध करने के लिए कि सुधार नए डेटा के विशिष्ट डिजाइन से आया था न कि केवल अधिक डेटा होने से, शोधकर्ताओं ने अपने तरीके की तुलना एक संस्करण से की जिसमें यादृच्छिक (randomly) रूप से उत्पन्न पथों का उपयोग किया गया था। रैंडम डेटा ने लगभग कोई लाभ नहीं दिया, जिससे पुष्टि हुई कि प्रशिक्षण सेट का सावधानीपूर्वक निर्माण ही मुख्य कुंजी थी। कार को सड़क के किनारे और सामने वाली कार की ओर धकेलने का विशिष्ट डिजाइन ही महत्वपूर्ण था। अध्ययन दर्शाता है कि न्यूरल नेटवर्क के आर्किटेक्चर से कहीं अधिक महत्वपूर्ण प्रशिक्षण डेटा की गुणवत्ता है। जानबूझकर एक ऐसा डेटासेट बनाकर जो उन निर्णय सीमाओं को कवर करता है जहाँ दुर्घटनाएं होती हैं, शोधकर्ताओं ने दिखाया कि एक स्थिर (frozen) प्लानर को एक बहुत अधिक स्मार्ट स्कोरर के साथ जोड़ा जा सकता है, बिना पूरे सिस्टम को फिर से प्रशिक्षित किए। यह दृष्टिकोण सुरक्षित स्वायत्त ड्राइविंग के लिए एक व्यावहारिक और कुशल मार्ग प्रदान करता है, यह साबित करते हुए कि कभी-कभी मशीन के निर्णय को बेहतर बनाने का सबसे अच्छा तरीका उसे यह दिखाना है कि रेखा कहाँ है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।