← नवीनतम पेपर
💻 computer science

Designing Versatile Samples for Learned Trajectory Scoring

यह शोध पत्र लॉग किए गए मानव प्रक्षेपवक्रों (trajectories) के पार्श्व (lateral) और अनुदैर्ध्य (longitudinal) विक्षोभों (perturbations) के माध्यम से सूचनात्मक प्रशिक्षण नमूने उत्पन्न करके सीखे गए प्रक्षेपवक्र स्कोरिंग को बढ़ाने की एक विधि प्रस्तुत करता है, जो NAVSIM डेटासेट पर DiffusionDrive और MeanFuser जैसे फ्रोजन जनरेटिव प्लानर्स के प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Yaguang Li, Jiaru Zhang, Chuheng Wei, Can Cui, Ziran Wang

प्रकाशित 2026-09-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yaguang Li, Jiaru Zhang, Chuheng Wei, Can Cui, Ziran Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

स्वायत्त वाहनों (ऑटोनॉमस व्हीकल्स) को एक मौलिक चुनौती का सामना करना पड़ता है जो केवल सड़क देखने से कहीं अधिक है। जबकि शुरुआती प्रणालियों ने आगे के एक एकल, आदर्श पथ की गणना करने की कोशिश की, वास्तविक दुनिया का ड्राइविंग इतना सीधा नहीं होता है। एक चौराहे के पास पहुँच रही कार को कई संभावनाओं को तौलना पड़ता है: बाएँ मुड़ना, सीधे जाना, या शायद किसी पैदल यात्री के लिए रुकना। यह अनिश्चितता, जिसे मल्टीमोडैलिटी (multimodality) कहा जाता है, का अर्थ है कि एक सुरक्षित ड्राइविंग सिस्टम केवल एक उत्तर आउटपुट नहीं कर सकता; इसे संभावित मार्गों का एक छोटा सेट उत्पन्न करना चाहिए और फिर उनमें से सबसे अच्छा चुनना चाहिए। यह चयन प्रक्रिया महत्वपूर्ण है। यदि सिस्टम एक ऐसा पथ चुनता है जो सुरक्षित दिखता है लेकिन वास्तव में फुटपाथ के बहुत करीब है या आगे चल रही कार के बहुत करीब है, तो इसका परिणाम यातायात उल्लंघन या टक्कर हो सकता है। एक बाल-बाल बचने (near-miss) और एक आपदा के बीच अंतर करने की क्षमता, जो अक्सर मात्र कुछ सेंटीमीटर से अलग होती है, एक सुगम यात्रा और एक खतरनाक विफलता के बीच का अंतर है।

पर्ड्यू यूनिवर्सिटी और बॉश आर्टिफिशियल इंटेलिजेंस सेंटर के शोधकर्ताओं ने कंप्यूटर को इन महत्वपूर्ण विकल्पों को चुनने का तरीका सिखाने का एक नया तरीका विकसित किया है। उनका काम "स्कोरर" (scorer) पर केंद्रित है, जो वह सॉफ्टवेयर हिस्सा है जो संभावित पथों की एक सूची को रैंक करने और विजेता चुनने के लिए जिम्मेदार है। उन्होंने पाया कि इन स्कोरर्स को प्रशिक्षित करने का मानक तरीका उन्हें सबसे कठिन स्थितियों के लिए तैयार नहीं छोड़ रहा था। एक विशेष प्रशिक्षण डेटासेट बनाकर, जो वाहनों को जानबूझकर सुरक्षा की सीमा तक धकेलता है, वे इन प्रणालियों के प्रदर्शन को जटिल ड्राइविंग परिदृश्यों में काफी बेहतर बनाने में सक्षम रहे।

समस्या का मूल कारण यह है कि इन प्रणालियों को वर्तमान में कैसे सिखाया जाता है। अधिकांश स्वायत्त ड्राइविंग नीतियां दो चरणों में काम करती हैं। पहले, एक "प्लानर" (planner) सड़क को देखता है और संभावित प्रक्षेप पथों (trajectories) का एक समूह बनाता है, जो आमतौर पर लगभग बीस होते हैं। ये वे विकल्प हैं जो कार ले सकती है। दूसरा, एक "स्कोरर" इस सूची की समीक्षा करता है और निष्पादित करने के लिए एकल सबसे अच्छा पथ चुनता है। शोधकर्ताओं ने पाया कि प्लानर स्पष्ट दुर्घटनाओं से बचने में काफी अच्छे हैं, इसलिए उनके विकल्पों की सूची आमतौर पर सुरक्षित, आरामदायक ड्राइविंग के इर्द-गिर्द केंद्रित होती है। वे शायद ही कभी ऐसे पथ शामिल करते हैं जो सड़क के किनारे के बहुत करीब हों या किसी अन्य कार के ठीक पीछे हों। यह स्कोरर के लिए एक ब्लाइंड स्पॉट (blind spot) बना देता है। क्योंकि प्रशिक्षण डेटा में इन जोखिम भरे, सीमा-धकेलने वाले परिदृश्यों के उदाहरणों की कमी है, इसलिए स्कोरर कभी यह नहीं सीख पाता कि एक पथ जो केवल उल्लंघन के करीब है और जो वास्तव में नियम का उल्लंघन करता है, उनके बीच अंतर कैसे किया जाए। यह एक छात्र को पानी के तापमान को केवल गुनगुने नमूनों को दिखाकर सिखाने जैसा है; वे कभी भी गर्म और ठंडे के बीच अंतर नहीं सीख पाएंगे यदि वे कभी भी दोनों चरमों को महसूस नहीं करेंगे।

इसे ठीक करने के लिए, टीम ने कृत्रिम रूप से गायब "एज केसेस" (edge cases) बनाने के लिए एक विधि डिजाइन की। उन्होंने रिकॉर्ड किए गए दृश्य में एक मानव चालक द्वारा लिए गए वास्तविक पथ से शुरुआत की और फिर व्यवस्थित रूप से उसे दो विशिष्ट दिशाओं में धकेला। पहले दिशा में, उन्होंने पथ को बगल की ओर स्थानांतरित किया, जिससे वह सड़क के किनारे के करीब आता गया जब तक कि उसने सीमा पार नहीं कर ली। दूसरे दिशा में, वे कार को उसके पथ पर आगे ले गए, जिससे वह सामने वाली गाड़ी के करीब आती गई जब तक कि वह उससे टकरा न जाए। इसे छोटे, क्रमिक चरणों में करके, उन्होंने सुरक्षित 'बाल-बाल बचने' से लेकर स्पष्ट उल्लंघन तक के परिदृश्यों की एक सीढ़ी बनाई। इन सिंथेटिक पथों को एक सिम्युलेटर में डाला गया ताकि यह देखा जा सके कि सड़क के नियम वास्तव में उन्हें कैसे आंकते हैं। इस प्रक्रिया ने सकारात्मक और नकारात्मक उदाहरणों का एक समृद्ध सेट तैयार किया जो मूल प्लानर ने अपने आप कभी नहीं बनाया होता।

शोधकर्ताओं ने इस नए प्रशिक्षण डेटा को एक आधुनिक स्कोरिंग सिस्टम से जोड़ा जो 'ट्रांसफॉर्मर' नामक एक प्रकार के न्यूरल नेटवर्क पर आधारित है, जो अनुक्रमों (sequences) और संबंधों को समझने में उत्कृष्ट है। उन्होंने इस सेटअप का परीक्षण दो अलग-अलग, पूर्व-मौजूदा प्लानिंग सिस्टम का उपयोग करके किया जिन्हें पूरी तरह से अपरिवर्तित छोड़ दिया गया था। एक सिस्टम ने कैमरों और लेजर स्कैनर दोनों का उपयोग किया, जबकि दूसरे ने केवल कैमरों पर भरोसा किया। दोनों मामलों में, स्कोरर को नए, संवर्धित डेटासेट पर अलग से प्रशिक्षित किया गया जबकि प्लानर स्थिर (frozen) रहा। परिणाम आश्चर्यजनक थे। जब सिस्टम का परीक्षण वास्तविक दुनिया के ड्राइविंग दृश्यों के एक बड़े बेंचमार्क पर किया गया, तो नए स्कोरर ने लगातार सुरक्षित पथ चुने। कैमरा-ओनली सिस्टम पर, समग्र प्रदर्शन स्कोर 89.5 से बढ़कर 90.4 हो गया। कैमरों और लेजर दोनों वाले सिस्टम पर, यह 88.3 से बढ़कर 90.1 हो गया।

सुधार सभी ड्राइविंग पहलुओं में एक समान नहीं था, जिसने ठीक से बताया कि नए प्रशिक्षण डेटा ने क्या हासिल किया। सिस्टम टक्करों से बचने और चलने योग्य क्षेत्र के भीतर रहने में काफी बेहतर हो गया, जो सबसे महत्वपूर्ण सुरक्षा कारक हैं। वास्तव में, शोधकर्ताओं ने पाया कि लाभ मुख्य रूप से इन सुरक्षा मेट्रिक्स में केंद्रित थे। सिस्टम प्रगति और लेन-कीपिंग (lane-keeping) में थोड़ा कम आक्रामक हो गया, जो एक ऐसा समझौता है जिसे स्कोरिंग सिस्टम सुरक्षा सुनिश्चित करने के लिए स्वीकार करता है। यह सुझाव देता है कि नए प्रशिक्षण डेटा ने सफलतापूर्वक स्कोरर को यह प्राथमिकता देना सिखाया कि जब गति या आराम और नियम के उल्लंघन के बीच संघर्ष हो, तो नियम उल्लंघन से बचने को प्राथमिकता दी जाए।

यह सिद्ध करने के लिए कि सुधार नए डेटा के विशिष्ट डिजाइन से आया था न कि केवल अधिक डेटा होने से, शोधकर्ताओं ने अपने तरीके की तुलना एक संस्करण से की जिसमें यादृच्छिक (randomly) रूप से उत्पन्न पथों का उपयोग किया गया था। रैंडम डेटा ने लगभग कोई लाभ नहीं दिया, जिससे पुष्टि हुई कि प्रशिक्षण सेट का सावधानीपूर्वक निर्माण ही मुख्य कुंजी थी। कार को सड़क के किनारे और सामने वाली कार की ओर धकेलने का विशिष्ट डिजाइन ही महत्वपूर्ण था। अध्ययन दर्शाता है कि न्यूरल नेटवर्क के आर्किटेक्चर से कहीं अधिक महत्वपूर्ण प्रशिक्षण डेटा की गुणवत्ता है। जानबूझकर एक ऐसा डेटासेट बनाकर जो उन निर्णय सीमाओं को कवर करता है जहाँ दुर्घटनाएं होती हैं, शोधकर्ताओं ने दिखाया कि एक स्थिर (frozen) प्लानर को एक बहुत अधिक स्मार्ट स्कोरर के साथ जोड़ा जा सकता है, बिना पूरे सिस्टम को फिर से प्रशिक्षित किए। यह दृष्टिकोण सुरक्षित स्वायत्त ड्राइविंग के लिए एक व्यावहारिक और कुशल मार्ग प्रदान करता है, यह साबित करते हुए कि कभी-कभी मशीन के निर्णय को बेहतर बनाने का सबसे अच्छा तरीका उसे यह दिखाना है कि रेखा कहाँ है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →