← नवीनतम पेपर
💻 computer science

A Multi-Modal Perception Pipeline for Object Detection and Tracking in Autonomous Racing

यह शोध पत्र एक सुदृढ़ मल्टी-मोडल लेट-फ्यूजन परसेप्शन पाइपलाइन प्रस्तुत करता है जो उच्च-गति, प्रतिकूल और एज-केस स्थितियों के तहत स्वायत्त रेसिंग के लिए विश्वसनीय ऑब्जेक्ट डिटेक्शन और ट्रैकिंग प्राप्त करने हेतु कैमरा, LiDAR और RADAR डेटा को एक विशेष ट्रैकिंग फ्रेमवर्क के साथ एकीकृत करता है।

मूल लेखक: Davide Malvezzi, Michele Pestarino, Vittoria Cavicchioli, Valentina La Gamba, Silvia Severi, Fabio Bagni, Luca Bartoli, Massimiliano Bosi, Francesco Gatti, Micaela Verucchi, Ayoub Raji, Marko Bertogna

प्रकाशित 2026-09-09
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Davide Malvezzi, Michele Pestarino, Vittoria Cavicchioli, Valentina La Gamba, Silvia Severi, Fabio Bagni, Luca Bartoli, Massimiliano Bosi, Francesco Gatti, Micaela Verucchi, Ayoub Raji, Marko Bertogna

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ कारें ऐसी गति से दौड़ती हैं जो एक फॉर्मूला वन ड्राइवर को भी पसीना ला दे, फिर भी पहिए के पीछे कोई इंसान नहीं है। इस चरम वातावरण में, त्रुटि की गुंजाइश इंच और मिलीसेकंड में मापी जाती है। 80 मीटर प्रति सेकंड की गति के करीब, केवल एक-दशावें सेकंड की देरी का मतलब है कि एक कार लगभग आठ मीटर की दूरी तय कर लेती है, बिना यह जाने कि वह कहाँ है या उसके सामने क्या है। यह स्वायत्त रेसिंग (autonomous racing) की वास्तविकता है, एक ऐसा क्षेत्र जो धारणा तकनीक (perception technology) को उसकी पूर्ण सीमा तक धकेलता है। इस अराजकता से निपटने के लिए, एक वाहन को अपनी आँखें और मस्तिष्क स्वयं बनना होगा, अन्य कारों को खोजने, उनकी गतिविधियों का पूर्वानुमान लगाने और यह निर्णय लेने के लिए ट्रैक को लगातार स्कैन करना होगा कि कब तेज होना है, धीमा होना है, या रास्ता बदलना है। चुनौती केवल देखने की नहीं है, बल्कि धुंधली गति, कंपन करते सेंसर और बाधाओं के अचानक प्रकट होने के बावजूद स्पष्ट रूप से देखने की है, जबकि यह सब उन स्थितियों में किया जा रहा है जो सबसे उन्नत मानवीय इंद्रियों को भी भ्रमित कर सकती हैं।

यूनिवर्सिटी ऑफ मोडेना एंड रेगियो एमिलिया के शोधकर्ताओं की एक टीम ने, HiPeRT Srl के साथ मिलकर, 2025 अबू धाबी ऑटोनॉमस रेसिंग लीग के लिए इन समस्याओं को हल करने के लिए डिज़ाइन किया गया एक नया सिस्टम विकसित किया है। उनका कार्य, जिसे हाल ही में एक शोध पत्र में प्रस्तुत किया गया है, एक "परसेप्शन पाइपलाइन" (perception pipeline) पर केंद्रित है—जो सॉफ्टवेयर और हार्डवेयर की एक जटिल श्रृंखला है जो कार के सेंसर से प्राप्त कच्चे डेटा को दुनिया के एक विश्वसनीय मानचित्र में बदल देती है। टीम का दृष्टिकोण इस विचार पर आधारित है कि कोई भी एकल प्रकार का सेंसर पूर्ण नहीं होता। कैमरे आकृतियों को पहचानने में उत्कृष्ट हैं लेकिन अंधेरे या खराब मौसम में दूरी मापने में संघर्ष करते हैं। LiDAR सेंसर, जो 3D मानचित्र बनाने के लिए लेजर पल्स का उपयोग करते हैं, सटीक होते हैं लेकिन धूल या बारिश से प्रभावित हो सकते हैं। RADAR इकाइयाँ गति मापने में बेहतरीन होती हैं लेकिन अक्सर उनमें विवरण की कमी होती है। शोधकर्ताओं ने महसूस किया कि हाई-स्पीड अराजकता में जीवित रहने के लिए, एक कार को इन सभी इंद्रियों को एक एकल, एकीकृत दृश्य में संयोजित करने की आवश्यकता है, जिसे वे "लेट फ्यूजन" (late fusion) कहते हैं। इसका अर्थ है कि कार पहले प्रत्येक सेंसर के डेटा को स्वतंत्र रूप से संसाधित करती है, और फिर एक पूर्ण चित्र बनाने के लिए परिणामों को एक साथ लाती है, बजाय इसके कि कच्चे डेटा स्ट्रीम को तुरंत मिलाने का प्रयास किया जाए।

इस अध्ययन में उपयोग किया गया वाहन, डैलेरा EAV-24, उपकरणों के एक परिष्कृत समूह से लैस है: तीन LiDAR सेंसर, सात कैमरे और चार RADAR इकाइयाँ, जो सभी एक सटीक घड़ी के साथ सिंक्रोनाइज़्ड हैं। सिस्टम इस तरह काम करता है कि प्रत्येक सेंसर प्रकार अपने आप में अन्य कारों की तलाश करता है। कैमरे वीडियो फीड में वाहनों के 2D आउटलाइन को पहचानने के लिए एक न्यूरल नेटवर्क का उपयोग करते हैं। LiDARs लेजर के साथ हवा को स्कैन करके 3D आकृतियाँ खोजते हैं, जबकि RADAR रेडियो तरंगों के आधार पर वस्तुओं की उपस्थिति और गति का पता लगाते हैं। एक बार ये स्वतंत्र डिटेक्शन हो जाने के बाद, सिस्टम का "फ्यूजन" मॉड्यूल एक मैचमेकर (जोड़ी बनाने वाले) के रूप में कार्य करता है। यह विभिन्न सेंसरों के डेटा को देखता है और पूछता है, "क्या यह LiDAR ब्लब वही कार है जो वह कैमरा बॉक्स है?" यदि समय और स्थान मेल खाते हैं, तो सिस्टम उन्हें मिला देता है, जिससे दूसरी कार कहाँ है और वह कितनी तेजी से चल रही है, इसका एक एकल, मजबूत अनुमान प्राप्त होता है। यह प्रक्रिया महत्वपूर्ण है क्योंकि यदि सिस्टम केवल एक ही सेंसर पर निर्भर रहता, तो एक क्षणिक खराबी या ब्लाइंड स्पॉट विनाशकारी विफलता का कारण बन सकता था। उन्हें मिलाकर, सिस्टम यह सुनिश्चित करता है कि यदि एक सेंसर विफल होता है या बाधित होता है, तो अन्य कार को सुरक्षित रख सकते हैं।

हालाँकि, कार को देखना केवल आधी लड़ाई है; अगले एक सेकंड के अंश में वह कहाँ होगी, यह जानना दूसरी आधी लड़ाई है। शोधकर्ताओं ने पाया कि रेसिंग की गति पर, प्रोसेसिंग में मामूली देरी भी कार को यह सोचने पर मजबूर कर सकती है कि बाधा एक स्थान पर है जबकि वास्तव में वह कई मीटर आगे बढ़ चुकी होती है। इसे ठीक करने के लिए, उनके ट्रैकिंग सिस्टम में एक "डिले कंपनसेशन" (delay compensation) तंत्र शामिल है। यह देखता है कि सेंसर ने किसी वस्तु को देखने का सटीक क्षण क्या था और गणना करता है कि डेटा को कंप्यूटर के माध्यम से यात्रा करने में लगने वाले समय को ध्यान में रखते हुए, उस वस्तु को अभी कहाँ होना चाहिए। इसके अलावा, सिस्टम केवल अनुमान नहीं लगाता; यह रेस कारों के व्यवहार की गहरी समझ का उपयोग करता है। यह जानता है कि कारें आम तौर पर ट्रैक के चारों ओर विशिष्ट पथों का पालन करती हैं, जिन्हें रेसिंग लाइन्स कहा जाता है, और वे कोनों पर धीमी होती हैं और सीधे रास्तों पर तेज होती हैं। इस ज्ञान को अपनी गणनाओं में फीड करके, सिस्टम एक मानक ट्रैकर की तुलना में, जो मान लेता है कि कारें सीधी रेखा में निरंतर गति से चलती हैं, बहुत अधिक सटीकता के साथ कार की भविष्य की स्थिति का पूर्वानुमान लगा सकता है।

टीम ने इस सिस्टम का वास्तविक दुनिया की स्थितियों में परीक्षण किया, जिसमें उनके स्वायत्त वाहन को यास मरीना सर्किट पर अन्य कारों के विरुद्ध उतारा गया। उन्होंने सिस्टम को तीन विशिष्ट, उच्च-तनाव वाले परिदृश्यों में डाला ताकि देखा जा सके कि यह कैसा प्रदर्शन करता है। पहले परीक्षण में, उन्होंने सिम्युलेट किया कि एक कार अचानक ट्रैक पर रुक गई जबकि स्वायत्त वाहन उच्च गति से उसकी ओर बढ़ रहा था। सिस्टम ने लगभग 80 मीटर की दूरी से रुकी हुई कार का पता लगाया और कुछ सौ मिलीसेकंड के भीतर, सही ढंग से अनुमान लगाया कि वह स्थिर थी, जिससे प्लानिंग सॉफ्टवेयर को सुरक्षित रूप से ब्रेक लगाने या रास्ता बदलने के लिए पर्याप्त समय मिल गया। दूसरे परिदृश्य में, उन्होंने परीक्षण किया कि सिस्टम "ब्लाइंड स्पॉट" की स्थिति को कैसे संभालता है जहाँ एक कार दूसरी कार के दृश्य को रोक देती है। जब रोकने वाली कार हिली, तो सिस्टम ने तुरंत प्रकट हुई नई वाहन को पहचान लिया और बिना किसी हिचकिचाहट के उसे ट्रैक करना शुरू कर दिया, जिससे यह सिद्ध हुआ कि वह अचानक आने वाली बाधाओं को संभाल सकता है। अंत में, उन्होंने एक साइड-बाय-साइड ओवरटेक का परीक्षण किया, जहाँ दो कारें कुछ इंच की दूरी पर दौड़ रही थीं। हालांकि सिस्टम ने सामने या पीछे होने के आधार पर दूसरी कार की सटीक स्थिति का अनुमान लगाने में थोड़ा पूर्वाग्रह दिखाया, लेकिन समग्र सटीकता मैन्यूवर को बिना किसी टक्कर के पूरा करने के लिए पर्याप्त थी।

इन परीक्षणों के परिणामों ने पुष्टि की कि कई सेंसरों को संयोजित करना केवल एक पर निर्भर रहने की तुलना में कहीं अधिक श्रेष्ठ है। जब शोधकर्ताओं ने समीकरण से LiDAR सेंसरों को हटा दिया, तो दूरी का निर्णय लेने की सिस्टम की क्षमता काफी कम हो गई। जब उन्होंने RADAR को हटाया, तो सिस्टम अन्य कारों की गति का सटीक अनुमान लगाने में संघर्ष करने लगा। केवल तभी जब तीनों प्रकार के सेंसर एक साथ काम कर रहे थे, सिस्टम ने सटीकता और रेंज का सबसे अच्छा संतुलन प्राप्त किया। अध्ययन निष्कर्ष निकालता है कि स्वायत्त वाहनों को अत्यधिक गति पर सुरक्षित रूप से संचालित करने के लिए, उन्हें न केवल कई आँखों के माध्यम से दुनिया को देखना होगा, बल्कि दुनिया के बारे में इस तरह सोचना होगा जो रेसिंग के भौतिकी (physics) को ध्यान में रखे। हालाँकि सिस्टम पूर्ण नहीं है—यह अभी भी किनारे से देखे जाने पर कार की सटीक ज्यामिति (geometry) के साथ थोड़ा संघर्ष करता है—यह एक महत्वपूर्ण प्रगति का प्रतिनिधित्व करता है। यह साबित करता है कि विभिन्न प्रकार के डेटा को फ्यूज करके और रेस के संदर्भ को समझकर, मशीनें पृथ्वी के सबसे खतरनाक और मांग वाले वातावरण में नेविगेट करना सीख सकती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →