← नवीनतम पेपर
💻 computer science

Safe Overtaking for Autonomous Racing Using Hierarchical Optimization and Learning-Based Control

यह शोध पत्र स्वायत्त रेसिंग के लिए एक पदानुक्रमित ओवरटेकिंग फ्रेमवर्क प्रस्तावित करता है जो युक्ति चयन (maneuver selection) के लिए एक उच्च-स्तरीय मिक्स्ड-इंटीजर क्वाड्रेटिक प्रोग्राम को एक नॉनलीनियर मॉडल प्रेडिक्टिव कंट्रोल कंट्रोलर के साथ जोड़ता है, जिसे सुरक्षा बाधा बाधाओं (safety barrier constraints) को अनुकूल रूप से ट्यून करने के लिए एक सुदृढीकरण शिक्षण (reinforcement learning) नीति द्वारा संवर्धित किया गया है, जिससे विभिन्न ट्रैक स्थितियों में बिना किसी मैनुअल ट्यूनिंग के मजबूत सुरक्षा-प्रदर्शन संतुलन प्राप्त किया जा सके।

मूल लेखक: Hassan Jardali, Kai Yin, Lantao Liu

प्रकाशित 2026-07-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hassan Jardali, Kai Yin, Lantao Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ रोबोट केवल चीजों से टकराने से बचने के लिए सख्त नियमों का पालन नहीं कर रहे हैं, बल्कि वे वास्तव में एक-दूसरे के खिलाफ जबरदस्त गति से प्रतिस्पर्धा कर रहे हैं। यह स्वायत्त रेसिंग (autonomous racing) का रोमांचक, उच्च-दांव वाला अखाड़ा है। एक हाईवे पर चलने वाली सेल्फ-ड्राइविंग कार के विपरीत, जो एक सुचारू, आरामदायक सवारी और यातायात नियमों के सख्त पालन को प्राथमिकता देती है, एक रेसिंग रोबोट को जीतने के लिए अपने टायरों की पकड़ के बिल्कुल किनारे पर नृत्य करना पड़ता है। यह पूरी गति से साइकिल चलाने और साथ ही करतब (juggling) करने जैसा है, जहाँ लक्ष्य बिना दुर्घटना के हुए सबसे तेज़ होना है। इस खेल की सबसे बड़ी चुनौती है ओवरटेक करना: आप किसी प्रतिद्वंद्वी से टकराए बिना या स्पिन आउट हुए बिना उसके पास से कैसे निकल सकते हैं? इसे हल करने के लिए, वैज्ञानिक "कंट्रोल बैरियर फंक्शन" (Control Barrier Function - CBF) नामक एक विशेष प्रकार के "सुरक्षा जाल" का उपयोग करते हैं। इसे कार के चारों ओर एक अदृश्य, लचीले बुलबुले के रूप में समझें जो कहता है, "आप इतनी गति से जा सकते हैं, लेकिन यदि आप किनारे के बहुत करीब पहुँचते हैं, तो आपको धीमा होना होगा।" पेचीदा बात यह है कि यदि यह सुरक्षा बुलबुला बहुत सख्त है, तो कार डरपोक बन जाएगी, जो किसी को भी पास करने से मना कर देगी। यदि यह बहुत ढीला है, तो कार दुर्घटनाग्रस्त हो जाएगी। बड़ा सवाल यह है कि: आप इस सुरक्षा बुलबुले को इतना स्मार्ट कैसे बना सकते हैं कि वह जान सके कि कब सख्त होना है और कब ढीला, और वह भी तब जब रेस चल रही हो?

यह शोध पत्र एक चतुर नए तरीके को पेश करता है जिससे रेसिंग रोबोट्स को सुरक्षित और आक्रामक रूप से ओवरटेक करना सिखाया जा सके। लेखक, हसन जार्दली, काई यिन और लांटौ लियू, एक "पदानुक्रमित" (hierarchical) प्रणाली का प्रस्ताव देते हैं, जो एक रोबोट को दो अलग-अलग परतों वाली सोच वाला मस्तिष्क देने जैसा है। पहली परत "रणनीतिकार" (strategist) है। यह रेस को देखती है और बड़े, असतत निर्णय लेती है, जैसे "मैं बाईं ओर से गुजरूँगा" या "मैं दाईं ओर से गुजरूँगा।" यह 'मिक्स्ड-इंटीजर क्वाड्रेटिक प्रोग्रामिंग' (MIQP) नामक एक गणितीय उपकरण का उपयोग करके इस पहेली को हल करती है, जो अनिवार्य रूप से कार के चलने से पहले ही ट्रैफ़िक के बीच से सबसे अच्छे रास्ते को चुन लेती है। दूसरी परत "पायलट" है। एक बार जब रणनीतिकार एक पक्ष चुन लेता है, तो पायलट 'मॉडल प्रेडिक्टिव कंट्रोल' (MPC) नामक एक परिष्कृत नियंत्रक का उपयोग करके वास्तव में कार को स्टीयर करता है, यह सुनिश्चित करते हुए कि वह भौतिकी के नियमों के भीतर रहे और दीवारों से न टकराए।

हालाँकि, लेखकों ने गौर किया कि आमतौर पर ये सुरक्षा बुलबुले कैसे काम करते हैं। पारंपरिक रूप से, सुरक्षा बुलबुले की "कठोरता" (stiffness) एक मानव इंजीनियर द्वारा एक निश्चित संख्या के रूप में सेट की जाती है। यह एक कार चलाने जैसा है जिसमें क्रूज कंट्रोल है जो अपनी गति सीमा कभी नहीं बदलता, चाहे आप एक सीधी सड़क पर हों या एक तीखे मोड़ पर। पेपर का तर्क है कि यह निश्चित दृष्टिकोण बहुत कठोर है; यह अक्सर कार को अत्यधिक सतर्क बना देता है, जिससे वह पास करने के बेहतरीन अवसर खो देती है, या इसके लिए हर एक रेस ट्रैक के लिए निरंतर मैन्युअल ट्यूनिंग की आवश्यकता होती है। इसे ठीक करने के लिए, टीम ने एक तीसरा घटक जोड़ा: एक "कोच" जो 'रीइन्फोर्समेंट लर्निंग' (RL) द्वारा संचालित है। यह कोच वास्तविक समय में रेस को देखता है और सुरक्षा बुलबुले की कठोरता को तुरंत समायोजित करता है। यदि कार प्रतिद्वंद्वी से दूर है, तो कोच कार को आक्रामक होने देने के लिए बुलबुले को ढीला कर देता है। यदि कार प्रतिद्वंद्वी के बिल्कुल बगल में है, तो कोच सुरक्षा सुनिश्चित करने के लिए बुलबुले को कस देता है।

शोधकर्ताओं ने कंप्यूटर सिमुलेशन में चार प्रसिद्ध रेस ट्रैक्स, जिनमें इंडियानापोलिस मोटर स्पीडवे और लागुना सेका शामिल हैं, में इस तीन-भाग वाली प्रणाली का परीक्षण किया। उन्होंने पाया कि सुरक्षा बुलबुले की कोई भी एक निश्चित सेटिंग सभी ट्रैक्स पर अच्छी तरह काम नहीं करती थी; एक सेटिंग जो एक ट्रैक के लिए एकदम सही थी, वह दूसरे के लिए बहुत खराब थी। इसके विपरीत, उनके अनुकूलन योग्य (adaptive) "कोच" ने स्वचालित रूप से सुरक्षा सेटिंग्स को समायोजित करना सीख लिया। इन सिमुलेशन में, अनुकूलन योग्य रणनीति ने 67% की उच्चतम समग्र सफलता दर हासिल की, जिसका अर्थ है कि कार अन्य सभी निश्चित सेटिंग्स की तुलना में अधिक बार बिना दुर्घटना के रेस पूरी करती रही। इसने प्रत्येक नए ट्रैक के लिए फिर से ट्यून किए बिना अधिक लैप्स पूरे किए और अधिक ओवरटेक्स भी किए।

यह साबित करने के लिए कि यह केवल एक कंप्यूटर ट्रिक नहीं है, टीम ने एक छोटा, स्केल-डाउन किया गया रेसिंग कार भी बनाया और वास्तविक दुनिया में सिस्टम का परीक्षण किया। उन्होंने वास्तविक रेस का अनुकरण करने के लिए एक आभासी "घोस्ट" प्रतिद्वंद्वी का उपयोग किया। परिणामों ने दिखाया कि सिस्टम कार की गतिविधियों के साथ तालमेल बिठाने के लिए पर्याप्त तेज़ था, जो मिलीसेकंड में निर्णय ले सकता है। प्रयोगों ने पुष्टि की कि पदानुक्रमित दृष्टिकोण—पास होने के स्थान के बड़े निर्णय को ड्राइविंग के विस्तृत नियंत्रण से अलग करना—महत्वपूर्ण था। जब उन्होंने "रणनीतिकार" परत को हटाने की कोशिश की और "पायलट" को अपने आप पास होने का पक्ष तय करने दिया, तो कार भ्रमित हो गई, लूप में फंस गई, और बहुत अधिक बार दुर्घटनाग्रस्त हुई।

संक्षेप में, पेपर सुझाव देता है कि स्वायत्त रेसिंग के लिए वास्तव में प्रतिस्पर्धी और सुरक्षित होने के लिए, रोबोट्स को एक टीम दृष्टिकोण की आवश्यकता है: एक रणनीतिकार जो सही लेन चुने, एक पायलट जो ड्राइविंग को संभाले, और एक स्मार्ट कोच जो वास्तविक समय में सुरक्षा नियमों को समायोजित करे। हालाँकि यह सिस्टम अभी भी पूरी तरह से परफेक्ट नहीं है (यह अभी भी विरोधियों के चलने के बारे में कुछ सरलीकरणों पर निर्भर करता है), परिणाम बताते हैं कि रोबोट को अपने स्वयं के सुरक्षा मार्जिन को ट्यून करना सिखाना, पहले से ही एक आदर्श सेटिंग का अनुमान लगाने की कोशिश करने की तुलना में एक बहुत बेहतर विचार है। यह कार्य, जिसे 2026 IEEE/RSJ इंटरनेशनल कॉन्फ्रेंस ऑन इंटेलिजेंट रोबोट्स एंड सिस्टम्स के लिए स्वीकार किया गया है, रोबोट्स के लिए ऐसे द्वार खोलता है जो न केवल सुरक्षित रूप से, बल्कि एक मानव चैंपियन की तरह साहसी और अनुकूलन योग्य होकर रेस कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →