← नवीनतम पेपर
💻 computer science

Track-Guided Hierarchical Reinforcement Learning for Autonomous Vehicle Drifting with Minimum-Lap-Time Planning

यह शोध पत्र एक ट्रैक-गाइडेड पदानुक्रमित सुदृढीकरण शिक्षण (hierarchical reinforcement learning) ढांचे का प्रस्ताव करता है जो ढीली सतहों पर स्थिर और समय-कुशल ड्रिफ्टिंग के लिए एक स्वायत्त वाहन नियंत्रक को प्रगतिशील रूप से प्रशिक्षित करने हेतु न्यूनतम-लैप-टाइम नियोजन प्रक्षेप पथों (minimum-lap-time planning trajectories) का लाभ उठाता है।

मूल लेखक: Sheng Zhao, Bolin Zhao, Xiaodong Wu, Chen Lv

प्रकाशित 2026-08-04
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Sheng Zhao, Bolin Zhao, Xiaodong Wu, Chen Lv

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ कारें केवल चलती नहीं हैं; वे नृत्य करती हैं। फॉर्मूला 1 के उच्च-दांव वाले अखाड़े में, ड्राइवर अंदरूनी रेखा को पकड़कर चलते हैं, अपनी टायरों को सड़क से चिपकाए रखते हैं ताकि वे जितनी हो सके उतनी तेज़ जा सकें। लेकिन रैली रेसिंग में, ढीली बजरी या बर्फ पर, सबसे अच्छे ड्राइवर कुछ जंगली करते हैं: वे जानबूझकर ग्रिप (पकड़) खो देते हैं। वे कार को तिरछा घुमाते हैं, बर्फ पर एक फिगर स्केटर की तरह कोनों से फिसलते हुए निकलते हैं। इसे "ड्रिफ्टिंग" कहा जाता है। यह खतरनाक लगता है, और यह है भी, क्योंकि कार अपने ही भौतिक विज्ञान (फिजिक्स) से लड़ रही होती है। लेकिन जब इसे सही ढंग से किया जाता है, तो यह वास्तव में कार को तेज़ी से मुड़ने और दौड़ को जल्दी समाप्त करने में मदद करता है।

एक कंप्यूटर को यह करने के लिए तैयार करना इंजीनियरों के लिए एक दुःस्वप्न है। आमतौर पर, आप एक रोबोट को यह सिखाने के लिए कि उसे क्या करना है, उसे ठीक-ठीक दिखाते हैं, या उसे नियमों का एक सख्त सेट देते हैं। लेकिन ड्रिफ्टिंग अव्यवस्थित है। कार के टायर फिसल रहे हैं, स्टीयरिंग अजीब महसूस हो रहा है, और भौतिक विज्ञान बेहद अप्रत्याशित है। यदि आप केवल कंप्यूटर को कहें "कार को स्लाइड करो," तो वह घूमकर दुर्घटनाग्रस्त हो सकता है। यदि आप हर संभावित स्लाइड के लिए एक आदर्श गणितीय सूत्र लिखने की कोशिश करते हैं, तो कंप्यूटर भ्रमित हो जाता है क्योंकि वास्तविक दुनिया बहुत जटिल है। इसलिए, वैज्ञानिकों ने एक अलग तरकीब की ओर रुख किया है: रीइन्फोर्समेंट लर्निंग (Reinforcement Learning)। इसे एक वीडियो गेम के पात्र को हजारों गेम खेलकर सिखाने के रूप में सोचें, जिसमें वह बार-बार हारता है, जब तक कि वह अंततः जीतना नहीं सीख जाता। समस्या यह है कि एक रोबोट को शुरुआत से ड्रिफ्ट करना सिखाना एक छोटे बच्चे को ट्रिपल बैकफ्लिप करना सिखाने जैसा है; वे आमतौर पर पहले अपना चेहरा ज़मीन पर पटकते हैं।

यह शोध पत्र एक चतुर नए तरीके को पेश करता है जिससे आप एक सेल्फ-ड्राइविंग कार को ड्रिफ्ट करना और दौड़ जीतना सिखा सकते हैं, जिसे "ट्रैक-गाइडेड हिरार्कीकल रीइन्फोर्समेंट लर्निंग" (Track-Guided Hierarchical Reinforcement Learning) कहा जाता है। लेखक, शेन्ग झाओ और उनकी टीम ने महसूस किया कि रोबोट को सीधे गहरे पानी में फेंकने के बजाय, उन्हें चरणों में सिखाना चाहिए, जैसे कि स्तरों वाला एक वीडियो गेम। सबसे पहले, उन्होंने एक अत्यंत सटीक गणितीय मॉडल का उपयोग करके ट्रैक के चारों ओर सबसे तेज़ संभव पथ की गणना की, भले ही उस पथ में जंगली स्लाइड शामिल हों। वे इसे "मिनिमम-लैप-टाइम" (Minimum-Lap-Time) योजना कहते हैं। यह योजना रोबोट के लिए एक संदर्भ या मानचित्र के रूप में कार्य करती है।

फिर, उन्होंने रोबोट को सीखने दिया। लेकिन उन्होंने केवल "जाओ" नहीं कहा। उन्होंने एक "ट्रैक-गाइडेड" दृष्टिकोण का उपयोग किया। पहले चरण में, रोबोट एक सीधी रेखा पर सीखता है, बस यह समझने के लिए कि कार को बिना दुर्घटनाग्रस्त हुए कैसे स्लाइड किया जाए। दूसरे चरण में, वह तीखे हेयरपिन मोड़ों के चारों ओर ड्रिफ्ट करना सीखता है। अंत में, तीसरे चरण में, वह एक पूर्ण रेस ट्रैक पर इन सबको एक साथ जोड़ देता है ताकि देख सके कि वह कितनी तेज़ जा सकता है। रोबोट को पथ पर बने रहने, सही कोण पर फिसलने और जल्दी दौड़ पूरी करने के अंक मिलते हैं। उनके कंप्यूटर सिमुलेशन के परिणाम दिखाते हैं कि यह चरण-दर-चरण विधि एक साथ सब कुछ सीखने की कोशिश करने की तुलना में बहुत बेहतर काम करती है। रोबोट ने प्रभावी ढंग से ड्रिफ्ट करना सीखा, स्लाइड करते समय कार को स्थिर रखा, और अन्य परीक्षण किए गए AI तरीकों की तुलना में लैप्स को काफी तेज़ी से पूरा किया। हालाँकि यह सब अभी तक एक कंप्यूटर सिमुलेशन में परीक्षण किया गया था और एक वास्तविक ट्रैक पर वास्तविक कार पर नहीं, फिर भी यह सुझाव देता है कि सही प्रशिक्षण गाइड के साथ, रोबट जल्द ही पेशेवर रैली ड्राइवरों की तरह कोनों से ड्रिफ्ट कर सकेंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →