← नवीनतम पेपर
💻 computer science

CorrectionPlanner: Self-Correction Planner with Reinforcement Learning in Autonomous Driving

CorrectionPlanner एक ऑटोरेग्रेसिव ऑटोनॉमस ड्राइविंग प्लानर है जो टकराव के पूर्वानुमानों के आधार पर मोशन टोकन को गतिशील रूप से उत्पन्न और परिष्कृत करने के लिए सुदृढीकरण लर्निंग (reinforcement learning) के साथ एक प्रपोज़-इवैल्यूएट-करेक्ट लूप को एकीकृत करता है, जो टकराव की दरों को काफी कम करता है और अत्याधुनिक प्लानिंग प्रदर्शन प्राप्त करता है।

मूल लेखक: Yihong Guo, Dongqiangzi Ye, Sijia Chen, Anqi Liu, Xianming Liu

प्रकाशित 2026-03-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yihong Guo, Dongqiangzi Ye, Sijia Chen, Anqi Liu, Xianming Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नए ड्राइवर को व्यस्त शहर में गाड़ी चलाना सिखा रहे हैं।

वर्तमान सेल्फ-ड्राइविंग कारों की समस्या
ज्यादातर वर्तमान सेल्फ-ड्राइविंग AI एक आत्मविश्वासी लेकिन जल्दबाज किशोर की तरह काम करते हैं। वे सड़क को देखते हैं, एक पल का निर्णय लेते हैं (जैसे "मैं अभी बाएं मुड़ूँगा!"), और तुरंत उसे लागू कर देते हैं। यदि वह निर्णय खतरनाक साबित होता है—मान लीजिए, एक कार चौराहे की ओर तेजी से आ रही है—तो AI के पास कोई "अनडू" (undo) बटन नहीं होता। वह बस टकरा जाता है। यह एक ऐसी कार चलाने जैसा है जहाँ आप दीवार से टकराने से पहले ब्रेक नहीं लगा सकते।

समाधान: CorrectionPlanner
यह पेपर CorrectionPlanner पेश करता है, जो एक सतर्क, अनुभवी ड्राइवर की तरह काम करता है जो कदम उठाने से पहले खुद से बात करता है। केवल एक चाल चलने के बजाय, यह एक मानसिक "क्या-होगा-अगर" (what-if) सिमुलेशन चलाता है।

यह कैसे काम करता है, यहाँ एक सरल उदाहरण दिया गया है:

1. "मानसिक सैंडबॉक्स" (The Loop)

कल्पना कीजिए कि आप फुटपाथ से नीचे उतरने जा रहे हैं।

  • चरण 1: प्रस्ताव (The Proposal)। आपका मस्तिष्क कहता है, "ठीक है, मैं आगे कदम रखूँगा।"
  • चरण 2: सुरक्षा जांच (The Safety Check)। आपके सिर में एक छोटा सा अलार्म (Collision Critic) तुरंत पूछता है, "रुको, क्या कोई बस आ रही है?"
  • चरण 3: सुधार (The Correction)। यदि अलार्म बजता है, तो आप बस कदम नहीं रखते। आप कदम नहीं रखते। इसके बजाय, आप अपनी मानसिक नोटबुक में लिखते हैं: "आगे कदम रखना खतरनाक है।"
  • चरण 4: पुन: प्रयास (The Retry)। अब, आप फिर से सोचते हैं, लेकिन इस बार आप उस नोट को याद रखते हैं। आप कहते हैं, "ठीक है, आगे कदम रखना बुरा है, इसलिए मैं रुकूँगा और बाईं ओर देखूँगा।"
  • चरण 5: क्रियान्वयन (Execution)। आप तभी कदम रखते हैं जब आपका मानसिक अलार्म कहता है, "सुरक्षित।"

AI की दुनिया में, यह मिलीसेकंड में होता है। यह एक "मोशन टोकन" (गति का एक छोटा हिस्सा) उत्पन्न करता है, जांच करता है कि क्या इससे कोई टक्कर होती है, और यदि ऐसा होता है, तो यह उस बुरे विचार को एक "करेक्शन ट्रेस" (Correction Trace) (गलतियों की एक मानसिक सूची) में जोड़ देता है और फिर से प्रयास करता है। यह इस लूप को तब तक जारी रखता है जब जब तक कि इसे एक सुरक्षित रास्ता नहीं मिल जाता।

2. इसने यह कैसे सीखा (प्रशिक्षण)

आप केवल बेहतरीन ड्राइविंग के वीडियो दिखाकर एक कार को सुरक्षित होना नहीं सिखा सकते (इमिटेशन लर्निंग)। यदि आप इसे केवल आदर्श ड्राइवरों के बारे में दिखाते हैं, तो यह गलती को कैसे ठीक करना है, यह कभी नहीं सीख पाएगा।

इसलिए, शोधकर्ताओं ने दो-चरणीय प्रशिक्षण पद्धति का उपयोग किया:

  • चरण 1: छात्र (The Student)। उन्होंने AI को विशेषज्ञ ड्राइवरों की नकल करने के लिए सिखाया। इसने इसे बुनियादी बातें दीं।
  • चरण 2: सिम्युलेटर (Reinforcement Learning)। यह जादू वाला हिस्सा है। उन्होंने AI को एक वीडियो गेम जैसे सिम्युलेटर में डाला जहाँ यह किसी को नुकसान पहुँचाए बिना हजारों बार दुर्घटनाग्रस्त हो सकता था।
    • AI ने गाड़ी चलाने की कोशिश की।
    • वह दुर्घटनाग्रस्त हो गया।
    • सिस्टम ने कहा, "बुरा कदम! फिर से प्रयास करें, लेकिन याद रखें कि आप क्यों दुर्घटनाग्रस्त हुए।"
    • AI ने सीखा कि अगली बार उसी गलती से बचने के लिए अपने "करेक्शन ट्रेस" का उपयोग कैसे करना है।

यह एक पायलट के उड़ान सिम्युलेटर में प्रशिक्षण लेने जैसा है। वे सिम्युलेटर में विमान को क्रैश कर सकते हैं, क्रैश से सीख सकते हैं, और फिर वास्तविक दुनिया में सुरक्षित रूप से उड़ सकते हैं।

3. यह सिर्फ "फिर से कोशिश करने" से बेहतर क्यों है

आप सोच सकते हैं, "क्यों न AI को 10 रैंडम रास्ते आज़माने दें और उनमें से एक को चुन लें जो टकराता नहीं है?" (इसे रिजेक्शन सैंपलिंग कहा जाता है)।

पेपर बताता है कि यह 10 बार पासा फेंकने और 6 आने की उम्मीद करने जैसा है। यदि पासा पक्षपाती (खतरे की ओर झुका हुआ) है, तो आप बार-बार खराब नंबर ही प्राप्त करेंगे।
CorrectionPlanner अधिक स्मार्ट है। यह केवल दोबारा पासा नहीं फेंकता; यह पासे को ही बदल देता है। बुरे मूव्स (Correction Trace) को याद रखकर, यह अपनी सोच को पूरी तरह से बदल देता है। यह रैंडम अनुमान लगाने और पहेली को हल करने के लिए तर्क का उपयोग करने के बीच का अंतर है।

परिणाम

जब उन्होंने वास्तविक दुनिया के ड्राइविंग डेटा पर इसका परीक्षण किया:

  • कम दुर्घटनाएं: इसने मौजूदा बेहतरीन AI की तुलना में टक्करों को 20% से अधिक कम कर दिया।
  • बेहतर निर्णय लेना: इसने सीखा कि कब धीमा होना है, कब मुड़ने वाली कार के लिए रुकना है, और फिर कब फिर से गति बढ़ानी है, बिल्कुल वैसे ही जैसे एक इंसान करेगा, न कि केवल रुक जाने या टकरा जाने के बजाय।
  • कोई "जादुई" भाषा नहीं: कुछ AI के विपरीत जो मानव शब्दों में "सोचते" हैं (जैसे "मुझे रुकना चाहिए क्योंकि लाइट लाल है"), यह AI गति (motion) में "सोचता" है। यह सीधे कार की भौतिक गति के बारे में तर्क करता है, जो ड्राइविंग के लिए तेज़ और अधिक सटीक है।

संक्षेप में

CorrectionPlanner एक ऐसा सेल्फ-ड्राइविंग सिस्टम है जो तब तक कोई कदम उठाने से इनकार करता है जब तक कि उसने मानसिक रूप से उसका अभ्यास न कर लिया हो, खतरे की जांच न कर ली हो, और पहले अपने दिमाग में किसी भी संभावित गलती को ठीक न कर लिया हो। यह वर्तमान AI के "टकराओ और उम्मीद करो" दृष्टिकोण को "सोचो, जांचो, सुधारो, फिर चलो" के दृष्टिकोण में बदल देता है, जिससे हमारी सड़कें काफी सुरक्षित हो जाती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →