← नवीनतम पेपर
💻 computer science

AutoDrive-P3AutoDrive\text{-}P^3: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning

यह शोध पत्र **AutoDrive-P³** को प्रस्तुत करता है, जो एक विशेष डेटासेट और पदानुक्रमित सुदृढीकरण शिक्षण (hierarchical reinforcement learning) के माध्यम से धारणा (perception), पूर्वानुमान (prediction) और नियोजन (planning) को एक एकल सुसंगत चेतना-प्रवाह (chain-of-thought) प्रक्रिया में एकीकृत करने वाला एक नवीन ढांचा है, जो सहक्रियात्मक निर्णय लेने को सुनिश्चित करते हुए और दोहरी विचार पद्धतियों (dual thinking modes) के साथ अनुमान दक्षता को संतुलित करते हुए स्वायत्त ड्राइविंग में अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Yuqi Ye, Zijian Zhang, Junhong Lin, Shangkun Sun, Changhao Peng, Wei Gao

प्रकाशित 2026-03-31
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuqi Ye, Zijian Zhang, Junhong Lin, Shangkun Sun, Changhao Peng, Wei Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। अतीत में, हमने रोबोट को दो तरीकों से सिखाने की कोशिश की, और दोनों में समस्याएँ थीं:

  1. "अंतर्ज्ञान वाला" ड्राइवर (The "Gut Feeling" Driver): कुछ रोबोटों को बताया गया, "सड़क को देखो, और बस मुझे बताओ कि स्टीयरिंग कहाँ घुमाना है।" उन्होंने सोचने वाले हिस्से को छोड़ दिया। यह ऐसा था जैसे किसी इंसान को आँखों पर पट्टी बांधकर गाड़ी चलाने के लिए कहना, और अंदाज़ा लगाना कि अन्य कारें कहाँ हैं। वे अक्सर खतरनाक गलतियाँ करते थे क्योंकि उन्होंने खतरे को पहले "देखा" नहीं था।

  2. "अलग-थलग" ड्राइवर (The "Siloed" Driver): अन्य रोबोट इतने स्मार्ट थे कि वे कह सकते थे, "मैं एक ट्रक देख रहा हूँ," फिर "मुझे लगता है कि ट्रक बाईं ओर जाएगा," और अंत में "मैं दाईं ओर मुड़ूँगा।" लेकिन वे ये तीनों कदम अलग-अलग करते थे, जैसे तीन अलग-अलग लोग ड्राइवर को निर्देश चिल्ला रहे हों बिना एक-दूसरे से बात किए। परिणाम एक भ्रमित ड्राइवर था जिसे यह समझ नहीं आ रहा था कि ट्रक की गति ही मुड़ने का कारण थी।

AutoDrive-P 3 नया समाधान है। यह रोबोट को एक विचारशील मानव विशेषज्ञ की तरह गाड़ी चलाना सिखाता है जो कभी भी कोई कदम नहीं छोड़ता और हमेशा कड़ियों को जोड़ता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:

1. "सोचने की श्रृंखला" (The "Chain of Thought" - आंतरिक एकालाप)

केवल उत्तर देने के बजाय, AutoDrive-P 3 रोबोट को कार्य करने से पहले खुद से ज़ोर से बात करने के लिए मजबूर करता है। यह एक संरचना का उपयोग करता है जिसे P 3-CoT (परसेप्शन-प्रेडिक्शन-प्लानिंग चेन ऑफ थॉट) कहा जाता है।

इसे शतरंज के खिलाड़ी की तरह समझें जो चाल चलने से पहले सोचता है:

  • परसेप्शन (आंखें): "मैं आगे एक लाल कार और फुटपाथ पर एक पैदल यात्री देख रहा हूँ।"
  • प्रेडिक्शन (भविष्यवाणी/क्रिस्टल बॉल): "लाल कार धीमी हो रही है, और पैदल यात्री ऐसा लग रहा है जैसे वह सड़क पर उतर सकता है।"
  • प्लानिंग (रणनीति): "चूंकि कार धीमी हो रही है और पैदल यात्री जोखिम भरा है, इसलिए मैं धीरे से ब्रेक लगाऊंगा और अपनी लेन में रहूंगा।"

पिछले सिस्टमों में, रोबोट सीधे "ब्रेक लगाओ!" पर कूद सकता था बिना यह समझाए कि क्यों। AutoDrive-P 3 रोबोट को पहले पूरी कहानी लिखने के लिए मजबूर करता है। यह सुनिश्चित करता है कि अंतिम निर्णय दुनिया की ठोस समझ पर आधारित हो।

2. "कोच" (The "Coach" - सुदृढीकरण फाइन-ट्यूनिंग)

रोबोट यह सब पूरी तरह से कैसे सीखता है? लेखकों ने एक विशेष प्रशिक्षण पद्धति बनाई है जिसे P 3-GRPO कहा जाता है।

कल्पना कीजिए कि एक ड्राइविंग इंस्ट्रक्टर बगल वाली सीट पर बैठा है।

  • पुराना तरीका: इंस्ट्रक्टर केवल पूरे चक्कर के खत्म होने के बाद "अच्छा काम किया!" या "बुरा काम किया!" चिल्लाता था। रोबोट को यह पता नहीं चलता था कि वह दुर्घटना इसलिए हुई क्योंकि उसने बाधा को नहीं देखा या इसलिए हुई क्योंकि उसने बहुत देर से मुड़ने का निर्णय लिया।
  • AutoDrive-P 3 का तरीका: इंस्ट्रक्टर हर एक कदम पर फीडबैक देता है।
    • "तुमने अपने 'परसेप्शन' स्टेप में उस पैदल यात्री को मिस कर दिया! फिर से कोशिश करो।"
    • "तुम्हारा यह 'प्रेडिक्शन' कि कार रुक जाएगी, गलत था।"
    • "तुम्हारा अंतिम 'प्लानिंग' कि बाईं ओर मुड़ना सुरक्षित था, लेकिन केवल इसलिए क्योंकि तुमने पहले की गलतियों को ठीक कर लिया था।"

यह "पदानुक्रमित" (hierarchical) कोचिंग सुनिश्चित करती है कि यदि रोबोट दुनिया को देखने में गलती करता है, तो वह पहले उसे ठीक करना सीखता है, जिससे स्वाभाविक रूप से बाद में बेहतर ड्राइविंग निर्णय लिए जाते हैं।

3. "दोहरा मोड" (The "Dual Mode" - तेज़ सोचना बनाम धीरे सोचना)

इसकी एक सबसे शानदार विशेषता यह है कि रोबोट के पास दो मोड हैं, बिल्कुल इंसानों की तरह:

  • विस्तृत सोच (धीमा, सावधानी वाला मोड): जब सड़क पर स्थिति कठिन हो (बारिश, निर्माण कार्य, भीड़), तो रोबलेट अपना समय लेता है। वह हिलने से पहले हर कार और पैदल यात्री के बारे में एक लंबी, विस्तृत कहानी लिखता है। यह सुरक्षा के लिए है।
  • तेज़ सोच (त्वरित मोड): जब सड़क खाली और साफ हो, तो रोबोट लंबी कहानी छोड़कर सीधे उत्तर दे देता है। यह ऐसा है जैसे बिना ट्रैफिक के हाईवे पर गाड़ी चलाना; आपको हर सांस का वर्णन करने की आवश्यकता नहीं है, आप बस गाड़ी चलाते हैं। यह समय और कंप्यूटिंग पावर बचाता है।

परिणाम

इन विचारों को जोड़कर, AutoDrive-P 3 एक घबराए हुए शिक्षार्थी से एक अनुभवी दिग्गज में अपग्रेड करने जैसा है।

  • यह बेहतर देखता है (Perception)।
  • यह दूसरों के व्यवहार का बेहतर अनुमान लगाता है (Prediction)।
  • यह चलने के लिए बेहतर निर्णय लेता है (Planning)।

पेपर दिखाता है कि यह विधि कार को अन्य किसी भी वर्तमान उपलब्ध सिस्टम की तुलना में बहुत अधिक सुरक्षित (कम दुर्घटनाएं) और कठिन स्थितियों में बहुत स्मार्ट बनाती है। यह साबित करता है कि यदि आप रोबोट को केवल उत्तर का अनुमान लगाने के बजाय पूरी प्रक्रिया के माध्यम से सोचना सिखाते हैं, तो वह एक बहुत बेहतर ड्राइवर बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →