← नवीनतम पेपर
💻 computer science

Balancing Progress and Safety: A Novel Risk-Aware Objective for RL in Autonomous Driving

यह शोध पत्र स्वायत्त ड्राइविंग में सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) के लिए एक नवीन, पदानुक्रमित और जोखिम-सचेत रिवॉर्ड फंक्शन प्रस्तावित करता है जो सामान्यीकृत उद्देश्यों और एक विस्तारित रिस्पॉन्सिबिलिटी-सेंसिटिव सेफ्टी मॉडल को एकीकृत करता है, जिसके परिणामस्वरूप अनसिग्नलकृत चौराहे के परिदृश्यों में उच्च मार्ग प्रगति बनाए रखते हुए टक्कर दरों में 21% की कमी आती है।

मूल लेखक: Ahmed Abouelazm, Jonas Michel, Helen Gremmelmaier, Tim Joseph, Philip Schörner, J. Marius Zöllner

प्रकाशित 2026-03-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ahmed Abouelazm, Jonas Michel, Helen Gremmelmaier, Tim Joseph, Philip Schörner, J. Marius Zöllner

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बिल्कुल नए, सुपर-स्मार्ट रोबोट को कार चलाना सिखा रहे हैं। आप चाहते हैं कि वह पॉइंट A से पॉइंट B तक जितनी जल्दी हो सके पहुँचे, लेकिन आपको यह भी सुनिश्चित करना है कि वह किसी चीज़ से टकरा न जाए।

आर्टिफिशियल इंटेलिजेंस की दुनिया में, यह काम रीइन्फोर्समेंट लर्निंग (RL) नामक चीज़ का उपयोग करके किया जाता है। इसे एक कुत्ते को प्रशिक्षित करने जैसा समझें: यदि कुत्ता कुछ अच्छा करता है, तो आप उसे एक ट्रीट (इनाम) देते हैं; यदि वह कुछ बुरा करता है, तो आप उसे "ना" कहते हैं (दंड)।

इस पेपर के अनुसार, समस्या यह है कि लंबे समय तक इन ड्राइविंग रोबोट्स को जो "ट्रीट्स और पेनल्टीज़" दी जाती थीं, वे खराब तरीके से डिज़ाइन की गई थीं। यहाँ इसका सरल विवरण दिया गया है कि लेखकों ने क्या ठीक किया और उन्होंने इसे कैसे किया।

समस्या: "रेस कार" बनाम "सुरक्षा प्रथम" ड्राइवर

लेखक बताते हैं कि पहले के रोबोट्स को प्रशिक्षित करने के तरीके में एक मज़ेदार लेकिन खतरनाक खामी थी।

कल्पना कीजिए कि एक रोबोट सड़क पर एक विशाल, अचल दीवार के पीछे फंसा हुआ है।

  • एक मानव चालक: वह धैर्यपूर्वक प्रतीक्षा करेगा। वह जानता है कि टकराना बुरा है, इसलिए वह तब तक स्थिर बैठा रहेगा जब तक दीवार हट न जाए (या वह बचने का कोई रास्ता न ढूंढ ले)।
  • पुराना रोबोट: हालाँकि, वह दीवार से टकराने का निर्णय ले सकता है। क्यों? क्योंकि उसका "रिवॉर्ड सिस्टम" टूटा हुआ था। उसे बताया गया था: "यदि तुम बहुत देर तक इंतज़ार करते हो, तो तुम्हें भारी दंड मिलेगा, लेकिन टकराने पर केवल छोटा सा दंड मिलेगा।" इसलिए, रोबोट ने गणना की: "अगर मैं टकराता हूँ, तो मुझे एक छोटा सा 'आउच' स्कोर मिलेगा। अगर मैं इंतज़ार करता हूँ, तो मुझे एक बहुत बड़ा 'बोरियत' स्कोर मिलेगा। मैं टकरा जाऊँगा!"

ऐसा इसलिए हुआ क्योंकि रोबोट्स को केवल तब दंडित किया जाता था जब वे वास्तव में किसी चीज़ से टकरा जाते थे, न कि तब जब वे एक ऐसा जोखिम भरा कदम उठा रहे होते थे जिससे दुर्घटना होने की संभावना हो।

समाधान: ड्राइविंग के लिए एक नया "नियम पुस्तिका"

लेखकों ने रोबोट के ड्राइविंग को ग्रेड देने का एक नया, स्मार्ट तरीका बनाया। नियमों की एक अव्यवस्थित सूची के बजाय, उन्होंने एक पदानुक्रमित नियम पुस्तिका (Hierarchical Rulebook) बनाई (प्राथमिकताओं के पिरामिड की तरह)।

इसे एक सख्त माता-पिता द्वारा बच्चे को दिए गए निर्देशों की तरह समझें:

  1. स्तर 1 (डील-ब्रेकर्स): "टकराना मत। सड़क से बाहर मत जाना। रेड लाइट पार मत करना।" यदि आप इन्हें तोड़ते हैं, तो खेल तुरंत समाप्त हो जाता है।
  2. स्तर 2 (सेफ्टी ज़ोन): "सिर्फ टकराने से बचो ही नहीं; खतरे से दूर रहो।" यही इस पेपर का बड़ा नया विचार है।
  3. स्तर 3 (लक्ष्य): "तेज़ी से चलो और गंतव्य तक पहुँचो।"
  4. स्तर 4 (पॉलिश): "इतनी सहजता से चलाओ कि यात्रियों को कारसिकनेस (जी मिचलाना) न हो।"

मुख्य नवाचार स्तर 2 है। लेखकों ने महसूस किया कि केवल दुर्घटना होने तक इंतज़ार करना बहुत देर हो जाना है। आपको रोबोट को खतरे के करीब आने के लिए दंडित करने की आवश्यकता है, भले ही वह टकरा न जाए।

जादुई उपकरण: "अदृश्य बल क्षेत्र" (Invisible Force Field)

रोबोट को सुरक्षा के बारे में सिखाने के लिए, लेखकों ने एक रिस्क-अवेयर ऑब्जेक्टिव (जोखिम-जागरूक उद्देश्य) का आविष्कार किया।

कल्पना कीजिए कि सड़क पर हर कार और बाधा के चारों ओर एक अदृश्य, खिंचाव वाला बुलबुला (वे इसे "2D एलिप्सॉइड" कहते हैं) है।

  • बुलबुले का आकार: यह बुलबुला एक आदर्श वृत्त (सर्कल) नहीं है। यह कार के सामने की ओर खिंचता है (क्योंकि यदि आप तेज़ गति से चल रहे हैं, तो आपको रुकने के लिए अधिक स्थान चाहिए) और यह किनारों पर चौड़ा होता है (क्योंकि आपको मुड़ने के लिए जगह चाहिए)।
  • यह कैसे काम करता है:
    • यदि रोबोट बुलबुले के बाहर रहता है, तो उसे कोई दंड नहीं मिलता।
    • यदि वह अपने नाक को बुलबुले के अंदर डालने लगता है, तो उसे एक छोटा "चेतावनी" दंड मिलता है।
    • बुलबुले के केंद्र (टकराव के बिंदु) के जितना करीब वह जाएगा, दंड उतना ही बड़ा होता जाएगा।

यह RSS (रेस्पॉन्सिबिलिटी-सेंसिटिव सेफ्टी) की अवधारणा पर आधारित है। यह गणितीय रूप से कहने का एक तरीका है कि, "यदि मैं तेज़ गति से चल रहा हूँ, तो मुझे एक बड़ा अंतर रखना चाहिए। यदि मैं धीरे चल रहा हूँ, तो एक छोटा अंतर ठीक है।"

रोबोट सीखता है कि यह केवल दूसरी कार से न टकराने के बारे में नहीं है; बल्कि उस अदृश्य बुलबुले को बरकरार रखने के बारे में है। यह रोबोट को "तर्कहीन" निर्णय लेने से रोकता है, जैसे रेड लाइट को मात देने के लिए तेज़ होना या किसी को कट मारना।

परिणाम: स्मार्ट, सुरक्षित ड्राइविंग

लेखकों ने व्यस्त चौराहों (जहाँ कारों को बिना ट्रैफिक लाइट के तय करना होता है कि पहले कौन जाएगा) के कंप्यूटर सिमुलेशन में इस नए सिस्टम का परीक्षण किया।

  • पुराने रोबोट: वे बहुत बार टकराते थे (भारी ट्रैफ़िक में लगभग 60% बार) क्योंकि वे आगे बढ़ने के लिए बहुत उत्सुक थे।
  • नए रोबोट (बुलबुले के साथ): उनके टकराने की दर 21% कम थी। वे बिना फंसे अपने गंतव्य तक पहुँचने में भी बेहतर थे।

बड़ी तस्वीर

सरल शब्दों में, यह पेपर कहता है: अपने AI रोबोट को केवल टकराने से बचने के लिए न सिखाएं; उसे अपने आस-पास के स्थान का सम्मान करना सिखाएं।

रोबोट को एक अधिक सूक्ष्म "स्कोरकार्ड" देने से, जिसमें अदृश्य सुरक्षा बुलबुले और नियमों का एक सख्त पदानुक्रम शामिल है, उन्होंने एक ऐसा ड्राइवर बनाया जो आगे बढ़ने के लिए साहसी है लेकिन यह जानने के लिए पर्याप्त स्मार्ट है कि कब धीमा होना और प्रतीक्षा करना है। यह स्टीयरिंग व्हील के पीछे बैठे एक लापरवाह किशोर और एक सतर्क, अनुभवी चालक के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →