A Review of Reward Functions for Reinforcement Learning in the context of Autonomous Driving
यह शोध पत्र स्वायत्त ड्राइविंग में सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) के लिए मौजूदा रिवॉर्ड फंक्शन्स को सुरक्षा, आराम, प्रगति और यातायात नियमों के अनुपालन में समीक्षा और वर्गीकृत करता है, साथ ही अधिक सुदृढ़ और संघर्ष-समाधान करने वाले रिवॉर्ड डिजाइनों के लिए भविष्य की अनुसंधान दिशाओं का प्रस्ताव देने हेतु मानकीकरण और संदर्भ-जागरूकता में उनकी वर्तमान सीमाओं को रेखांकित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। आप इसे सिर्फ यह नहीं कह सकते, "सुरक्षित तरीके से चलाओ।" आपको इसे एक स्कोरकार्ड देना होगा—नियमों का एक सेट जो इसे बताता है कि यह कब अच्छा काम कर रहा है और कब बुरा। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इस स्कोरकार्ड को रिवॉर्ड फंक्शन (Reward Function) कहा जाता है।
यह पेपर वास्तव में इस बारे में एक रिपोर्ट है कि शोधकर्ता वर्तमान में सेल्फ-ड्राइविंग कारों के लिए ये स्कोरकार्ड कैसे लिख रहे हैं। लेखक, अहमद, जोनास और जे. मारियस का तर्क है कि हालांकि हम रोबोटों को गाड़ी चलाना सिखाने में बेहतर हो रहे हैं, लेकिन जिस तरह से हम उन्हें ग्रेड दे रहे हैं, वह अव्यवस्थित, असंगत और कभी-कभी खतरनाक है।
यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. स्कोरकार्ड के चार स्तंभ
लेखकों ने सैकड़ों शोध पत्रों का अध्ययन किया और महसूस किया कि प्रत्येक रिवॉर्ड फंक्शन चार मुख्य लक्ष्यों को संतुलित करने की कोशिश करता है। इन्हें एक रियलिटी टीवी शो के चार जजों के रूप में सोचें:
- सुरक्षा (द बॉडीगार्ड): यह सबसे महत्वपूर्ण जज है। रोबोट को टकराना नहीं चाहिए।
- समस्या: वर्तमान में, स्कोरकार्ड बहुत अस्पष्ट है। यदि रोबलेट किसी शॉपिंग कार्ट से टकराता है, तो उसे उतना ही "बुरा स्कोर" मिलता है जितना कि यदि वह तेज गति से किसी पैदल यात्री से टकरा जाए। कुछ शोधकर्ता इसे ठीक करने के लिए दंड को और अधिक गंभीर बनाने का प्रयास करते हैं यदि कार तेज चल रही हो, लेकिन यह अभी भी एक अनुमान है।
- प्रगति (द मैराथन रनर): रोबोट को अपने गंतव्य तक पहुँचना होगा।
- समस्या: यदि आप केवल रोबोट को "तेज चलो" कहते हैं, तो वह दीवार में जा टकरा सकता है क्योंकि दीवार से टकराना तकनीकी रूप से "आगे बढ़ने" के समान है। वर्तमान स्कोरकार्ड कभी-कभी रोबोट को इतना उत्सुक बना देते हैं कि वह बाधाओं को अनदेखा कर देता है।
- आराम (द टैक्सी पैसेंजर): सवारी रोलरकोस्टर जैसी नहीं होनी चाहिए। अचानक झटके या तेज ब्रेक न लगें।
- समस्या: कई शोधकर्ता इसे पूरी तरह से अनदेखा कर देते हैं! वे टकराने से बचने पर इतना ध्यान केंद्रित करते हैं कि वे रोबोट को एक घबराए हुए किशोर की तरह अचानक ब्रेक मारते हुए गाड़ी चलाना सिखा देते हैं।
- यातायात नियम (द पुलिस ऑफिसर): लेन में रहें, रेड लाइट पर रुकें, स्पीड न बढ़ाएं।
- समस्या: स्कोरकार्ड अक्सर बहुत कठोर होते हैं। उन्हें यह नहीं पता होता कि नियम तोड़ना कब ठीक है (जैसे सुरक्षित रूप से तेज ट्रैफिक में शामिल होने के लिए गति सीमा से थोड़ा ऊपर जाना)।
2. "स्मूदी" की समस्या (एकत्रीकरण/Aggregation)
आप इन चार जजों को एक अंतिम स्कोर में कैसे मिलाते हैं?
- वर्तमान विधि (द स्मूदी): अधिकांश शोधकर्ता सब कुछ एक ब्लेंडर में मिला देते हैं। वे सुरक्षा स्कोर, प्रगति स्कोर और आराम स्कोर को जोड़ देते हैं।
- दोष: यदि "प्रगति" वाला जज बहुत तेज है, तो वह "सुरक्षा" वाले जज को दबा देता है। रोबोट यह तय कर सकता है, "मैं उस दीवार से टकरा जाऊंगा क्योंकि आगे बढ़ने के लिए मिलने वाले अंक टकराने के लिए खोए जाने वाले अंकों से अधिक हैं।"
- वेटेड विधि (Weighted Method): कुछ लोग सुरक्षा को "तेज आवाज" देने के लिए उसके स्कोर को एक बड़ी संख्या से गुणा करने का प्रयास करते हैं।
- दोष: यह रेडियो ट्यून करने के लिए अनुमान लगाने जैसा है। आपको बार-बार नंबरों को मैन्युअल रूप से बदलने की आवश्यकता होती है, और जो चीज़ एक बरसाती शहर में काम करती है, वह धूप वाले हाईवे पर विफल हो सकती है।
3. "एक ही आकार सबके लिए" का जाल (संदर्भ का अभाव)
कल्पना कीजिए कि एक शिक्षक एक छात्र के गणित के टेस्ट को उसी तरह ग्रेड करता है जैसे वह उनके कला प्रोजेक्ट को ग्रेड करता है। सेल्फ-ड्राइविंग कारों के साथ भी यही हो रहा है।
- वर्तमान स्कोरकार्ड अक्सर एक विशिष्ट स्थिति (जैसे हाईवे) के लिए बनाए जाते हैं।
- यदि आप उसी स्कोरकार्ड को पैदल यात्रियों वाले व्यस्त शहर में ले जाते हैं, तो वह भ्रमित हो जाता है। उसे यह नहीं पता होता कि मौसम, समय या सड़क के प्रकार के आधार पर नियम बदल जाते हैं। इसमें "कॉमन सेंस" की कमी है।
4. गायब "नियम पुस्तिका" (Rulebook)
लेखक सुझाव देते हैं कि हमें नंबरों के साथ अनुमान लगाना बंद करना चाहिए और एक नियम पुस्तिका का उपयोग करना चाहिए।
- उपमा: ब्लेंडर में सामग्री मिलाने के बजाय, कानूनों के एक सख्त पदानुक्रम (hierarchy) की कल्पना करें।
- नियम 1: कभी किसी व्यक्ति से न टकराएं। (यदि आप इसे तोड़ते हैं, तो खेल खत्म)।
- नियम 2: कभी किसी कार से न टकराएं।
- नियम 3: तेज गति से न चलें।
- नियम 4: आरामदायक सफर सुनिश्चित करें।
- इस तरह, रोबोट जानता है कि सुरक्षा हमेशा प्रगति से ऊपर है। आपको नंबरों का अनुमान लगाने की आवश्यकता नहीं है; नियम स्पष्ट हैं।
5. "कॉन्टेक्स्ट मशीन" (Context Machine)
कॉमन सेंस की कमी को ठीक करने के लिए, वे रिवॉर्ड मशीनों (Reward Machines) का उपयोग करने का सुझाव देते हैं।
- उपमा: इसे एक GPS के रूप में सोचें जो आपके चलते रहने के साथ नियमों को बदलता है।
- जब आप हाईवे पर होते हैं, तो मशीन कहती है, "ठीक है, गति महत्वपूर्ण है।"
- जब आप स्कूल ज़ोन में प्रवेश करते हैं, तो मशीन तुरंत नियमों का एक नया सेट बदल देती है: "रुको! बच्चों को देखो! धीमे हो जाओ!"
- यह रोबोट को स्थिति के अनुसार अपने "स्कोरकार्ड" को अनुकूलित करने की अनुमति देता है, ठीक वैसे ही जैसे एक मानव चालक करता है।
6. गायब सुरक्षा जांच (Safety Check)
अंत में, पेपर एक डरावने अंतर की ओर इशारा करता है: हमारे पास स्वचालित रूप से यह परीक्षण करने का कोई तरीका नहीं है कि स्कोरकार्ड टूटा हुआ है या नहीं।
- वर्तमान में, यदि कोई शोधकर्ता एक नया स्कोरकार्ड डिजाइन करता है, तो उसे मैन्युअल रूप से यह जांचना पड़ता है कि क्या उसका रोबोट मूर्खतापूर्ण चीजें कर रहा है।
- लेखक कहते हैं कि हमें एक "सेफ्टी इंस्पेक्टर" टूल की आवश्यकता है जो स्वचालित रूप से हजारों अजीब परिदृश्यों (जैसे हिरण का अचानक सामने आना, या टायर फटना) को चलाकर देखे कि क्या रोबोट का स्कोरकार्ड सुरक्षित व्यवहार करता है।
निष्कर्ष
पेपर निष्कर्ष निकालता है कि हालांकि 'रीइन्फोर्समेंट लर्निंग' सेल्फ-ड्राइविंग कारों के लिए एक शक्तिशाली उपकरण है, लेकिन वर्तमान में हम उन्हें एक टूटे हुए ग्रेडिंग सिस्टम के साथ सिखा रहे हैं। हमें "सही नंबरों का अनुमान लगाने" से हटकर संरचित नियम पुस्तिकाओं और संदर्भ-जागरूक प्रणालियों की ओर बढ़ने की आवश्यकता है जो यह समझते हैं कि बर्फ़ीले तूफान में गाड़ी चलाना धूप वाले ट्रैक पर गाड़ी चलाने से अलग है। जब तक हम स्कोरकार्ड को ठीक नहीं करते, रोबोट ड्राइवर वास्तव में सुरक्षित नहीं हो पाएगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।