Robust Shielding for Safe Reinforcement Learning
यह शोध पत्र रोबस्ट मार्कोव निर्णय प्रक्रियाओं (Markov decision processes) के लिए एक नवीन, सुदृढ़ और इष्टतम शिल्डिंग फ्रेमवर्क प्रस्तुत करता है जो सैंपलिंग विधियों के साथ संयोजन करते हुए, सीखी गई मॉडलों के लिए प्रोबेबली एप्रोक्सिमेटली करेक्ट (PAC) सुरक्षा गारंटी प्रदान करने के लिए, सबसे खराब स्थिति वाली ट्रांज़िशन अनिश्चितताओं के तहत सुदृढीकरण लर्निंग (reinforcement learning) एजेंटों की सुरक्षा सुनिश्चित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम खेलना सिखा रहे हैं, जैसे पैकमैन (Pac-Man), या कार चलाना। आप चाहते हैं कि रोबोट उच्चतम स्कोर प्राप्त करे या जितनी जल्दी हो सके अपने गंतव्य तक पहुँचे। इसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) कहा जाता है। रोबोट चीज़ों को आज़माकर सीखता है: वह चलता है, देखता है कि क्या होता है, और अच्छे मूव्स के लिए उसे "रिवॉर्ड" (पॉइंट्स) मिलता है या बुरे मूव्स के लिए "पेनल्टी" मिलती है।
समस्या यह है कि सीखने के लिए, रोबोट को एक्सप्लोर (Explore) करना होगा। उसे यह देखने के लिए जोखिम भरे कदम उठाने होंगे कि क्या वे काम करते हैं। लेकिन वास्तविक दुनिया में, एक जोखिम भरा कदम किसी दीवार से टकराने या एक सेल्फ-ड्राइविंग कार का पैदल यात्री से टकराने जैसा हो सकता है। हम रोबोट को ट्रायल और एरर (trial and error) के माध्यम से सीखने नहीं दे सकते यदि उस ट्रायल का परिणाम खतरनाक हो सकता है।
समस्या: वास्तविकता का "ब्लैक बॉक्स"
आमतौर पर, रोबोट को सुरक्षित रखने के लिए, हमें एक "शील्ड" (Shield) की आवश्यकता होती है—एक सुरक्षा गार्ड जो रोबोट को खतरनाक मूव्स करने से रोकता है। लेकिन एक आदर्श शील्ड बनाने के लिए, आपको दुनिया के सटीक नियमों (भौतिकी, यातायात कानून, गेम मैकेनिक्स) को जानना आवश्यक है।
वास्तविक दुनिया में, हम सटीक नियमों को नहीं जानते। हमारे पास केवल पिछले रन या सिम्युलेटर से कुछ डेटा होता है। यदि हम सीमित डेटा के आधार पर नियमों का अनुमान लगाते हैं, तो हम गलत हो सकते हैं। यदि हमारी शील्ड एक गलत अनुमान पर बनी है, तो वह आपदा को रोकने में विफल हो सकती है।
समाधान: "वर्स्ट-केस" (Worst-Case) छाता
यह शोध पत्र एक नए प्रकार की शील्ड पेश करता है जिसे तब उपयोग किया जाता है जब हमें सटीक नियम नहीं पता होते। एक निश्चित सेट के नियमों का अनुमान लगाने के बजाय, लेखक अज्ञात दुनिया को दो खिलाड़ियों के बीच एक खेल के रूप में देखते हैं:
- रोबोट (एजेंट): उच्च स्कोर प्राप्त करने की कोशिश कर रहा है।
- "ग्रिमलिन" (विरोधी/Adversary): एक शरारती शक्ति जो रोबोट के हर मूव के लिए सबसे खराब परिणाम चुनकर उसे विफल करने की कोशिश करती है।
लेखक इसे रोबस्ट MDP (Robust MDP) कहते हैं। इसे इस तरह सोचें:
- पुराना तरीका: "मेरे डेटा के आधार पर, 90% संभावना है कि यह पुल टिकेगा। मैं रोबोट को पार करने दूँगा।" (यदि पुल वास्तव में टूट जाता है, तो रोबोट गिर जाएगा)।
- नया तरीका (यह पेपर): "मुझे नहीं पता कि पुल की सटीक मजबूती क्या है, लेकिन मुझे पता है कि यह 'कमजोर' और 'मजबूत' के बीच कहीं है। मैं एक ऐसी शील्ड बनाऊँगा जो यह मानकर चलेगी कि पुल कमजोर है। यदि रोबोट कमजोर होने पर भी सुरक्षित रूप से पार कर सकता है, तो वह निश्चित रूप से सुरक्षित रहेगा यदि पुल मजबूत है।"
यह कैसे काम करता है: "सेफ्टी बजट"
यह पेपर सेफ्टी बजट (Safety Budget) के एक चतुर तरीके का उपयोग करता है।
कल्पना कीजिए कि रोबोट के पास एक विशेष राशि का "सेफ्टी मनी" वाला वॉलेट है (मान लीजिए $100)। हर बार जब रोबोट एक कदम उठाता है, तो एक सूक्ष्म जोखिम होता है कि वह कुछ पैसे खो सकता है।
- शील्ड हर संभव मूव के लिए पैसे खोने की सबसे खराब स्थिति (worst-case) की गणना करती है।
- यदि किसी मूव में रोबोट के वॉलेट में बचे पैसे से अधिक खर्च होने का जोखिम है, तो शील्ड उस मूव को रोक देती है।
- यदि मूव इतना सुरक्षित है कि वॉलेट को दिवालिया होने से बचा सके, तो शील्ड रोबोट को वह मूव लेने देती है।
यह "वॉलेट" वास्तविक समय में अपडेट होता है। जैसे-जैसे रोबोट दुनिया के बारे में अधिक सीखता है (अधिक डेटा एकत्र करके), "ग्रिमलिन" कम डरावना होता जाता है। अनिश्चितता कम होती जाती है, "वर्स्ट-केस" परिदृश्य कम गंभीर होता जाता है, और रोबोट को उच्च रिवॉर्ड की ओर ले जाने वाले जोखिम भरे मूव्स लेने की अधिक स्वतंत्रता मिलती है।
क्रिया में "शील्ड"
पेपर तीन-चरणीय प्रक्रिया का वर्णन करता है:
- अनिश्चितता को समझना: रोबोट वातावरण से डेटा एकत्र करता है। यह कहने के बजाय कि "गिरने की संभावना 5% है," यह कहता है "गिरने की संभावना 2% और 8% के बीच है।" यह रेंज ही "रोबस्ट" हिस्सा है।
- शील्ड बनाना: इन श्रेणियों का उपयोग करके, शील्ड को यह गारंटी देने के लिए बनाया जाता है कि यदि संभावना डरावनी सीमा (8%) पर भी हो, तो भी सुरक्षा बनी रहे।
- रोबोट को खेलने देना: रोबोट गेम खेलता है। शील्ड हर मूव पर नज़र रखती है। यदि रोबोट कुछ ऐसा करने की कोशिश करता है जो असुरक्षित हो सकता है (भले ही वह केवल सबसे खराब स्थिति में ही असुरक्षित क्यों न हो), तो शील्ड हस्तक्षेप करती है और उसे एक सुरक्षित विकल्प चुनने के लिए मजबूर करती है।
परिणाम: सुरक्षित लेकिन स्मार्ट
लेखकों ने पैकमैन और "कलर बॉम्ब्स" वाले ग्रिड-वर्ल्ड जैसे खेलों पर इसका परीक्षण किया।
- "अनुमान" विधि (पुराना तरीका): यदि आप केवल डेटा के आधार पर नियमों का अनुमान लगाते हैं, तो रोबोट अक्सर भूत या बम से टकरा जाता है क्योंकि आपका अनुमान थोड़ा गलत था।
- "रोबस्ट शील्ड" (नया तरीका):
- शुरुआत में: जब रोबोट के पास बहुत कम डेटा होता है, तो शील्ड बहुत सख्त होती है। यह कहती है "नहीं, तुम वहाँ नहीं जा सकते, यह खतरनाक हो सकता है!" रोबोट बहुत सुरक्षित तरीके से खेलता है लेकिन कम स्कोर प्राप्त करता है।
- जैसे-जैसे डेटा बढ़ता है: जैसे-जैसे रोबोट अधिक सीखता है, "अनिश्चितता की सीमा" छोटी होती जाती है। शील्ड महसूस करती है, "ओह, वह मूव वास्तव में इतना जोखिम भरा नहीं है!" यह अपने नियम ढीले कर देती है।
- परिणाम: रोबोट 100% सुरक्षित रहता है (वह कभी नहीं टकराता) लेकिन अंततः वह लगभग उतना ही अच्छा खेल पाता है जितना कि वह रोबोट जो शुरू से ही सभी नियमों को जानता था।
सारांश उपमा
कल्पना कीजिए कि आप एक बच्चे को साइकिल चलाना सिखा रहे हैं।
- पुराना तरीका: आप बच्चे को कहते हैं, "मुझे लगता है कि सड़क समतल है, इसलिए तेज़ चलो।" यदि सड़क पर कोई छिपा हुआ गड्ढा निकलता है, तो बच्चा गिर जाता है।
- नया तरीका (यह पेपर): आपको नहीं पता कि सड़क समतल है या ऊबड़-खाबड़। इसलिए, आप साइकिल पर ट्रेनिंग व्हील्स (training wheels) लगा देते हैं (शील्ड)। आप बच्चे से कहते हैं, "हम मान लेंगे कि सड़क गड्ढों से भरी है। यदि आप ऊबड़-खाबड़ सड़क पर ट्रेनिंग व्हील्स के साथ सुरक्षित रूप से चल सकते हैं, तो आप सुरक्षित हैं।"
- शुरुआत में, ट्रेनिंग व्हील्स भारी होते हैं, और बच्चा धीरे चलता है।
- लेकिन जैसे-जैसे आप साइकिल को सड़क पर चलाते हैं और महसूस करते हैं कि सड़क वास्तव में चिकनी है, आप धीरे-धीरे ट्रेनिंग व्हील्स हटा देते हैं।
- बच्चा कभी नहीं गिरता (सुरक्षा की गारंटी), लेकिन अंततः, वह लगभग उतनी ही तेज़ी से साइकिल चलाता है जितनी तेज़ी से वह तब चलाता जब उसे पता होता कि सड़क समतल है।
यह पेपर गणितीय रूप से सिद्ध करता है कि यह तरीका काम करता है: यह गारंटी देता है कि रोबोट कुछ भी खतरनाक नहीं करेगा, भले ही हम दुनिया के बारे में अनिश्चित हों, और यह रोबोट को जानकारी एकत्र करने के साथ-साथ कुशल बनने में मदद करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।