Provably Safe, Yet Scalable Reinforcement Learning
यह शोध पत्र PS2-RL को प्रस्तुत करता है, जो एक नवीन दो-चरणीय ढांचा (two-phase framework) है जो एक सीखे हुए बैकअप पॉलिसी को ऑनलाइन स्पष्ट रूप से नियंत्रण-अपरिवर्तनीय सेट (control-invariant sets) उत्पन्न करने के लिए प्रशिक्षित करके सिद्ध रूप से सुरक्षित और स्केलेबल सुदृढीकरण लर्निंग (reinforcement learning) प्राप्त करता है, जिन्हें अंतर्निहित RL एल्गोरिदम को प्रतिबंधित किए बिना एक विभेदक प्रक्षेपण परत (differentiable projection layer) के माध्यम से लागू किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "प्रूवेबली सेफ, येट स्केलेबल रीइन्फोर्समेंट लर्निंग" (PS2-RL) का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।
बड़ी समस्या: "जंगली बच्चा" बनाम "सख्त संरक्षक"
कल्पना कीजिए कि आप एक रोबोट (या खुद चलने वाली कार) को एक कठिन कार्य करना सिखा रहे हैं, जैसे कि एक ट्रैक के चारों ओर रेस कार चलाना या तूफान में ड्रोन उड़ाना। आप चाहते हैं कि रोबोट तेज़ और कुशल हो (उच्च प्रदर्शन), लेकिन आपको यह भी सुनिश्चित करना होगा कि वह 100% सुरक्षित हो (कभी टकराए नहीं या दीवार से न भिड़े)।
- "जंगली बच्चा" (स्टैंडर्ड AI): वर्तमान AI विधियाँ जंगली बच्चों की तरह हैं। वे प्रयास और त्रुटि (trial and error) से सीखते हैं। वे कार्य में बहुत अच्छे हो जाते हैं, लेकिन वे गलती से टकरा सकते हैं क्योंकि उन्हें भौतिकी (physics) के नियमों के बारे में औपचारिक रूप से नहीं सिखाया गया है। वे "अनुभवजन्य रूप से सुरक्षित" (अभी तक नहीं टकराए हैं) हैं, लेकिन इस बात की कोई गारंटी नहीं है कि वे कल नहीं टकराएंगे।
- "सख्त संरक्षक" (पुरानी सुरक्षा विधियाँ): अन्य विधियाँ रोबोट के चारों ओर एक कठोर पिंजरा बनाकर सुरक्षा लागू करने की कोशिश करती हैं। वे पहले से ही हर संभावित सुरक्षित पथ की गणना करती हैं। समस्या यह है कि जटिल रोबोटों (जैसे 10-डायमेंशनल ड्रोन) के लिए, इस पिंजरे की गणना करने में बहुत समय लगता है। इसे काम करने लायक बनाने के लिए, वे पिंजरे को इतना छोटा और रूढ़िवादी बना देते हैं कि रोबोट मुश्किल से हिल पाता है। यह सुरक्षित है, लेकिन यह बेकार है क्योंकि यह बहुत धीमा और सख्त है।
लक्ष्य: हमें एक ऐसा रोबोट चाहिए जो "जंगली बच्चे" की तरह कुशल हो लेकिन "सख्त संरक्षक" की तरह सुरक्षित भी हो, बिना उस धीमे और कठोर पिंजरे के।
समाधान: PS2-RL ("दो-चरणों वाली" टीम)
लेखक PS2-RL नामक एक नया फ्रेमवर्क प्रस्तावित करते हैं। इसे एक दो-सदस्यीय टीम के रूप में सोचें जो मिलकर काम कर रही है: एक रिकवरी एक्सपर्ट (बचाव विशेषज्ञ) और एक परफॉर्मेंस एथलीट (प्रदर्शन एथलीट)।
चरण 1: "रिकवरी एक्सपर्ट" को प्रशिक्षित करना (बैकअप प्लान)
मुख्य कार्य करने से पहले, रोबोट पहले एक "बैकअप प्लान" सीखता है।
- उपमा: कल्पना कीजिए कि एक जिम्नास्ट सुरक्षित रूप से गिरना सीख रहा है। यदि वह फिसल जाता है, तो उसे पता होता है कि अपने पैरों पर लैंड करने और लुढ़कना रोकने के लिए अपने शरीर को कैसे घुमाना है।
- यह कैसे काम करता है: AI एक "सेफ-अराइवल पॉलिसी" सीखता है। यह रेस जीतने के बारे में नहीं है; यह कहीं से भी सुरक्षित क्षेत्र से वापस एक छोटे, अत्यंत सुरक्षित "होम बेस" (जैसे पार्किंग स्पॉट) तक रोबोट को वापस ले जाने के बारे में है बिना किसी चीज़ से टकराए।
- नवाचार: पुरानी विधियों ने इसके लिए सरल, पूर्व-लिखित गणितीय सूत्रों (जैसे एक बेसिक LQR कंट्रोलर) का उपयोग किया था। यह पेपर एक स्मार्ट रिकवरी प्लान सीखने के लिए AI का उपयोग करता है। यह रोबोट को पहले की तुलना में बहुत अधिक खतरनाक स्थितियों से उबरने में सक्षम बनाता है, जिससे "सेफ ज़ोन" प्रभावी रूप से बहुत बड़ा हो जाता है।
चरण 2: "परफॉर्मेंस एथलीट" को प्रशिक्षित करना (मुख्य कार्य)
अब जब रोबोट के पास एक सुपर-स्मार्ट बैकअप प्लान है, तो हम इसे वास्तविक काम (जैसे लूप-द-लूप उड़ाना) करने के लिए प्रशिक्षित करते हैं।
- उपमा: एक फॉर्मूला 1 ड्राइवर की कल्पना करें। उन्हें जितना चाहें उतना तेज़ और आक्रामक रूप से गाड़ी चलाने की अनुमति है, लेकिन उनके स्टीयरिंग व्हील से एक "सेफ्टी फ़िल्टर" जुड़ा हुआ है।
- यह कैसे काम करता है: AI तेज़ी से चलाने की कोशिश करता है। यदि वह ऐसा कदम उठाने की कोशिश करता है जिससे दुर्घटना हो सकती है, तो कंट्रोल-इनवेरिएंट लेयर (सेफ्टी फ़िल्टर) तुरंत उस कमांड को रोक देता है। यह कार को रोकता नहीं है; यह बस स्टीयरिंग को थोड़े से सुरक्षित कोण की ओर मोड़ देता है जो कार को ट्रैक पर बनाए रखे।
- जादू: क्योंकि यह फ़िल्टर "डिफरेंशिएबल" (गणितीय रूप से सुचारू) है, इसलिए AI इसके माध्यम से सीख सकता है। AI सीखता है कि "यदि मैं यहाँ बहुत ज़ोर से मुड़ता हूँ, तो फ़िल्टर मुझे ठीक कर देगा, और मैं समय खो दूँगा।" इसलिए, AI सुरक्षा की सीमा के बिल्कुल करीब तक गाड़ी चलाना सीखता है बिना उसे पार किए, जिससे गति को अधिकतम करते हुए सुरक्षा बनी रहती है।
यह एक बड़ी बात क्यों है?
1. यह स्केल करता है (यह बड़े, जटिल रोबोटों के लिए काम करता है)
पुरानी सुरक्षा विधियाँ रोबोट के चलने से पहले ही पूरे "सुरक्षित ब्रह्मांड" का मानचित्र बनाने की कोशिश करती थीं। 10 गतिशील भागों वाले रोबोट (जैसे स्थिति, गति और रोटेशन वाला ड्रोन) के लिए, यह चंद्रमा के आकार के शहर में हर संभव रास्ते का नक्शा बनाने जैसा है। यह असंभव है।
- PS2-RL की ट्रिक: पूरे शहर का नक्शा बनाने के बजाय, यह बस पूछता है, "यदि मैं इस दिशा में जाता हूँ, तो क्या मेरा बैकअप एक्सपर्ट मुझे घर पहुँचा पाएगा?" यह इसे चलते समय (on the fly) गणना करता है। यह इसे जटिल, उच्च-आयामी रोबोटों के लिए पर्याप्त तेज़ बनाता है।
2. यह "प्रूवेबली सेफ" है (कोई अनुमान नहीं)
कई AI सुरक्षा विधियाँ कहती हैं, "हमें लगता है कि यह सुरक्षित है।" PS2-RL कहता है, "हम जानते हैं कि यह सुरक्षित है।"
- गारंटी: क्योंकि सिस्टम एक गणितीय आधार (बैकअप कंट्रोल बैरियर फंक्शन्स) पर बनाया गया है, लेखक यह गणितीय रूप से सिद्ध कर सकते हैं कि जब तक रोबोट एक सुरक्षित स्थान से शुरू होता है, वह कभी भी सुरक्षित क्षेत्र को नहीं छोड़ेगा, चाहे कार्य कितना भी पागलपन भरा क्यों न हो।
3. यह रूढ़िवादी नहीं है (यह पीछे नहीं हटता)
चूंकि "रिकवरी एक्सपर्ट" ने घर पहुँचने का एक स्मार्ट तरीका सीखा है, इसलिए "सेफ्टी फ़िल्टर" को बहुत सख्त होने की आवश्यकता नहीं है। रोबोट जोखिम ले सकता है और आक्रामक रूप से गाड़ी चला सकता है क्योंकि वह जानता है कि उसके पास पहले की तुलना में बेहतर सुरक्षा जाल है।
परिणाम: प्रयोग
लेखकों ने दो परिदृश्यों पर इसका परीक्षण किया:
- एक यूनिसाइकिल (लेन कीपिंग): एक सरल रोबोट जो एक टेढ़े-मेढ़े पथ का पालन करते हुए लेन में रहने की कोशिश कर रहा है जो लेन के बाहर जाता है।
- परिणाम: PS2-RL 100% समय लेन में रहा और अन्य विधियों की तुलना में पथ का बहुत बेहतर ढंग से अनुसरण किया।
- एक क्वाड्रोटर (ड्रोन पावरलूप): एक 10-डायमेंशनल ड्रोन जो एक वर्टिकल लूप करने की कोशिश कर रहा है, जहाँ लूप का ऊपरी हिस्सा एक "सीलिंग" (छत) के बहुत करीब है जिससे उसे टकराना नहीं चाहिए।
- परिणाम: यह एक बहुत कठिन कार्य है। अन्य विधियाँ या तो टकरा गईं या सुरक्षित रहने के लिए बहुत धीरे उड़ीं। PS2-RL ने लूप को पूरी तरह से पूरा किया, छत के नीचे 100% समय रहा, और अगली सबसे अच्छी विधि की तुलना में काफी तेज़ और सटीक था।
सारांश
PS2-RL एक रेस कार ड्राइवर को एक स्मार्ट को-पायलट देने जैसा है। ड्राइवर (AI) दौड़ जीतने के लिए कार को उसकी सीमा तक धकेलता है। को-पायलट (सीखा हुआ बैकअप पॉलिसी) सड़क को देखता है और यदि ड्राइवर किनारे के बहुत करीब आता है, तो तुरंत कार को सुरक्षा की ओर वापस मोड़ देता है। परिणाम एक ऐसी कार है जो तेज़ भी है और जिसे क्रैश न होने की गारंटी भी है, भले ही वह ऐसे ट्रैक पर हो जिसे कोई और चलाने की हिम्मत न कर सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।