Symmetric Behavior Regularized Policy Optimization
यह शोध पत्र सिमेट्रिक बिहेवियर रेगुलराइज्ड पॉलिसी ऑप्टिमाइजेशन (SymBRPO) के लिए एक सार्वभौमिक ढांचे को प्रस्तुत करता है जो पियर्सन-वजडा डाइवर्जेंस के परिमित-श्रृंखला सन्निकटन (finite-series approximation) का उपयोग करके सिमेट्रिक डाइवर्जेंस में क्लोज्ड-फॉर्म समाधानों की कमी और संख्यात्मक अस्थिरता पर विजय प्राप्त करता है, जिससे मजबूत प्रदर्शन प्राप्त होता है और ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) में एसिमेट्रिक रेगुलराइजेशन की सीमाओं को संबोधित किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम खेलना सिखा रहे हैं, लेकिन आप इसे वास्तविक दुनिया में चीजें आजमाकर अभ्यास करने की अनुमति नहीं दे सकते। शायद गेम बहुत महंगा है, बहुत खतरनाक है, या रोबोट पहले से ही टूटा हुआ है। इसके बजाय, आपको इसे एक मानव खिलाड़ी के विशाल वीडियो रिकॉर्डिंग का उपयोग करके सिखाना होगा जिसने पहले ही गेम खेला था। यह "ऑफलाइन रिइन्फोर्समेंट लर्निंग" (offline reinforcement learning) की दुनिया है। रोबोट को इस स्थिर इतिहास से सीखना होगा बिना कोई नया कदम उठाए।
पेचीदा हिस्सा यह है कि रोबोट बहुत लालची हो सकता है। यदि वह वीडियो में एक ऐसा कदम देखता है जो अद्भुत दिखता है, तो वह उसे पूरी तरह से कॉपी करने की कोशिश कर सकता है। लेकिन यदि वह कदम वास्तव में एक मानवीय चूक या गलती थी, तो रोबोट क्रैश हो सकता है और बर्बाद हो सकता है। इसे रोकने के लिए, वैज्ञानिक एक "रेगुलराइज़र" (regularizer) का उपयोग करते हैं। इसे एक हल्के पट्टे (leash) की तरह समझें। यह रोबोट के नए निर्णयों को पुराने मानव की शैली से बांध देता है, जिससे उसे खतरनाक, अनोखे क्षेत्रों में भटकने से रोका जा सके। आमतौर पर, यह पट्टा "असममित" (asymmetric) होता है, जिसका अर्थ है कि यह एक तरफ की तुलना में दूसरी तरफ अधिक जोर से खींचता है। यह एक ऐसे माता-पिता की तरह है जो बाएं जाने के बारे में बहुत सख्त है, लेकिन उसे इस बात की ज्यादा परवाह नहीं है कि आप दाएं जाएं।
लेकिन क्या होगा अगर पट्टा "सममित" (symmetric) हो? क्या होगा अगर यह दोनों दिशाओं में समान रूप से खींचे? यह पेपर एक बड़ा सवाल पूछता है: क्या एक सममित पट्टा वास्तव में बेहतर है? लेखक सुझाव देते हैं कि जबकि पुराना असममित पट्टा मानक रहा है, एक सममित पट्टा कुछ कठिन स्थितियों को—जैसे कि जब रोबोट किसी चट्टान के किनारे पर हो या जब मानव डेटा में अजीब अंतराल हों—कहीं अधिक प्रभावी ढंग से संभाल सकता है। हालाँकि, एक सममित पट्टे का उपयोग करना गणितीय रूप से जटिल है और रोबोट के दिमाग को खराब करने (संख्यात्मक अस्थिरता/numerical instability का कारण बनने) की संभावना रखता है। यह पेपर एक नया, मजबूत ढांचा बनाता है ताकि यह सममित पट्टा बिना कुछ तोड़े काम कर सके।
सममित पट्टे की कहानी (The Story of the Symmetric Leash)
रोबोट लर्निंग की दुनिया में, एक निरंतर खींचतान चलती रहती है। एक तरफ, आप चाहते हैं कि रोबोट स्मार्ट हो और सबसे अच्छे कदम खोजे। दूसरी ओर, आप चाहते हैं कि वह सुरक्षित रहे और जो वह जानता है उसी पर टिका रहे। यह पेपर एक विधि पेश करता है जिसे Symmetric Behavior Regularized Policy Optimization (Sf-AC) कहा जाता है। यह एक फैंसी तरीका है यह कहने का कि: "आइए हम रोबोट को एकतरफा पट्टे के बजाय एक संतुलित, दो-तरफा पट्टे का उपयोग करके सिखाएं।"
पुराना पट्टा थोड़ा असंतुलित क्यों था
लंबे समय तक, वैज्ञानिकों ने एक "असममित" पट्टे (विशेष रूप से, जिसे KL divergence कहा जाता है) का उपयोग किया। कल्पना करें कि आप एक पुराने सांचे में एक नया आकार फिट करने की कोशिश कर रहे हैं। पुराना पट्टा उन चीजों को रोकने में बहुत अच्छा था जो मानव ने कभी नहीं की थीं। लेकिन इसमें एक दोष था: यह उन चीजों को आज़माने से बहुत डरता था जो मानव ने शायद ही कभी की थीं।
लेखकों ने कुछ सरल परीक्षण किए (जैसे कि एक रोबोट जो केवल दो बटनों वाला गेम खेल रहा है) और पाया कि पुराना पट्टा बहुत रूढ़िवादी था। यदि कोई दुर्लभ बटन वास्तव में जीतने वाला कदम था, तो असममित पट्टा उसे दबाने से बहुत डरता था, यह सोचते हुए, "मानव ने इस पर शायद ही कभी हाथ लगाया, इसलिए मुझे भी ऐसा नहीं करना चाहिए!" हालाँकि, नया सममित (symmetric) पट्टा, दुर्लभ अच्छे कदमों के प्रति अधिक सम्मान रखता है। यह केवल इस बात को नहीं देखता कि मानव ने कुछ कितनी बार किया; यह रोबोट के विचार और मानव के इतिहास के बीच के संतुलन को देखता है। उनके परीक्षणों में, इसने रोबोट को बेहतर समाधान तेजी से खोजने में सक्षम बनाया।
चट्टान के किनारे वाली समस्या (The edge-of-the-cliff problem)
एक और समस्या थी जिसके साथ पुराना पट्टा संघर्ष करता था: सीमाएँ (boundaries)। कई खेलों में, आप अपने चरित्र को एक विशिष्ट सीमा के भीतर ही हिला सकते हैं, मान लीजिए -1 से 1 के बीच। यदि रोबोट -1.5 पर जाने की कोशिश करता है, तो गेम इसे काटकर वापस -1 कर देता है। इससे अजीब, विकृत व्यवहार होता है।
लेखकों ने दिखाया कि पुराना असममित पट्टा प्रायिकता द्रव्यमान (probability mass) को किनारे से बाहर "गिराने" (spill) की प्रवृत्ति रखता है। यह एक भरे हुए कप में पानी डालने की तरह है; पानी किनारे से बाहर गिर जाता है, और जब गेम इसे वापस काट देता है, तो रोबोट भ्रमित हो जाता है। नया सममित पट्टा, हालांकि, पानी को कप के अंदर रखने में बहुत बेहतर है। यह दोनों तरफ से किनारे से बाहर गिरने पर दंडित करता है, यह सुनिश्चित करता है कि रोबोट सुरक्षित रूप से अनुमत सीमाओं के भीतर रहे। उनके सिमुलेशन में, इससे रोबोट को पुराने तरीके की तुलना में लगभग दोगुना रिवॉर्ड मिला क्योंकि उसने अवैध चालों पर समय बर्बाद नहीं किया।
गणितीय उलझन और जादुई समाधान
यहाँ एक पेच है: सममित पट्टे (Symmetric leashes) उपयोग करने में बेहद कठिन होते हैं। जब आप एक सममित पट्टे के लिए सटीक गणित लिखने की कोशिश करते हैं, तो समीकरण इतने जटिल हो जाते हैं कि आप उन्हें आसानी से हल नहीं कर सकते। यह एक ऐसे पहेली को हल करने जैसा है जहाँ उसके टुकड़े लगातार अपना आकार बदलते रहते हैं। इसके अलावा, यदि आप कंप्यूटर पर उनकी गणना करने का प्रयास करते हैं, तो संख्याएं इतनी बड़ी या इतनी छोटी हो सकती हैं कि कंप्यूटर क्रैश हो जाता है (जिसे संख्यात्मक अस्थिरता कहा जाता है)।
इस पेपर की बड़ी सफलता एक चतुर गणितीय ट्रिक है। लेखकों ने महसूस किया कि किसी भी जटिल सममित पट्टे को सरल टुकड़ों (जिन्हें Pearson-Vajda divergences कहा जाता है) की एक लंबी, अनंत श्रृंखला में तोड़ा जा सकता है। असंभव अनंत पहेली को हल करने के बजाय, उन्होंने दिखाया कि आपको लगभग सटीक परिणाम प्राप्त करने के लिए केवल पहले कुछ टुकड़ों (एक परिमित श्रृंखला) का उपयोग करने की आवश्यकता है।
श्रृंखला को जल्दी काटने से, वे निम्नलिखित में सक्षम हुए:
- एक स्पष्ट सूत्र ढूँढना: उन्होंने रोबोट की सर्वोत्तम नीति के लिए एक साफ, क्लोज्ड-फॉर्म अभिव्यक्ति (closed-form expression) निकाली, जिसका अर्थ है कि रोबोट को अनुमान लगाने के बिना पता है कि क्या करना है।
- कंप्यूटर को क्रैश होने से रोकना: उन्होंने लॉस (loss) की गणना करने का एक नया, स्थिर तरीका बनाया, जिससे पिछले प्रयासों में होने वाले संख्यात्मक विस्फोटों से बचा जा सका।
- यह साबित करना कि यह पर्याप्त है: उन्होंने गणितीय रूप से सिद्ध किया कि उनका "छोटा" संस्करण "पूर्ण" अनंत संस्करण के अविश्वसनीय रूप से करीब है, जिसमें त्रुटि इतनी कम है कि वह व्यावहारिक रूप से शून्य है।
क्या यह वास्तव में काम करता है?
लेखक केवल गणित तक ही सीमित नहीं रहे। उन्होंने अपने नए तरीके का परीक्षण किया, जिसे वे Symmetric f-Actor-Critic (Sf-AC) कहते हैं, D4RL नामक रोबोट लर्निंग के एक प्रसिद्ध बेंचमार्क सेट पर किया। इन बेंचमार्क में रोबोट कुत्ते का चलना सीखने, हाथ से पेन उठाने, या भूलभुलैया सुलझाने वाले रोबोट जैसे कार्य शामिल हैं।
परिणाम प्रभावशाली थे। अधिकांश कार्यों में, नया सममित तरीका मौजूदा सर्वोत्तम तरीकों के बराबर या उनसे बेहतर प्रदर्शन करता है। यह विशेष रूप से उन "किनारे" (edge) के मामलों को संभालने में अच्छा था जहाँ अन्य रोबोट संघर्ष करते थे। लेखकों ने यह भी जांचा कि उनके गणितीय ट्रिक में उपयोग किए गए टुकड़ों की संख्या के प्रति उनका तरीका कितना संवेदनशील है। उन्होंने पाया कि केवल कुछ टुकड़ों (2 से 6 के बीच) के साथ भी, रोबोट लगातार अच्छा प्रदर्शन करता है, जो यह दर्शाता है कि यह विधि मजबूत है और इसे काम करने के लिए अत्यधिक जटिल होने की आवश्यकता नहीं है।
उन्होंने क्या खारिज किया
यह ध्यान रखना महत्वपूर्ण है कि पेपर क्या कहता है जो काम नहीं करता है। लेखकों ने स्पष्ट रूप से रोबोट के लक्ष्य के लिए एक सममित पट्टे और मानव के इतिहास के लिए एक असममित पट्टे का उपयोग करने की वर्तमान लोकप्रिय प्रथा के खिलाफ तर्क दिया। उन्होंने गणित और उदाहरणों के माध्यम से दिखाया कि इन दो प्रकार के पट्टों को मिलाने से एक "ज्यामितीय बेमेल" (geometry mismatch) पैदा होता है। यह एक चौकोर छेद में गोल खूंटी डालने जैसा है; रोबक किस दिशा में जाना है, इसे लेकर भ्रमित हो जाता है, जिससे उप-इष्टतम (suboptimal) प्रदर्शन होता। उनका पेपर सिद्ध करता है कि यदि आप सममित दृष्टिकोण का उपयोग करना चाहते हैं, तो आपको पट्टे और लक्ष्य दोनों के लिए इसका उपयोग करना होगा।
वे कितने आश्वस्त हैं?
लेखक अपने गणितीय प्रमाणों में बहुत आश्वस्त हैं। उन्होंने केवल यह अनुमान नहीं लगाया कि श्रृंखला सन्निकटन (series approximation) काम करता है; उन्होंने इसे उन प्रमेयों (theorems) के साथ सिद्ध किया जो दिखाते हैं कि त्रुटि कितनी कम है। अपने प्रयोगों में, उन्होंने हजारों चरणों के माध्यम से रोबोट का परीक्षण किया और परिणामों को सुनिश्चित करने के लिए कई प्रयासों (seeds) पर औसत निकाला कि परिणाम केवल किस्मत नहीं थे। हालांकि उन्होंने यह दावा नहीं किया कि उन्होंने ऑफलाइन लर्निंग को हमेशा के लिए "हल" कर दिया है, उन्होंने प्रदर्शित किया कि उनका सममित दृष्टिकोण एक शक्तिशाली, स्थिर और अक्सर बेहतर विकल्प है, विशेष रूप से कठिन सीमाओं या पक्षपाती डेटा के मामले में।
संक्षेप में, यह पेपर एक अव्यवस्थित, कठिन विचार (सममित रेगुलराइजेशन) को एक चतुर गणितीय शॉर्टकट के साथ नियंत्रित करता है। परिणाम एक ऐसा रोबोट लर्निंग तरीका है जो अधिक संतुलित, अधिक स्थिर और अक्सर उन उपकरणों की तुलना में अधिक स्मार्ट है जिनका हम वर्षों से उपयोग कर रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।