Retry Policy Gradients in Continuous Action Spaces
यह शोध पत्र पाथवाइज डेरिवेटिव एस्टिमेटर्स (pathwise derivative estimators) को पेश करके निरंतर एक्शन स्पेस (continuous action spaces) के लिए ReMax रिट्राई-आधारित ऑब्जेक्टिव का विस्तार करता है, जिसके परिणामस्वरूप ReMAC एल्गोरिदम प्राप्त होता है जो पॉलिसी-ग्रेडिएंट लैंडस्केप को नया आकार देकर स्टोकेस्टिक एक्सप्लोरेशन को बढ़ावा देता है और स्पष्ट एंट्रॉपी रेगुलराइजेशन के बिना SAC-तुलनीय प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कमरे के आर-पार चलना सिखा रहे हैं। रोबोट की आँखों पर पट्टी बंधी है और वह केवल अंदाज़ा लगा सकता है कि उसे कहाँ कदम रखना है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) कहा जाता है। रोबोट अलग-अलग चालें चलता है, अच्छा करने पर उसे एक "स्कोर" (इनाम) मिलता है, और वह अपनी गलतियों से सीखता है।
बड़ी समस्या एक्सप्लोरेशन (Exploration) की है: आप रोबोट को नई चीज़ें आज़माने के लिए कैसे प्रेरित करेंगे, बजाय इसके कि वह बस वही पुराने, सुरक्षित और उबाऊ कदमों को दोहराता रहे?
पुराना तरीका: "नॉइज़" (Noise) जोड़ना
परंपरागत रूप से, रोबोट को एक्सप्लोर करने के लिए वैज्ञानिक उसके दिमाग में थोड़ा सा "नॉइज़" या रैंडमनेस (यादृच्छिकता) जोड़ देते हैं। यह ऐसा ही है जैसे रोबोट को कहना, "हे, कभी-कभी बस अपने पैरों को बेतरतीब ढंग से हिलाओ!" यह काम तो करता है, लेकिन यह एक व्यंजन में मसाला डालने जैसा है जिसे आपको सावधानी से मापना होता है और अंततः हटाना भी पड़ता है, अन्यथा व्यंजन का स्वाद बिगड़ सकता है।
नया विचार: "रिट्राय" (Retry) रणनीति
यह पेपर रोबोट को सिखाने का एक नया तरीका पेश करता है, जिसे ReMax ("रिट्राय मैक्सिमम") कहा जाता है।
रोबोट को रैंडम होने के लिए कहने के बजाय, ReMax खेल के नियम बदल देता है। कल्पना कीजिए कि आप एक परीक्षा दे रहे हैं।
- पुराना तरीका: आपको एक सवाल का जवाब देने के लिए एक ही मौका मिलता है। आप अपना सबसे अच्छा अंदाज़ा चुनते हैं, और वही आपका स्कोर होता है।
- ReMax का तरीका: आपको उसी सवाल के लिए M बार (मान लीजिए 4 या 8 बार) परीक्षा देने का मौका मिलता है। आप सभी 8 जवाब लिखते हैं, उनमें से सबसे अच्छे वाले को चुनते हैं, और वही आपका स्कोर होता है।
रोबोट यह सीखता है कि यदि वह अपने विकल्पों को खुला रखता है (यानी थोड़ा "स्टोकेस्टिक" या परिवर्तनशील रहता है), तो उसके पास कई कोशिशों में से एक बेहतरीन जवाब ढूंढने की बेहतर संभावना होती है। उसे किसी विशेष "नॉइज़" निर्देश की आवश्यकता नहीं है; कई कोशिशों में से सर्वश्रेष्ठ को खोजने की इच्छा स्वाभाविक रूप से उसे एक्सप्लोर करने के लिए मजबूर करती है।
निरंतर स्पेस (Continuous Spaces) में क्या होता है?
यह पेपर कंटीन्यूअस एक्शन स्पेस पर ध्यान केंद्रित करता है, जो एक फैंसी तरीका है यह कहने का कि रोबट अपने जोड़ों को किसी भी कोण (angle) पर घुमा सकता है, न कि केवल "बाएँ" या "दाएँ"।
लेखकों ने खोजा कि यह "रिट्राय" रणनीति रोबोट के सीखने के रास्ते को कैसे बदल देती है:
- "पुश" (दिशा): जब रोबोट लक्ष्य से दूर होता है और बहुत सख्त (कम रैंडमनेस के साथ) चल रहा होता है, तो "रिट्राय" रणनीति का गणित स्वाभाविक रूप से उसे अधिक रैंडम बनने के लिए धकेलता है। यह ऐसा है जैसे रोबोट को एहसास होता है, "मैं एक कोने में फंस गया हूँ; मुझे बाहर निकलने का रास्ता खोजने के लिए अधिक हिलना-डुलना होगा।"
- "ब्रेक" (परिमाण): जब रोबोट एकदम सही समाधान के करीब होता है, तो "रिट्राय" रणनीति एक हल्के ब्रेक की तरह काम करती है। यह सीखने की गति को धीमा कर देती है। यह अच्छा है क्योंकि यह रोबोट को एकदम सही जगह से आगे निकल जाने या ओवरशूट करने से रोकता है। यह उसे सेटल होने से पहले थोड़ा और एक्सप्लोर करने के लिए बनाए रखता है।
"ReMAC" रोबोट
लेखकों ने इस परीक्षण के लिए एक विशिष्ट रोबोट मस्तिष्क बनाया जिसे ReMAC (ReMax Actor-Critic) कहा जाता है। उन्होंने एक मानक, अत्यधिक सफल रोबोट मस्तिष्क (जिसे SAC कहा जाता है) को लिया और बस उसके "नॉइज़" निर्देशों को "रिट्राय" निर्देशों से बदल दिया।
परिणाम:
- प्रदर्शन: ReMAC रोबोट ने दुनिया के बेहतरीन रोबोट्स (SAC) की तरह ही चलना सीखा।
- एक्सप्लोरेशन: बिना किसी अतिरिक्त "नॉइज़" मसाले के, ReMAC रोबोट ने स्वाभाविक रूप से अपने आंदोलनों को लंबे समय तक अधिक विविध (उच्च एंट्रॉपी) बनाए रखा, ठीक वैसा ही जैसा सिद्धांत भविष्यवाणी करता है।
- चुनौती: "रिट्राय" विधि के लिए रोबोट को एक साथ कई परिणामों का सिमुलेशन करना पड़ता है, जिसके लिए थोड़े अधिक कंप्यूटर पावर की आवश्यकता होती है।
एडम ऑप्टिमाइज़र (Adam Optimizer) का ट्विस्ट
पेपर में यह भी देखा गया कि रोबोट को प्रशिक्षित करने वाला कंप्यूटर टूल (जिसे Adam कहा जाता है) में एक छोटा सा सेटिंग (एक "स्टेबिलाइजेशन पैरामीटर") होता है जो एक वॉल्यूम नॉब की तरह काम करता है।
- यदि नॉब को कम पर सेट किया जाता है, तो "रिट्राय" रणनीति का "ब्रेकिंग" प्रभाव कमजोर हो जाता है, और रोबोट तेजी से सीखता है लेकिन बहुत जल्दी सेटल हो सकता है।
- यदि नॉब को उच्च पर सेट किया जाता है, तो ब्रेकिंग प्रभाव अधिक मजबूत होता है, जिससे रोबोट लंबे समय तक एक्सप्लोर करता रहता है।
संक्षेप में
यह पेपर दिखाता है कि आपको शोर (noise) जोड़कर AI को रैंडम होने के लिए मजबूर करने की आवश्यकता नहीं है। इसके बजाय, यदि आप AI को कई प्रयासों में से सर्वश्रेष्ठ के लिए अनुकूलित (optimize) करना सिखाते हैं, तो वह स्वाभाविक रूप से समझ जाता है कि सर्वश्रेष्ठ समाधान खोजने के लिए थोड़ा अप्रत्याशित होना ही सबसे स्मार्ट तरीका है। यह बिना किसी अतिरिक्त नियमों के जिज्ञासा को प्रोत्साहित करने का एक चतुर, अंतर्निहित तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।