Shaping Sparse Rewards in Reinforcement Learning: A Semi-supervised Approach
यह शोध पत्र एक अर्ध-पर्यवेक्षित (semi-supervised) रिवॉर्ड शेपिंग दृष्टिकोण प्रस्तावित करता है जो ट्रजेक्टरी रिप्रजेंटेशन सीखने के लिए नवीन डेटा ऑग्मेंटेशन के माध्यम से गैर-शून्य और शून्य-रिवॉर्ड ट्रांज़िशन का लाभ उठाता है, जो एटाारी (Atari) और रोबोटिक मैनिपुलेशन जैसे विरल-रिवॉर्ड (sparse-reward) वातावरण में पर्यवेक्षित बेसलाइनों से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम खेलना सिखा रहे हैं, जैसे कि Montezuma's Revenge या Seaquest। इन खेलों में, रोबोट को "थम्स अप" (एक इनाम) तभी मिलता है जब वह कुछ बहुत विशिष्ट करता है, जैसे किसी गोताखोर को बचाना या लक्ष्य तक पहुँचना। 99% समय, रोबोट बस इधर-उधर घूम रहा होता है, और गेम उसे शून्य फीडबैक देता है। यह साइकिल चलाना सीखने जैसा है, जहाँ आपको केवल तभी "अच्छा काम किया" कहा जाता है जब आप पूरे एक मिनट तक बिना गिरे खड़े रहने में सफल होते हैं, लेकिन आपको इस बात का कोई संकेत नहीं मिलता कि आप कब लड़खड़ा रहे थे या कब गिरने वाले थे।
यह स्पार्स रिवॉर्ड प्रॉब्लम (Sparse Reward Problem) है। क्योंकि रोबोट को बहुत कम बार "अच्छा काम किया" सुनने को मिलता है, इसलिए उसे यह समझने में संघर्ष करना पड़ता है कि वह क्या सही कर रहा है।
पुराना तरीका: अनुमान लगाना और जांचना
पारंपरिक रूप से, शोधकर्ताओं ने एक मानव शिक्षक द्वारा रोबोट को देखने और यह कहने की कोशिश की कि "हे, वह चाल अच्छी थी!" या एक कंप्यूटर प्रोग्राम का उपयोग किया जो केवल उन दुर्लभ क्षणों से सीखता था जब रोबोट वास्तव में सफल हुआ था।
- समस्या: यह एक भाषा सीखने जैसा है जहाँ आप केवल उन शब्दों के डिक्शनरी एंट्री पढ़ रहे हैं जिन्हें आप पहले से जानते हैं। यदि आप केवल उन कुछ मौकों का अध्ययन करते हैं जब आपको "थम्स अप" मिला था, तो आपके पास खेल के नियमों को सीखने के लिए पर्याप्त डेटा नहीं होगा।
नया विचार: "सेमी-सुपरवाइज्ड" जासूस
इस पेपर के लेखक एक नई विधि प्रस्तावित करते हैं जिसे SSRS (सेमी-सुपरवाइज्ड रिवॉर्ड शेपिंग) कहा जाता है। इसे एक ऐसे जासूस को काम पर रखने की तरह समझें जो शब्दों के बीच के अर्थ पढ़ने में बहुत कुशल है।
यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:
1. संकेतों के दो प्रकार
- "गोल्ड" (Gold) संकेत: ये वे दुर्लभ क्षण हैं जब रोबोट को वास्तविक इनाम (एक "थम्स अप") मिलता है।
- "साइलेंट" (Silent) संकेत: ये वे लाखों क्षण हैं जहाँ रोबोट को शून्य इनाम मिलता है।
- पुराना दृष्टिकोण: केवल "गोल्ड" संकेतों को देखता था।
- SSRS दृष्टिकोण: दोनों को देखता है। यह मानता है कि भले ही रोबोट को शून्य अंक मिल रहे हों, फिर भी वह कुछ "ठीक" या "लगभग सही" कर रहा होगा।
2. जासूस का तर्क (सेमी-सुपरवाइज्ड लर्निंग)
जासूस (AI मॉडल) यह सीखने के लिए "गोल्ड" संकेतों को देखता है कि एक "अच्छा" मूव कैसा दिखता है। फिर, वह "साइलेंट" संकेतों को देखता है। वह पूछता है: "यह साइलेंट मूव उस 'गोल्ड' मूव जैसा दिखता है जो मैंने पहले देखा था। शायद इसे भी एक छोटा सा 'अच्छा काम किया' मिलना चाहिए?"
यह कंसिस्टेंसी रेगुलराइजेशन (Consistency Regularization) नामक तकनीक का उपयोग करता है। कल्पना कीजिए कि आप जासूस को बिल्ली की एक तस्वीर दिखाते हैं, लेकिन आप उसे थोड़ा धुंधला कर देते हैं या रोशनी बदल देते हैं। जासूस को अभी भी कहना चाहिए, "यह एक बिल्ली है।" यदि वह कहता है, "यह एक कुत्ता है," तो वह भ्रमित है।
- इस पेपर में, वे रोबोट के पथ (मूव्स का एक क्रम) को लेते हैं, उसमें थोड़ा बदलाव करते हैं (जैसे फोटो को धुंधला करना), और पूछते हैं कि क्या इनाम अभी भी वही रहना चाहिए। यदि उत्तर सुसंगत (consistent) है, तो जासूस अपने स्वयं के निर्णय पर भरोसा करना सीख जाता है।
3. सीक्रेट सॉस: "एंट्रॉपी ऑग्मेंटेशन" (Entropy Augmentation)
आमतौर पर, जब आप डेटा को जासूस के लिए बदलते हैं, तो आप उसे उल्टा कर सकते हैं या उसका एक हिस्सा काट सकते हैं (जैसे फोटो एडिट करना)। लेकिन यह पेपर एक चतुर नई तकनीक पेश करता है जिसे एंट्रॉपी ऑग्मेंटेशन कहा जाता है।
- उपमा: कल्पना कीजिए कि रोबोट का पथ एक गाना है। "एंट्रॉपी" इस बात का माप है कि वह गाना कितना अराजक (chaotic) या अनुमानित है।
- गाने को उल्टा करने के बजाय, जासूस गाने के "अराजक स्वरूप" (chaos) का विश्लेषण करता है। यदि एक अराजक पथ अचानक अधिक व्यवस्थित हो जाता है, तो वह एक संकेत है!
- लेखकों ने पाया कि इस विशेष प्रकार के रोबोट लर्निंग के लिए डेटा को बदलने का एक बेहतर तरीका सामान्य फोटो-एडिटिंग ट्रिक्स की तुलना में यह "अराजकता" (entropy) को मापना था। इसने जासूस को खेल के नियमों को तोड़े बिना रोबोट के पथ को समझने में मदद की।
परिणाम: एक बड़ी जीत
शोधकर्ताओं ने इसका परीक्षण इन पर किया:
- अटारी गेम्स (Atari Games): क्लासिक वीडियो गेम जहाँ इनाम बहुत दुर्लभ होते हैं।
- रोबोटिक्स: एक रोबोटिक हाथ जो ब्लॉक पकड़ने की कोशिश कर रहा है।
परिणाम:
- नया तरीका (SSRS) पुराने तरीकों की तुलना में बहुत तेज़ी से सीखा और उच्च स्कोर प्राप्त किया।
- सबसे कठिन खेलों (जैसे Montezuma's Revenge) में, नए तरीके ने पिछले सर्वोत्तम तरीकों की तुलना में दोगुना स्कोर हासिल किया।
- केवल "एंट्रॉपी" ट्रिक ने डेटा को बदलने के अन्य तरीकों की तुलना में प्रदर्शन को लगभग 15% बढ़ा दिया।
यह क्यों मायने रखता है
पेपर का दावा है कि "साइलेंट" क्षणों (शून्य इनाम) को खाली स्थान के बजाय मूल्यवान डेटा के रूप में मानकर, और इस नए "अराजकता-मापने" वाले तरीके का उपयोग करके, हम रोबोट और गेम-प्लेइंग एजेंटों को बहुत अधिक कुशलता से सिखा सकते हैं। यह एक ऐसे अंधेरे कमरे में जाने जैसा है जहाँ आप केवल कुछ चमकते बिंदुओं को देखते हैं, और फिर आप पूरे मानचित्र को देख पाते हैं क्योंकि आपने छायाओं की व्याख्या करना सीख लिया है।
संक्षेप में: यह पेपर AI को केवल "गोल्ड स्टार" मिलने का इंतज़ार करने के बजाय, बीच के शांत क्षणों से भी सीखना सिखाता है, और यह सुनिश्चित करने के लिए एक विशेष गणितीय ट्रिक का उपयोग करता है कि वह भ्रमित न हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।