Gated Q-learning: Add Off-Policy Bias to Taste
गेटेड Q-लर्निंग एक नवीन गेटिंग तंत्र पेश करके सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) में ऑफ-पॉलिसी बायस और क्रेडिट-असाइनमेंट लेंथ के बीच लंबे समय से चले आ रहे समझौते को हल करता है, जो वॉटकिन्स (Watkins) और पेंग (Peng) के Q() चरम सीमाओं के बीच सहजता से इंटरपोलेट करने में सक्षम है, जिससे इम्पोर्टेंस सैंपलिंग पर निर्भर किए बिना नियंत्रित बायस के साथ तेज़ शिक्षण संभव होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को भूलभुलैया (maze) में खजाना खोजने के लिए प्रशिक्षित कर रहे हैं। रोबोट चीज़ों को आज़माकर सीखता है: वह चलता है, दीवारों से टकराता है, बंद रास्तों पर पहुँचता है, और कभी-कभी उसे सोना मिल जाता है। इस प्रक्रिया को रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) कहा जाता है। रोबोट का लक्ष्य यह पता लगाना है कि कौन सी चालें समय के साथ सबसे अधिक खजाना दिलाती हैं। इसका एक महत्वपूर्ण हिस्सा है क्रेडिट असाइनमेंट (Credit Assignment): यह समझना कि एक लंबी यात्रा में कौन से विशिष्ट कदम वास्तव में अंतिम इनाम के लिए जिम्मेदार थे। क्या रोबोट को सोना इसलिए मिला क्योंकि उसने आखिरी मोड़ लिया था, या इसलिए क्योंकि उसने दस मिनट पहले कोई समझदारी भरा कदम उठाया था?
तेजी से सीखने के लिए, रोबोट अक्सर एक ट्रिक का उपयोग करते हैं जिसे Q-लर्निंग (Q-learning) कहा जाता है। खेल के अंत तक सीखने का इंतज़ार करने के बजाय, रोबोट हर एक कदम के बाद अपने ज्ञान को अपडेट करता है, भविष्य के बारे में जो वह जानता है उसका उपयोग करके वर्तमान के मूल्य का अनुमान लगाता है। हालाँकि, इसमें एक पेंच है। रोबोट खोजबीन (exploring) के दौरान सीखता है (यानी कुछ नया देखने के लिए रैंडम चालें चलता है), लेकिन वह एक आदर्श, लालची विशेषज्ञ की तरह कार्य करना चाहता है जो कभी गलती नहीं करता। यह एक संघर्ष पैदा करता है: यदि रोबotong अपने द्वारा किए गए किसी "मूर्खतापूर्ण" कदम से सीखता है (जो उसने केवल यह देखने के लिए किया था कि क्या होता है), तो वह अनजाने में खुद को बुरी आदतें सिखा सकता है। दशकों से, वैज्ञानिक एक कठिन स्थिति में फंसे हुए हैं: या तो रोबोट के "मूर्खतापूर्ण" कदम चलते ही सीखना बंद कर दें (जो सुरक्षित है लेकिन बहुत धीमा है), या हर चीज़ से सीखना जारी रखें (जो तेज़ है लेकिन जोखिम भरा है क्योंकि रोबोट अपनी गलतियों से सीख सकता है)।
यह शोध पत्र एक चतुर नया समाधान पेश करता है जिसे गेटेड Q-लर्निंग (Gated Q-learning) कहा जाता है। लेखक, ब्रेट डेली (Brett Daley), एक ऐसा तरीका प्रस्तावित करते हैं जिससे दोनों दुनियाओं का सर्वश्रेष्ठ प्राप्त किया जा सके। एक सख्त "चालू/बंद" स्विच के बजाय, वे एक "गेट" या डिमर स्विच (dimmer switch) पेश करते हैं। जब रोबोट एक मूर्खतापूर्ण, खोजबीन वाली चाल चलता है, तो गेट पूरी तरह से बंद नहीं होता; बल्कि, यह आंशिक रूप से बंद हो जाता है, जिससे थोड़ा सा सीखना संभव हो पाता है। यह रोबोट को घटनाओं की लंबी श्रृंखलाओं से सीखने में सक्षम बनाता है, बिना अपने ही रैंडम प्रयोगों से भ्रमित हुए। कंप्यूटर सिमुलेशन के माध्यम से, यह पेपर दिखाता है कि यह "बिल्कुल सही" दृष्टिकोण इसे पुराने, चरम तरीकों की तुलना में बहुत तेज़ी से सीखने में मदद करता है, जिससे यह एक ऐसा 'स्वीट स्पॉट' ढूंढ लेता है जहाँ यह बहुत अधिक गलतियाँ किए बिना तेज़ी से सीखता है।
समस्या: "सब कुछ या कुछ नहीं" का दुविधा
कल्पना कीजिए कि आप एक सॉकर खिलाड़ी को प्रशिक्षित कर रहे एक कोच हैं। खिलाड़ी खेल सीख रहा है, लेकिन वह नए, अजीब किक आज़माने का भी प्रयोग कर रहा है ताकि देखा जा सके कि क्या होता है।
- विधि A (एक सख्त कोच): हर बार जब खिलाड़ी एक अजीब, प्रयोगात्मक किक मारता है, तो कोच चिल्लाता है, "रुको! इसे भूल जाओ!" और प्रशिक्षण को रीसेट कर देता है। यह सुरक्षित है क्योंकि खिलाड़ी कभी भी गलत चाल से नहीं सीखता, लेकिन वे अविश्वसनीय रूप से धीरे सीखते हैं क्योंकि वे अपना अधिकांश समय रुकने और रीसेट करने में बिताते हैं। यह वॉटकिन्स' Q(λ) (Watkins' Q(λ)) की तरह है।
- विधि B (एक उदार कोच): कोच खिलाड़ी को जारी रखने देता है, भले ही उसने एक भयानक, प्रयोगात्मक किक मारी हो। वे कहते हैं, "ठीक है, वह एक खराब किक थी, लेकिन देखते हैं आगे क्या होता है!" यह तेज़ है क्योंकि खिलाड़ी चलते रहते हैं, लेकिन वे गलती से यह सीख सकते हैं कि "खराब किक वास्तव में ठीक है" यदि वे बाद में भाग्यशाली हो जाते हैं। यह पेंग्स Q(λ) (Peng's Q(λ)) की तरह है।
30 वर्षों तक, कोचों (या AI शोधकर्ताओं) को या तो बहुत सख्त और धीमा, या बहुत उदार और जोखिम भरा होने के बीच चुनाव करना पड़ा। इन समस्याओं को ठीक करने के आधुनिक प्रयास आमतौर पर "इम्पॉर्टेंस सैंपलिंग" (importance sampling) नामक जटिल गणित का उपयोग करते हैं, लेकिन वह गणित तब विफल हो जाता है जब रोबोट एक लालची, पूर्ण विशेषज्ञ बनने की कोशिश कर रहा होता है। यह एक जटिल तराजू का उपयोग करके पंख को तौलने की कोशिश करने जैसा है; वह उपकरण इस विशिष्ट कार्य के लिए काम नहीं करता है।
समाधान: "गेट"
शोध पत्र गेटेड Q-लर्निंग पेश करता है, जो कोच और खिलाड़ी के बीच एक स्मार्ट, समायोज्य गेट की तरह काम करता है।
एक सख्त "रुकने" या पूरी तरह से "चलने" के बजाय, यह गेट एक डिमर स्विच की तरह है। जब खिलाड़ी एक मानक, समझदार चाल चलता है, तो गेट पूरी तरह खुला होता है (पूर्ण शिक्षण)। लेकिन जब खिलाड़ी एक अजीब, प्रयोगात्मक चाल चलता है, तो गेट पूरी तरह बंद नहीं होता। इसके बजाय, यह आंशिक रूप से बंद हो जाता है।
इसे एक पानी के पाइप की तरह सोचें।
- एक सख्त कोच पाइप को पूरी तरह से बंद कर देता है यदि पानी थोड़ा गंदा दिखता है।
- एक उदार कोच गंदे पानी को सिस्टम में भरने देता है।
- गेटेड Q-लर्निंग पाइप में एक फ़िल्टर लगाता है। यदि पानी गंदा है (एक प्रयोगात्मक चाल से), तो फ़िल्टर थोड़े हिस्से को गुजरने देता है लेकिन उसे थोड़ा साफ भी करता है। यह कहता है, "ठीक है, हम इससे थोड़ा सीखेंगे, लेकिन उतना नहीं जितना कि एक आदर्श चाल से।"
इस "गेट" को एक संख्या द्वारा नियंत्रित किया जाता है जिसे शोधकर्ता χ (ची) कहते हैं।
- यदि χ = 0 है, तो गेट खराब चालों पर कसकर बंद हो जाता है (सख्त कोच की तरह)।
- यदि χ = 1 है, तो गेट पूरी तरह खुला रहता है (उदार कोच की तरह)।
- यदि χ = 0.5 है, तो गेट आधा खुला है, जिससे सीखने की मध्यम मात्रा गुजरती है।
उन्होंने क्या पाया
लेखक ने एक साधारण "रैंडम वॉक" (19 स्थानों वाली एक सीधी रेखा, जहाँ रोबोट को सही छोर खोजना होता है) के कंप्यूटर सिमुलेशन में इस विचार का परीक्षण किया। उन्होंने हजारों प्रयोग चलाए, यह बदलकर कि रोबोट कितनी तेज़ी से सीखता है, वह कितनी दूर तक देखता है, और गेट कितना खुलता है।
सिमुलेशन ने जो दिखाया वह यहाँ है:
- एक स्वीट स्पॉट मौजूद है: रोबोट ने सबसे तेज़ी से तब सीखा जब गेट को "मध्यम" स्तर (लगभग χ = 0.45) पर सेट किया गया था। यह पूरी तरह से खुला नहीं था, और न ही पूरी तरह से बंद था।
- तेज़ सीखना: इस मध्यम गेट का उपयोग करके, रोबोट ने सख्त और उदार दोनों कोचों की तुलना में काफी तेज़ी से सीखा। यह इनाम का कारण पता लगाने के लिए समय में पीछे देख सकता था, बिना अपने ही रैंडम प्रयोगों से भ्रमित हुए।
- मजबूती (Robustness): परिणाम आश्चर्यजनक रूप से सहिष्णु थे। भले ही गेट को परफेक्ट नंबर पर सेट न किया गया हो, जब तक कि वह बीच में (0.2 और 0.6 के बीच) कहीं भी था, रोबोट बहुत अच्छी तरह से सीखता रहा।
इसके पीछे का सिद्धांत
यह पेपर केवल यह नहीं दिखाता कि यह काम करता है; यह गणित का उपयोग करके सिद्ध करता है कि यह क्यों काम करता है। उन्होंने दिखाया कि यह "गेटेड" विधि एक कॉन्ट्रैक्शन मैपिंग (contraction mapping) है। सरल शब्दों में, इसका अर्थ है कि हर बार जब रोबता अपने ज्ञान को अपडेट करता है, तो वह गणितीय रूप से सत्य के करीब पहुँच जाता है, और वह कभी भी लूप में नहीं फँसेगा या पागल नहीं होगा।
उन्होंने यह भी सिद्ध किया कि रोबोट अंततः एक विशिष्ट "फिक्स्ड पॉइंट" (fixed point) पर स्थिर हो जाता है। यह फिक्स्ड पॉइंट परफेक्ट विशेषज्ञ नहीं है (क्योंकि रोबोट अभी भी अपनी गलतियों से थोड़ा सीखता है), लेकिन यह एक बहुत अच्छा विशेषज्ञ है जिसने उन लोगों की तुलना में बहुत तेज़ी से सीखा जिन्होंने गलतियों से सीखना ही छोड़ दिया था। गणित पुष्टि करता है कि गेट को समायोजित करके, आप बिल्कुल नियंत्रित कर सकते हैं कि आप तेज़ सीखने के लिए कितने "बायस" (गलतियों से सीखना) को स्वीकार करने के लिए तैयार हैं।
यह क्यों मायने रखता है
यह शोध पत्र सुझाव देता है कि हमें AI प्रशिक्षण में सुरक्षा और गति के बीच चयन करने की आवश्यकता नहीं है। केवल एक "गेट" जोड़कर जो खोजबीन के शोर को आंशिक रूप से फ़िल्टर करता है, हम ऐसे एजेंट बना सकते हैं जो घटनाओं की लंबी श्रृंखलाओं से कुशलतापूर्वक सीख सकें। हालांकि इसका परीक्षण सरल सिमुलेशन में किया गया था, लेखक का मानना है कि इस विधि को जटिल AI सिस्टम (जैसे वीडियो गेम या रोबोटिक्स में उपयोग किए जाने वाले) में आसानी से लगाया जा सकता है ताकि उन्हें बिना जटिल इम्पॉर्टेंस सैंपिंग गणित के तेज़ी से सीखने में मदद मिल सके। यह एक सरल, सुंदर सुधार है जो AI शोधकर्ताओं के लिए 30 साल पुरानी समस्या का समाधान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।