Self-Play Reinforcement Learning under Imperfect Information in Big 2
यह शोध पत्र 'बिग 2' (Big 2) नामक अपूर्ण-सूचना वाले कार्ड गेम के लिए एक सेल्फ-प्ले सुदृढीकरण शिक्षण (self-play reinforcement learning) ढांचे को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि नियंत्रित परिस्थितियों में PPO, वैल्यू-आधारित विधियों से बेहतर प्रदर्शन करता है और मजबूत मल्टी-एजेंट एजेंटों को प्रशिक्षित करने के लिए एंट्रॉपी रेगुलराइजेशन (entropy regularization) और करंट-पॉलिसी सेल्फ-प्ले के लाभों को रेखांकित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपने तीन दोस्तों के साथ एक मेज पर बैठे हैं और 'बिग 2' (Big 2) नामक कार्ड गेम खेल रहे हैं। आप अपने हाथ के 13 कार्ड देख सकते हैं, और आप देख सकते हैं कि बाकी सभी ने अब तक कौन से कार्ड खेले हैं। लेकिन आप अपने दोस्तों के हाथों में छिपे हुए कार्ड नहीं देख सकते। इसे शोधकर्ता "अपूर्ण सूचना" (imperfect information) कहते हैं। आपको यह अनुमान लगाना होगा कि उनके पास क्या है, यह देखते हुए कि वे क्या खेलते हैं, वे क्या छोड़ देते हैं, और कितने कार्ड बचे हैं।
इस शोध पत्र का लक्ष्य एक कंप्यूटर प्रोग्राम (एक AI एजेंट) को यह गेम बहुत अच्छी तरह से खेलना सिखाना है, जिसका उपयोग रीइन्फोर्समेंट लर्निंग (RL) के माध्यम से किया जाता है। RL को 'गलती और सुधार' (trial and error) से सीखने वाले एक छात्र के रूप में समझें: AI हजारों गेम खेलता है, जीतने या हारने के लिए "ग्रेड" (पुरस्कार/दंड) प्राप्त करता है, और धीरे-धीरे सबसे अच्छी रणनीतियाँ बनाना सीख जाता है।
यहाँ इस शोध पत्र के निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. चुनौती: छिपे हुए रहस्यों का खेल
बिग 2 मुश्किल है क्योंकि:
- आप सब कुछ नहीं जानते: आपको अपने विरोधियों के हाथों का अनुमान लगाना पड़ता है।
- हर मोड़ पर नियम बदलते हैं: कभी आप एक कार्ड खेलते हैं, कभी एक जोड़ा (pair), तो कभी एक जटिल "स्ट्रेट" (straight)। कानूनी चालों की सूची लगातार बदलती रहती है।
- अल्पकालिक बनाम दीर्घकालिक: कभी-कभी अभी अपना सबसे मजबूत कार्ड खेलना अच्छा लगता है, लेकिन इससे आप बाद में असहाय हो सकते हैं। AI को पूरे गेम को जीतने के लिए आज एक छोटी जीत का त्याग करना सीखना होगा।
2. प्रयोग: किसने सबसे अच्छा सीखा?
शोधकर्ताओं ने एक "ट्रेनिंग कैंप" बनाया जहाँ उन्होंने चार अलग-अलग प्रकार के AI छात्रों को बिल्कुल समान नियमों, समान कंप्यूटर शक्ति और समान समय का उपयोग करके सिखाया। वे देखना चाहते थे कि कौन सी सीखने की शैली सबसे अच्छी काम करती है।
- छात्र:
- PPO (द "पॉलिसी" छात्र): यह छात्र अलग-अलग रणनीतियों को आजमाकर और अपनी चाल चलने के बारे में अपने "अंतर्ज्ञान" (gut feeling) को समायोजित करके सीखता है। यह एक कोच की तरह है जो आपसे कहता है, "यहाँ एक जोड़ा चलाओ, यह सही लग रहा है।"
- Q-Learning / SARSA / Monte Carlo (द "वैल्यू" छात्र): ये छात्र हर संभावित स्थिति के लिए एक स्कोर याद करने की कोशिश करते हैं। वे पूछते हैं, "यदि मैं यह कार्ड खेलता हूँ, तो अंत में मुझे सटीक रूप से कितने अंक मिलेंगे?"
परिणाम: PPO छात्र ट्रेनिंग कैंप जीत गया। इसने "वैल्यू" छात्रों की तुलना में तेजी से सीखा और एक बेहतर खिलाड़ी बना।
- क्यों? छिपी हुई जानकारी और कई खिलाड़ियों वाले खेल में, हर चाल के लिए सटीक भविष्य के स्कोर की गणना करना अगले साल के मौसम की सटीक भविष्यवाणी करने की कोशिश करने जैसा है—यह बहुत शोर भरा (noisy) है और इसमें बहुत समय लगता है। PPO का दृष्टिकोण—"चीजें कैसे रहीं इसके आधार पर रणनीति को समायोजित करना"—अधिक कुशल था।
3. सीक्रेट सॉस: एंट्रॉपी (बहुत अधिक अनुमानित न बनें)
शोधकर्ताओं ने जीतने वाले PPO छात्र के बारे में एक दिलचस्प बात देखी। शुरुआत में, यह बहुत आत्मविश्वासी था, जो 90% बार एक ही "सर्वश्रेष्ठ" चाल चुनता था। लेकिन एक ऐसे खेल में जहाँ आपके विरोधी आपके कार्ड नहीं देख सकते, 100% अनुमानित होना खतरनाक है। यदि आप हमेशा एक ही तरह से खेलते हैं, तो समझदार विरोधी आपको समझ जाएंगे।
- उपमा: कल्पना कीजिए कि रॉक-पेपर-सिज़र्स (Rock-Paper-Scissors) खेल रहे हैं। यदि आप हमेशा "रॉक" फेंकते हैं क्योंकि यह सबसे अच्छा लगता है, तो आपका प्रतिद्वंद्वी जल्दी ही "पेपर" फेंकना शुरू कर देगा और आपको हरा देगा। आपको थोड़ा बदलाव करने की आवश्यकता है।
- समाधान: शोधकर्ताओं ने AI के प्रशिक्षण में थोड़ी सी "एंट्रॉपी" (यादृच्छिकता/randomness) जोड़ी। उन्होंने इसे कहा, "100% निश्चित न हों; अपनी चालों में थोड़ा आश्चर्य बनाए रखें।"
- परिणाम: वह AI जिसने मध्यम मात्रा में यादृच्छिकता (randomness) बनाए रखी, वह सबसे अच्छा प्रदर्शन करता था। यह समझना कठिन हो गया और अधिक अनुकूलन योग्य बन गया। हालाँकि, बहुत अधिक यादृच्छिकता ने इसे मूर्खतापूर्ण बना दिया, इसलिए संतुलन ही कुंजी थी।
4. प्रशिक्षण साथी: आपको किसके खिलाफ खेलना चाहिए?
AI ने खुद के विरुद्ध खेलकर (Self-Play) सीखा। शोधकर्ताओं ने इन अभ्यास मैचों को सेट करने के तीन अलग-अलग तरीकों का परीक्षण किया:
- फिक्स्ड अपोनेंट (निश्चित प्रतिद्वंद्वी): AI एक ऐसे कंप्यूटर के खिलाफ खेला जो हमेशा एक ही "स्मार्ट" रणनीति अपनाता था।
- चेकपॉइंट अपोनेंट (चेकपॉइंट प्रतिद्वंद्वी): AI ने अपने ही पुराने संस्करणों के खिलाफ खेला जिन्हें प्रशिक्षण के शुरुआती चरणों में सहेजा गया था।
- करंट-पॉलिसी अपोनेंट (वर्तमान-नीति प्रतिद्वंद्वी): AI ने अपने ही वर्तमान संस्करण के खिलाफ खेला, जो हर दिन बेहतर होता जा रहा था।
परिणाम: करंट-पॉलिसी (स्वयं का वह संस्करण जो अभी सुधार कर रहा है) के खिलाफ खेलना सबसे अच्छा तरीका था।
- उपमा: कल्पना कीजिए कि तैराकी सीख रहे हैं।
- यदि आप केवल एक धीमे, स्थिर रोबोट के खिलाफ अभ्यास करते हैं, तो आप उस रोबोट को हराने में अच्छे हो जाते हैं, लेकिन आप एक तेज़ तैराक को कैसे संभालना है, यह नहीं सीख पाते।
- यदि आप अपने "पिछले स्वयं" के खिलाफ अभ्यास करते हैं, तो आप उन लड़ाइयों से लड़ रहे होंगे जिन्हें आप पहले ही जीत चुके हैं।
- यदि आप अपने वर्तमान स्वयं के खिलाफ अभ्यास करते हैं, तो कठिनाई का स्तर ठीक उसी गति से बढ़ता है जैसे आपके कौशल में सुधार होता है। यह एक व्यक्तिगत ट्रेनर की तरह है जो आपकी वर्तमान ताकत के अनुसार बार पर वजन को ठीक से समायोजित करता है। इसने AI को लगातार चुनौती दी और सबसे प्रासंगिक सबक सिखाया।
सारांश
यह शोध पत्र दिखाता है कि बिग 2 जैसे जटिल कार्ड गेम के लिए:
- रणनीति-आधारित सीखना (PPO) सटीक स्कोर को याद करने की कोशिश करने की तुलना में बेहतर काम करता है।
- अपनी चालों में थोड़ी सी यादृच्छिकता (randomness) रखना आपको एक कठिन प्रतिद्वंद्वी बनाता है।
- अपने ही एक ऐसे संस्करण के खिलाफ अभ्यास करना जो आपके साथ-साथ सुधर रहा है, सीखने का सबसे तेज़ तरीका है।
लेखक निष्कर्ष निकालते हैं कि बिग 2 कंप्यूटरों को यह सिखाने के लिए एक बेहतरीन "टेस्ट किचन" है कि जब उनके पास सभी तथ्य न हों तो स्मार्ट निर्णय कैसे लिए जाते हैं, एक ऐसा कौशल जो अंततः कई वास्तविक दुनिया की स्थितियों में मदद कर सकता है जहाँ जानकारी छिपी होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।