← नवीनतम पेपर
🤖 AI

Impartial Games: A Challenge for Reinforcement Learning

यह शोध पत्र प्रदर्शित करता है कि अल्फाज़ीरो (AlphaZero) शैली के सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम निम (Nim) जैसे निष्पक्ष खेलों में विशेषज्ञ-स्तरीय महारत हासिल करने में विफल रहते हैं, जो अमूर्त गणितीय सिद्धांतों को सीखने में एक मौलिक प्रतिनिधित्व संबंधी बाधा (representational bottleneck) को प्रकट करता है, जिससे यह स्पष्ट होता है कि सरल हाइपरपैरामीटर ट्यूनिंग भी रटे हुए अवस्थाओं (memorized states) से परे सामान्यीकरण करने की उनकी अक्षमता को दूर नहीं कर सकती।

मूल लेखक: Bei Zhou, Søren Riis

प्रकाशित 2026-09-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bei Zhou, Søren Riis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, एक विशिष्ट प्रकार के कंप्यूटर प्रोग्राम हाल ही में जटिल रणनीति वाले खेलों में महारत हासिल करने की अपनी क्षमता के कारण प्रसिद्ध हुए हैं। स्वयं के विरुद्ध लाखों खेल खेलकर, ये प्रोग्राम ऐसे चालें चलना सीख जाते हैं जो अक्सर महानतम मानव विशेषज्ञों को भी आश्चर्यचकित कर देती हैं। वे शतरंज और गो जैसे खेलों में चैंपियन बन गए हैं, जहाँ सफलता पैटर्न पहचानने, स्थिति का मूल्यांकन करने और कई चरणों आगे की योजना बनाने पर निर्भर करती है। अंतर्निहित विचार यह है कि यदि कोई मशीन खेल के प्रवाह को समझकर जीतना सीख सकती है, तो वह अंततः किसी भी जटिल समस्या को हल करना सीख सकती है। हालाँकि, इस सफलता ने सुरक्षा की एक झूठी भावना पैदा कर दी है। यह पता चला है कि इन मशीनों के सीखने का तरीका सार्वभौमिक नहीं है। खेलों का एक विशिष्ट वर्ग है जहाँ नियम सरल हैं, मोहरे दोनों खिलाड़ियों द्वारा साझा किए जाते हैं, और जीतने की रणनीति पैटर्न पहचान के बजाय एक छिपे हुए गणितीय तर्क पर निर्भर करती है। इन खेलों में, सबसे उन्नत आर्टिफिशियल इंटेलिजेंस सिस्टम एक दीवार से टकरा जाते हैं, और उन सिद्धांतों को सीखने में विफल रहते हैं जो खेल को मानव के लिए हल करने योग्य बनाते हैं।

इंपीरियल कॉलेज लंदन और क्वीन मैरी यूनिवर्सिटी ऑफ लंदन के शोधकर्ताओं ने 'निम' (Nim) नामक खेल का उपयोग करके इस अंध बिंदु की जांच करने का निर्णय लिया। निम वस्तुओं के कई ढेर (piles) के साथ खेला जाने वाला एक खेल है, जहाँ दो खिलाड़ी एक बारी में एक ही ढेर से कोई भी संख्या में वस्तुएं हटा सकते हैं। लक्ष्य वह व्यक्ति बनना है जो अंतिम वस्तु लेता है। हालांकि यह खेल सरल दिखता है, लेकिन जीतने का रहस्य ढेर के आकार के बाइनरी नंबरों से जुड़ी एक विशिष्ट गणितीय गणना है। एक इंसान के लिए, यह नियम सीखना एक अमूर्त अवधारणा को समझने का मामला है। आर्टिफिशियल इंटेलिजेंस के लिए, चुनौती अलग है। शोधकर्ता यह देखना चाहते थे कि क्या शतरंज जीतने वाले समान लर्निंग एल्गोरिदम निम जीतना सीख सकते हैं, और यदि नहीं, तो क्यों। उन्होंने प्रसिद्ध अल्फाजीरो (AlphaZero) लर्निंग सिस्टम का एक कस्टम संस्करण बनाया और इसे बढ़ते आकार के बोर्डों पर निम खेलने के लिए प्रशिक्षित किया, और यह देखते रहे कि कंप्यूटर की समझ कैसे विकसित होती है।

परिणाम स्पष्ट और चौंकाने वाले थे। जब शोधकर्ताओं ने पांच ढेरों वाले छोटे निम बोर्ड पर सिस्टम का परीक्षण किया, तो कंप्यूटर ने अच्छी तरह खेलना सीख लिया। वह लगातार जीत सकता था, एक ऐसे चैंपियन की तरह कार्य करता था जो जानता है कि खेल कैसे शुरू करना है और जीत की ओर कैसे बढ़ना है। हालाँकि, जैसे ही बोर्ड का आकार छह या सात ढेरों तक बढ़ा, सिस्टम का प्रदर्शन ढह गया। कंप्यूटर जीतना सीखना बंद कर गया। सही चालें खोजने के बजाय, वह अनुमान लगाने लगा, और उसका प्रदर्शन उतना ही था जितना कि रैंडम (यादृच्छिक) चालें चुनने पर होता। शोधकर्ताओं ने पाया कि समस्या यह नहीं थी कि खेल बहुत जटिल था या कंप्यूटर को प्रशिक्षण के लिए अधिक समय की आवश्यकता थी। समस्या यह कि कंप्यूटर का मस्तिष्क, जो एक प्रकार का न्यूरल नेटवर्क है, जानकारी को कैसे संसाधित करता है, इसमें मौलिक थी। ये नेटवर्क चीजों के बीच संबंध पहचानने में उत्कृष्ट हैं, जैसे यह पहचानना कि शतरंज के मोहरों की एक निश्चित व्यवस्था आमतौर पर जीत की ओर ले जाती है। लेकिन वे 'पैरिटी' (parity) नामक एक विशिष्ट प्रकार के तर्क के साथ अत्यधिक संघर्ष करते हैं, जो अनिवार्य रूप से वस्तुओं के एक समूह में संख्या विषम है या सम, इसकी गिनती करने का एक तरीका है। निम में, जीतने वाली चाल पूरी तरह से इसी तरह के गिनती वाले तर्क पर निर्भर करती है।

यह समझने के लिए कि यह क्यों महत्वपूर्ण है, शोधकर्ताओं ने आर्टिफिशियल इंटेलिजेंस के कौशल को मापने का एक नया तरीका पेश किया। उन्होंने एक "चैंपियन" और एक "विशेषज्ञ" (expert) के बीच अंतर किया। एक चैंपियन वह खिलाड़ी है जो परिचित क्षेत्रों में खेल को निर्देशित करके शुरुआती स्थिति से जीत सकता है जहाँ वह क्या करना है यह जानता है। हालाँकि, एक विशेषज्ञ बोर्ड की किसी भी स्थिति से, यहाँ तक कि उन स्थितियों से भी, सही चाल चल सकता है जिन्हें उसने पहले कभी नहीं देखा है। अध्ययन ने दिखाया कि आर्टिफिशियल इंटेलिजेंस छोटे बोर्डों पर चैंपियन बन सकता है, सही शुरुआती चालों को याद कर सकता है। लेकिन वह विशेषज्ञ बनने में विफल रहा। जब खेल मध्य या अंतिम चरणों में पहुँचा, या जब बोर्ड बड़ा हुआ, तो कंप्यूटर सही चाल नहीं निकाल सका। इसका आंतरिक मार्गदर्शक, जिसे यह बताना चाहिए कि कौन सी चालें अच्छी हैं, भ्रमित हो गया। यह एक हारने वाली चाल की उच्च संभावना निर्धारित कर देता था और जीतने वाली चाल को अनदेखा कर देता था। यहाँ तक कि जब कंप्यूटर ने अपने विकल्पों की जाँच करने के लिए लाखों सिमुलेशन चलाए, तब भी वह अपनी प्रारंभिक गलती को सुधार नहीं सका क्योंकि उसका शुरुआती अनुमान बहुत गलत था।

शोधकर्ताओं ने परीक्षण किया कि क्या यह विफलता स्वयं सीखने की पद्धति के कारण थी या खेल के तर्क की कठिनाई के कारण। उन्होंने खेल का एक संशोधित संस्करण बनाया जहाँ दो खिलाड़ी अलग-अलग ढेरों को नियंत्रित करते थे और उन्हें जीतने के लिए पैरिटी तर्क का उपयोग करने की आवश्यकता नहीं थी। इस संशोधित खेल में, उसी आर्टिफिशियल इंटेलिजेंस ने तेजी से और आसानी से सीखा, जिससे सिद्ध हुआ कि लर्निंग सिस्टम स्वयं सक्षम था। इसने पुष्टि की कि समस्या प्रशिक्षण प्रक्रिया में नहीं थी, बल्कि मूल खेल के लिए आवश्यक विशिष्ट गणित में थी। कंप्यूटर केवल स्वयं के विरुद्ध खेलकर उत्पन्न किए गए डेटा से पैरिटी के अमूर्त नियम को सीखने में असमर्थ था। डेटा में मौजूद 'नॉइज़' (noise), जो कंप्यूटर द्वारा अपने शुरुआती सीखने के चरण के दौरान गलतियाँ करने से उत्पन्न हुआ था, नेटवर्क के लिए अंतर्निहित पैटर्न को समझना असंभव बना देता था।

यह निष्कर्ष इस विचार को चुनौती देता है कि वर्तमान आर्टिफिशियल इंटेलिजेंस पर्याप्त डेटा और कंप्यूटिंग पावर मिलने पर किसी भी समस्या को हल कर सकता है। यह सुझाव देता है कि कुछ प्रकार के तार्किक तर्क ऐसे हैं जिन्हें ये सिस्टम अपने आप नहीं सीख सकते। शोधकर्ता प्रस्ताव देते हैं कि निम जैसे खेलों, और शायद अमूर्त गणित पर आधारित अन्य जटिल समस्याओं में महारत हासिल करने के लिए, भविष्य के आर्टिफिशियल इंटेलिजेंस को अलग तरह से बनाया जाना होगा। वे सुझाव देते हैं कि वर्तमान प्रणालियों की पैटर्न-मैचिंग शक्ति को एक अलग, प्रतीकात्मक तर्क मॉड्यूल (symbolic reasoning module) के साथ जोड़ा जाना चाहिए जो इन विशिष्ट तार्किक नियमों को संभाल सके। जब तक ऐसा परिवर्तन नहीं किया जाता, तब तक ये शक्तिशाली लर्निंग सिस्टम कुछ क्षेत्रों में चैंपियन रहेंगे लेकिन दूसरों के मौलिक तर्क के प्रति अंधे रहेंगे, और उस स्तर की वास्तविक विशेषज्ञता तक पहुँचने में असमर्थ रहेंगे जो एक मानव एक एकल अंतर्दृष्टि के साथ प्राप्त कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →