DSLE: A Learning Environment for Dark Souls Boss Encounters
यह शोध पत्र DSLE प्रस्तुत करता है, जो डार्क सोल्स: रिमास्टर्ड के सभी 22 बॉस मुकाबलों के लिए एक जिमनेजियम-शैली (Gymnasium-style) का बेंचमार्किंग वातावरण है, जो यह प्रदर्शित करता है कि वर्तमान सुदृढीकरण शिक्षण (reinforcement learning) और विकासवादी विधियाँ इन बॉस के एक प्रतिनिधि उपसमुच्चय को भी हराने में काफी संघर्ष करती हैं क्योंकि गेम में उच्च-आयामी दृश्य इनपुट, विरल पुरस्कार (sparse rewards) और जटिल युद्ध यांत्रिकी मौजूद हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर केवल संख्याओं की गणना नहीं करते, बल्कि इंसानों की तरह गेम खेलना सीखते हैं: स्क्रीन को देखकर, बटन दबाकर, और प्रयास और त्रुटि (trial and error) के माध्यम से जीतना सीखकर। यही रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) का सार है, जो आर्टिफिशियल इंटेलिजेंस की एक शाखा है जहाँ एक एजेंट (एक कंप्यूटर प्रोग्राम) एक डिजिटल क्लासरूम में एक छात्र की तरह कार्य करता है। यहाँ शिक्षक कोई व्यक्ति नहीं, बल्कि स्वयं वह गेम है। जब एजेंट एक अच्छा कदम उठाता है, तो उसे एक "पुरस्कार" (जैसे कि एक गोल्ड स्टार) मिलता है; जब वह गलती करता है, तो उसे दंड मिलता है। लाखों प्रयासों के माध्यम से, एजेंट एक ऐसी रणनीति सीखने की उम्मीद करता है जो गेम को जिता सके। दशकों से, वैज्ञानिकों ने इन AI छात्रों का परीक्षण सरल बोर्ड गेम्स या पुराने आर्केड क्लासिक्स पर किया है, लेकिन उन्हें उन जटिल, आधुनिक वीडियो गेम्स को खेलना सिखाने में संघर्ष किया है जो वास्तविक जीवन जैसे दिखते हैं, रियल-टाइम में चलते हैं, और गलतियों पर तुरंत दंड देते हैं। बड़ा सवाल यह है: क्या एक AI केवल पिक्सेल को देखकर और हार के दर्द को महसूस करके एक मास्टर गेमर बनना सीख सकता है, या क्या इन आधुनिक गेम्स में एक ऐसा "डिफिकल्टी स्पाइक" (कठिनाई का उछाल) है जो वर्तमान सीखने के तरीकों को तोड़ देता है?
यहाँ डार्क सोल्स लर्निंग एनवायरनमेंट (DSLE) आता है, जो शोधकर्ताओं द्वारा ठीक इसी बात का परीक्षण करने के लिए बनाया गया एक नया टूल है। डार्क सोल्स: रिमास्टर्ड (Dark Souls: Remastered) को एक कुख्यात रूप से कठिन वीडियो गेम के रूप में समझें जो अपने क्रूर बॉसेस (bosses) के लिए जाना जाता है—विशाल, डरावने दुश्मन जो आपको सेकंडों में मार सकते हैं यदि आप पूर्ण न हों। शोधकर्ताओं ने एक "कंटेनर" (एक विशेष डिजिटल बॉक्स) बनाया जो AI एजेंटों को गेम की सभी 22 बॉस फाइट्स को स्वचालित रूप से खेलने की अनुमति देता है। उन्होंने AI को कोई विशेष लाभ नहीं दिया; उन्होंने इसे एक मानव खिलाड़ी की तरह स्क्रीन देखने और वही बटन दबाने के लिए बनाया। उन्होंने पाँच बॉसेस का एक "स्टार्टर पैक" तैयार किया, जो एक धीमे, आसान ट्यूटोरियल फाइट से लेकर एक अराजक, बहु-दुश्मन वाले दुस्वप्न तक फैला हुआ था, ताकि यह देखा जा सके कि क्या कोई AI उन्हें हरा सकता है।
परिणाम AI की दुनिया के लिए एक वास्तविकता की जाँच (reality check) की तरह थे। जब उन्होंने अपने सबसे स्मार्ट AI छात्रों को इन बॉसेस के खिलाफ खड़ा किया, तो परिणाम बहुत स्पष्ट थे। एक सरल, पूर्व-लिखित कंप्यूटर स्क्रिप्ट (एक "एक्सपर्ट सिस्टम") ने सबसे आसान ट्यूटोरियल बॉस को लगभग 63% बार हरा दिया। एक अधिक उन्नत "इवोल्यूशनरी" (विकासवादी) विधि, जो हजारों यादृच्छिक रणनीतियों को आज़माती है और सर्वश्रेष्ठ को बनाए रखती है, उसी आसान बॉस को लगभग 43% बार हराने में सफल रही। हालाँकि, दो सबसे प्रसिद्ध आधुनिक AI लर्निंग मेथड्स (जिन्हें PPO और DQN कहा जाता है) पूरी तरह से विफल रहे। दर्जनों घंटों तक चलने और हजारों प्रयासों के बाद भी, ये उन्नत AI ट्यूटोरियल बॉस को 0.33% से अधिक बार नहीं हरा सके, और उन्होंने चार कठिन बॉसेस के खिलाफ शून्य बार जीत हासिल की। वास्तव में, उन्होंने सीखने का कोई संकेत नहीं दिखाया; उनका प्रदर्शन स्थिर रहा, जैसे कि वे केवल रैंडम अनुमान लगा रहे हों।
शोधकर्ताओं ने पाया कि AI दो बहुत ही विशिष्ट तरीकों से विफल हुआ। जिन बॉसेस को छोटे, तंग कमरों में तेज़ दुश्मनों के साथ लड़ा गया था, वहाँ AI 10 सेकंड से भी कम समय में मर गया, उसे पलटवार करने का मौका भी नहीं मिला। जिन बॉसेस को लावा से भरे खतरनाक अरीना में लड़ा गया था, वहाँ AI एक मिनट से अधिक समय तक जीवित रहा लेकिन लगभग कोई नुकसान नहीं पहुँचाया, वह प्रभावी ढंग से हमला करने के बजाय केवल बचने (dodging) के लूप में फंस गया। यहाँ तक कि जब शोधकर्ताओं ने AI को बेहतर स्वास्थ्य और हथियारों के साथ एक "सुपर-पावर्ड" पात्र दिया, तब भी वह 22 में से अधिकांश बॉसेस को नहीं हरा सका, और केवल शुरुआती कुछ को ही जीतने में सक्षम रहा।
पेपर यह निष्कर्ष निकालता है कि जबकि हम AI को सरल गेम खेलना सिखा सकते हैं, डार्क सोल्स एक नया, बहुत कठिन स्तर का प्रतिनिधित्व करता है जिसे वर्तमान AI तरीके अभी तक भेद नहीं पाए हैं। यह गेम केवल कठिन नहीं है; इसके लिए समय (timing), रणनीति और अनुकूलन क्षमता के मिश्रण की आवश्यकता होती है जो आज के लर्निंग एल्गोरिदम को तोड़ देती है। शोधकर्ता सुझाव देते हैं कि इसे हल करने के लिए, हमें शायद नए प्रकार के AI की आवश्यकता हो सकती है जो मानव प्रदर्शन (demonstrations) से सीख सकें या गेम की गहरी संरचना को समझ सकें, न कि केवल बार-बार रैंडम चालें चलाने के बजाय। फिलहाल के लिए, डार्क सोल्स के बॉसेस आर्टिफिशियल इंटेलिजेंस के खिलाफ अजेय चैंपियन बने हुए हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।