PLATO: Pointer Learner for Agent and Task Openness
यह शोध पत्र PLATO को प्रस्तुत करता है, जो एक नवीन मल्टी-एजेंट सुदृढीकरण शिक्षण (मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग) ढांचा है जो कृत्रिम सीमाओं या पुनर्र्व huấn (रिट्रेनिंग) पर निर्भर हुए बिना गतिशील वातावरण में एजेंट और कार्य दोनों की खुलापन (ओपननेस) को प्रभावी ढंग से संभालने के लिए पॉइंटर-नेटवर्क-आधारित एक्टर को ग्राफ न्यूरल नेटवर्क क्रिटिक के साथ जोड़ता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ खेल के नियम तब भी बदल जाते हैं जब आप अभी भी खेल रहे हों। आर्टिफिशियल इंटेलिजेंस के क्षेत्र में, विशेष रूप से मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग (Multi-Agent Reinforcement Learning) नामक एक क्षेत्र में, कंप्यूटर अच्छे कदमों के लिए पुरस्कार प्राप्त करके और चीज़ों को आज़माकर मिलकर काम करना सीखते हैं। आमतौर पर, ये कंप्यूटर टीमें एक स्थिर दुनिया में प्रशिक्षित की जाती हैं: खिलाड़ियों की समान संख्या, लक्ष्यों का समान सेट, और हमेशा के लिए समान नियम। लेकिन वास्तविक दुनिया में, चीज़ें अस्त-व्यस्त होती हैं। नए कार्य अप्रत्याशित रूप से सामने आते हैं, टीम के सदस्य खेल के बीच में ही छोड़ सकते हैं या शामिल हो सकते हैं, और "खेल का मैदान" स्वयं बदल सकता है। इस अराजक, परिवर्तनशील वातावरण को एक ओपन एजेंट सिस्टम (Open Agent System) के रूप में जाना जाता है। वैज्ञानिकों के लिए बड़ी चुनौती AI टीमों को यह सिखाना है कि जब टीम का आकार और नौकरियों की सूची अप्रत्याशित रूप से बदल जाए, तब भी वे प्रभावी ढंग से मिलकर काम करना जारी रखें। यदि एक AI को पाँच आग बुझाने के लिए प्रशिक्षित किया गया है, लेकिन अचानक छठा आग का स्रोत प्रकट हो जाता है, या यदि उसके अग्निशमन बॉट्स में से एक का ईंधन समाप्त हो जाता है और वह चला जाता है, तो क्या वह बिना दोबारा प्रशिक्षित हुए तुरंत अनुकूलित हो सकता है?
यह शोध पत्र PLATO (पॉइंटर लर्नर फॉर एजेंट एंड टास्क ओपननेस) नामक एक नया AI सिस्टम पेश करता है, जिसे ठीक इसी समस्या को हल करने के लिए डिज़ाइन किया गया है। PLATO को एक अत्यंत लचीले टीम कप्तान के रूप में समझें जो किसी निश्चित चेकलिस्ट पर निर्भर नहीं है। एक "कार्य 1, कार्य 2, कार्य 3" की सूची को याद रखने के बजाय, यह एक चतुर तकनीक का उपयोग करता है जिसे पॉइंटर नेटवर्क कहा जाता है। कल्पना करें कि आप लोगों से भरे कमरे में हैं, और आपको उस व्यक्ति की ओर इशारा करना है जिसे मदद की ज़रूरत है। यदि कोई नया व्यक्ति कमरे में आता है या कोई चला जाता है, तो आपको इशारा करना फिर से सीखने की आवश्यकता नहीं होती; आप बस वर्तमान में वहां मौजूद व्यक्ति की ओर इशारा करते हैं। PLATO कार्यों के साथ यही करता है। जब कोई नई आग दिखाई देती है या कोई एजेंट चला जाता है, तो सिस्टम बिना पुन: प्रशिक्षित हुए उपलब्ध विकल्पों की ओर तुरंत संकेत करता है।
शोधकर्ताओं ने PLATO का परीक्षण एक सिम्युलेटेड वाइल्डफायर (जंगल की आग) परिदृश्य में किया, जो एक डिजिटल दुनिया है जहाँ फायरफाइटर बॉट्स को उन आगों को बुझाना होता है जो फैल सकती हैं, अचानक प्रकट हो सकती हैं, या बुझ सकती हैं। उन्होंने PLATO की तुलना अन्य स्मार्ट AI विधियों से की और पाया कि PLATO ने अराजकता को बहुत बेहतर तरीके से संभाला। जब टीम का आकार बदला या नई आग उत्पन्न हुई, तो PLATO ने टीम को समन्वित और कुशल बनाए रखा। इससे भी अधिक प्रभावशाली बात यह है कि जब उन्होंने PLATO को एक छोटे ग्रिड पर प्रशिक्षित किया और फिर उसे बिना किसी अतिरिक्त प्रशिक्षण के एक बहुत बड़े, अनदेखे ग्रिड में डाल दिया, तो इसने फिर भी मज़बूत प्रदर्शन किया। यह "ज़ीरो-शॉट" क्षमता बताती है कि PLATO केवल एक विशिष्ट मानचित्र को याद नहीं कर रहा है; यह एक लचीला कौशल सीख रहा है जो नई, अप्रत्याशित स्थितियों में काम करता है। यह शोध पत्र दिखाता है कि इस पॉइंटिंग तंत्र को ग्राफ-आधारित मस्तिष्क के साथ मिलाने से, जो यह समझता है कि एजेंट और कार्य आपस में कैसे जुड़ते हैं, AI टीमें तब भी मजबूत बनी रह सकती हैं जब उनके आसपास की दुनिया लगातार बदल रही हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।