Tackling Decision Processes with Non-Cumulative Objectives using Reinforcement Learning
यह शोध पत्र एक सामान्य मैपिंग प्रस्तुत करता है जो नॉन-क्यूम्युलेटिव मार्कोव डिसीजन प्रोसेस (NCMDPs) को मानक MDPs में परिवर्तित करता है, जिससे किसी भी मनमाने रिवॉर्ड फंक्शन को अनुकूलित करने के लिए मौजूदा सुदृढीकरण शिक्षण (reinforcement learning) तकनीकों का प्रत्यक्ष अनुप्रयोग सक्षम होता है और विविध कार्यों में बेहतर प्रदर्शन और प्रशिक्षण दक्षता प्रदर्शित होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की दुनिया में, मशीनों को निर्णय लेना सिखाने के लिए एक शक्तिशाली ढांचे (framework) का उपयोग किया जाता है। कल्पना कीजिए कि एक रोबोट चलना सीख रहा है, एक कंप्यूटर प्रोग्राम वीडियो गेम में महारत हासिल कर रहा है, या एक ट्रेडिंग एल्गोरिदम स्टॉक पोर्टफोलियो का प्रबंधन कर रहा है। ये सिस्टम अपने परिवेश के जवाब में, एक के बाद एक, क्रियाओं की एक श्रृंखला करके कार्य करते हैं। अपनी हर हरकत के साथ, सिस्टम को एक संकेत प्राप्त होता है, जिसे अक्सर 'रिवॉर्ड' (पुरस्कार) कहा जाता है, जो उसे बताता है कि वह क्रिया अच्छी थी या बुरी। दशकों से, इन परिदृश्यों में सफलता का मानक नियम सरल रहा है: समय के साथ एकत्र किए गए सभी रिवॉर्ड्स के कुल योग को अधिकतम करना। यदि एक रोबोट को हर कदम के लिए एक छोटा अंक मिलता है, तो लक्ष्य यात्रा के अंत तक अधिक से अधिक अंक प्राप्त करना है। यह दृष्टिकोण, जिसे 'मार्कोव डिसिजन प्रोसेस' के रूप में जाना जाता है, अविश्वसनीय रूप से सफल रहा है, जिसने औद्योगिक रोबोटों से लेकर सेल्फ-ड्राइविंग कारों तक का मार्गदर्शन किया है।
हालाँकि, वास्तविक जीवन अक्सर एक साधारण गणना पत्रक (tally sheet) से कहीं अधिक जटिल होता है। कभी-कभी, सबसे महत्वपूर्ण परिणाम उन सभी अच्छी चीजों की कुल मात्रा नहीं होती है जो हुईं, बल्कि वह सबसे बुरा क्षण होता है जो घटित हुआ, या समय के साथ प्रदर्शन की निरंतरता होती है। एक अंतरिक्ष यान की कल्पना करें जो किसी ग्रह पर उतर रहा है। लक्ष्य केवल सुरक्षित रूप से उतरना नहीं है; बल्कि यह सुनिश्चित करना है कि पूरे उतरने के दौरान यान कभी भी एक खतरनाक गति से अधिक न हो, चाहे बाकी की उड़ान कितनी भी सुचारू क्यों न रही हो। वित्त (finance) के क्षेत्र में, एक निवेशक को एक वर्ष में हुए कुल लाभ की तुलना में इस बात की अधिक चिंता हो सकती है कि वह लाभ कितना उतार-चढ़ाव भरा था, और वह जोखिम भरे जुए के बजाय एक स्थिर रिटर्न चाहता है। इन परिदृश्यों में 'नॉन-क्यूम्युलेटिव ऑब्जेक्टिव्स' (गैर-संचयी उद्देश्य) शामिल होते हैं, जहाँ अंतिम स्कोर रिवॉर्ड के पूरे इतिहास का एक विशिष्ट फलन (function) होता है, जैसे कि उच्चतम मूल्य या औसत लाभ और अस्थिरता का अनुपात। अब तक, आर्टिफिशियल इंटेलिजेंस को इन जटिल, इतिहास-निर्भर लक्ष्यों को अनुकूलित करने के लिए सिखाना कठिन रहा है, जिसके लिए अक्सर कस्टम-निर्मित एल्गोरिदम की आवश्यकता होती है जिन्हें नई समस्याओं पर लागू करना कठिन होता है।
मैक्स प्लैंक इंस्टीट्यूट फॉर द साइंस ऑफ लाइट और फ्रेडरिक-अलेक्जेंडर-यूनिवर्सिटैट एरलेंजेन-न्यूर्नबर्ग के शोधकर्ताओं की एक टीम ने इस समस्या का एक सामान्य समाधान विकसित किया है। उन्होंने इन जटिल, नॉन-क्यूम्युलेटिव चुनौतियों को उस मानक प्रारूप में बदलने का तरीका खोजा है जिसे मौजूदा, शक्तिशाली आर्टिफिशियल इंटेलिजेंस उपकरण पहले से ही हल करना जानते हैं। एक नया प्रकार का लर्निंग एल्गोरिदम शुरू से बनाने के बजाय, उन्होंने एक सेतु बनाया। उन्होंने दिखाया कि मशीन के अपनी वर्तमान स्थिति को समझने के तरीके और उसके तत्काल फीडबैक की गणना करने के तरीके में थोड़ा बदलाव करके, किसी भी जटिल लक्ष्य को एक मानक "रिवॉर्ड के योग" वाली समस्या में बदला जा सकता है। यह शोधकर्ताओं को आज उपलब्ध सबसे उन्नत, 'ऑफ-द-शेल्फ' लर्निंग सॉफ्टवेयर का उपयोग करने और उन्हें सीधे उन समस्याओं पर लागू करने की अनुमति देता है जो पहले पहुंच से बाहर थीं, बिना सॉफ्टवेयर को संशोधित किए।
उनके तरीके का मूल हिस्सा एजेंट को थोड़ी अधिक स्मृति (memory) देना है। एक मानक सेटअप में, एक एजेंट को निर्णय लेने के लिए केवल अपनी वर्तमान स्थिति जानने की आवश्यकता होती है। लेकिन जब लक्ष्य रिवॉर्ड के पूरे इतिहास पर निर्भर करता है—जैसे कि अब तक देखी गई उच्चतम गति को याद रखना—तो एजेंट को वह जानकारी अपने साथ लेकर चलने की आवश्यकता होती है। शोधकर्ताओं ने एक प्रणाली प्रस्तावित की जहाँ एजेंट का "स्टेट" (अवस्था) अतीत के एक चलते हुए सारांश (running summary) को शामिल करने के लिए विस्तारित किया गया है, जैसे कि अब तक देखा गया उच्चतम या निम्नतम रिवॉर्ड। साथ मिलकर, उन्होंने उस तत्काल रिवॉर्ड को भी समायोजित किया जो एजेंट को प्रत्येक चरण पर प्राप्त होता है। केवल वर्तमान क्रिया को दर्शाने वाले रिवॉर्ड के बजाय, एजेंट को एक गणना किया गया मान प्राप्त होता है जो, पूरी यात्रा के दौरान जुड़ने पर, जटिल लक्ष्य का सटीक पुनर्निर्माण करता है। उदाहरण के लिए, यदि लक्ष्य अधिकतम गति को कम करना है, तो एजेंट को इस तरह से पुरस्कृत किया जाता है कि वह केवल तभी दंडित होता है जब वह एक नया गति रिकॉर्ड बनाता है, जिससे "अधिकतम के न्यूनतम" की समस्या प्रभावी रूप से एक मानक "योग" की समस्या में बदल जाती है।
इस दृष्टिकोण का परीक्षण विभिन्न कठिन कार्यों के माध्यम से किया गया, जिसने इसकी बहुमुखी प्रतिभा को सिद्ध किया। एक लूनर लैंडर (चंद्र लैंडर) के सिमुलेशन में, शोधकर्ताओं ने एक एजेंट को अंतरिक्ष यान उतारने के लिए प्रशिक्षित किया जबकि उसकी अधिकतम गति को सख्ती से सीमित किया गया। उन्होंने अपने तरीके की तुलना एक मानक दृष्टिकोण से की जो उड़ान के अंत में एक दंड (penalty) जोड़कर लक्ष्य का अनुमान लगाने की कोशिश करता है। नए तरीके ने, जिसने गति सीमा को सीखने की एक निरंतर प्रक्रिया के रूप में माना, सुरक्षित लैंडिंग और कुशल गति के बीच एक बहुत बेहतर संतुलन पाया। वित्त के क्षेत्र में, उन्होंने इसे पोर्टफोलियो ऑप्टिमाइज़ेशन पर लागू किया, जहाँ लक्ष्य 'शार्प रेशियो' को अधिकतम करना है—जो औसत लाभ और उन लाभों की अस्थिरता के बीच के अनुपात को मापता है। पिछले तरीकों को इस अनुपात के मोटे अनुमानों पर निर्भर रहना पड़ता था। इस नए मैपिंग का उपयोग करके, एजेंटों ने सटीक अनुपात को सीधे सीखना सीखा, जिसके परिणामस्वरूप प्रशिक्षण के दौरान काफी बेहतर निवेश रणनीतियाँ प्राप्त हुईं।
शोधकर्ताओं ने डिस्क्रीट ऑप्टिमाइज़ेशन समस्याओं का भी अन्वेषण किया, जैसे कि क्वांटम लॉजिक गेट्स की सबसे कुशल व्यवस्था खोजना या क्वांटम कंप्यूटिंग में उपयोग किए जाने वाले जटिल आरेखों (diagrams) को सरल बनाना। इन कार्यों में, लक्ष्य अक्सर एक लंबी खोज के दौरान प्राप्त एकल सर्वश्रेष्ठ अवस्था को खोजना होता है, न कि रास्ते में होने वाले सभी सुधारों के योग को। यहाँ, नए तरीके ने एजेंटों को अधिक साहसी ढंग से अन्वेषण करने की अनुमति दी। क्योंकि एजेंट को उन अस्थायी असफलताओं के लिए दंडित नहीं किया गया था जो बाद में एक बेहतर समाधान तक पहुँचने के लिए आवश्यक थीं, इसलिए उसने मानक संचयी रिवॉर्ड्स वाले एजेंटों की तुलना में तेजी से सीखा और उच्च-गुणवत्ता वाले समाधान खोजे। क्वांटम एरर करेक्शन से जुड़े एक प्रयोग में, नए तरीके ने प्रदर्शन में महत्वपूर्ण अंतर से सुधार किया, और कम समय में बेहतर समाधान खोजे।
इस कार्य की शक्ति इसकी सरलता और व्यापकता में निहित है। शोधकर्ताओं ने कोई नया लर्निंग एल्गोरिदम नहीं बनाया; उन्होंने एक 'ट्रांसलेशन लेयर' (अनुवाद परत) बनाई। इसका अर्थ यह है कि किसी भी विशिष्ट क्षेत्र के विशेषज्ञ, चाहे वह रोबोटिक्स हो या वित्त, अपने मौजूदा समस्या को ले सकते हैं, इस मैपिंग को लागू कर सकते हैं, और तुरंत उपलब्ध सबसे शक्तिशाली रिइन्फोर्समेंट लर्निंग टूल्स का उपयोग कर सकते हैं। यह विधि अनुमानित वातावरण और शोर (noise) से भरे वातावरण, दोनों में काम करती है, और सरल एवं जटिल दोनों लक्ष्यों को संभालती है। हालांकि शोधकर्ताओं ने उल्लेख किया कि एजेंट के लिए विस्तारित मेमोरी की आवश्यकता समस्या को थोड़ा बड़ा बना सकती है, आधुनिक डीप लर्निंग तकनीकें इसे संभालने के लिए पूरी तरह सक्षम हैं। परिणाम एक एकीकृत ढांचा है जो जटिल, वास्तविक दुनिया के उद्देश्यों और आर्टिफिशियल इंटेलिजेंस के परिष्कृत उपकरणों के बीच की बाधा को हटा देता है, जिससे ऐसी रणनीतियों को सीखने का मार्ग प्रशस्त होता है जिन्हें परिभाषित करना पहले बहुत कठिन था।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।