Efficient Hypergradient Descent for Inverse Reinforcement Learning
यह शोध पत्र एक कुशल इन्वर्स रीइन्फोर्समेंट लर्निंग पद्धति प्रस्तावित करता है जो एक संरचित हाइपरग्रेडिएंट प्राप्त करने के लिए आंतरिक उद्देश्य के हेसियन (Hessian) और पॉलिसी के फिशर इंफॉर्मेशन मैट्रिक्स (Fisher information matrix) के बीच आनुपातिकता का लाभ उठाता है, जिसे फिर बड़े फिशर मैट्रिसेस से जुड़ी स्केलेबिलिटी बाधाओं को दूर करने के लिए स्ट्रीमिंग स्पेक्ट्रल स्केचिंग (streaming spectral sketching) के माध्यम से अनुमानित किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक पेशेवर डांसर की तरह चलना सिखाने की कोशिश कर रहे हैं। आप रोबोट को डांस का एक वीडियो दिखा सकते हैं और कह सकते हैं, "बस मेरे मूव्स की हुबहू नकल करो।" इसे इमिटेशन लर्निंग (imitation learning) कहा जाता है। लेकिन क्या होगा अगर फर्श बदल जाए, या रोबोट को स्टेज के बजाय ट्रैम्पोलिन पर डांस करना पड़े? यदि इसने केवल मूव्स को रट लिया होता, तो यह बुरी तरह गिर सकता था। एक स्मार्ट तरीका यह है कि यह पता लगाया जाए कि डांसर ने उस तरह से मूवमेंट क्यों किया। वह क्या हासिल करने की कोशिश कर रहा था? वह कौन सा "स्कोर" था जिसे वे अधिकतम करने की कोशिश कर रहे थे? यही इनवर्स रीइन्फोर्समेंट लर्निंग (Inverse Reinforcement Learning - IRL) का लक्ष्य है: केवल डांस की नकल करने के बजाय, हम उस अदृश्य "रिवॉर्ड सिस्टम" को रिवर्स-इंजीनियर करने की कोशिश करते जिसका विशेषज्ञ पालन कर रहा था। एक बार जब हम खेल के नियम जान लेते हैं, तो हम रोबोट को किसी भी सतह पर डांस करना सिखा सकते हैं, न कि केवल उसी सतह पर जिसे उसने वीडियो में देखा था।
इसे करने के लिए, वैज्ञानिक बाइलेवल ऑप्टिमाइज़ेशन (bilevel optimization) नामक एक पेचीदा दो-चरणीय खेल का उपयोग करते हैं। इसे एक शिक्षक और छात्र के रूप में सोचें। "इनर लेवल" (inner level) वह छात्र है जो हमारे द्वारा दिए गए नियमों (रिवॉर्ड) के आधार पर सबसे अच्छे मूव्स सीखने की कोशिश कर रहा है। "आउटर लेवल" (outer level) वह शिक्षक है जो यह जांच रहा है कि छात्र के मूव्स विशेषज्ञ जैसे दिखते हैं या नहीं। यदि वे मेल नहीं खाते हैं, तो शिक्षक नियमों (रिवॉर्ड) में थोड़ा बदलाव करता है और छात्र को वापस अभ्यास के लिए भेज देता है। समस्या यह है कि यह पता लगाना कि नियमों को ठीक से कैसे बदला जाए, अविश्वसनीय रूप से कठिन है। यह अनुमान लगाने जैसा है कि नियमों में एक छोटा सा बदलाव छात्र की पूरी सीखने की प्रक्रिया में कैसे असर डालेगा। आमतौर पर, इसकी गणना करने के लिए बहुत अधिक कंप्यूटर मेमोरी की आवश्यकता होती है, जैसे कि केवल एक गणित की समस्या हल करने के लिए अपने बैकपैक में एक पूरी लाइब्रेरी ले जाने की कोशिश करना।
यह शोध पत्र उस मेमोरी समस्या को हल करने के लिए एक चतुर शॉर्टकट पेश करता है। लेखकों, निकिता सेवरियुकोव और HSE यूनिवर्सिटी की उनकी टीम ने खोजा कि जब छात्र (रोबोट) ने नियमों को पूरी तरह से सीख लिया होता है, तो उनके सीखने की प्रक्रिया का गणितीय "आकार" बिल्कुल एक विशिष्ट मानचित्र की तरह दिखता है जिसे फिशर इंफॉर्मेशन मैट्रिक्स (Fisher Information Matrix) कहा जाता है। यह एक बड़ी बात है क्योंकि इस मानचित्र की एक विशेष संरचना है जो इसे संभालना आसान बनाती है। हालाँकि, यह मानचित्र भी कंप्यूटर पर स्टोर करने के लिए बहुत बड़ा हो सकता है। इसलिए, टीम ने एक "स्ट्रीमिंग स्पेक्ट्रल स्केच" (streaming spectral sketch) का उपयोग करने का तरीका ईजाद किया। कल्पना करें कि मानचित्र के हर एक विवरण को लिखने के बजाय, आप एक त्वरित, स्मार्ट स्नैपशॉट लेते हैं जो कचरे को हटाते हुए सबसे महत्वपूर्ण विशेषताओं को कैप्चर करता है। वे इस पद्धति को एफिशिएंट हाइपरग्रेडिएंट डिसेंट (Efficient Hypergradient Descent) कहते हैं।
शोधकर्ताओं ने इस विचार का परीक्षण दो अलग-अलग दुनिया में किया: एक सरल पोल-बैलेंसिंग गेम जिसे कार्टपोल (CartPole) कहा जाता है, और एक अधिक जटिल, निरंतर नियंत्रण कार्य जिसे एलक्यूआर (LQR) कहा जाता है। उन्होंने अपने नए "स्केचिंग" तरीके की तुलना पुराने, धीमे तरीकों से की। परिणाम उत्साहजनक थे। जटिल LQR वातावरण में, उनके तरीके ने आवश्यक मेमोरी को लगभग 1.31 गुना कम कर दिया और यह थोड़ा तेज़ भी था। सरल कार्टपोल गेम में, यह लगभग 1.3 गुना तेज़ था। हालांकि "स्केच" पद्धति हमेशा धीमे और भारी तरीकों की तुलना में बिल्कुल सटीक रिवॉर्ड मैप नहीं बना पाती थी, लेकिन यह उसके बहुत करीब थी। अधिक महत्वपूर्ण बात यह है कि इसने रोबोट को विशेषज्ञ की शैली को उतनी ही अच्छी तरह से सीखने में सक्षम बनाया, लेकिन इसने इसे बहुत अधिक कुशलता से किया। लेखक सुझाव देते हैं कि इन स्मार्ट, हल्के अनुमानों का उपयोग करके, हम रोबोट को विशेषज्ञों से सीखने के लिए प्रशिक्षित कर सकते हैं बिना सारा डेटा रखने के लिए सुपरकंप्यूटरों की आवश्यकता के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।