Disentangled Unsupervised Skill Discovery for Efficient Hierarchical Reinforcement Learning
यह शोध पत्र डिसेंटैंगल्ड अनसुपरवाइज्ड स्किल डिस्कवरी (DUSDi) का प्रस्ताव करता है, जो एक म्यूचुअल-इन्फॉर्मेशन-आधारित ऑब्जेक्टिव और वैल्यू फैक्टराइजेशन के माध्यम से पुन: प्रयोज्य, फैक्टर-विशिष्ट कौशल सीखने की एक नवीन विधि है, जो डाउनस्ट्रीम पदानुक्रमित सुदृढीकरण शिक्षण (hierarchical reinforcement learning) कार्यों को कुशलतापूर्वक हल करने में मौजूदा दृष्टिकोणों से काफी बेहतर प्रदर्शन करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। पुराने तरीके में, आप रोबोट को एक एकल "कौशल डायल" (skill dial) देते। यदि रोबोट उस डायल को ऊपर घुमाता, तो कार की गति बढ़ जाती, वह बाईं ओर मुड़ जाती और एक ही समय में अपनी हेडलाइट्स भी चमका देती। यदि आप चाहते कि रोबोट केवल हेडलाइट्स जला दे बिना गति या दिशा बदले, तो यह एक दुस्वप्न बन जाता। रोबोट को अनुमान लगाना पड़ता, "अगर मैं डायल को थोड़ा सा घुमाता हूँ, तो शायद लाइट जल जाए लेकिन कार स्थिर रहे?" यह एक कठपुतली को नियंत्रित करने जैसा है जहाँ एक धागा खींचने से पूरा शरीर उछल पड़ता है। शोधकर्ता इसे "एंटैंगल्ड" (entangled) कौशल कहते हैं, और यह पेपर तर्क देता है कि यह नए कार्यों को सीखना अविश्वसनीय रूप से कठिन और धीमा बना देता है।
यहाँ आता है DUSDi (डिसेन्टैंगल्ड अनसुपरवाइज्ड स्किल डिस्कवरी), एक नई विधि जो एक मास्टर कठपुतली संचालक की तरह है जिसके पास हर एक गतिविधि के लिए अलग बटन वाला रिमोट कंट्रोल है। एक बड़े डायल के बजाय, DUSDi रोबोट को "स्वतंत्र कौशल बटनों" का एक सेट देता है। एक बटन केवल गति को नियंत्रित करता है, दूसरा केवल स्टीयरिंग को, और तीसरा केवल हेडलाइट्स को। रोबोट इन बटनों को बिना किसी शिक्षक या पुरस्कार के, बस दुनिया का पता लगाकर (exploring) सीखता है।
पेपर का मुख्य निष्कर्ष यह है कि जब आप रोबोट को ये अलग-अलग, "डिसेन्टैंगल्ड" बटन सिखाते हैं, तो वह बाद में नए कार्यों को सीखने में जीनियस बन जाता है। कंप्यूटर सिमुलेशन की एक श्रृंखला में—एक साधारण 2D शूटर गेम से लेकर एक जटिल 3D रोबोट जो घर में नेविगेट कर रहा है तक—DUSDi ने इन कारकों को स्वतंत्र रूप से नियंत्रित करना सीखा। जब शोधकर्ताओं ने फिर रोबोट को विशिष्ट चुनौतियाँ हल करने के लिए कहा (जैसे "लाल क्षेत्र की ओर ड्राइव करें" या "टीवी चालू करें"), तो DUSDi के अलग बटनों का उपयोग करने वाला रोबोट पुराने "एंटैंगल्ड" डायल वाले रोबोट की तुलना में बहुत तेज़ी से सीखता और बेहतर प्रदर्शन करता।
यह पेपर स्पष्ट रूप से इस विचार का खंडन करता है कि जटिल कार्यों के लिए एक एकल, अव्यवस्थित कौशल चर (skill variable) पर्याप्त है। यह दिखाता है कि जब आप रोबोट को ऐसे कौशल सीखने के लिए मजबूर करते हैं जहाँ एक बदलाव एक साथ सब कुछ बदल देता है, तो रोबोट भ्रमित हो जाता है और नए लक्ष्यों के लिए इन कौशलों को कैसे संयोजित किया जाए, यह समझने में संघर्ष करता है। उन्होंने इसे चार अलग-अलग वातावरणों में 13 विभिन्न डाउनस्ट्रीम कार्यों के माध्यम से मापकर देखा। उन जटिल दुनियाओं में जहाँ रोबोट को एक साथ कई चीजों को संभालना था (जैसे 10 अलग-अलग एजेंटों को नियंत्रित करना या एक अस्त-व्यस्त कमरे में रोबोटिक हाथ को नियंत्रित करना), पुराने तरीके अक्सर विफल हो गए या बहुत धीरे सीखे, जबकि DUSDi ने लगातार उन्हें पछाड़ दिया।
एक शानदार ट्रिक जिसका उपयोग पेपर में किया गया है, वह है "म्युचुअल इंफॉर्मेशन" (mutual information) नामक एक गणितीय "स्कोरकार्ड"। इसे एक खेल की तरह समझें जहाँ रोबोट को अंक मिलते हैं यदि वह एक विशिष्ट बटन (जैसे "गति" बटन) से गति बदलता है, लेकिन उसे नकारात्मक अंक मिलते हैं यदि वही बटन गलती से स्टीयरिंग या लाइट को बदल देता है। रोबोट अपने स्कोर को अधिकतम करने के लिए सीखता है ताकि वह अपने कौशलों को पूरी तरह से अलग रख सके। इस सीखने की प्रक्रिया को तेज़ और कम अस्थिर बनाने के लिए, शोधकर्ताओं ने रोबोट के "वैल्यू" (मूल्य) गणना को छोटे टुकड़ों में तोड़ दिया, जो प्रत्येक बटन के लिए एक अलग हिस्सा था, न कि पूरे अव्यवस्थित मिश्रण के मूल्य का अनुमान लगाने की कोशिश की। इसने रोबोट को अपने अलग कौशलों को अधिक स्थिरता से सीखने में मदद की, विशेष रूप से बड़े और अधिक जटिल सिमुलेशन में।
पेपर ने यह भी परीक्षण किया कि क्या यह तब काम करता है जब रोबोट केवल कैमरा (पिक्सेल) के माध्यम से "देख" सकता है, बजाय इसके कि वह दुनिया के सटीक नंबरों को जानता हो। एक विशेष इमेज-रीडिंग टूल का उपयोग करके, DUSDi अभी भी इन अलग-अलग कौशलों को सीखने और कार्यों को हल करने में सक्षम था, जबकि अन्य विधियाँ केवल छवियों के साथ शुरू भी नहीं हो पाई थीं।
हालाँकि, लेखक सावधानी बरतते हुए कहते हैं कि यह विधि इस बात पर निर्भर करती है कि रोबोट के पास दुनिया का "फैक्टर्ड" (factored) दृश्य हो—अर्थात, उसे दुनिया को अलग-अलग हिस्सों (जैसे गति, दिशा और लाइट) के रूप में देखने में सक्षम होना चाहिए, न कि केवल एक धुंधले धब्बे के रूप में। हालाँकि उन्होंने दिखाया है कि यह छवियों के साथ काम कर सकता है क्योंकि वे पहले उन हिस्सों को निकाल लेते हैं, लेकिन वे सुझाव देते हैं कि बहुत ही अव्यवस्थित, वास्तविक दुनिया के वातावरण के लिए जहाँ रोबोट आसानी से कारकों को अलग नहीं कर सकता, इस विधि को मदद की आवश्यकता हो सकती है। लेकिन उनके द्वारा परीक्षण किए गए सिम्युलेटेड दुनिया में, परिणाम स्पष्ट थे: रोबोट को एक एकल, उलझे हुए डायल के बजाय स्वतंत्र, डिसेन्टैंगल्ड कौशल का एक सेट देना, उसे वास्तविक दुनिया के लिए तैयार करने का एक बहुत बेहतर तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।