Privileged observations enable rapid and reliable policy discovery directly in the physical world
यह शोध पत्र यह प्रदर्शित करता है कि एक अराजक भौतिक प्रणाली (chaotic physical system) के विशेषाधिकार प्राप्त अवलोकन (privileged observations), सुदृढीकरण सीखने वाले एजेंटों (reinforcement learning agents) को वास्तविक दुनिया में सीधे उच्च-प्रदर्शन वाली नीतियों को तेजी से खोजने में सक्षम बनाने के लिए निर्णायक हैं, क्योंकि ऐसे एजेंट जिनमें इस प्रवाह डेटा (flow data) का अभाव था, वे ड्रैग-घटाने वाली रणनीतियों को सफलतापूर्वक सीखने के बावजूद ड्रैग-बढ़ाने वाली रणनीतियों को सीखने में विफल रहे।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक तैराक पानी के माध्यम से आगे बढ़ने की कोशिश कर रहा है। यदि वह अपने चारों ओर घूमते हुए जलधाराओं (currents) को देख पाता, तो शायद वह अपने शरीर को इस तरह घुमाना सीख जाता जिससे प्रतिरोध को काटा जा सके, या शायद इस तरह कि वह खुद को आगे धकेलने के लिए पानी को पकड़ सके। यही 'एक्टिव फ्लो कंट्रोल' (active flow control) का सार है: एक ऐसा क्षेत्र जहाँ इंजीनियर वस्तुओं के चलने या स्थिर रहने के तरीके को बेहतर बनाने के लिए अदृश्य, अराजक तरल गति को नियंत्रित करने का प्रयास करते हैं। दशकों से, वैज्ञानिक जानते हैं कि एक धारा में सिलेंडर को घुमाने से इस बात में बदलाव आ सकता है कि पानी उसे कितना धक्का देता है। कभी-कभी, एक स्थिर घूर्णन (spin) ड्रैग (drag) को कम कर देता है, जिससे वस्तु आसानी से फिसल जाती है। दूसरी ओर, कभी-कभी एक विशिष्ट लयबद्ध घूर्णन वास्तव में ड्रैग को बढ़ा सकता है, जो वस्तु को पीछे रोकता है। चुनौती हमेशा उस घूर्णन के सटीक समय और गति को निर्धारित करने की रही है ताकि सर्वोत्तम परिणाम प्राप्त किया जा सके, विशेष रूप से इसलिए क्योंकि पानी का प्रवाह अराजक होता है और अनुमान लगाना कठिन होता है।
आमतौर पर, जब इंजीनियरों को यह सिखाना होता है कि ऐसे सिस्टम को कैसे नियंत्रित किया जाए, तो वे पानी का एक आभासी मॉडल (virtual model) बनाते हैं और कंप्यूटर को वहीं अभ्यास करने देते हैं। लेकिन आभासी मॉडल कभी भी पूर्ण नहीं होते; वे वास्तविक पानी के सूक्ष्म, अव्यवस्थित विवरणों को छोड़ देते हैं। इसलिए, ETH ज़्यूरिख के शोधकर्ताओं ने सिमुलेशन को पूरी तरह से छोड़ने का निर्णय लिया। उन्होंने एक भौतिक जल चैनल बनाया और एक कंप्यूटर एजेंट को सीधे वास्तविक, उथल-पुथल वाले पानी से सीखने के लिए प्रशिक्षित किया। उन्होंने एक सरल लेकिन गहरा प्रश्न पूछा: पानी को नियंत्रित करने का सबसे अच्छा तरीका सीखने के लिए, क्या कंप्यूटर को सीखने के दौरान अपने चारों ओर पानी को घूमते हुए देखने की आवश्यकता है? या क्या वह केवल वस्तु पर पड़ने वाले दबाव और खिंचाव को महसूस करके इसे समझ सकता है?
शोधकर्ताओं ने एक टेबलटॉप वॉटर चैनल बनाया, जो एक पारदर्शी टैंक है जहाँ पानी एक लूप में घूमता है। इसके भीतर, एक सिलेंडर प्रवाह में स्थित है, और एक मोटर इसे किसी भी गति या दिशा में घुमा सकती है। यह मापने के लिए कि पानी सिलेंडर पर कितना दबाव डाल रहा है, उन्होंने एक संवेदनशील टॉर्क सेंसर का उपयोग किया। पानी को देखने के लिए, उन्होंने 'पार्टिकल इमेज वेलोसिटीमेट्री' (particle image velocimetry) नामक तकनीक का उपयोग किया। इसमें पानी के माध्यम से एक लेजर शीट को चमकाया जाता है, जिसमें सूक्ष्म तैरते हुए कण होते हैं, और तेजी से तस्वीरें ली जाती हैं। इन तस्वीरों के बीच उन कणों के हिलने-डुलने को ट्रैक करके, एक कंप्यूटर सिलेंडर के ठीक पीछे पानी की गति और दिशा का विस्तृत, वास्तविक समय का मानचित्र बना सकता है। यह मानचित्र "विशेषाधिकार प्राप्त अवलोकन" (privileged observation) है—वह अतिरिक्त जानकारी जिसे कंप्यूटर प्रशिक्षण के दौरान देख सकता है, लेकिन बाद में इसकी आवश्यकता नहीं हो सकती है।
उन्होंने एक सामान्य-उद्देश्य वाले लर्निंग एजेंट (एक प्रकार का आर्टिफिशियल इंटेलिजेंस) को सिलेंडर को नियंत्रित करने के लिए प्रशिक्षित किया। प्रयोगों के एक सेट में, एजेंट को ड्रैग का अहसास और पानी के प्रवाह का विस्तृत मानचित्र दोनों दिए गए। दूसरे सेट में, एजेंट को केवल ड्रैग का अहसास दिया गया, जिसमें पानी का मानचित्र छिपा हुआ था। लक्ष्य दोहरा था: पहला, सिलेंडर को इस तरह घुमाना कि ड्रैग को यथासंभव कम किया जा सके, और दूसरा, सिलेंडर को इस तरह घुमाना कि ड्रैग को यथासंभव बढ़ाया जा सके।
परिणाम चौंकाने वाले थे और एक आश्चर्यजनक विषमता (asymmetry) को प्रकट करते हैं। जब एजेंट के पास पानी के प्रवाह का विस्तृत मानचित्र था, तो उसने अविश्वसनीय रूप से तेजी से सीखा। वास्तविक पानी के साथ बातचीत करने के कुछ ही मिनटों के भीतर, उसने ड्रैग को लगभग 32 प्रतिशत कम करने की रणनीति खोज ली। उसने ड्रैग को लगभग 25 प्रतिशत बढ़ाने की रणनीति भी जल्दी से खोज ली। ये संख्याएँ दशकों के अध्ययन से विकसित सर्वोत्तम ज्ञात मानव-निर्मित रणनीतियों के बराबर थीं या उनसे थोड़ा अधिक थीं।
हालाँकि, जब शोधकर्ताओं ने पानी का मानचित्र छिपा दिया और एजेंट को केवल ड्रैग माप का उपयोग करके सीखने के लिए मजबूर किया, तो कहानी पूरी तरह बदल गई। एजेंट अभी भी ड्रैग को कम करना सीख पा रहा था, और अंततः लगभग 31 प्रतिशत की कमी हासिल करने में सफल रहा। इसमें उसे थोड़ा अधिक समय लगा और यह थोड़ा परिवर्तनशील था। लेकिन जब लक्ष्य ड्रैग को बढ़ाना था, तो वह विफल रहा। पानी के प्रवाह को देखे बिना, किसी भी प्रशिक्षण रन ने ड्रैग को महत्वपूर्ण रूप से बढ़ाने की रणनीति नहीं सीखी। एजेंट यह नहीं समझ सका कि पानी को अधिक जोर से कैसे धकेला जाए, भले ही सर्वोत्तम संभव रणनीति मौजूद थी और भौतिक रूप से संभव थी।
यह समझने के लिए कि ऐसा क्यों हुआ, शोधकर्ताओं ने बारीकी से देखा कि पानी क्या कर रहा था। उन्होंने पाया कि जब भी सिलेंडर घूमना शुरू करता, तो पानी लगभग हमेशा प्रतिक्रिया के रूप में सिलेंडर पर पहले कम दबाव डालता था, चाहे लक्ष्य अधिक धक्का देना हो या कम। यह शुरुआती ड्रैग में गिरावट एक स्वाभाविक भौतिक प्रतिक्रिया है। ड्रैग को कम करने के प्रयास में लगे एजेंट के लिए, यह शुरुआती गिरावट एक सहायक संकेत थी कि वह सही रास्ते पर है। लेकिन ड्रैग बढ़ाने के लक्ष्य वाले एजेंट के लिए, यह शुरुआती गिरावट भ्रमित करने वाली थी; यह उसे ऐसा महसूस हुआ जैसे यह उसके उद्देश्य के विपरीत हो। पानी के विस्तृत मानचित्र के बिना बड़े परिदृश्य को समझने के लिए, एजेंट इस शुरुआती गिरावट में फंस गया और कभी भी सही रणनीति नहीं सीख सका।
शोधकर्ताओं ने फिर परीक्षण किया कि क्या एजेंट द्वारा सीखे गए रणनीतियों का उपयोग बिना मानचित्र के किया जा सकता है। उन्होंने उन सटीक घूमने वाले पैटर्न को रिकॉर्ड किया जिनका उपयोग एजेंट ने मानचित्र होने पर किया था, और फिर उन पैटर्न को निश्चित अनुक्रमों (fixed sequences) के रूप में फिर से चलाया। आश्चर्यजनक रूप से, वे निश्चित अनुक्रम लाइव, सोचने वाले एजेंट के समान ही प्रभावी रहे। एजेंट ने गतिविधियों का एक विशिष्ट सेट सीख लिया था जो इतना अच्छा काम करता था कि उसे निष्पादित करने के लिए पानी को लगातार देखने की आवश्यकता नहीं थी। यह सिद्ध करता है कि पानी का मानचित्र कार्य को करने के लिए आवश्यक नहीं था, लेकिन कार्य को खोजने के लिए यह अनिवार्य था।
यह खोज सीखने के एक महत्वपूर्ण अंतर को उजागर करती है: समाधान खोजने के लिए आपको जिसकी आवश्यकता होती है, वह अक्सर उसे उपयोग करने के लिए आवश्यक चीज़ से भिन्न होता है। इस मामले में, पानी के प्रवाह का समृद्ध, विस्तृत दृश्य एक शिक्षक की तरह था, जिसने एजेंट को तरल की भ्रमित करने वाली प्रारंभिक प्रतिक्रियाओं के माध्यम से मार्गदर्शन किया। एक बार जब एजेंट ने सही रास्ता खोज लिया, तो वह आँखें बंद करके भी उस पर चल सकता था। यह अध्ययन बताता है कि जटिल भौतिक प्रणालियों में, सीखने के चरण के दौरान अतिरिक्त जानकारी तक पहुँच होना सफलता और विफलता के बीच का निर्णायक कारक हो सकता है, भले ही वह जानकारी वास्तव में सिस्टम चलते समय उपलब्ध न हो। यह दर्शाता है कि जटिल, अराजक वास्तविक दुनिया में महारत हासिल करने के लिए, आर्टिफिशियल इंटेलिजेंस को उससे कहीं अधिक देखने की अनुमति दी जानी चाहिए जितना कि उसे वास्तव में उपयोग करने की अनुमति होगी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।