Deep Reinforcement Learning for Reach-Avoid-Stay Problems
यह शोध पत्र एक दो-चरणीय डीप रिइन्फोर्समेंट लर्निंग फ्रेमवर्क प्रस्तावित करता है जो अधिकतम सुदृढ़ रीच-अवॉयड-स्टे (Reach-Avoid-Stay) सेट और एक संगत स्विचिंग कंट्रोल पॉलिसी को संयुक्त रूप से सीखता है, जो मौजूदा विधियों की तुलना में सीमित विक्षोभों (bounded disturbances) के तहत सिस्टम को लक्ष्य सेटों तक सुरक्षित रूप से पहुँचने और उनके भीतर बने रहने को सुनिश्चित करने में बेहतर सटीकता और प्रदर्शन प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोटिक्स और स्वायत्त मशीनों की दुनिया में, सुरक्षा केवल एक दुर्घटना से बचने के बारे में नहीं है; यह इस बारे में है कि मशीन ठीक कहाँ जा सकती है और, इससे भी महत्वपूर्ण बात यह है कि उसे कहाँ रुकना चाहिए। एक सेल्फ-ड्राइविंग कार या डिलीवरी ड्रोन की कल्पना करें जो एक व्यस्त शहर में नेविगेट कर रहा है। इंजीनियर "सुरक्षित क्षेत्रों" (सेफ ज़ोन) को मैप करने के लिए गणितीय उपकरणों का उपयोग करते हैं, यह सुनिश्चित करते हुए कि यदि मशीन एक निश्चित स्थान से शुरू होती है, तो वह किसी चीज़ से टकराए बिना अपने गंतव्य तक पहुँच सके। हालाँकि, इन सुरक्षा मानचित्रों में एक सामान्य दोष यह है कि वे अक्सर मशीन को लक्ष्य तक पहुँचने का तरीका तो बताते हैं, लेकिन उसे वहाँ बने रहने का तरीका बताने में विफल रहते हैं। एक वाहन पार्किंग स्थल तक तो पहुँच सकता है, लेकिन हवा या अचानक आई गति के कारण, वह पर्याप्त रूप से धीमा होने में असमर्थ हो सकता है ताकि वह वहीं खड़ा रह सके, जिससे वह सुरक्षित क्षेत्र से बाहर निकलकर खतरे में पड़ सकता है। पहुँचने और बने रहने के बीच का यह अंतर कंप्यूटर वैज्ञानिकों के लिए एक कठिन समस्या रही है जो मशीनों को अप्रत्याशित वातावरण में वास्तव में विश्वसनीय बनाने की कोशिश कर रहे हैं।
इसे हल करने के लिए, नॉर्थ कैरोलिना स्टेट यूनिवर्सिटी और यूनिवर्सिटी ऑफ टेक्सास एट ऑस्टिन के शोधकर्ताओं की एक टीम ने मशीनों को लक्ष्य तक पहुँचने और किसी भी व्यवधान के विरुद्ध अपनी स्थिति बनाए रखने के लिए सिखाने का एक नया तरीका विकसित किया है। उन्होंने एक विशिष्ट चुनौती पर ध्यान केंद्रित किया जिसे "रीच-अवॉयड-स्टे" (पहुँचना-बचना-रुकना) समस्या कहा जाता है। सरल शब्दों में, यह पूछता है: किन शुरुआती बिंदुओं से एक मशीन सुरक्षित रूप से लक्ष्य तक पहुँच सकती है, सभी बाधाओं से बच सकती है, और फिर उस लक्ष्य के भीतर हमेशा के लिए बनी रह सकती है, भले ही हवा चल रही हो या सड़क फिसलन भरी हो? पिछले तरीके इसमें संघर्ष करते थे क्योंकि या तो वे जटिल गणितीय डिजाइनों पर निर्भर थे जिन्हें जटिल मशीनों के लिए बनाना कठिन था, या उन्होंने अवास्तविक धारणाएँ बनाईं, जैसे कि यह मान लेना कि एक वाहन तुरंत रुक सकता है। शोधकर्ताओं ने 'डीप रीइन्फोर्समेंट लर्निंग' नामक आर्टिफिशियल इंटेलिजेंस का उपयोग करते हुए एक दो-चरणीय सीखने की प्रक्रिया का प्रस्ताव दिया, जहाँ एक कंप्यूटर एक सिम्युलेटेड दुनिया में परीक्षण और त्रुटि (ट्रायल एंड एरर) के माध्यम से सीखता है।
टीम का दृष्टिकोण एक दो-चरणीय यात्रा की तरह काम करता है। सबसे पहले, कंप्यूटर लक्ष्य क्षेत्र के भीतर एक विशेष आंतरिक क्षेत्र की पहचान करना सीखता है। यह आंतरिक क्षेत्र एक ऐसी जगह है जहाँ मशीन को हमेशा सुरक्षित रूप से रहना चाहिए, चाहे उसे कितने भी व्यवधानों का सामना करना पड़े। शोधकर्ता इसे "रोबस्ट वायबिलिटी कर्नेल" कहते हैं। इसे खोजने के लिए, AI एक 'पॉलिसी', या नियमों का एक सेट सीखता है, जो मशीन को इस तरह से चलते रहने में मदद करता है कि वह कभी भी इस सुरक्षित आंतरिक घेरे से बाहर न निकले। एक बार जब कंप्यूटर इस "रुकने" (स्टे) के व्यवहार में महारत हासिल कर लेता है, तो वह दूसरे चरण पर जाता है। यहाँ, वह यह सीखता है कि मशीन को किसी भी शुरुआती बिंदु से उस सुरक्षित आंतरिक क्षेत्र तक कितनी तेज़ी से पहुँचाया जा सकता है, जबकि रास्ते में सभी बाधाओं से बचा जाए। शोधकर्ताओं ने गणितीय रूप से सिद्ध किया कि यदि कोई मशीन इस आंतरिक क्षेत्र तक पहुँच सकती है और फिर वहाँ बनी रह सकती है, तो उसने सफलतापूर्वक पूरा कार्य पूरा कर लिया है। इन दो सीखे हुए व्यवहारों को एक एकल स्विचिंग सिस्टम में संयोजित करके, मशीन को पता होता है कि कब लक्ष्य की ओर बढ़ना है और कब उस मोड में स्विच करना है जो उसे अपनी जगह पर स्थिर रखता है।
शोधकर्ताओं ने इस पद्धति का परीक्षण कई अलग-अलग परिदृश्यों पर किया, जिसमें एक ट्रैक पर एक साधारण द्वि-आयामी कार्ट से लेकर एक वर्टिकल टेकऑफ़ एंड लैंडिंग टैक्सी के जटिल, उच्च-आयामी सिमुलेशन (जो शहर के बीच से उड़ रही है) और एक चलते हुए कंबाइन हार्वेस्टर से फसल उतारते हुए ट्रैक्टर तक शामिल हैं। साधारण कार्ट के मामले में, उन्होंने अपनी नई पद्धति की तुलना एक पुरानी तकनीक से की जो जटिल गणितीय फलनों का उपयोग करती है। उनके नए दृष्टिकोण ने एक ऐसा सुरक्षित शुरुआती क्षेत्र पहचाना जो पुराने तरीके द्वारा खोजे गए क्षेत्र से लगभग पंद्रह गुना बड़ा था, जिसका अर्थ है कि इसने मशीन को कई अधिक स्थितियों से शुरू करने की अनुमति दी बिना विफलता के जोखिम के। फ्लाइंग टैक्सी और ट्रैक्टर वाले अधिक जटिल सिमुलेशन में, नए तरीके ने 95 प्रतिशत से अधिक सटीकता के साथ सुरक्षित शुरुआती क्षेत्रों की पहचान की, भले ही सीखने की प्रक्रिया में कंप्यूटर प्रशिक्षण के दौरान होने वाली छोटी त्रुटियाँ शामिल थीं।
परिणामों ने पुराने तरीकों से प्रशिक्षित मशीनों और इस नए दो-चरणीय ढांचे से प्रशिक्षित मशीनों के बीच एक स्पष्ट अंतर दिखाया। फ्लाइंग टैक्सी पर परीक्षण करते समय, पुराना "रीच-एंड-अवॉयड" तरीका, जो केवल लक्ष्य तक पहुँचने पर ध्यान देता है, वहाँ रुकने के कार्य में पूरी तरह विफल रहा और शून्य प्रतिशत सफलता दर प्राप्त की। इसके विपरीत, नए तरीके ने 93 प्रतिशत सफलता प्राप्त की। इसी तरह, ट्रैक्टर परिदृश्य के लिए, नया तरीका 99.3 प्रतिशत सफल रहा, जबकि पुराना तरीका केवल 73.5 प्रतिशत सफल रहा। शोधकर्ताओं ने पाया कि पुराने तरीके अक्सर मशीनों को पूरी गति से लक्ष्य क्षेत्र में ले जाते थे, जिससे उनके पास धीमे होने और वहीं टिके रहने का कोई रास्ता नहीं बचता था। हालाँकि, नया तरीका मशीन को जल्दी धीमा करना सीख गया, जिससे यह सुनिश्चित हुआ कि वह सुरक्षित आंतरिक क्षेत्र में ऐसी गति पर प्रवेश करे जहाँ वह अनिश्चित काल तक बनी रह सके।
हालाँकि सिमुलेशन अत्यधिक सफल रहे, शोधकर्ताओं ने नोट किया कि उनका सिस्टम प्रशिक्षण शुरू होने से पहले वातावरण और मशीन के भौतिक विज्ञान (फिजिक्स) की सटीक समझ पर निर्भर करता है। यदि वास्तविक दुनिया कंप्यूटर मॉडल से अलग व्यवहार करती है—उदाहरण के लिए, यदि हवा अनुमान से अधिक तेज़ है या ज़मीन अधिक फिसलन भरी है—तो प्रशिक्षित मशीन सुरक्षा की गारंटी नहीं दे पाएगी। टीम का सुझाव है कि भविष्य के कार्यों को अज्ञात चीजों को संभालने के लिए वास्तविक दुनिया के सेंसर डेटा को एकीकृत करने की आवश्यकता होगी। फिलहाल के लिए, यह दो-चरणीय शिक्षण ढांचा एक महत्वपूर्ण प्रगति प्रदान करता है, जो मशीनों को न केवल पहुँचना, बल्कि बने रहना सिखाने का एक तरीका प्रदान करता है, जिससे एक सैद्धांतिक सुरक्षा गारंटी को जटिल, वास्तविक दुनिया के अनुप्रयोगों के लिए एक व्यावहारिक उपकरण में बदल दिया गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।