ASGARD: Action-Space Guard for UAV Resilience via Reinforcement Learning
यह शोध पत्र ASGARD को प्रस्तुत करता है, जो एक दो-चरणीय शिक्षक-छात्र ढांचा (teacher-student framework) है, जो केवल भौतिक अवस्था के इतिहास (physical state history) का उपयोग करके सुधारा गया एक्शन कमांड उत्पन्न करने के लिए एक मॉनिटर को प्रशिक्षित करके, रनटाइम एक्शन-स्पेस हमलों के विरुद्ध सुदृढीकरण लर्निंग (Reinforcement Learning) आधारित UAV नियंत्रकों की लचीलापन (resilience) को बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
ड्रोन अब केवल रिमोट-कंट्रोल खिलौने नहीं रह गए हैं; वे परिष्कृत मशीनें हैं जो दुनिया की व्याख्या करने और यह तय करने के लिए सॉफ्टवेयर का उपयोग करके आकाश में नेविगेट करती हैं कि उन्हें कहाँ उड़ना है। इस स्वायत्तता के केंद्र में सुदृढीकरण शिक्षण (reinforcement learning) नामक एक प्रकार का कृत्रिम बुद्धिमत्ता (artificial intelligence) है, जहाँ एक कंप्यूटर प्रोग्राम अनुभव और त्रुटि (trial and error) के माध्यम से एक वाहन को नियंत्रित करना सीखता है, ठीक वैसे ही जैसे एक बच्चा साइकिल चलाना सीखता है। सिस्टम अपने परिवेश का अवलोकन करता है, एक गतिविधि का प्रयास करता है, और इस पर प्रतिक्रिया प्राप्त करता है कि क्या उस गतिविधि ने उसे उसके लक्ष्य के करीब पहुँचाया। समय के साथ, यह सुरक्षित और कुशलता से उड़ने के लिए एक रणनीति बनाता है। हालाँकि, इस सॉफ्टवेयर पर निर्भरता एक भेद्यता (vulnerability) पैदा करती है। जिस तरह एक मानव पायलट को गलत संकेत द्वारा धोखा दिया जा सकता है, उसी तरह एक ड्रोन का कंप्यूटर भी ठगा जा सकता है। जबकि शोधकर्ता लंबे समय से हैकर्स द्वारा ड्रोन के सेंसरों में गलत डेटा डालने की चिंता करते रहे हैं, एक अधिक सूक्ष्म और खतरनाक खतरा उभर कर आया है: ऐसे हमले जो ड्रोन द्वारा निर्णय लेने के बाद होते हैं।
कल्पना कीजिए कि एक ड्रोन ने गणना की है कि उसे रास्ते पर बने रहने के लिए थोड़ा बाईं ओर झुकने की आवश्यकता है। कंप्यूटर यह निर्देश मोटरों को भेजता है। एक विशिष्ट प्रकार के साइबर हमले में, एक घुसपैgehend (intruder) कंप्यूटर के निर्णय और मोटर की क्रिया के बीच के उस क्षण भर में उस निर्देश को रोकता है, और क्रियान्वित होने से पहले ही कमांड को बदल देता है। ड्रोन का मस्तिष्क सोचता है कि वह सही ढंग से उड़ रहा है, लेकिन उसके शरीर को एक अलग, खतरनाक दिशा में जाने के लिए मजबूर किया जा रहा है। इसे 'एक्शन-स्पेस अटैक' (action-space attack) के रूप में जाना जाता है। क्योंकि हमला निर्णय लेने के बाद होता है, इसलिए पारंपरिक सुरक्षा प्रणालियाँ जो ड्रोन के सेंसर या कंप्यूटर के तर्क की जाँच करती हैं, अक्सर इसे पूरी तरह से चूक जाती हैं। ड्रोन स्पष्ट रूप से सोचता हुआ प्रतीत होता है, भले ही उसे हाईजैक किया जा रहा हो।
इस अदृश्य खतरे से निपटने के लिए, ब्रिटिश कोलंबिया विश्वविद्यालय के शोधकर्ताओं ने ASGARD नामक एक नई रक्षा प्रणाली विकसित की है। इस प्रणाली को ड्रोन के कमांड के लिए एक संरक्षक के रूप में डिज़ाइन किया गया है, यह सुनिश्चित करने के लिए कि मोटरों को वही मिले जो कंप्यूटर चाहता था, भले ही कोई हमलावर संदेश के साथ छेड़छाड़ करने की कोशिश करे। शोधकर्ताओं ने इस प्रणाली को एक दो-चरणीय प्रशिक्षण प्रक्रिया का उपयोग करके बनाया है जो इस तरह नकल करती है जैसे एक मास्टर शिक्षक किसी छात्र को प्रशिक्षित करता है। पहले चरण में, "शिक्षक" प्रणाली हमलों के बारे में गुप्त जानकारी तक पहुँच रखते हुए उड़ना सीखती है, जैसे कि यह जानना कि घुसपैgehend ठीक कब और कैसे नियंत्रणों के साथ छेड़छाड़ करने की कोशिश कर रहा है। यह विशेषाधिकार प्राप्त ज्ञान शिक्षक को एक सुरक्षित कमांड और एक दूषित कमांड के बीच अंतर समझने में सक्षम बनाता है। यह एक छिपा हुआ संकेत (hidden signal) उत्पन्न करना सीखता है जो वातावरण के शोर के बावजूद उड़ान के वास्तविक इरादे को पकड़ लेता है।
एक बार जब शिक्षक ने यह कौशल सीख लिया, तो वह इस ज्ञान को एक "छात्र" प्रणाली को सौंप देता है जो वास्तविक दुनिया में ड्रोन को उड़ाएगी। छात्र के पास गुप्त जानकारी तक पहुँच नहीं होती है; वह केवल ड्रोन की भौतिक गतिविधियों के इतिहास को देखता है, जैसे कि उसकी स्थिति, गति और अभिविन्यास (orientation)। सावधानीपूर्वक प्रशिक्षण के माध्यम से, छात्र केवल इन अवलोकन योग्य तथ्यों का उपयोग करके शिक्षक के छिपे हुए संकेत को पुनर्गठित करना सीखता है। यह छात्र को यह पहचानने की अनुमति देता है कि कब एक कमांड में बदलाव किया गया है, भले ही उसे हमले के विशिष्ट विवरणों का पता न हो। इस प्रणाली में एक हल्का मॉनिटरिंग घटक शामिल है जो निर्णय लेने वाले सॉफ्टवेयर और मोटरों के बीच स्थित होता है। यह मॉनिटर लगातार बाहर जाने वाले कमांड्स की जांच उसके द्वारा पुनर्गठित छिपे हुए संकेत के विरुद्ध करता है। यदि यह विसंगति का पता लगाता है, तो यह तुरंत कमांड को ठीक करता है इससे पहले कि वह मोटरों तक पहुँचे, जिससे हमले को वास्तविक समय में निष्प्रभावी कर दिया जाता है।
शोधकर्ताओं ने एक सिम्युलेटेड वातावरण में इस दृष्टिकोण का परीक्षण किया जहाँ एक ड्रोन को चेकपॉइंट्स की एक श्रृंखला के माध्यम से उड़ना था। उन्होंने ड्रोन को विभिन्न प्रकार के हमलों के अधीन किया, जिनमें वे हमले शामिल थे जो इसे आगे की ओर झुकने (pitch forward), बगल में लुढ़कने (roll sideways) या अपनी गति बदलने के लिए मजबूर करने की कोशिश करते थे। इन परीक्षणों में, बिना इस सुरक्षा के एक मानक ड्रोन कंट्रोलर लगभग आधे परिदृश्यों में क्रैश हो गया। यहाँ तक कि एक पिछला, उन्नत रक्षा तंत्र भी जो सेंसर हमलों को संभालने के लिए डिज़ाइन किया गया था, एक्शन-स्पेस घुसपैठ के सामने पूरी तरह विफल रहा, और जब चारों नियंत्रण चैनलों पर हमला किया गया, तो वह हर एक प्रयास में क्रैश हो गया। इसके विपरीत, ASGARD प्रणाली ने ड्रोन को सुरक्षित रूप से उड़ते रहने में मदद की। जब केवल एक नियंत्रण चैनल पर हमला किया गया, तो सिस्टम ने बिना किसी क्रैश के 95% मिशन सफलतापूर्वक पूरे किए। सबसे कठिन परिदृश्य में भी, जहाँ चारों नियंत्रण चैनलों पर एक साथ हमला किया गया था, सिस्टम ने दो-तिहाई मिशनों को पूरा करने में सफलता प्राप्त की, जो कि अन्य प्रणालियों के लिए असंभव था।
यह प्रणाली आश्चर्यजनक रूप से अनुकूलनीय भी सिद्ध हुई। शोधकर्ताओं ने ड्रोन को केवल एक विशिष्ट नियंत्रण, जैसे कि 'पिच' (pitch) पर हमलों के खिलाफ बचाव करने के लिए प्रशिक्षित किया, और फिर इसका परीक्षण उन अन्य नियंत्रणों पर किया जिन्हें उसने पहले कभी नहीं देखा था। सिस्टम ने अच्छी तरह से सामान्यीकरण (generalize) किया, अनदेखे खतरों के खिलाफ सफलतापूर्वक बचाव किया और अधिकांश मिशन पूरे किए। यह सुझाव देता है कि सिस्टम ने केवल विशिष्ट हमले के पैटर्न को याद करने के बजाय, नियंत्रण प्रवाह में भ्रष्टाचार का पता लगाने की एक मौलिक समझ विकसित की है। इसके अलावा, सिस्टम उन गुप्त हमलों के खिलाफ भी प्रभावी रहा जो समय के साथ हस्तक्षेप को धीरे-धीरे बढ़ाते हैं, एक ऐसी रणनीति जो अक्सर अन्य सुरक्षा प्रणालियों को चौंका देती है। ड्रोन के इतिहास को लगातार ट्रैक करके और व्यवधान बढ़ने के साथ अपने सुधारों को समायोजित करके, सिस्टम ने ड्रोन को रास्ते से भटकने से बचाया।
परिणाम संकेत देते हैं कि यह दो-चरणीय दृष्टिकोण एक ऐसी समस्या के लिए एक मजबूत समाधान प्रदान करता है जिसने स्वायत्त ड्रोन को असुरक्षित छोड़ दिया है। निर्णय लेने वाले सॉफ्टवेयर और भौतिक मोटरों के बीच एक स्मार्ट, सुधारात्मक परत रखकर, यह प्रणाली सुनिश्चित करती है कि ड्रोन अपने इच्छित पथ का पालन करे, भले ही कोई हमलावर कमांड लाइन को हाईजैक करने की कोशिश करे। हालांकि यह अध्ययन सिमुलेशन में किया गया था, लेकिन इसके निष्कर्ष एक स्पष्ट मार्ग सुझाते हैं कि कैसे तेजी से बढ़ते जुड़े हुए और संभावित रूप से शत्रुतापूर्ण विश्व में स्वायत्त उड़ान को सुरक्षित बनाया जा सकता है। यह कार्य प्रदर्शित करता है कि साइबर हमलों के प्रति लचीलापन केवल ड्रोन को रोकने या आपातकालीन लैंडिंग करने की आवश्यकता नहीं है; इसके बजाय, इसे वास्तविक समय में कमांड को सक्रिय रूप से ठीक करके प्राप्त किया जा सकता है, जिससे मशीन आत्मविश्वास के साथ अपना मिशन जारी रख सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।