Explainable Autonomous Cyber Defense using Adversarial Multi-Agent Reinforcement Learning
यह शोध पत्र C-MADF को प्रस्तुत करता है, जो एक संरचनात्मक रूप से बाधित स्वायत्त साइबर रक्षा ढांचा है जो उन्नत निरंतर खतरों (एडवांस्ड पर्सिस्टेंट थ्रेट्स) का पता लगाने में फाल्स पॉजिटिव को कम करने और व्याख्यात्मकता बढ़ाने के लिए कॉज़ल मॉडलिंग को एडवर्सरियल डुअल-पॉलिसी सुदृढीकरण लर्निंग के साथ जोड़ता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक उच्च-सुरक्षा वाली इमारत है जहाँ स्वायत्त रोबोटों (autonomous robots) की एक टीम को परिसर की सुरक्षा करने का काम सौंपा गया है। उनका काम घुसपैठियों को पहचानना और आवश्यकता पड़ने पर इमारत को लॉक डाउन करना है।
अतीत में, ये रोबोट डरे हुए सुरक्षा गार्डों की तरह काम करते थे। यदि वे किसी छाया को हिलते हुए देखते, तो वे तुरंत "घुसपैठिया!" चिल्ला देते और हर दरवाजा बंद कर देते, भले ही वह केवल एक बिल्ली या सफाईकर्मी हो। इसे फॉल्स पॉजिटिव (False Positive) कहा जाता है। वास्तविक दुनिया के परिदृश्य में (जैसे पावर ग्रिड या बैंक में), अनावश्यक रूप से सब कुछ लॉक कर देने से अराजकता फैलती है और इमारत का काम रुक जाता है।
इसके अलावा, बुरे हैकर्स (APT actors) बहुत चतुर होते हैं। वे केवल घुसपैकी नहीं होते; वे भेष भी बदलते हैं। वे सफाईकर्मी के कदमों की नकल कर सकते हैं या भ्रमित करने के लिए एक सेकंड के लिए कैमरों को बंद कर सकते हैं। इसे टेलीमेट्री मैनिपुलेशन (Telemetry Manipulation) कहा जाता है।
आपके द्वारा साझा किया गया पेपर एक नई प्रणाली पेश करता है जिसे C-MADF (कॉज़ल मल्टी-एजेंट डिसीजन फ्रेमवर्क) कहा जाता है। इसे उन डरे हुए रोबोटों को एक अत्यधिक प्रशिक्षित, तार्किक और आत्म-जांच करने वाली सुरक्षा टीम में अपग्रेड करने के रूप में समझें।
यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:
1. "कारण-और-प्रभाव" का मानचित्र (The SCM)
पुराने सुरक्षा सिस्टम सहसंबंध (correlations) की तलाश करते थे। वे सोचते थे, "यदि लाइटें झपकी मारती हैं और दरवाजा खुलता है, तो यह हमला होना चाहिए!" लेकिन हैकर्स इस तरह से चीजों को धोखा दे सकते हैं कि बिना किसी कारण के लाइटें झपकी मारें।
C-MADF एक कॉज़ल मैप (Causal Map) बनाता है। यह सीखता है कि चीजें वास्तव में कैसे घटित होती हैं।
- उपमा: एक जासूस की कल्पना करें जो जानता है कि "धुआं आग के अलार्म का कारण बनता है," लेकिन "फायर अलार्म धुएं का कारण नहीं बनता।"
- यह कैसे मदद करता है: यदि सिस्टम देखता है कि फायर अलार्म बज रहा है लेकिन धुआं नहीं है, तो वह जानता है कि सेंसर के साथ कुछ गलत है, न कि वहां आग लगी है। यह घबराने से इनकार कर देता है क्योंकि कारण (धुआं) गायब है। यह रोबोटों को केवल इसलिए लॉक डाउन करने से रोकता है क्योंकि एक सेंसर में खराबी आ गई थी।
2. "प्रतिद्वंद्वियों की परिषद" (ब्लू और रेड टीमें)
केवल एक रोबोट द्वारा निर्णय लेने के बजाय, C-MADF दो रोबोटों का उपयोग करता है जो कार्य करने से पहले एक-दूसरे से बहस करते हैं।
- ब्लू टीम (आक्रामक रक्षक): इसका काम बुरे लोगों को पकड़ना है। यह कहता है, "मुझे एक संदिग्ध पैटर्न दिख रहा है! चलो दरवाजा लॉक करते हैं!"
- रेड टीम (संदेहवादी वकील): इसका काम "डेविल्स एडवोकेट" (विपक्षी तर्क देने वाला) बनना है। यह कहती है, "रुको। क्या हमारे पास पर्याप्त सबूत हैं? क्या यह एक गलत अलार्म हो सकता है? यदि हम अभी दरवाजा लॉक करते हैं, तो हम निर्दोष लोगों को नुकसान पहुंचा सकते हैं।"
जादू: वे केवल अनुमान नहीं लगाते; वे कॉज़ल मैप के आधार पर बहस करते हैं।
- यदि ब्लू टीम दरवाजा लॉक करना चाहती है, तो रेड टीम पूछती है, "क्या आपने पहले स्मोक सेंसर की जांच की?"
- यदि ब्लू टीम कहती है, "नहीं," तो रेड टीम कार्रवाई को रोक देती है।
- यदि वे सहमत होते हैं, तो कार्रवाई होती है। यदि वे बहुत अधिक असहमत होते हैं, तो सिस्टम रुक जाता है और मानव से मदद मांगता है।
3. "ट्रैफिक लाइट" स्कोर (The ETS)
सिस्टम को यह कैसे पता चलता है कि मानव से मदद कब मांगनी है? यह एक स्कोर का उपयोग करता है जिसे एक्सप्लेनेबिलिटी-ट्रांसपेरेंसी स्कोर (ETS) कहा जाता है।
- ग्रीन लाइट (उच्च स्कोर): रोबोट सहमत हैं, सबूत स्पष्ट हैं, और कॉज़ल मैप समझ में आता है। कार्रवाई: स्वचालित रूप से दरवाजा लॉक करें।
- येलो लाइट (मध्यम स्कोर): रोबोट थोड़े अनिश्चित हैं, या सबूत अस्पष्ट हैं। कार्रवाई: रुकें और अधिक सुराग इकट्ठा करें।
- रेड लाइट (कम स्कोर): रोबोट आपस में लड़ रहे हैं, सबूत भ्रमित करने वाले हैं, या हैकर्स उन्हें धोखा देने की कोशिश कर रहे हैं। कार्रवाई: रुकें! तुरंत मानव पर्यवेक्षक को बुलाएं।
यह स्कोर एक "आत्मविश्वास मीटर" के रूप में कार्य करता है। यह सुनिश्चित करता है कि सिस्टम भ्रमित होने पर अंधाधुंध कार्य न करे।
4. "नो-शॉर्टकट" नियम (The DAG Roadmap)
सिस्टम रोबोटों को एक विशिष्ट जांच पथ का पालन करने के लिए मजबूर करता है। वे "साक्ष्य एकत्र करने" की जांच किए बिना सीधे "लॉक डाउन" पर नहीं कूद सकते।
- उपमा: यह एक वीडियो गेम की तरह है जहां आप सभी चाबियां एकत्र किए बिना अंतिम बॉस से नहीं लड़ सकते।
- यह क्यों महत्वपूर्ण है: हैकर्स अक्सर सिस्टम को कदम छोड़ने के लिए धोखा देने की कोशिश करते हैं। यह नियम सिस्टम को अपना होमवर्क करने के लिए मजबूर करता है, जिससे उन्हें बेवकूफ बनाना बहुत कठिन हो जाता है।
परिणाम: यह एक बड़ी बात क्यों है?
शोधकर्ताओं ने इस प्रणाली का परीक्षण एक वास्तविक दुनिया के डेटासेट (CICIoT2023) पर किया और इसकी तुलना मौजूदा सर्वश्रेष्ठ सुरक्षा AI से की।
- पुराने सिस्टम: वे बुरे लोगों को खोजने में अच्छे थे, लेकिन वे बहुत शोर (noisy) पैदा करते थे। जब कुछ गलत नहीं था तब भी वे 8% से 11% बार सिस्टम को लॉक कर देते थे (फॉल्स पॉजिटिव)। यह एक ऐसे गार्ड की तरह है जो हर छाया पर गोली चलाता है।
- C-MADF: इसने बुरे लोगों को उतनी ही अच्छी तरह से पकड़ा, लेकिन यह केवल 1.8% बार गलत था जब यह गलत हुआ।
- जीत: इसने "शोर" को लगभग 80% कम कर दिया। इसका मतलब है कम गलत अलार्म, कम घबराहट, और एक ऐसा सिस्टम जिस पर मनुष्य वास्तव में स्वचालित रूप से चलाने के लिए भरोसा कर सकते हैं।
सारांश
C-MADF एक सुरक्षा टीम को डरे हुए, शंकालु गार्डों के समूह से बदलकर एक तार्किक, बहस करने वाली और सतर्क जांच इकाई में अपग्रेड करने जैसा है।
- यह केवल संयोग नहीं, बल्कि कारण और प्रभाव को समझता है।
- यह हर निर्णय की दोबारा जांच और बहस करने के लिए दो एजेंटों का उपयोग करता है।
- इसके पास एक आत्मविश्वास मीटर है जो जानता है कि कब रुकना है और मानव से पूछना है।
- यह एक कठोर नियम पुस्तिका का पालन करता है ताकि यह कभी भी कदम न छोड़ दे।
परिणामस्वरूप, यह एक साइबर-रक्षा प्रणाली है जो तेज़, स्मार्ट और सबसे महत्वपूर्ण रूप से, इतनी सुरक्षित है कि इसे पावर ग्रिड और अस्पतालों जैसे महत्वपूर्ण बुनियादी ढांचे के साथ भरोसेमंद बनाया जा सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।