Learning Red Agent Policy from Observations for Neurosymbolic Autonomous Cyber Agents
यह शोध पत्र न्यूरोसिंबोलिक स्वायत्त साइबर-रक्षा एजेंटों को नेटवर्क अवलोकनों से अदृश्य रेड एजेंट नीतियों और कार्यों की भविष्यवाणी करने में सक्षम बनाने के लिए एक इमिटेशन लर्निंग तकनीक का प्रस्ताव करता है, जिससे आंशिक रूप से दृश्यमान वातावरण में परिष्कृत साइबर हमलों के प्रति उनकी अनुकूलन क्षमता को बढ़ाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि कोहरे से भरे कमरे में शतरंज का एक उच्च-दांव वाला खेल चल रहा है। आप रक्षक (ब्लू एजेंट) हैं, जो अपने किले की रक्षा करने की कोशिश कर रहे हैं। आपका प्रतिद्वंद्वी हमलावर (रेड एजेंट) है, जो अंदर घुसने की कोशिश कर रहा है।
समस्या क्या है? आप अपने प्रतिद्वंद्वी को देख नहीं सकते। आप केवल उनके कदमों के परिणाम देखते हैं: एक दरवाजा अचानक खुल गया, एक लाइट टिमटिमाई, या फर्नीचर का एक टुकड़ा हिल गया। आप अपनी चालों को जानते हैं, लेकिन आपको यह अनुमान लगाना होगा कि आपके अदृश्य प्रतिद्वंद्वी ने कमरे में बदलाव के आधार पर क्या किया होगा।
यह शोध पत्र एक नया तरीका बताता है जिससे रक्षक एक डिजिटल नेटवर्क में हमलावर के "मन को पढ़" सकता है, भले ही हमलावर छिपा हुआ हो।
परिवेश: एक डिजिटल किला
शोधकर्ताओं ने CybORG नामक एक सिम्युलेटेड नेटवर्क का उपयोग किया। इस नेटवर्क को एक किले के रूप में सोचें जिसमें तीन क्षेत्र हैं:
- आंगन (यूजर सबनेट): जहाँ नियमित लोग काम करते हैं।
- कार्यालय (एंटरप्राइज सबनेट): जहाँ महत्वपूर्ण सर्वर और डेटा रहता है।
- तिजोरी (ऑपरेशनल सबनेट): सबसे महत्वपूर्ण, संवेदनशील मशीनरी।
हमलावर आंगन से होते हुए, कार्यालय से गुजरते हुए, अंततः तिजोरी में घुसने और नुकसान पहुँचाने की कोशिश करता है। रक्षक उन्हें रोकने की कोशिश करता है।
समस्या: "ब्लैक बॉक्स" कोहरा
इस खेल में, रक्षक "पार्शियली ऑब्जर्वेबल" (आंशिक रूप से दृश्यमान) है। यह कहने का एक फैंसी तरीका है: "मैं हमलावर को नहीं देख सकता।"
- रक्षक नेटवर्क की स्थिति देखता है (जैसे, "सर्वर A अब समझौता किया गया है/compromised है")।
- रक्षक जानता है कि उसने क्या किया (जैसे, "मैंने नेटवर्क को स्कैन किया")।
- लेकिन रक्षक को यह नहीं पता कि उस बदलाव को पैदा करने के लिए हमलावर ने क्या किया। क्या उन्होंने स्कैन किया? क्या उन्होंने पासवर्ड हैक किया? क्या उन्होंने वायरस इंस्टॉल किया?
यह जाने बिना कि हमलावर का विशिष्ट कदम क्या था, उनके अगले कदम की भविष्यवाणी करना या यह समझना कठिन है कि वे सिस्टम में कितनी गहराई तक घुस चुके हैं।
समाधान: एक "शरलॉक होम्स" AI
लेखकों ने इमिटेशन लर्निंग के समान एक विधि का उपयोग करके पॉलिसी लर्निंग नामक एक तकनीक का प्रस्ताव दिया है।
यहाँ उपमा है: कल्पना कीजिए कि आप एक जादूगर को उसका करतब दिखाते हुए देख रहे हैं। आप जादूगर के हाथों को चलते हुए देखते हैं (रक्षक की कार्रवाई) और आप खरगोश को टोपी से बाहर निकलते देखते हैं (नेटवर्क की स्थिति में परिवर्तन)। आप वह गुप्त चाल नहीं देखते जो जादूगर ने खरगोस को टोपी से बाहर निकालने के लिए की थी।
शोधकर्ताओं ने एक AI बनाया जो एक जासूस की तरह काम करता है:
- देखना और सीखना: उन्होंने AI को हजारों गेम देखने दिए जहाँ हमलावर और रक्षक खेलते हैं। भले ही AI गेम के दौरान हमलावर के कदमों को नहीं देख पाता है, लेकिन प्रशिक्षण के दौरान उसके पास एक "चीट शीट" (ग्राउंड ट्रुथ) होती है कि वास्तव में क्या हुआ था।
- पैटर्न खोजना: AI एक पैटर्न सीखता है: "जब रक्षक नेटवर्क को स्कैन करता है और सर्वर अचानक अलग दिखने लगता है, तो हमलावर ने X किया ही होगा।"
- भविष्यवाणी करना: प्रशिक्षित होने के बाद, AI वास्तविक समय में एक नया गेम देख सकता है। वह रक्षक की चाल और परिणामी परिवर्तन को देखता है, और कहता है, "मुझे दांव है कि हमलावर ने अभी X किया है।"
यह कैसे काम करता है: तीन-चरणीय जासूसी प्रक्रिया
शोध पत्र इसे तीन चरणों में तोड़ता है, जैसे एक जासूस केस सुलझाता है:
- "क्या हुआ?" चरण (इनवर्स डायनेमिक्स): AI नेटवर्क के "पहले" और "बाद" के दृश्य और रक्षक की चाल को देखता है। यह अनुमान लगाने की कोशिश करता है कि हमलावर का वह "अदृश्य" कदम क्या था जिसने परिवर्तन का कारण बनाया। यह एक मोटा, अमूर्त अनुमान (एक लेटेंट एक्शन) बनाता है।
- "अभ्यास" चरण (पॉलिसी लर्निंग): AI खुद को बेहतर अनुमान लगाने के लिए प्रशिक्षित करता है। यह चरण 1 में पहचाने गए अदृश्य कदमों की नकल करने की कोशिश करता है। यह शिक्षक के पदचिह्नों को देखकर नृत्य सीखने वाले छात्र जैसा है।
- "अनुवाद" चरण (मैपिंग): AI के अनुमान अभी भी अस्पष्ट हैं। यह चरण अस्पष्ट अनुमान को एक विशिष्ट, वास्तविक दुनिया के हमले के नाम (जैसे, "एक्सप्लॉइट रिमोट सर्विस") और एक विशिष्ट लक्ष्य (जैसे, "सर्वर 3") में अनुवादित करता है।
"न्यूरोसिम्बोलिक" मस्तिष्क
शोध पत्र न्यूरोसिम्बोलिक AI और बिहेवियर ट्रीज़ का उल्लेख करता है।
- न्यूरोसिम्बोलिक का अर्थ है दो प्रकार की सोच को मिलाना:
- न्यूरल: डेटा से सीखना (जैसे एक इंसान अनुभव से सीखता है)।
- सिंबोलिक: तार्किक नियमों का पालन करना (जैसे एक कंप्यूटर एक सख्त चेकलिस्ट का पालन करता है)।
- बिहेवियर ट्रीज़ एक फ्लोचार्ट या निर्णय वृक्ष (डिसीजन ट्री) की तरह हैं। एक सुरक्षा गार्ड की कल्पना करें जिसके पास क्लिपबोर्ड है। गार्ड चेक करता है: "क्या दरवाजा खुला है? हाँ। क्या कोई घुसपैठिया है? हाँ। फिर, अलार्म बजाएं।"
- शोधकर्ताओं ने इस "माइंड-रीडिंग" AI को इस फ्लोचार्ट में प्लग इन किया। अब, गार्ड केवल दरवाजा खुलने पर प्रतिक्रिया नहीं देता; वह यह भी अनुमान लगा सकता है कि घुसपैठिया अगला कदम तिजोरी की ओर बढ़ने वाला है, और उसके लिए तैयारी कर सकता है।
परिणाम: यह कितना अच्छा था?
शोधकर्ताओं ने सिम्युलेटेड "CybORG" वातावरण में दो प्रकार के हमलावरों के खिलाफ इसका परीक्षण किया:
- "बी-लाइन" हमलावर: लक्ष्य की ओर एक सीधा, सीधी रेखा वाला रास्ता। (जैसे एक चोर सीधे तिजोरी की ओर भाग रहा हो)।
- "मींडर" हमलावर: एक भटकने वाला हमलावर जो हर कमरे की जांच करता है और आगे बढ़ने से पहले हर कंप्यूटर में घुसने की कोशिश करता है। (जैसे एक चोर पूरे घर में ताक-झांक कर रहा हो)।
निष्कर्ष:
- सीधे हमलावर: AI सीधे हमलावर के कदमों की भविष्यवाणी करने में अविश्वसनीय रूप से सटीक (99% से अधिक) था। क्योंकि उनका रास्ता अनुमानित है, "जासूस" AI आसानी से अगले कदम का अनुमान लगा सकता है।
- भटकने वाले हमलावर: AI अभी भी बहुत अच्छा था (सामान्य क्षेत्र के लिए लगभग 95%, हालांकि सटीक कंप्यूटर पर थोड़ा कम), हालांकि भटकने वाले हमलावर की भविष्यवाणी करने में भी सक्षम था।
- रणनीति बदलने वाले हमलावर: उन्होंने एक ऐसे हमलावर का भी परीक्षण किया जो बीच में अपनी रणनीति बदल देता है। AI अनुकूलित हो सका और भविष्यवाणी करना जारी रख सका, हालांकि रणनीति बदलने पर उसे थोड़ा समय लगा।
यह क्यों महत्वपूर्ण है
मुख्य बात यह है कि यह प्रणाली रक्षक को अदृश्य को देखने की अनुमति देती है। हमलावर के बारे में अभी क्या हो रहा है, इसकी भविष्यवाणी करके, रक्षक:
- घुसपैठ का जल्दी पता लगा सकता है।
- समझ सकता है कि हमलावर कितनी गहराई तक जा चुका है (जैसे, "उनके पास यूजर एक्सेस है, लेकिन अभी तक एडमिन एक्सेस नहीं है")।
- अधिक प्रभावी ढंग से प्रतिक्रिया दे सकता है क्योंकि वे केवल अनुमान नहीं लगा रहे हैं; वे हमलावर की छिपी हुई "पॉलिसी" के आधार पर एक शिक्षित भविष्यवाणी कर रहे हैं।
संक्षेप में, यह शोध पत्र एक तरीका प्रस्तुत करता है जिससे एक धुंधले, अंधेरे रक्षात्मक खेल को एक स्पष्ट मुकाबले में बदला जा सके जहाँ रक्षक हमलावर के अगले कदम का अनुमान लगा सके, भले ही वे उन्हें देख न सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।