SCOPE: Rethinking Attack Analysis as Uncertainty-Aware Security Reasoning under Incomplete Observations
यह शोध पत्र SCOPE को प्रस्तुत करता है, जो एक अनिश्चितता-जागरूक (uncertainty-aware), प्रशिक्षण-मुक्त ढांचा है जो व्यवहार-केंद्रित समूहीकरण (behavior-centric grouping), वितरण संबंधी TTP मैपिंग (distributional TTP mapping), और Top-K विटर्बी अनुक्रम अनुमान (Top-K Viterbi sequence inference) को एकीकृत करके अपूर्ण अवलोकनों के तहत सुसंगत हमले के व्यवहारों को पुनर्गठित करता है ताकि सटीकता और मजबूती में मौजूदा बेसलाइन से बेहतर प्रदर्शन किया जा सके।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
डिजिटल दुनिया में, सुरक्षा टीमें कंप्यूटरों और सर्वरों से आने वाले डेटा के प्रवाह से लगातार घिरी रहती हैं। ये लॉग (logs) मशीन द्वारा की जाने वाली हर क्रिया को रिकॉर्ड करते हैं: एक फ़ाइल का खुलना, एक प्रोग्राम का शुरू होना, एक कनेक्शन बनाया जाना। वर्षों से, साइबर सुरक्षा का लक्ष्य इन बिखरे हुए नोट्स को जोड़कर हमले की बड़ी तस्वीर देखना रहा है। चुनौती यह है कि ये नोट्स अक्सर अधूरे होते हैं। हमलावर अपने पदचिह्नों को छिपाने, लॉग हटाने या घटनाओं के क्रम को अस्त-व्यस्त करने में कुशल होते हैं। इसके अलावा, एक एकल कंप्यूटर क्रिया संदर्भ के आधार पर कई अलग-अलग चीजें हो सकती हैं; एक प्रोग्राम का शुरू होना एक हानिरहित अपडेट या चोरी की शुरुआत हो सकता है। पारंपरिक तरीके ज्ञात खतरों के साथ विशिष्ट पैटर्न को मिलाने की कोशिश करते हैं, लेकिन जब सबूत बिखरे हुए हों या जब हमलावर परिचित उपकरणों का नए, अप्रत्याशित तरीकों से उपयोग करते हैं, तो वे अक्सर विफल हो जाते हैं।
गचोन यूनिवर्सिटी, दक्षिण कोरिया के शोधकर्ताओं की एक टीम ने इस समस्या के बारे में सोचने का एक नया तरीका प्रस्तावित किया है। वे अपने सिस्टम को SCOPE कहते हैं। प्रत्येक एकल लॉग प्रविष्टि को एक कठोर ढांचे में फिट करने की कोशिश करने के बजाय, SCOPE विश्लेषण को अनिश्चितता के तहत तर्क देने की एक प्रक्रिया के रूप में मानता है। यह स्वीकार करता है कि इसे प्राप्त डेटा त्रुटिपूर्ण और अधूरा है, और यह एक ऐसा मॉडल बनाता है जो बिना टूटे लापता हिस्सों को संभाल सके। शोधकर्ताओं ने अपने सिस्टम का परीक्षण तीस-पाँच ज्ञात हमले के परिदृश्यों के विरुद्ध किया जहाँ घटनाओं का वास्तविक क्रम पहले से ही प्रलेखित था। उन्होंने पाया कि SCOPE मौजूदा तरीकों की तुलना में हमले के समग्र पथ को बहुत अधिक सटीकता के साथ पुनर्गठित कर सकता है, भले ही डिजिटल साक्ष्य का आधा हिस्सा गायब हो। इससे भी महत्वपूर्ण बात यह है कि सिस्टम उन जटिल हमले के पैटर्न की पहचान कर सकता है जिन्हें उसने पहले कभी नहीं देखा था, बशर्ते वे पैटर्न ज्ञात निर्माण खंडों (building blocks) से बने हों जो एक नए क्रम में व्यवस्थित हों।
लॉग्स के विश्लेषण में मुख्य कठिनाई यह है कि व्यक्तिगत घटनाएं अकेले कहानी बताने के लिए बहुत छोटी होती हैं। एक एकल लॉग प्रविष्टि दिखा सकती है कि एक फ़ाइल बनाई गई है, लेकिन यह स्पष्ट नहीं करती कि क्यों। इसे हल करने के लिए, शोधकर्ताओं ने पहले संबंधित घटनाओं को बड़े, सार्थक समूहों में समूहित किया। वे उन घटनाओं को देखते हैं जो समय में करीब होती हैं, जिनमें एक ही कंप्यूटर प्रक्रियाएं शामिल होती हैं, या जो एक ही फ़ाइलों और नेटवर्क कनेक्शनों को छूती हैं। यह एक "व्यवहार समूह" (behavior group) बनाता है जो हमले के एक सुसंगत चरण का प्रतिनिधित्व करता है, जैसे कि पासवर्ड चुराने की कोशिश करने वाला हैकर, न कि केवल अलग-थलग फ़ाइल परिवर्तनों की एक सूची। यह समूहीकरण मजबूत बनाने के लिए डिज़ाइन किया गया है; यदि बीच की कुछ घटनाएं गायब या हटा दी जाती हैं, तो सिस्टम अभी भी समूह को पहचान सकता है क्योंकि शेष हिस्से उनके साझा संदर्भ द्वारा जुड़े होते हैं।
एक बार जब ये समूह बन जाते हैं, तो सिस्टम के सामने अगली चुनौती आती है: यह तय करना कि प्रत्येक समूह वास्तव में क्या दर्शाता है। अतीत में, सिस्टम एक समूह को एक एकल लेबल देने की कोशिश करते थे, जैसे कि "पासवर्ड चोरी"। यदि वह लेबल गलत होता, तो पूरा विश्लेषण टूट जाता। SCOPE इस जाल से बचता है क्योंकि यह एक साथ कई संभावनाओं को खुला रखता है। प्रत्येक व्यवहार समूह के लिए, यह विभिन्न स्तर की संभावनाओं के साथ संभावित लेबल की एक सूची बनाता है। यह तुरंत अंतिम निर्णय नहीं लेता। इसके बजाय, यह इन विकल्पों को अनिश्चितता की स्थिति में रखता है, जिससे सिस्टम को उत्तर पर बैठने से पहले पूरी तस्वीर पर विचार करने की अनुमति मिलती। यह दृष्टिकोण स्वीकार करता है कि एक ही क्रिया आगे क्या होता है इसके आधार पर अलग-अलग चीजें लग सकती है।
अंतिम चरण इन समूहों को एक पूर्ण श्रृंखला में जोड़ना है। शोधकर्ता एक ऐसी विधि का उपयोग करते हैं जो यह स्कोर करती है कि एक व्यवहार दूसरे का कितना अच्छी तरह अनुसरण करता है, जो दो मुख्य कारकों पर आधारित है: हमले का तार्किक प्रवाह और उनके बीच का भौतिक संबंध। वे जानते हैं कि कुछ प्रकार की क्रियाएं आमतौर पर एक विशिष्ट क्रम में होती हैं, जैसे डेटा चुराने से पहले सिस्टम तक पहुंच प्राप्त करना। वे भौतिक लिंक भी देखते हैं, जैसे कि एक चरण में बनाई गई फ़ाइल का अगले चरण में उपयोग किया जाना। इन तार्किक और भौतिक संकेतों को जोड़कर, सिस्टम उन अंतरालों को भर सकता है जहाँ साक्ष्य गायब हैं। यदि एक चरण गायब है, तो सिस्टम रुकता नहीं है; यह बस जीवित चरणों को जोड़ता है, यह स्वीकार करते हुए कि छलांग सामान्य से बड़ी है लेकिन फिर भी संभव है। यह सिस्टम को एक निरंतर कहानी को पुनर्गठित करने की अनुमति देता है भले ही टाइमलाइन के कुछ हिस्से मिटा दिए गए हों।
शोधकर्ताओं ने तीस-पाँच हमले के परिदृश्यों के एक डेटासेट का उपयोग करके इस दृष्टिकोण का परीक्षण किया जिसमें ठीक से क्या हुआ था, इसके ग्राउंड-ट्रुथ रिकॉर्ड शामिल थे। उन्होंने अन्य अग्रणी विधियों के विरुद्ध SCOPE की तुलना की, जिसमें नियम-आधारित सिस्टम (जो विशिष्ट पैटर्न देखते हैं), ग्राफ-आधारित सिस्टम (जो कनेक्शनों को मैप करते हैं), और वे सिस्टम शामिल हैं जो कहानी का अनुमान लगाने के लिए लार्ज लैंग्वेज मॉडल का उपयोग करते हैं। SCOPE ने उन सभी को पछाड़ दिया। इसने शीर्ष पांच अनुमानों को देखते समय हमलों में उपयोग की जाने वाली विशिष्ट तकनीकों को लगभग 84% बार सही ढंग से पहचाना। जब इसने घटनाओं के पूरे क्रम को पुनर्गठित करने की सफलता को मापा, तो इसने 0.68 का स्कोर प्राप्त किया, जो अगले सबसे अच्छे तरीके से काफी अधिक था।
शायद सबसे महत्वपूर्ण निष्कर्ष यह था कि सिस्टम ने लापता डेटा को कैसे संभाला। शोधकर्ताओं ने एक ऐसी स्थिति का अनुकरण किया जहाँ बेतरतीब ढंग से 50% तक लॉग घटनाओं को हटा दिया गया था, जो एक ऐसे परिदृश्य की नकल करता है जहाँ हमलावर सफलतापूर्वक अपने पदचिह्न मिटा देता है। जबकि डेटा गायब होने पर अन्य सिस्टमों का प्रदर्शन तेजी से गिर गया, SCOPE स्थिर रहा। आधा साक्ष्य गायब होने के बावजूद, इसने लगभग 0.57 का पुनर्गठन स्कोर बनाए रखा, जो कि अन्य किसी भी विधि द्वारा प्राप्त सर्वोत्तम स्कोर से भी अधिक था जब सारा डेटा मौजूद था। यह सुझाव देता है कि अनिश्चितता के बारे में तर्क करने और जीवित साक्ष्य के टुकड़ों को जोड़ने की सिस्टम की क्षमता इसे वास्तविक दुनिया के डेटा नुकसान के प्रति बहुत अधिक लचीला बनाती है।
सिस्टम ने नवीन हमले के संयोजनों को पहचानने की क्षमता भी प्रदर्शित की। साइबर सुरक्षा में, हमलावर अक्सर ज्ञात उपकरणों को लेते हैं और उनका उपयोग नए तरीकों से करते हैं। पारंपरिक सिस्टम यहाँ अक्सर विफल हो जाते हैं क्योंकि उन्हें केवल विशिष्ट, ज्ञात अनुक्रमों पर प्रशिक्षित किया जाता है। हालाँकि, SCOPE विशिष्ट अनुक्रमों को याद रखने पर निर्भर नहीं करता है। इसके बजाय, यह विभिन्न हमले के चरणों की अनुकूलता को समझता है। परीक्षणों में, इसने उन ज्ञात तकनीकों की सुसंगत श्रृंखलाओं को सफलतापूर्वक पुनर्गठित किया जो प्रशिक्षण डेटा में कभी एक साथ नहीं दिखाई दी थीं। इसने 0.83 की "कोहेरेंट-नोवेल" (coherent-novel) दर प्राप्त की, जिसका अर्थ है कि इसने उन मामलों में इन नए संयोजनों को 83% बार सही ढंग से पहचाना और जोड़ा जहाँ वे मौजूद थे। यह इंगित करता है कि सिस्टम अपने ज्ञान का सामान्यीकरण अज्ञात खतरों के लिए कर सकता है, बशर्ते व्यक्तिगत घटक परिचित हों।
SCOPE में एक प्रमुख डिजाइन विकल्प यह है कि यह आर्टिफिशियल इंटेलिजेंस का उपयोग कैसे करता है। शोधकर्ताओं ने एक लार्ज लैंग्वेज मॉडल का उपयोग किया, जो प्राकृतिक भाषा को समझने में सक्षम AI का एक प्रकार है, लेकिन केवल एक विशिष्ट कार्य के लिए: व्यवहार समूहों को सरल टेक्स्ट में वर्णित करने के लिए। मॉडल यह निर्णय नहीं लेता है कि हमला क्या है या टुकड़े कैसे फिट होते हैं। वे निर्णय एक नियत (deterministic), गणितीय प्रक्रिया द्वारा लिए जाते हैं जो चरणों के बीच कनेक्शन को स्कोर करती है। यह अलगाव सुनिश्चित करता है कि सिस्टम "हैलुसिनेट" (hallucinate) न करे या ऐसे विवरण न बनाए जो डेटा द्वारा समर्थित न हों। भाषा मॉडल केवल एक अनुवादक के रूप में कार्य करता है, कच्चे कंप्यूटर लॉग को एक ऐसे विवरण में बदलता है जिसे स्कोरिंग सिस्टम समझ सके, जबकि स्कोरिंग सिस्टम अंतिम श्रृंखला का सख्त न्यायाधीश बना रहता है।
शोधकर्ता स्वीकार करते हैं कि उनका कार्य एक नियंत्रित डेटासेट पर आधारित है और वास्तविक दुनिया के एंटरप्राइज वातावरण बहुत अधिक जटिल होते हैं। वे नोट करते हैं कि उनका सिस्टम कम-स्तरीय डिटेक्शन ट्रिगर्स का विकल्प नहीं है बल्कि उन ट्रिगर्स द्वारा उत्पन्न डेटा को समझने के लिए एक उपकरण है। सिस्टम को वास्तविक लॉग की अपूर्ण और शोर वाली प्रकृति के साथ काम करने के लिए डिज़ाइन किया गया है, जो हमले के वृत्तांत को वापस पाने का एक तरीका प्रदान करता है भले ही साक्ष्य खंडित हों। हमले के विश्लेषण को सरल पैटर्न मिलान के बजाय अनिश्चितता के तहत तर्क देने की समस्या के रूप में मानकर, शोधकर्ताओं ने एक ऐसा ढांचा तैयार किया है जो हमलावरों द्वारा अपने पदचिह्नों को छिपाने के लिए उपयोग किए जाने वाले तरीकों के प्रति अधिक मजबूत है। परिणाम बताते हैं कि हमले के विश्लेषण का भविष्य अधिक डेटा खोजने में नहीं, बल्कि बचे हुए डेटा के साथ अधिक प्रभावी ढंग से तर्क करने में निहित है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।