SOC Copilot: A Complete, Lightweight, and Explainable Multi-Model Anomaly Detection Engine for Security Log Analysis
यह शोध पत्र SOC Copilot को प्रस्तुत करता है, जो एक हल्का, केवल CPU-आधारित, अनसुपरवाइज्ड मल्टी-मॉडल विसंगति पहचान इंजन है जो बिना किसी लेबल वाले डेटा या GPU इंफ्रास्ट्रक्चर की आवश्यकता के, HDFS सुरक्षा लॉग का विश्लेषण करने के लिए एक उन्नत आइसोलेशन फॉरेस्ट और एक डीप ऑटोएनकोडर को SHAP-आधारित व्याख्यात्मकता के साथ जोड़कर 99.84% सटीकता प्राप्त करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
हर दिन, आधुनिक कंप्यूटर सिस्टम डिजिटल रिकॉर्ड का एक विशाल आयतन उत्पन्न करते हैं जिन्हें लॉग (logs) के रूप में जाना जाता है। ये वे स्वचालित नोट्स हैं जो मशीनें अपनी गतिविधियों के बारे में लिखती हैं, जिसमें उपयोगकर्ता के लॉग इन करने से लेकर नेटवर्क पर किसी फ़ाइल को स्थानांतरित किए जाने तक सब कुछ ट्रैक किया जाता है। एक बड़े संगठन में, ये लॉग लाखों की संख्या में जमा होते जाते हैं, जिससे सूचना की एक विशाल, अराजक धारा बन जाती है। सुरक्षा टीमें, जिन्हें सुरक्षा संचालन केंद्र (Security Operations Centers) के रूप में जाना जाता है, इस धारा पर नज़र रखने और परेशानी के संकेतों को पहचानने का काम करती हैं। समस्या यह है कि इसका आयतन इतना अधिक है कि इंसान इसे पढ़ नहीं सकते, और परेशानी खोजने का पुराना तरीका—बुरे व्यवहार के विशिष्ट, ज्ञात पैटर्न की जाँच करना—विफल हो जाता है जब हमलावर नई, अनदेखी विधियों का उपयोग करते हैं। जब सिस्टम अत्यधिक बोझ से दब जाते हैं, तो वे या तो वास्तविक खतरों को चूक जाते हैं या हानिरहित घटनाओं के लिए अलार्म बजा देते हैं, जिससे विश्लेषक थका हुआ और भ्रमित महसूस करते हैं। आधुनिक सुरक्षा अनुसंधान का लक्ष्य एक ऐसा सिस्टम बनाना है जो इस शोर के बीच से स्वचालित रूप से छानबीन कर सके, दुर्लभ, अजीब घटनाओं को खोज सके जो हमले का संकेत देती हैं, और यह स्पष्ट रूप से समझा सके कि उसने उन्हें क्यों पाया, और वह भी बिना किसी महंगे, विशेष हार्डवेयर या अपराध के हर एक उदाहरण को लेबल करने वाली विशेषज्ञों की टीम के।
शोधकर्ताओं की एक टीम ने इस विशिष्ट समस्या को हल करने के लिए 'SOC कोपायलट' (SOC Copilot) नामक एक उपकरण बनाया है। उन्होंने एक पूर्ण प्रणाली विकसित की है जो मानक कंप्यूटर प्रोसेसर पर चलती है, जिसका अर्थ है कि इसे उन विशाल, भारी ग्राफिक्स कार्डों की आवश्यकता नहीं है जिनकी कई उन्नत आर्टिफिशियल इंटेलिजेंस टूल्स को आवश्यकता होती है। इसके बजाय, उनका सिस्टम यह सीखता है कि "सामान्य" व्यवहार कैसा दिखता है और उस पैटर्न से किसी भी विचलन को चिह्नित करता है। शोधकर्ताओं ने अपने इंजन का परीक्षण हेडूप डिस्ट्रीब्यूटेड फाइल सिस्टम (Hadoop Distributed File System) के ग्यारह मिलियन से अधिक लॉग लाइनों के एक विशाल डेटासेट पर किया, जो बड़ी मात्रा में डेटा संग्रहीत करने के लिए एक सामान्य तकनीक है। उन्होंने इस डेटा को एक प्रबंधनीय प्रारूप में संसाधित किया, संबंधित घटनाओं को ब्लॉकों में समूहित किया और उन्हें पचास-आठ विभिन्न विशेषताओं की एक सूची में बदल दिया, जैसे कि एक विशिष्ट प्रकार का संदेश कितनी बार प्रकट हुआ या घटनाओं का एक क्रम कितनी देर तक चला।
उनके सिस्टम का मूल भाग दो अलग-अलग तरीकों का उपयोग करता है जो अलग-अलग विशेषज्ञताओं वाले दो विशेषज्ञों की तरह मिलकर काम करते हैं। पहला तरीका एक सांख्यिकीय उपकरण (statistical tool) है जो आउटलेर्स (outliers) को देखता है, यानी उन डेटा बिंदुओं की पहचान करता है जो भीड़ से बहुत दूर स्थित होते हैं। दूसरा तरीका एक न्यूरल नेटवर्क है, जो एक प्रकार का कंप्यूटर प्रोग्राम है जिसे जानकारी को संकुचित करने और फिर उसे पुनर्गठित करने के लिए डिज़ाइन किया गया है। यदि प्रोग्राम एक ऐसा पैटर्न देखता है जिसका उसने पहले कभी सामना नहीं किया है, तो वह उसे पुनर्गठित करने में संघर्ष करता है, और यही संघर्ष एक संकेत बन जाता है कि कुछ गलत है। शोधकर्ताओं ने दोनों तरीकों को केवल सामान्य, सुरक्षित व्यवहार के उदाहरणों पर प्रशिक्षित किया। उन्होंने सीखने के चरण के दौरान उन्हें हमलों के किसी भी उदाहरण को नहीं दिखाया, जो उन्हें पहले कभी न देखे गए नए प्रकार के खतरों का पता लगाने की अनुमति देता है।
सिस्टम को विश्वसनीय बनाने के लिए, शोधकर्ताओं ने केवल दो तरीकों को निर्णय देने के लिए वोट करने के लिए नहीं छोड़ा। उन्होंने पहले प्रत्येक तरीके के स्कोर को समायोजित किया ताकि उनकी निष्पक्ष तुलना की जा सके, और फिर उन्हें एक विशिष्ट वेटिंग रणनीति (weighting strategy) का उपयोग करके संयोजित किया जो एक अलग डेटा सेट पर परीक्षण द्वारा निर्धारित की गई थी। अंतिम परिणाम एक एकल स्कोर है जो बताता है कि लॉग का एक ब्लॉक कितना संदिग्ध है। यदि स्कोर एक निश्चित रेखा को पार करता है, तो सिस्टम इसे विसंगति (anomaly) के रूप में चिह्नित करता है। महत्वपूर्ण रूप से, सिस्टम केवल यह नहीं कहता कि "यह बुरा है।" यह अपने निर्णय के लिए एक विस्तृत स्पष्टीकरण प्रदान करता है, यह उजागर करते हुए कि लॉग प्रविष्टि की किस विशेषता ने अलार्म बजाया। यह एक गंभीरता स्तर (severity level) भी सौंपता है, जो निम्न से लेकर गंभीर तक होता है, जिससे मानव विश्लेषकों को यह तय करने में मदद मिलती है कि किन अलर्टों की जांच पहले करनी है।
जब टीम ने अपने अंतिम सिस्टम का परीक्षण उस डेटा पर किया जिसे उसने पहले कभी नहीं देखा था, तो परिणाम उल्लेखनीय रूप से सटीक थे। साठ हजार से अधिक लॉग ब्लॉकों में से, सिस्टम ने लगभग हर एक विसंगति की सही पहचान की, केवल एक को ही चूक सका। इसने गलत अलार्म को भी बहुत कम रखा, केवल सामान्य गतिविधि के एक बहुत छोटे हिस्से को संदिग्ध के रूप में चिह्नित किया। दोनों तरीकों का संयोजन अकेले किसी भी एक तरीके से अधिक मजबूत साबित हुआ। जबकि न्यूरल नेटवर्क बेहतर व्यक्तिगत डिटेक्टर था, सांख्यिकीय पद्धति ने उन खतरों को पकड़ा जिन्हें नेटवर्क चूक गया था। उन्हें आपस में जोड़कर, सिस्टम ने सटीकता का एक ऐसा स्तर प्राप्त किया जो इस क्षेत्र में दुर्लभ है, जो सभी प्रमुख प्रदर्शन मापदंडों पर लगभग निन्यानवे प्रतिशत तक पहुँच गया।
शोधकर्ताओं ने एक दृश्य डैशबोर्ड (visual dashboard) भी बनाया है जो मानव विश्लेषकों को सिस्टम के साथ बातचीत करने की अनुमति देता है। यह इंटरफ़ेस अलर्ट, गंभीरता स्कोर और कारण के स्पष्टीकरणों को प्रदर्शित करता है कि प्रत्येक अलर्ट क्यों उठाया गया था। यह उन विशिष्ट लॉग टेम्पलेट्स को दिखाता है जिन्होंने अलार्म को ट्रिगर किया और उन विशेषताओं को भी दिखाता है जिन्होंने निर्णय में सबसे अधिक योगदान दिया। यह पारदर्शिता महत्वपूर्ण है क्योंकि यह एक मनुष्य को मशीन के निर्णय पर भरोसा करने और खतरे के संदर्भ को समझने की अनुमति देती है। संपूर्ण प्रणाली को हल्का और व्याख्या योग्य (explainable) बनाया गया था, जो इस सामान्य शिकायत को संबोधित करता है कि शक्तिशाली सुरक्षा उपकरण चलाने के लिए बहुत महंगे या समझने के लिए बहुत अपारदर्शी होते हैं।
अध्ययन पुष्टि करता है कि ज्ञात हमलों के विशाल लेबल वाले डेटासेट या भारी कंप्यूटिंग शक्ति पर निर्भर किए बिना एक अत्यधिक प्रभावी सुरक्षा इंजन बनाना संभव है। अनसुपरवाइज्ड लर्निंग (unsupervised learning) पर ध्यान केंद्रित करके, जहाँ सिस्टम सामान्य व्यवहार के आकार को सीखता है, और कई पहचान विधियों को संयोजित करके, टीम ने एक ऐसा उपकरण बनाया जो सटीक और समझने योग्य दोनों है। उन्होंने प्रदर्शित किया कि एक सिस्टम को सामान्य डेटा पर प्रशिक्षित किया जा सकता है, सावधानीपूर्वक अंशांकन (calibration) के साथ ट्यून किया जा सकता है, और बड़े पैमाने पर लॉग की धारा में लगभग हर विसंगति को पकड़ने के लिए तैनात किया जा सकता है। यह कार्य यह दावा नहीं करता है कि यह हर सुरक्षा समस्या को हल कर देगा, और यह स्वीकार करता है कि यह वर्तमान में इस विशिष्ट प्रकार के लॉग डेटा पर सबसे अच्छा काम करता है। हालाँकि, यह एक स्पष्ट, कामकाजी उदाहरण प्रदान करता है कि कैसे प्रतिक्रियात्मक नियम-जांच (reactive rule-checking) से सक्रिय, बुद्धिमान विसंगति पहचान (proactive, intelligent anomaly detection) की ओर बढ़ा जा सकता है जिसे उन लोगों द्वारा समझा और भरोसा किया जा सके जिन्हें इसकी आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।