← नवीनतम पेपर
🤖 machine learning

Detecting Cybersecurity Threats by Integrating Explainable AI with SHAP Interpretability and Strategic Data Sampling

यह शोध पत्र एक एकीकृत व्याख्यात्मक एआई (Explainable AI) ढांचे को प्रस्तुत करता है जो CIC-IDS2017 डेटासेट पर साइबर सुरक्षा खतरे का पता लगाने की दक्षता, कठोरता और पारदर्शिता को बढ़ाने के लिए रणनीतिक डेटा सैंपलिंग, स्वचालित डेटा लीकेज रोकथाम और SHAP-आधारित व्याख्यात्मकता को संयोजित करता है।

मूल लेखक: Norrakith Srisumrith, Sunantha Sodsee

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Norrakith Srisumrith, Sunantha Sodsee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हलचल भरे शहर (इंटरनेट) के सुरक्षा प्रमुख हैं। हर दिन, लाखों लोग आपके द्वारों से गुजरते हैं। अधिकांश लोग बस अपने काम में लगे होते हैं (सामान्य ट्रैफ़िक), लेकिन कुछ चोर, उपद्रवी या जासूस हैं जो घुसपैठ करने की कोशिश कर रहे हैं (साइबर खतरे)।

आपका काम बुराई को तुरंत पहचानना है। लेकिन एक समस्या है: शहर इतना बड़ा है कि आप हर एक व्यक्ति पर नज़र नहीं रख सकते। साथ ही, जो उपकरण आप पहचानने के लिए उपयोग करते हैं, वे "ब्लैक बॉक्स" रोबोटों की तरह हैं—वे चिल्लाकर "चोर!" तो कहते हैं, लेकिन यह नहीं बताते कि क्यों, जिससे आप भ्रमित हो जाते हैं और उन पर भरोसा करने में असमर्थ होते हैं।

यह शोध पत्र एक सुपर-स्मार्ट, पारदर्शी और कुशल सुरक्षा प्रणाली बनाने के बारे में है जो इन तीन समस्याओं का समाधान करती है। उन्होंने इसे कैसे किया, इसका सरल विवरण यहाँ दिया गया है:

1. "स्मार्ट सैंपल" रणनीति (रणनीतिक नमूनाकरण - Strategic Sampling)

समस्या: शहर के द्वारों से 2.8 मिलियन लोग गुजर रहे हैं। हर एक को पहचानने के लिए अपने सुरक्षा गार्डों को प्रशिक्षित करना बहुत समय लेगा और उनके कंप्यूटर क्रैश कर देगा।
समाधान: पूरे शहर को याद करने के बजाय, शोधकर्ताओं ने भीड़ का एक पूरी तरह से प्रतिनिधि हिस्सा (representative slice) लिया।

  • उपमा: कल्पना कीजिए कि आप जानना चाहते हैं कि सूप का एक बड़ा बर्तन नमकीन है या नहीं। आपको पूरा बर्तन खाने की ज़रूरत नहीं है; आपको बस एक चम्मच चाहिए। लेकिन, उस चम्मच में पूरे बर्तन के अनुपात में थोड़ा-थोड़ा सब कुछ (गाजर, आलू, मांस) होना चाहिए।
  • उन्होंने क्या किया: उन्होंने विशाल डेटासेट को 2.8 मिलियन रिकॉर्ड से घटाकर लगभग 470,000 कर दिया, लेकिन उन्होंने यह सुनिश्चित किया कि "नुस्खा" (अच्छे लोगों और बुरे लोगों का अनुपात) बिल्कुल वैसा ही रहे। इसने सटीकता खोए बिना प्रशिक्षण प्रक्रिया को बहुत तेज़ बना दिया।

2. "सत्य का पता लगाने वाला" (डेटा लीकेज की रोकथाम - Data Leakage Prevention)

समस्या: कभी-कभी, प्रशिक्षण के दौरान, सुरक्षा प्रणालियाँ नकल करती हैं। वे अनजाने में परीक्षा से पहले उत्तर कुंजी पर "झलक" (peek) देख सकती हैं। उदाहरण के लिए, यदि डेटा में कोई विशेषता कहती है कि "यह व्यक्ति चोर है क्योंकि उसने लाल टोपी पहनी है," लेकिन वास्तविक दुनिया में, चोर लाल टोपी नहीं पहनते, तो सिस्टम नकल कर रहा है। वह एक कौशल नहीं, बल्कि एक चाल सीख रहा है।
समाधान: उन्होंने एक स्वचालित "चीट डिटेक्टर" बनाया।

  • उपमा: कल्पना कीजिए कि एक शिक्षक गणित की परीक्षा दे रहा है। यदि उत्तर छात्र के माथे पर लिखा है, तो वह बुद्धिमान नहीं है; वह बस उत्तर पढ़ रहा है। शोधकर्ताओं ने 29 ऐसी विशेषताएं (जैसे कि वह "लाल टोपी") पाईं जो उत्तरों को बहुत आसानी से उजागर कर रही थीं। उन्होंने उन्हें हटा दिया।
  • परिणाम: अब, सिस्टम को वास्तव में वास्तविक व्यवहार के आधार पर बुरे लोगों को पहचानना होगा, न कि नकल वाले संकेतों के आधार पर। यह परिणामों को विश्वसनीय बनाता है।

3. "व्याख्या करने योग्य रोबोट" (व्याख्यात्मक AI और SHAP - Explainable AI & SHAP)

समस्या: भले ही रोबोट सही हो, लेकिन मानव सुरक्षा गार्ड को यह जानने की आवश्यकता है कि क्यों, ताकि वह कार्रवाई कर सके। यदि रोबoret केवल "चोर!" चिल्लाता है, लेकिन यह नहीं बता पाता कि क्यों, तो गार्ड उसे अनदेखा कर सकता है या घबरा सकता है।
समाधान: उन्होंने SHAP नामक एक उपकरण का उपयोग किया (इसे एक "क्यों-हुआ-इसका" टॉर्च के रूप में सोचें)।

  • उपमा: केवल "चोर!" चिल्लाने के बजाय, अब यह कहता है: "मैंने इस व्यक्ति को इसलिए चिह्नित किया क्योंकि वह सामान्य से 10 गुना तेज़ी से चल रहा है, एक भारी बैग ले जा रहा है, और एक मिनट में 50 दरवाजे खोलने की कोशिश कर रहा है।"
  • परिणाम: मानव विश्लेषक अब सिस्टम पर भरोसा कर सकते हैं क्योंकि वे तर्क को समझते हैं। वे देख सकते हैं कि किन संकेतों ने निर्णय लेने में मदद की।

4. "सर्वश्रेष्ठ टीम" का चयन (एल्गोरिदम और फीचर चयन - Algorithm & Feature Selection)

समस्या: सुरक्षा गार्डों (एल्गोरिदम) के कई अलग-अलग प्रकार और देखने के लिए कई अलग-अलग चीजें (विशेषताएं/features) हैं। कौन सा संयोजन सबसे अच्छा काम करता है?
समाधान: उन्होंने एक बड़ा टूर्नामेंट आयोजित किया।

  • उपमा: उन्होंने अलग-अलग कोचों (XGBoost, Random Forest जैसे एल्गोरिदम) और अलग-अलग संकेतों के सेट (फीचर सिलेक्शन) को आज़माया। उन्होंने पाया कि XGBoost (एक बहुत ही तेज़ कोच) और 34 प्रमुख संकेतों (मूल 78 में से) की एक विशिष्ट सूची का संयोजन जीतने वाली टीम थी।
  • परिणाम: बेकार संकेतों को हटाने से, सिस्टम 30% तेज़ हो गया और वास्तव में अधिक सटीक भी हो गया।

अंतिम स्कोरकार्ड

जब उन्होंने इन सबको एक साथ जोड़ा, तो परिणाम अविश्वसनीय थे:

  • सटीकता (Accuracy): 99.92% (उन्होंने लगभग हर बुरे आदमी को पकड़ा और शायद ही कभी गलती की)।
  • गति (Speed): यह प्रति सेकंड 324,000 लोगों की जांच कर सकता है।
  • विश्वास (Trust): यह आपको बताता है कि इसने निर्णय क्यों लिया।

यह क्यों महत्वपूर्ण है

अतीत में, साइबर सुरक्षा में AI एक मैजिक 8-बॉल की तरह था: आप इसे हिलाते थे, यह एक उत्तर देता था, लेकिन आपको पता नहीं चलता था कि यह सही था या इसने निर्णय कैसे लिया।

यह शोध पत्र हमें एक स्मार्ट, ईमानदार सुरक्षा गार्ड देता है। यह तेज़ काम करता है, नकल नहीं करता है, और अपने तर्क की व्याख्या करता है। यह वास्तविक दुनिया के सुरक्षा केंद्रों में AI को सुरक्षित और उपयोगी बनाने की दिशा में एक बड़ा कदम है, जहाँ मशीन के सही होने जितना ही महत्वपूर्ण मशीन पर भरोसा करना भी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →