← नवीनतम पेपर
🤖 machine learning

Multi-Level Distributional Entropy for Explainable Network Intrusion Detection

यह शोध पत्र मल्टी-लेवल डिस्ट्रीब्यूशनल एंट्रॉपी (MDE) प्रस्तुत करता है, जो एक व्याख्या योग्य ढांचा है जो कच्चे पैकेट डेटा या प्रशिक्षण की आवश्यकता के बिना प्रभावी और पुनरुत्पादनीय नेटवर्क घुसपैठ का पता लगाने में सक्षम होने के लिए फ्लो-स्तरीय सांख्यिकी से सीधे एंट्रॉपी-आधारित विशेषताओं को व्युत्पन्न करता है, साथ ही यह उन महत्वपूर्ण प्रदर्शन विफलताओं को भी प्रकट करता है जो समग्र मेट्रिक्स द्वारा छिपाई जाती हैं।

मूल लेखक: Mohamed Aly Bouke, Md Shohel Sayeed, Swee-Huay Heng, Azizol Abdullah, Mohamed Othman

प्रकाशित 2026-06-30
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mohamed Aly Bouke, Md Shohel Sayeed, Swee-Huay Heng, Azizol Abdullah, Mohamed Othman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी तस्वीर: "अंधा" सुरक्षा गार्ड

एक व्यस्त हवाई अड्डे पर एक सुरक्षा गार्ड की कल्पना करें। उनका काम हज़ारों सामान्य यात्रियों (सामान्य इंटरनेट ट्रैफ़िक) के बीच आतंकवादियों (हैकर) को पहचानना है।

वर्षों से, यह गार्ड एक चेकलिस्ट का उपयोग कर रहा है जिसने कुल योग (totals) पर ध्यान दिया है: "इस व्यक्ति के पास कितने बैग थे?" "वे कितनी देर तक लाइन में रहे?" "उनके सामान का वजन कितना था?" ये कंप्यूटर सुरक्षा में उपयोग किए जाने वाले मानक सांख्यिकी (पैकेट काउंट, डेटा वॉल्यूम) की तरह हैं।

समस्या यह है कि ये कुल योग पैटर्न (तरीके) को मिस कर देते हैं। एक आतंकवादी के पास एक पर्यटक के समान ही बैग हो सकते हैं, लेकिन वे उन्हें बहुत ही सख्त, रोबोटिक तरीके से ले जा सकते हैं, जबकि पर्यटक स्वाभाविक रूप से चलता है। पुरानी चेकलिस्ट इन सूक्ष्म व्यवहार संबंधी अंतरों को अनदेखा कर देती है।

यह पेपर MDE (मल्टी-लेवल डिस्ट्रीब्यूशनल एंट्रॉपी) नामक एक नया टूल पेश करता है। केवल बैग गिनने के बजाय, MDE ट्रैफ़िक की लय (rhythm) और विविधता का विश्लेषण करता है ताकि यह देखा जा सके कि यह "मानवीय" दिखता है या "रोबोटिक"।


भाग 1: MDE कैसे काम करता है (तीन स्तर)

शोधकर्ताओं ने "एंट्रॉपी" (यादृच्छिकता या अराजकता का एक माप) की गणना करने का एक तरीका बनाया है जिसके लिए हर एक डेटा पीस को देखने की आवश्यकता नहीं है। वे इसे तीन रचनात्मक तरीकों से करते हैं:

  1. स्तर 1: "लय की जाँच" (गौसियन डिफरेंशियल एंट्रॉपी)

    • उदाहरण: एक ड्रमर (ढोल बजाने वाला) को सुनने की कल्पना करें। एक मानव ड्रमर में प्राकृतिक बदलाव होते हैं; कभी वे स्नेयर को थोड़ा ज़ोर से मारते हैं, तो कभी थोड़ा धीरे। एक रोबोट ड्रमर हर बार बिल्कुल समान बल के साथ प्रहार करता है।
    • विज्ञान: MDE डेटा पैकेट के आकार को देखता है। यदि वे सभी बिल्कुल एक ही आकार के हैं (जैसे एक रोबोट), तो "एंट्रॉपी" कम है। यदि वे स्वाभाविक रूप से भिन्न होते हैं (जैसे एक इंसान), तो एंट्रॉपी अधिक होती है। MDE व्यक्तिगत पैकेटों को देखे बिना, केवल आकारों के औसत और फैलाव को देखकर गणितीय रूप से इसकी गणना करता है।
  2. स्तर 2: "वन-वे स्ट्रीट" की जाँच (जेन्सन-शैनन डाइवर्जेंस)

    • उदाहरण: एक सामान्य बातचीत दो-तरफा सड़क की तरह होती है: आप बोलते हैं, मैं जवाब देता हूँ। एक चिल्लाने वाली बहस या मेगाफोन की आवाज़ एक-तरफा होती है: मैं आप पर चिल्लाता हूँ, आप कुछ नहीं कहते।
    • विज्ञान: कई साइबर हमले (जैसे DDoS फ्लड) एक दिशा में भारी मात्रा में डेटा भेजते हैं और बदले में लगभग कुछ भी प्राप्त नहीं करते हैं। MDE मापता है कि ट्रैफ़िक कितना "एकतरफा" है। यदि ट्रैफ़िक पूरी तरह से संतुलित है, तो यह संभवतः मानवीय है। यदि यह एक-तरफा सड़क है, तो यह हमला होने की संभावना है।
  3. स्तर 3: "एकरूपता की जाँच" (फ्लैग-पैटर्न एंट्रॉपी)

    • उदाहरण: ट्रैफिक लाइट के बारे में सोचें। एक सामान्य दिन में लाल, पीली और हरी लाइटों का मिश्रण होता है। एक ग्लिच वाला सिस्टम घंटों तक केवल "लाल" या केवल "हरी" लाइट पर अटका रह सकता है।
    • विज्ञान: इंटरनेट ट्रैफ़िक कनेक्शन को प्रबंधित करने के लिए "फ्लैग्स" (छोटे नियंत्रण संकेत) का उपयोग करता है। सामान्य ट्रैफ़िक इन फ्लैग्स के विविध मिश्रण का उपयोग करता है। हमले के उपकरण अक्सर केवल एक ही प्रकार के (जैसे फ्लड के लिए केवल "SYN" फ्लैग) का उपयोग करने में फंस जाते हैं। MDE यह जाँचता है कि ट्रैफ़िक एक विविध "भाषा" का उपयोग कर रहा है या एक दोहराव वाली, टूटी हुई भाषा का।

भाग 2: "ब्लैक बॉक्स" की समस्या (व्याख्यात्मकता)

अतीत में, उन्नत कंप्यूटर मॉडल ब्लैक बॉक्स की तरह थे। वे कहते थे, "यह एक हमला है," लेकिन कोई नहीं जानता था कि क्यों। सुरक्षा विश्लेषक उस सिस्टम पर भरोसा नहीं कर सकते थे जिसे वे समझ नहीं सकते थे।

यह पेपर SHAP (AI के लिए एक "अनुवादक") नामक एक टूल का उपयोग करता है।

  • उदाहरण: यदि AI कहता है "इस व्यक्ति को गिरफ्तार करो," तो SHAP एक रसीद प्रिंट करता है जो ठीक से दिखाता है कि किन सुरागों ने उस निर्णय तक पहुँचाया। "हमने उन्हें इसलिए गिरफ्तार किया क्योंकि उनकी लय रोबोटिक थी (स्तर 1) और वे केवल एक दिशा में चिल्ला रहे थे (स्तर 2)।"
  • परिणाम: शोधकर्ताओं ने पाया कि MDE फीचर्स बहुत सुसंगत हैं। AI निर्णयों को लेने के लिए इन "लय" और "एक-तरफा" सुरागों का विश्वसनीय रूप से उपयोग करता है, और वह ऐसा करता है जो मानव विशेषज्ञों के लिए समझ में आता है।

भाग 3: वास्तविकता की जाँच (क्यों "औसत" स्कोर झूठ बोलते हैं)

इस पेपर की सबसे महत्वपूर्ण खोज केवल नए टूल के बारे में नहीं है; बल्कि इस बारे में है कि हम सुरक्षा प्रणालियों का परीक्षण कैसे करते हैं।

शोधकर्ता तर्क देते हैं कि एक एकल "औसत स्कोर" (जैसे F1 स्कोर) देखना, व्यक्तिगत टेस्ट परिणामों को देखे बिना कक्षा के औसत ग्रेड को देखने जैसा है।

  • उदाहरण: एक ऐसी कक्षा की कल्पना करें जहाँ 99% छात्रों को टेस्ट में 100% मिलता है, और 1% को 0% मिलता है। कक्षा का औसत 99% है। यह एक बेहतरीन कक्षा दिखती है! लेकिन अगर वह 1% जो 0% लाया, वे एक महत्वपूर्ण सुरक्षा परीक्षा में फेल हुए थे, तो "99% औसत" एक झूठ है।

पेपर में क्या पाया गया:

  • एक डेटासेट (CICIDS-2018) पर, सिस्टम 0.74 के स्कोर के साथ बहुत अच्छा दिख रहा था। लेकिन जब उन्होंने करीब से देखा, तो उन्हें एहसास हुआ कि सिस्टम वास्तविक हमलों में से 52% को मिस कर रहा था। "औसत" स्कोर इस तथ्य को छिपा रहा था कि सिस्टम आधे समय विफल हो रहा था।
  • एक अन्य परीक्षण में, सिस्टम को सोमवार-गुरुवार के ट्रैफ़िक पर प्रशिक्षित किया गया और शुक्रवार के ट्रैफ़क पर टेस्ट किया गया। जब "शुक्रवार" का ट्रैफ़िक थोड़ा बदल गया (एक नए प्रकार का हमला), तो सिस्टम का "औसत" स्कोर ठीक लग रहा था, लेकिन वास्तव में, इसने वास्तविक हमलों का पता लगाना पूरी तरह से बंद कर दिया (0% डिटेक्शन रेट)। गणित ने कहा कि सिस्टम अभी भी हमलों को सही ढंग से "रैंक" कर रहा था, लेकिन अलार्म नहीं बजा क्योंकि थ्रेशोल्ड गलत था।

भाग 4: निष्कर्ष

MDE वास्तव में क्या करता है:
यह जरूरी नहीं कि कंप्यूटर को हमलों को खोजने में पुराने तरीकों की तुलना में "स्मार्टर" बनाता है (स्कोर अक्सर समान होते हैं)। इसके बजाय, यह कंप्यूटर को डेटा को देखने का एक बेहतर, अधिक तार्किक तरीका देता है।

  • यह कच्चे, अव्यवस्थित डेटा की आवश्यकता के बिना काम करता है (यह सारांशों का उपयोग करता है)।
  • यह बताता है कि इसने निर्णय क्यों लिया।
  • यह प्रकट करता है कि सिस्टम वास्तव में कब विफल हो रहा है, भले ही "औसत स्कोर" अच्छा दिख रहा हो।

सीमाएँ:
पेपर स्वीकार करता है कि यदि "रोबोट" अपने व्यवहार को पूरी तरह से बदल देता है (एक नया प्रकार का हमला जिसे पहले कभी नहीं देखा गया), तो सिस्टम विफल हो जाएगा, ठीक वैसे ही जैसे कोई अन्य सुरक्षा सिस्टम। साथ ही, गणित यह मान लेता है कि ट्रैफ़िक काफी हद तक बेल कर्व (Gaussian) की तरह व्यवहार करता है, जो एन्क्रिप्टेड या जटिल ट्रैफ़िक के लिए हमेशा सच नहीं होता है।

संक्षेप में: यह पेपर इंटरनेट ट्रैफ़िक के लिए एक बेहतर "लय डिटेक्टर" (rhythm detector) बनाता है जो पारदर्शी है, समझने में आसान है, और जब यह विफल होता है तो एक एकल, भ्रामक संख्या के पीछे छिपने के बजाय ईमानदार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →