← नवीनतम पेपर
💻 computer science

Advanced Persistent Threat Detection via Adaptive Dynamic Masking and Heterogeneity-Aware Projection

यह शोध पत्र AMH-APT का प्रस्ताव करता है, जो एक नवीन APT डिटेक्शन फ्रेमवर्क है जो महत्वपूर्ण हमले के संदर्भ को संरक्षित करने के लिए एक अनुकूली गतिशील मास्किंग रणनीति (adaptive dynamic masking strategy) और विविध इकाई प्रकारों के लिए विशिष्ट सिमेंटिक स्पेस को बनाए रखने के लिए विषमता-जागरूक प्रोजेक्शन (heterogeneity-aware projection) का उपयोग करके प्रोवेनेंस ग्राफ विश्लेषण को बढ़ाता है, जिससे यह लॉग-स्तर और इकाई-स्तर दोनों डिटेक्शन कार्यों में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Jiahao Liang, Xiaofeng Lu, Xinhong Hei, Silin Guo, Danna Zhu, Shibing Gu, Pengcheng Wang

प्रकाशित 2026-09-24
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiahao Liang, Xiaofeng Lu, Xinhong Hei, Silin Guo, Danna Zhu, Shibing Gu, Pengcheng Wang

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

डिजिटल दुनिया में, सुरक्षा प्रणालियाँ अक्सर डेटा की विशाल मात्रा के कारण अभिभूत हो जाती हैं। हर सेकंड, कंप्यूटर रिकॉर्ड्स की अंतहीन धाराएँ उत्पन्न करते हैं जो यह विवरण देती हैं कि किसने किसी फ़ाइल तक पहुँच बनाई, कौन सा प्रोग्राम चला, या कहाँ एक नेटवर्क कनेक्शन बनाया गया। दशकों से, रक्षकों ने विशिष्ट, ज्ञात बुरे व्यवहारों को देखकर घुसपैठियों को पहचानने की कोशिश की है, जैसे कि कोई चोर ताला तोड़ रहा हो। हालाँकि, एक नए प्रकार के खतरे का उदय हुआ है जो बिल्कुल भी चोर जैसा नहीं दिखता। ये एडवांस्ड पर्सिस्टेंट थ्रेट्स (APTs) हैं। एक एकल, शोर भरे ब्रेक-इन के बजाय, एक APT एक धीमी, शांत घुसपैठ है जो हफ्तों या महीनों तक चलती है। हमलावर अपने दुर्भावनापूर्ण कदमों को दैनिक कंप्यूटर संचालन के सामान्य, उबाऊ शोर के भीतर छिपा देते हैं, जिससे एक नियमित फ़ाइल अपडेट और गुप्त डेटा चोरी के बीच अंतर करना लगभग असंभव हो जाता है। इन गुप्त शत्रुओं को पकड़ने के लिए, शोधकर्ताओं ने कंप्यूटर की पूरी गतिविधि को कनेक्शन के एक विशाल जाल में मैप करना शुरू कर दिया है, जिसे प्रोवेनेंस ग्राफ (provenance graph) कहा जाता है। इस वेब में, प्रत्येक उपयोगकर्ता, फ़ाइल और प्रोग्राम एक बिंदु है, और उनके द्वारा किया गया प्रत्येक कार्य उन्हें जोड़ने वाली एक रेखा है। लक्ष्य इस विशाल, जटिल मानचित्र के भीतर छिपे सूक्ष्म, संदिग्ध पैटर्न को खोजना है।

लंबे समय तक, इन मानचित्रों को पढ़ने के लिए सबसे अच्छे उपकरण एक तकनीक पर निर्भर थे जिसे सेल्फ-सुपरवाइज्ड लर्निंग (self-supervised learning) कहा जाता है। कल्पना कीजिए कि एक छात्र कई शब्दों को ढके हुए एक किताब को पढ़कर एक भाषा के नियमों को सीखने की कोशिश कर रहा है। छात्र को आसपास के वाक्यों के संदर्भ के आधार पर गायब शब्दों का अनुमान लगाना होता है। यदि वे सही अनुमान लगाते हैं, तो वे भाषा की संरचना सीख रहे होते हैं। कंप्यूटर सुरक्षा में, शोधकर्ता एक समान विधि का उपयोग करते हैं: वे कंप्यूटर गतिविधि के मानचित्र के हिस्सों को छिपा देते हैं और AI को गायब हिस्सों को फिर से बनाने के लिए कहते हैं। यदि AI इसमें अच्छा है, तो इसने सीख लिया है कि "सामान्य" व्यवहार कैसा दिखता है। जब इसे एक नया मानचित्र मिलता है जहाँ गायब हिस्सों को इसलिए पुनर्गठित नहीं किया जा सकता क्योंकि पैटर्न गलत है, तो यह उसे एक संभावित हमला मानकर फ्लैग करता है। यह दृष्टिकोण प्रभावी रहा है, लेकिन इसमें एक दोष है। मानचित्र के हिस्सों को छिपाने की मानक विधि यादृच्छिक (random) है; यह बिना यह सोचे कि क्या वे महत्वपूर्ण हैं, शब्दों को ढक देती है। एक कंप्यूटर सिस्टम में, कुछ क्रियाएं केवल बैकग्राउंड शोर होती हैं, जैसे कि एक प्रोग्राम द्वारा समय की जाँच करना, जबकि अन्य घटनाओं की श्रृंखला में महत्वपूर्ण कड़ी होती हैं, जैसे कि एक उपयोगकर्ता द्वारा एक गुप्त कनेक्शन बनाए जाने से पहले एक विशिष्ट फ़ाइल खोलना। यादृच्छिक रूप से महत्वपूर्ण कड़ियों को छिपाने से AI के पास एक टूटा हुआ विवरण रह जाता है, जिससे हमले के वास्तविक आकार को सीखना कठिन हो जाता है।

शी'आन यूनिवर्सिटी ऑफ टेक्नोलॉजी के शोधकर्ताओं की एक टीम ने इन प्रणालियों को सिखाने का एक नया तरीका विकसित किया है, जो इस बात पर ध्यान देता है कि क्या महत्वपूर्ण है। उन्होंने महसूस किया कि कंप्यूटर गतिविधि के मानचित्र के सभी हिस्से समान नहीं होते हैं। कुछ नोड्स, जो विशिष्ट फ़ाइलों या प्रोग्रामों का प्रतिनिधित्व करते हैं, कहानी के केंद्र में होते हैं, जबकि अन्य केवल मामूली विवरण होते हैं। उनकी नई विधि, जिसे AMH-APT कहा जाता है, खेल के नियम बदल देती है। मानचित्र के हिस्सों को यादृच्छिक रूप से छिपाने के बजाय, सिस्टम पहले यह गणना करता है कि प्रत्येक हिस्सा कितना महत्वपूर्ण है। यह देखता है कि एक हिस्से के कितने कनेक्शन हैं और उसकी विशेषताएं कितनी अद्वितीय हैं। यदि कोई हिस्सा नेटवर्क में एक प्रमुख केंद्र (hub) है या उसका व्यवहार बहुत विशिष्ट है, तो सिस्टम उसे दृश्यमान छोड़ने का निर्णय लेता है। यह केवल मानचित्र के कम महत्वपूर्ण, शोर वाले हिस्सों को ही छिपाता है। यह सुनिश्चित करता है कि जब AI गायब जानकारी का अनुमान लगाने की कोशिश करता है, तो वह उपलब्ध सबसे महत्वपूर्ण संदर्भ के साथ काम कर रहा होता है, जिससे प्रशिक्षण के दौरान भी हमले के पथ का ढांचा सुरक्षित रहता है।

शोधकर्ताओं ने दूसरी समस्या का भी समाधान किया: मानचित्र पर मौजूद चीजों के विभिन्न प्रकार। एक कंप्यूटर सिस्टम में उपयोगकर्ता, फ़ाइलें, नेटवर्क कनेक्शन और प्रक्रियाएं होती हैं, जो सभी अलग-अलग तरह से व्यवहार करती हैं। पिछले तरीकों ने इन सभी विभिन्न प्रकारों को एक ही, समान स्थान में समाहित करने की कोशिश की, जिससे उनकी अनूठी विशेषताएं धुंधली हो गईं। यह एक कार, एक पक्षी और एक मछली का वर्णन करने के लिए केवल गति के एक ही सेट के नियमों का उपयोग करने जैसा था। नया दृष्टिकोण प्रत्येक प्रकार की इकाई को अपना समर्पित स्थान देता है ताकि उसे समझा जा सके। जब सिस्टम एक फ़ाइल को छिपाता है, तो वह उसे एक जेनेरिक छिपी हुई वस्तु के रूप में नहीं, बल्कि एक छिपी हुई फ़ाइल के रूप में मानता है। यह AI को वस्तु के लेबल का उपयोग करके उसकी सामग्री का अनुमान लगाने से रोकता है। उपयोगकर्ताओं, फ़ाइलों और नेटवर्क की विशिष्ट पहचानों को अलग रखते हुए भी एक-दूसरे से बात करने की अनुमति देकर, सिस्टम यह स्पष्ट चित्र बनाता है कि क्या हो रहा है।

यह परीक्षण करने के लिए कि क्या ये परिवर्तन वास्तव में काम कर रहे थे, शोधकर्ताओं ने अपने नए सिस्टम को वास्तविक दुनिया के डेटा के पांच अलग-अलग सेटों पर चलाया, जिसमें छोटे सिम्युलेटेड हमलों से लेकर हजारों घटनाओं वाले बड़े, जटिल परिदृश्य शामिल थे। उन्होंने अपने परिणामों की तुलना पिछले सबसे अच्छे तरीके से की, जो यादृच्छिक छिपाने पर निर्भर था। निष्कर्ष स्पष्ट थे। नया सिस्टम लगातार अधिक हमलों को खोज पाता है जबकि गलतियाँ बहुत कम करता है। CADETS नामक एक बड़े डेटासेट वाले एक विशिष्ट परीक्षण में, पुराने तरीके ने लगभग 2,900 सामान्य गतिविधियों को गलत तरीके से हमलों के रूप में चिह्नित किया, जिससे बहुत सारे झूठे अलार्म पैदा हुए। नए सिस्टम ने उस संख्या को घटाकर केवल 1,100 से थोड़ा अधिक कर दिया, जिससे हमलावरों को पकड़ते हुए भी झूठे अलार्म आधे से अधिक कम हो गए। Wget नामक एक अन्य परीक्षण में, हमलों को सही ढंग से पहचानने की प्रणाली की क्षमता में उल्लेखनीय सुधार हुआ, जो लगभग 94.5 प्रतिशत से बढ़कर लगभग 98.1 प्रतिशत हो गई। ये सुधार केवल छोटे बदलाव नहीं थे; वे इस बात का मौलिक बदलाव थे कि सिस्टम दैनिक जीवन के शोर और एक परिष्कृत घुसपैठिए के शांत कदमों के बीच अंतर करना कैसे सीखता है।

इस पद्धति की सफलता कठिनाई और स्पष्टता के बीच संतुलन बनाने की इसकी क्षमता में निहित है। शोधकर्ताओं ने पाया कि केवल एक निश्चित मात्रा में डेटा को छिपाना पर्याप्त नहीं था। इसके बजाय, उन्होंने एक शेड्यूल पेश किया जो आसान कार्यों के साथ शुरू हुआ, कम चीजें छिपाईं, और जैसे-जैसे सिस्टम ने सीखा, कठिनाई को धीरे-धीरे बढ़ाया। इसने AI को पहले सामान्य व्यवहार के स्थानीय पैटर्न में महारत हासिल करने दी, इससे पहले कि उसे उन जटिल, लंबी दूरी के कनेक्शनों को समझने की चुनौती दी जाए जो एक हमले को परिभाषित करते हैं। इस सावधानीपूर्वक शेड्यूलिंग को महत्वपूर्ण नोड्स की सुरक्षा की रणनीति और विभिन्न डेटा प्रकारों की अनूठी प्रकृति का सम्मान करने के साथ जोड़कर, सिस्टम ने एक ही समय में जंगल और पेड़ों दोनों को देखना सीख लिया। परिणाम एक ऐसा डिटेक्शन टूल है जो उल्लंघन के सूक्ष्म संकेतों के प्रति अधिक संवेदनशील है और निर्दोष गतिविधि पर 'गलत चेतावनी' देने की कम संभावना रखता है।

यह कार्य सुझाव देता है कि साइबर सुरक्षा का भविष्य नए, जटिल नियमों को खोजने पर कम और मशीनों को यह सिखाने पर अधिक निर्भर हो सकता है कि सही चीजों पर ध्यान कैसे दिया जाए। यह समझते हुए कि सभी डेटा बिंदु समान नहीं हैं और विभिन्न प्रकार की डिजिटल वस्तुओं को अलग-अलग तरह की समझ की आवश्यकता होती है, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जो अदृश्य को देखने में बेहतर है। यह अध्ययन इस समस्या को पूरी तरह से हल करने का दावा नहीं करता है, लेकिन यह डिजिटल गतिविधि के अराजक माहौल को देखने के लिए एक शक्तिशाली नया लेंस प्रदान करता है। यह दिखाता है कि अपने इतिहास से सीखने के लिए हम मशीनों को कैसे प्रशिक्षित करते हैं, इसे परिष्कृत करके, हम उन्हें हमारे डिजिटल जगत का अधिक सटीक, विश्वसनीय और तेज संरक्षक बना सकते हैं। आगे का मार्ग इन विधियों को परिष्कृत करना जारी रखने में निहित है, यह सुनिश्चित करना कि वे नुकसान पहुँचाने वालों की बदलती रणनीतियों के अनुकूल हो सकें, जबकि झूठे अलार्म को इतना कम रखा जा सके कि मानव रक्षक वास्तविक खतरों पर ध्यान केंद्रित कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →