← नवीनतम पेपर
🤖 machine learning

RAD: Rule-Augmented Relational Anomaly Detection

यह शोध पत्र RAD का प्रस्ताव करता है, जो एक नियम-संवर्धित संबंधपरक विसंगति पहचान (rule-augmented relational anomaly detection) ढांचा है जो बहु-तालिका डेटाबेस में विसंगतियों को प्रभावी ढंग से पहचानने के लिए हेटेरोजेनियस ग्राफ प्रतिनिधित्व शिक्षण को रैंडम-फॉरेस्ट पथों से प्राप्त परिष्कृत प्रतीकात्मक नियमों के साथ जोड़ता है, जो संबंधपरक संरचना को संरक्षित करते हुए और व्यवहारिक साक्ष्य को शामिल करते हुए साइबर सुरक्षा और ई-कॉमर्स डेटासेटों तक फैले एक नए बेंचमार्क पर मौजूदा बेसलाइनों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Noah Dahle, Anne Tumlin, Ngoc Tran, Xenofon Koutsoukos, Tyler Derr

प्रकाशित 2026-08-25
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Noah Dahle, Anne Tumlin, Ngoc Tran, Xenofon Koutsoukos, Tyler Derr

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक संगठनों के विशाल, गूँजते हुए सर्वरों में, डेटा व्यवस्थित, एकल कॉलमों में नहीं बैठा होता है। यह कनेक्शनों के एक जटिल जाल में रहता है, जहाँ एक उपयोगकर्ता, एक मशीन, एक लेनदेन और एक लॉगिन प्रयास, एक विस्तृत नेटवर्क के नोड्स की तरह एक साथ जुड़े होते हैं। दशकों से, कंप्यूटर वैज्ञानिकों ने इस घास के ढेर में सुई खोजने की कोशिश की है: वह दुर्लभ, संदिग्ध घटना जो सुरक्षा उल्लंघन, धोखाधड़ी के प्रयास, या किसी ग्राहक के जाने की संभावना का संकेत देती है। इन सुइयों को खोजने का पारंपरिक तरीका पूरे जाल को संख्याओं की एक लंबी, एकल सूची में समतल (flatten) करना रहा है, जिससे डेटा को संसाधित करना आसान बनाने के लिए कनेक्शनों को हटा दिया जाता है। लेकिन यह दृष्टिकोण अक्सर उन संकेतों को भी फेंक देता है जो किसी घटना को संदिग्ध बनाते हैं। एक लॉगिन अपने आप में पूरी तरह सामान्य लग सकता है, फिर भी उस विशिष्ट मशीन के संदर्भ में, समय के संदर्भ में, और उपयोगकर्ता के हालिया इतिहास के संदर्भ में देखने पर अत्यधिक खतरनाक हो सकता है। इन छिपे हुए पैटर्न को खोजने के लिए एक ऐसी पद्धति की आवश्यकता होती है जो डेटा की संरचना का सम्मान करे और साथ ही उन विशिष्ट, नियम-आधारित व्यवहारों को भी समझे जो खतरे को परिभाषित करते हैं।

वैंडरबिल्ट यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने RAD नामक एक नई प्रणाली विकसित की है, जिसे ठीक इसी समस्या को हल करने के लिए डिज़ाइन किया गया है। डेटा को समतल करके और उसका आकार खोकर, RAD डेटाबेस को संबंधों के एक जीवंत मानचित्र के रूप में देखता है, बिल्कुल एक शहर के मानचित्र की तरह जहाँ हर इमारत एक व्यक्ति है और हर सड़क उनके बीच का संबंध है। इस प्रणाली का नवाचार इस बात में निहित है कि यह सोचने के दो अलग-अलग तरीकों को कैसे जोड़ती है: एक नेटवर्क में पैटर्न से सीखने की आर्टिफिशियल इंटेलिजेंस की क्षमता, और मानव-परिभाषित नियमों की स्पष्टता जो विशिष्ट बुरे व्यवहारों का वर्णन करते हैं। शोधकर्ताओं ने पाया कि नेटवर्क का विश्लेषण शुरू करने से पहले इन स्पष्ट, तार्किक नियमों को सीधे AI की सीखने की प्रक्रिया में फीड करने से, सिस्टम उन दुर्लभ, खतरनाक घटनाओं को पहचानने में काफी बेहतर हो जाता है जिन्हें अन्य विधियाँ छोड़ देती हैं।

यह समझने के लिए कि यह क्यों महत्वपूर्ण है, साइबर हमले को पकड़ने की चुनौती पर विचार करें। एक विशिष्ट डेटाबेस में, एक एकल लॉगिन प्रयास केवल डेटा की एक पंक्ति है। लेकिन वास्तव में, वह लॉगिन एक कहानी का हिस्सा है। यदि कोई उपयोगकर्ता एक ऐसे कंप्यूटर में लॉग इन करता है जिसका उसने पहले कभी उपयोग नहीं किया है, ऐसे समय में जब वह आमतौर पर काम नहीं करता है, और ऐसे स्थान से जो उसके इतिहास से मेल नहीं खाता, तो डेटा की वह एकल पंक्ति एक चेतावनी का संकेत बन जाती है। पारंपरिक उपकरण अक्सर इसे चूक जाते हैं क्योंकि वे उस पंक्ति को अलग-थलग देखते हैं। शोधकर्ताओं ने अपने नए सिस्टम का परीक्षण तीन बहुत अलग प्रकार के डेटा पर किया: एक बड़े संगठन से प्राप्त विशाल साइबर सुरक्षा लॉग, एक ऑनलाइन रिटेलर से प्राप्त ग्राहकों की समीक्षाओं का डेटाबेस, और एक प्रमुख क्लोदिंग ब्रांड के शॉपिंग लेनदेन का डेटाबेस। प्रत्येक मामले में, लक्ष्य एक ही था: सबसे संदिग्ध घटनाओं को सूची के सबसे ऊपर रैंक करना, ताकि मानव विश्लेषक उन्हें जल्दी से ढूंढ सकें।

RAD प्रणाली एक सावधानीपूर्वक व्यवस्थित क्रम में कार्य करती है। सबसे पहले, यह जटिल, मल्टी-टेबल डेटाबेस लेता है और एक विस्तृत मानचित्र बनाता है कि सब कुछ कैसे जुड़ता है, जिससे प्रत्येक उपयोगकर्ता, मशीन और घटना की विशिष्ट पहचान सुरक्षित रहती है। फिर, यह विशिष्ट नियमों की खोज के लिए डेटा का एक सरल, अस्थायी दृश्य (view) बनाता है। एक मानक मशीन लर्निंग तकनीक का उपयोग करते हुए, यह डेटा को स्कैन करता है ताकि उन तार्किक स्थितियों को खोज सके जो अक्सर किसी समस्या से पहले होती हैं, जैसे कि "एक उपयोगकर्ता जिसने दस मिनट में चार से अधिक मशीनों में लॉगिन किया है" या "एक ग्राहक जिसने लंबे समय तक गतिविधि के बाद उत्पादों की समीक्षा करना बंद कर दिया है।" ये अस्पष्ट अनुमान नहीं हैं; ये डेटा से सीधे प्राप्त ठोस, व्याख्या योग्य नियम हैं।

यहीं पर यह प्रणाली पुरानी विधियों से अलग हो जाती है। इन नियमों का उपयोग केवल अंतिम परिणामों की जाँच करने के लिए करने के बजाय, RAD इन्हें AI द्वारा गहन विश्लेषण शुरू करने से पहले सीधे नेटवर्क मानचित्र के केंद्र में इंजेक्ट करता है। नेटवर्क मानचित्र की कल्पना ऐसे करें जैसे लोगों का एक समूह अपनी स्थिति को समझने के लिए एक-दूसरे को नोट्स पास कर रहा है। पिछले सिस्टम में, नियम उस अंतिम नोट की तरह थे जो समूह द्वारा निर्णय लेने के बाद पास किया जाता था। RAD में, नियमों को शुरुआत में ही दे दिया जाता है, जो इस बात को आकार देते हैं कि वे एक-दूसरे की बात कैसे सुनते हैं और अपनी स्थिति को कैसे समझते हैं। यह सिस्टम को डेटा का एक ऐसा प्रतिनिधित्व सीखने की अनुमति देता है जो पहले से ही उन विशिष्ट व्यवहारों के प्रति जागरूक है जो परेशानी का संकेत देते हैं।

इस दृष्टिकोण के परिणाम आश्चर्यजनक थे। मौजूदा विधियों के विरुद्ध परीक्षण किए जाने पर, RAD ने लगातार उन सिस्टमों से बेहतर प्रदर्शन किया जो केवल समतल डेटा पर निर्भर थे या जो इन विशिष्ट नियमों के लाभ के बिना नेटवर्क मानचित्रों का उपयोग करते थे। सुधार सबसे नाटकीय रूप से साइबर सुरक्षा सेटिंग में देखा गया, जहाँ सिस्टम पहले की तुलना में बहुत अधिक सटीकता के साथ संदिग्ध लॉगिन घटनाओं की पहचान करने में सक्षम था। रिटेल सेटिंग्स में, इसने उन ग्राहकों को सफलतापूर्वक चिह्नित किया जो सेवा का उपयोग अचानक बंद करने वाले थे, जो एक कठिन कार्य है क्योंकि उनका व्यवहार अंतिम क्षण तक सामान्य दिखता है। शोधकर्ताओं ने पाया कि सबसे खतरनाक घटनाओं को सूची में शीर्ष पर रैंक करने की सिस्टम की क्षमता में उल्लेखनीय सुधार हुआ, जो महत्वपूर्ण है क्योंकि वास्तविक दुनिया की सुरक्षा और व्यवसाय में, विश्लेषक प्रत्येक अलर्ट की समीक्षा नहीं कर सकते; उनके पास केवल शीर्ष कुछ को देखने का ही समय होता है।

अध्ययन ने यह भी खुलासा किया कि इस तरह के सिस्टम कैसे काम करते हैं इसके बारे में कुछ महत्वपूर्ण बारीकियां हैं। शोधकर्ताओं ने परीक्षण किया कि क्या पूरे नेटवर्क मानचित्र का पुनर्निर्माण करना—अनिवार्य रूप से AI से यह पूछना कि कौन से कनेक्शन मौजूद होने चाहिए—सिस्टम को विसंगतियों को खोजने में मदद करता है। उन्होंने पाया कि यह हमेशा सहायक नहीं था; कुछ मामलों में, मानचित्र को फिर से बनाने की कोशिश ने सिस्टम को अपने मुख्य कार्य (बुरे तत्वों को खोजने) से विचलित कर दिया। इसी तरह, उन्होंने परीक्षण किया कि क्या नियमों को परिष्कृत करने के लिए उन्नत भाषा मॉडल (language models) का उपयोग करने से कोई अंतर पड़ता है। उन्होंने पाया कि जबकि इन मॉडलों ने नियमों को साफ करने और व्यवस्थित करने में मदद की, लेकिन मुख्य शक्ति स्वयं नियमों की प्रारंभिक खोज से आई, न कि परिशोधन (refinement) चरण से। यह सुझाव देता है कि सबसे प्रभावी रणनीति स्पष्ट, सरल व्यवहारिक पैटर्न खोजना और उन्हें सीधे नेटवर्क विश्लेषण में फीड करना है, न कि जटिल, पोस्ट-हॉक समायोजनों पर भरोसा करना।

अंततः, यह कार्य प्रदर्शित करता है कि जटिल डेटा में विसंगतियों को खोजने का सबसे अच्छा तरीका डेटा की संरचना का सम्मान करना और सिस्टम को स्पष्ट रूप से सिखाना है कि क्या देखना है। नेटवर्क विश्लेषण की गहरी शिक्षण क्षमताओं को प्रतीकात्मक नियमों (symbolic rules) की सटीकता के साथ जोड़कर, RAD हमारे डिजिटल जीवन में छिपे खतरों को देखने का एक नया तरीका प्रदान करता है। यह दिखाता है कि जब हम डेटा को संख्याओं की एक सपाट सूची के रूप में मानना बंद कर देते हैं और इसे एक जुड़े हुए वृत्तांत (connected story) के रूप में देखना शुरू करते हैं, तो हम उन खतरों को पा सकते हैं जो हमेशा वहीं थे, बस समझने की प्रतीक्षा कर रहे थे। शोधकर्ताओं ने अपना कोड और डेटा दूसरों के उपयोग के लिए उपलब्ध करा दिया है, इस उम्मीद में कि यह दृष्टिकोण संगठनों को हर जगह unexpected (अप्रत्याशित) को संकट बनने से पहले पहचानने में बेहतर बनाने में मदद करेगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →