OntoLogX: Ontology-Guided Knowledge Graph Extraction from Cybersecurity Logs with Large Language Models
OntoLogX एक स्वायत्त AI एजेंट है जो लार्ज लैंग्वेज मॉडल्स (LLMs), रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) और ऑन्टोलॉजी-गाइडेड इटरेटिव करेक्शन का लाभ उठाकर असंरचित साइबर सुरक्षा लॉग्स को सटीक रूप से MITRE ATT&CK टैक्टिक्स से मैप करने के लिए सुसंगत, ऑन्टोलॉजी-ग्राउंडेड नॉलेज ग्राफ्स में परिवर्तित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक अपराध को सुलझाने की कोशिश कर रहे एक जासूस हैं, लेकिन आपको स्पष्ट गवाहों के बयानों के बजाय, सैकड़ों अलग-अलग पुलिस अधिकारियों के फटे हुए नोट्स, बिखरे हुए रसीदों और अस्पष्ट रेडियो ट्रांसमिशन का एक ढेर थमा दिया गया है। साइबर सुरक्षा विशेषज्ञ सिस्टम लॉग्स (system logs) को देखते समय बिल्कुल यही अनुभव करते हैं। ये लॉग्स कंप्यूटर द्वारा छोड़े गए डिजिटल पदचिह्न हैं, लेकिन ये अव्यवस्थित, असंरचित और अक्सर एक-दूसरे से भिन्न, भ्रमित करने वाले संक्षिप्त रूप में होते हैं।
यह शोध पत्र OntoLogX को प्रस्तुत करता है, जो एक नया "स्वायत्त एआई जासूस" (autonomous AI detective) है, जिसे इस अव्यवस्था को साफ करने और उन अराजक नोट्स को हुई घटना के एक स्पष्ट, व्यवस्थित मानचित्र में बदलने के लिए डिज़ाइन किया गया है।
OntoLogX कैसे काम करता है, इसे सरल उपमाओं के माध्यम से समझाया गया है:
1. समस्या: "फटे हुए नोट्स" (The "Shredded Notes")
सिस्टम लॉग्स फटे हुए कागज के ढेर की तरह हैं। इनमें हैकर्स के बारे में मूल्यवान सुराग होते हैं (वे कौन हैं, उन्होंने क्या करने की कोशिश की, और उन्होंने यह कैसे किया), लेकिन जानकारी बिखरी हुई, असंगत और पढ़ने में कठिन होती है। पारंपरिक उपकरण इन्हें कठोर नियमों (जैसे कि एक चेकलिस्ट) का पालन करके छांटने की कोशिश करते हैं, लेकिन हैकर्स रचनात्मक होते हैं और अपनी रणनीतियां बदलते रहते हैं, इसलिए यह चेकलिस्ट अक्सर विफल हो जाती है।
2. समाधान: "स्मार्ट अनुवादक" (The "Smart Translator" - OntoLogX)
OntoLogX एक एआई एजेंट है जो एक अत्यंत बुद्धिमान अनुवादक और संगठक के रूप में कार्य करता है। इसका काम एक एकल, अव्यवस्थित लॉग प्रविष्टि (log entry) को लेना और उसे एक संरचित नॉलेज ग्राफ (Knowledge Graph) में बदलना है।
- नॉलेज ग्राफ (The Knowledge Graph): इसे एक फैमिली ट्री या सबवे मैप की तरह समझें। टेक्स्ट के एक ब्लॉक के बजाय, यह विशिष्ट "बिंदुओं" (जैसे कि एक उपयोगकर्ता, एक कंप्यूटर, एक समय और एक क्रिया) को स्पष्ट "लाइनों" के साथ जोड़ता है जो यह दर्शाती हैं कि वे एक-दूसरे से कैसे संबंधित हैं।
- ऑन्टोलॉजी (The Ontology - द ब्लूप्रिंट): यह सुनिश्चित करने के लिए कि मानचित्र सही ढंग से बनाया जाए, OntoLogX एक हल्की ऑन्टोलॉजी (lightweight ontology) का उपयोग करता है। कल्पना कीजिए कि यह एक सख्त वास्तुशिल्प ब्लूप्रिंट या LEGO निर्देशों का एक सेट है। यह एआई को बताता है कि किस प्रकार के हिस्से (नोड्स) और संबंध (रिलेशनशिप) की अनुमति है, जिससे यह सुनिश्चित होता है कि अंतिम मानचित्र तर्कसंगत है और नियमों का पालन करता है।
3. यह कैसे काम करता है: तीन-चरणीय प्रक्रिया
OntoLogX केवल अनुमान नहीं लगाता; यह सटीकता सुनिश्चित करने के लिए एक चतुर तीन-चरणीय दिनचर्या का उपयोग करता है:
चरण 1: "संदर्भ पुस्तकालय" (The "Reference Library" - Retrieval Augmented Generation)
एक नया लॉग अनुवाद करने से पहले, एआई अपने स्वयं के मेमोरी बैंक (पहले से हल किए गए लॉग्स का एक डेटाबेस) में समान उदाहरण खोजने के लिए देखता है। यह एक जासूस की तरह है जो पिछले केस फाइलों को देखता है ताकि यह समझ सके कि समान अपराधों को कैसे प्रलेखित किया गया था। यह एआई को संदर्भ समझने और बार-बार वही काम करने से बचने में मदद करता है।चरण 2: "ड्राफ्टिंग चरण" (The "Drafting Phase" - Generation)
संदर्भ उदाहरणों और सख्त "LEGO निर्देशों" (ऑन्टोलॉजी) का उपयोग करते हुए, एआई एक ड्राफ्ट मैप तैयार करता है। यह मुख्य विवरण निकालने की कोशिश करता है: किसने किया? कब किया? उन्होंने किस टूल का उपयोग किया?चरण 3: "निरीक्षक" (The "Inspector" - Iterative Correction)
यह सबसे महत्वपूर्ण सुरक्षा जाल है। एक बार ड्राफ्ट बन जाने के बाद, एक डिजिटल निरीक्षक (SHACL नामक टूल का उपयोग करके) ब्लूप्रिंट के विरुद्ध इसकी जांच करता है।- यदि एआई ने गलती की है (उदाहरण के लिए, इसने गलत बिंदुओं को जोड़ा या कोई आवश्यक हिस्सा छोड़ दिया), तो निरीक्षक ड्राफ्ट को एक नोट के साथ एआई के पास वापस भेजता है: "इसे ठीक करें।"
- एआई फिर से प्रयास करता है। यह लूप तब तक दोहराता रहता है जब तक कि मानचित्र पूर्ण न हो जाए और सभी नियमों का पालन न करे। यदि वह कुछ प्रयासों के बाद भी इसे ठीक नहीं कर पाता है, तो वह एक नकली मानचित्र बनाने के बजाय हार मान लेता है और उस प्रविष्टि को खाली छोड़ देता है।
4. बड़ी तस्वीर: बिंदुओं को जोड़ना (Connecting the Dots)
एक बार जब OntoLogX हजारों व्यक्तिगत लॉग प्रविष्टियों को साफ कर लेता है, तो वह उन्हें "सेशन्स" (जैसे कि एक विशिष्ट घुसपैठ के प्रयास से जुड़े सभी नोट्स को समूहबद्ध करना) में समूहित करता है। इसके बाद, यह पूरी तस्वीर को देखने के लिए अंतिम बार एआई का उपयोग करता है और एक उच्च-स्तरीय प्रश्न का उत्तर देता है: "हैकर का लक्ष्य क्या था?"
यह गतिविधियों को MITRE ATT&CK से जोड़ता है, जो हैकर की रणनीतियों का एक सार्वभौमिक शब्दकोश है। यह केवल यह कहने के बजाय कि "हैकर ने एक कमांड चलाया," OntoLogX कह सकता है, "यह एक प्रारंभिक पहुंच (Initial Access) का प्रयास था जिसके बाद विशेषाधिकार वृद्धि (Privilege Escalation) हुई।" यह कच्चे डेटा को ऐसी कार्रवाई योग्य बुद्धिमत्ता में बदल देता है जिसका सुरक्षा टीमें वास्तव में उपयोग कर सकती हैं।
5. शोध पत्र ने क्या पाया
लेखकों ने OntoLogX का परीक्षण दो प्रकार के डेटा पर किया:
- सार्वजनिक डेटासेट (Public datasets): यह सुनिश्चित करने के लिए कि यह मानक, ज्ञात लॉग्स पर काम करता है।
- वास्तविक दुनिया के हनीपॉट्स (Real-world Honeypots): ये हैकर्स को आकर्षित करने के लिए बनाए गए नकली सर्वर हैं। इनके लॉग्स शुद्ध "बुरे व्यक्ति" (bad guy) की गतिविधि हैं।
परिणाम:
- सटीकता (Accuracy): सिस्टम ने सफलतापूर्वक अव्यवस्थित लॉग्स को साफ, नियम-अनुपालन वाले मानचित्रों में बदल दिया।
- मदद से बेहतर प्रदर्शन: सिस्टम सबसे अच्छा तब काम करता था जब यह अपने "संदर्भ पुस्तकालय" (रिट्रीवल) और "निरीक्षक" (करेक्शन) का उपयोग करता था। इनके बिना, एआई अधिक गलतियाँ करता था।
- मॉडल का महत्व: सभी एआई मस्तिष्क समान नहीं होते। सिस्टम उन मॉडल्स के साथ सबसे अच्छा काम करता है जो सख्त निर्देशों का पालन करने में कुशल हैं (जैसे कि कोड-केंद्रित मॉडल), न कि उन मॉडल्स के साथ जो रचनात्मक कहानी सुनाने में बेहतर हैं।
- रणनीति का पता लगाना (Tactic Detection): जब हैकर्स क्या करने की कोशिश कर रहे थे, इसकी भविष्यवाणी करने की बात आई, तो OntoLogX जटिल, बहु-चरणीय हमलों को पहचानने में उन सिस्टमों की तुलना में बहुत बेहतर था जो सीधे कच्चे लॉग्स को पढ़ते हैं।
सारांश
संक्षेप में, OntoLogX एक ऐसा टूल है जो कंप्यूटर लॉग्स की भ्रमित करने वाली, अराजक भाषा को लेता है और उसे साइबर हमलों के एक स्पष्ट, संरचित और सत्यापित मानचित्र में अनुवादित करता है। यह एक सख्त नियम पुस्तिका का उपयोग करता है, पिछले उदाहरणों से सीखता है, और यह सुनिश्चित करने के लिए अपने स्वयं के काम की दोबारा जांच करता है कि अंतिम बुद्धिमत्ता विश्वसनीय है ताकि सुरक्षा विशेषज्ञ उस पर कार्रवाई कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।