A Neural Screener–Reasoner Framework for Evidence-Grounded Log-Based Anomaly Detection and Explanation
यह शोध पत्र एक न्यूरल स्क्रीनर-रीज़नर (Neural Screener–Reasoner) फ्रेमवर्क प्रस्तावित करता है जो उच्च-सटीक लॉग विसंगति का पता लगाने और सत्यापन योग्य, साक्ष्य-आधारित स्पष्टीकरण उत्पन्न करने के साथ-साथ अनुमान लागत (inference costs) को प्रबंधित करने के लिए एक पार्सर-मुक्त, लीनियर सेल्फ-अटेंशन डिटेक्टर को रिट्रीवल-ऑगमेंटेड एलएलएम (LLM) के साथ संयोजित करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक कंप्यूटिंग सिस्टम विशाल, परस्पर जुड़े हुए नेटवर्क हैं जो वैज्ञानिक अनुसंधान से लेकर वैश्विक वित्त तक सब कुछ संचालित करते हैं। इन सिस्टमों को सुचारू रूप से चलाने के लिए, इंजीनियर डिजिटल रिकॉर्ड की एक निरंतर धारा पर भरोसा करते हैं जिन्हें लॉग (logs) कहा जाता है। ये लॉग सिस्टम की गतिविधि की एक डायरी की तरह कार्य करते हैं, जो प्रत्येक क्रिया, त्रुटि और स्थिति परिवर्तन को एक टाइमस्टैम्प और संदेश के साथ दर्ज करते हैं। जब कुछ गलत होता है—जैसे कोई सर्वर क्रैश हो जाता है, कोई फ़ाइल सेव होने में विफल हो जाती है, या कोई सुरक्षा उल्लंघन होता है—तो इन लॉग्स में उन सुरागों का संग्रह होता है जिनकी मदद से यह समझा जा सके कि क्या हुआ था। हालाँकि, जैसे-जैसे सिस्टम बड़े और तेज़ होते जाते हैं, इन लॉग्स की मात्रा अत्यधिक होती जाती है। एक दिन की गतिविधि भी लाखों पंक्तियों का टेक्स्ट उत्पन्न कर सकती है, जिससे मानव ऑपरेटरों के लिए उन सभी को पढ़ना असंभव हो जाता है। दशकों से, समाधान इन लॉग्स को स्कैन करने के लिए स्वचालित उपकरण बनाना रहा है ताकि विसंगतियों (anomalies), या असामान्य पैटर्नों को पहचाना जा सके जो किसी समस्या का संकेत देते हैं। लेकिन एक महत्वपूर्ण अंतर बना हुआ है: जबकि ये उपकरण एक ऑपरेटर को यह बता सकते हैं कि कुछ गलत है, वे अक्सर यह नहीं समझा पाते कि क्यों। वे केवल एक बाइनरी चेतावनी देते हैं, एक सरल "हाँ" या "नहीं", बिना उन विशिष्ट पंक्तियों की ओर इशारा किए जिन्होंने अलार्म बजाया या वर्तमान त्रुटि को पिछले विफलताओं से जोड़े बिना। यह इंजीनियरों को एक लाल बत्ती तो देता है लेकिन कोई मानचित्र नहीं देता, जिससे वे मूल कारण खोजने के लिए हजारों पंक्तियों के टेक्स्ट को मैन्युअल रूप से छानने के लिए मजबूर हो जाते हैं।
शोधकर्ताओं की एक टीम ने इस अंतर को पाटने के लिए डिज़ाइन किया गया एक नया फ्रेमवर्क विकसित किया है, जो सरल पहचान से आगे बढ़कर साक्ष्य-आधारित स्पष्टीकरण प्रदान करता है। उनका दृष्टिकोण समस्या को दो अलग-अलग चरणों में देखता है, ठीक वैसे ही जैसे एक ट्राइएज नर्स (triage nurse) के बाद एक विशेषज्ञ डॉक्टर। पहला चरण, जिसे वे "स्क्रीनर" (Screener) कहते हैं, एक तेज़, कुशल डिटेक्टर है जो कच्चे लॉग संदेशों को बिना उन्हें छोटे, पूर्व-निर्धारित भागों में तोड़े स्कैन करता है। पारंपरिक तरीके अक्सर लॉग्स को पहले कठोर टेम्प्लेट में बदलने के लिए मजबूर करते हैं, एक ऐसी प्रक्रिया जो महत्वपूर्ण विवरणों को हटा सकती है या त्रुटियां पैदा कर सकती है। यह नया स्क्रीनर सीधे कच्चे टेक्स्ट को पढ़ता है, और एक सुव्यवस्थित अटेंशन मैकेनिज्म का उपयोग करता है जो इसे डेटा के लंबे अनुक्रमों को तेज़ी से और सटीकता से संसाधित करने की अनुमति देता है। सुपरकंप्यूटर और वितरित स्टोरेज सिस्टम का प्रतिनिधित्व करने वाले दो प्रमुख डेटासेट्स पर परीक्षणों में, इस स्क्रीनर ने लगभग पूर्ण सटीकता के साथ विसंगतियों की पहचान की, लगभग हर समस्याग्रस्त सत्र को सही ढंग से चिह्नित किया और सामान्य गतिविधि को अनदेखा किया। यह एक अत्यधिक विश्वसनीय फिल्टर के रूप में कार्य करता है, यह सुनिश्चित करता है कि कोई भी वास्तविक समस्या छूट न जाए।
एक बार जब स्क्रीनर किसी सत्र को संदिग्ध के रूप रूप में चिह्नित कर देता है, तो दूसरा चरण, "रीज़नर" (Reasoner), मानवीय रूप से पठनीय स्पष्टीकरण उत्पन्न करने के लिए कार्यभार संभाल लेता है। अनुमान लगाने या केवल अपने आंतरिक ज्ञान पर निर्भर रहने के बजाय, रीज़नर एक शोधकर्ता की तरह कार्य करता है जो अभिलेखागार (archive) में खुदाई कर रहा हो। यह ऐतिहासिक लॉग्स के डेटाबेस से पिछले विसंगतियों और सामान्य व्यवहार के विशिष्ट उदाहरणों को प्राप्त करता है। इन प्राप्त उदाहरणों का उपयोग मार्गदर्शक के रूप में करते हुए, यह एक संरचित रिपोर्ट तैयार करता है जो अपने द्वारा किए गए प्रत्येक दावे को वर्तमान लॉग की एक विशिष्ट पंक्ति और ऐतिहासिक उदाहरणों की एक अनुरूप पंक्ति से जोड़ता है। यह सुनिश्चित करता है कि स्पष्टीकरण न केवल एक प्रवाहपूर्ण कहानी है, बल्कि ठोस साक्ष्य द्वारा समर्थित एक तर्क भी है। विश्वसनीयता सुनिश्चित करने के लिए, एक स्वचालित सत्यापनकर्ता (verifier) प्रत्येक उत्पन्न स्पष्टीकरण की सख्त नियमों के विरुद्ध जांच करता है, यह सुनिश्चित करता है कि उद्धृत प्रत्येक पंक्ति वास्तव में मौजूद है और तर्क सही है। उनके प्रयोगों में, इस प्रणाली द्वारा उत्पन्न प्रत्येक स्पष्टीकरण इन कठोर जांचों में पास हुआ, और मानव विशेषज्ञों ने स्पष्टीकरणों की गुणवत्ता को अत्यधिक सटीक और पूर्ण माना।
शोधकर्ताओं ने इस व्यावहारिक वास्तविकता को भी संबोधित किया कि इन विस्तृत स्पष्टीकरणों को उत्पन्न करना गणनात्मक रूप से महंगा है। प्रत्येक चिह्नित विसंगति पर एक जटिल तर्क प्रक्रिया चलाना वास्तविक दुनिया के उपयोग के लिए बहुत धीमा और महंगा होगा। इसे हल करने के लिए, उन्होंने एक स्मार्ट गेटिंग मैकेनिज्म (gating mechanism) पेश किया है जो यह निर्णय लेता है कि किन विसंगतियों को पूर्ण स्पष्टीकरण की आवश्यकता है। सिस्टम उन सत्रों को प्राथमिकता देता है जहाँ प्रारंभिक स्क्रीनर कम आश्वस्त था, अपनी महंगी तर्क शक्ति को उन मामलों पर केंद्रित करता है जो सबसे अधिक अस्पष्ट या कठिन हैं। ऐसा करके, फ्रेमवर्क विसंगतियों की एक विशाल संख्या के पैटर्न की व्याख्या कर सकता है और साथ ही बहुत कम कंप्यूटिंग संसाधनों का उपयोग कर सकता है। अध्ययन में पाया गया कि केवल सबसे अनिश्चित मामलों की व्याख्या करके, सिस्टम अभी भी ज्ञात त्रुटियों के अधिकांश प्रकारों को कवर कर सकता है, जो गहनता और दक्षता के बीच संतुलन बनाता है। यह कार्य प्रदर्शित करता है कि ऐसी स्वचालित प्रणालियाँ बनाना संभव है जो न केवल उच्च सटीकता के साथ समस्याओं का पता लगाती हैं, बल्कि वह पता लगाने योग्य, साक्ष्य-आधारित तर्क भी प्रदान करती हैं जिसकी मानव ऑपरेटरों को उन्हें जल्दी और आत्मविश्वास से ठीक करने के लिए आवश्यकता होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।