← नवीनतम पेपर
💻 computer science

Log-based Anomaly Detection Uses All Contextual Information with a Linear Self- Attention Encoder

यह शोध पत्र AllLinLog को प्रस्तुत करता है, जो एक सुव्यवस्थित मॉडल है जो सिस्टम लॉग से पूर्ण प्रासंगिक जानकारी को सीधे संसाधित करने के लिए एक लीनियर सेल्फ-अटेंशन एनकोडर का उपयोग करके लॉग पार्सिंग की आवश्यकता को समाप्त करता है, जिससे पारंपरिक तरीकों की तुलना में बेहतर विसंगति पहचान सटीकता और तेज़ इन्फरेंस प्राप्त होता है।

मूल लेखक: Chi-Ming Chou, Shang-Kuan Chen

प्रकाशित 2026-07-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chi-Ming Chou, Shang-Kuan Chen

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "AllLinLog: Log-based Anomaly Detection Uses All Contextual Information with a Linear Self-Attention Encoder" का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ हिंदी अनुवाद दिया गया है।

बड़ी समस्या: घास के ढेर में सुई ढूँढना (जो लगातार बढ़ता जा रहा है)

कल्पना कीजिए कि आप एक विशाल और व्यस्त हवाई अड्डे के सुरक्षा गार्ड हैं। हर व्यक्ति जो दरवाज़े से अंदर आता है, वह अपने साथ एक डिजिटल "रसीद" (सिस्टम लॉग) छोड़ जाता है। ये रसीदें आपको बताती हैं कि कौन आया, उन्होंने किस गेट का उपयोग किया, और क्या कुछ गलत हुआ।

  • पुराना तरीका (लॉग पार्सिंग/Log Parsing): पारंपरिक रूप से, सुरक्षा गार्ड इन रसीदों को पहले एक साफ-सुथरे, मानकीकृत (standardized) रूप में फिर से लिखने की कोशिश करते थे। वे बिखरे हुए विवरणों (जैसे विशिष्ट फ्लाइट नंबर या नाम) को हटा देते थे और बस इतना लिखते थे, "व्यक्ति गेट A में प्रवेश किया।"

    • खामी: कभी-कभी, गार्ड रसीद को गलत तरीके से फिर से लिख देता है। वे शायद किसी विशिष्ट फ्लाइट नंबर को केवल एक गेट का नाम समझ लें, या वे किसी महत्वपूर्ण विवरण को यह सोचकर फेंक दें कि वह महत्वहीन है। यदि पुन: लेखन (rewriting) गलत है, तो सुरक्षा प्रणाली खतरे को पहचान नहीं पाती। इसके अलावा, लाखों रसीदों को फिर से लिखने में बहुत समय लगता है।
  • नई समस्या (बहुत अधिक डेटा): यदि आप रसीदों को ठीक वैसे ही पढ़ने की कोशिश करते हैं जैसे वे लिखी गई हैं (बिना फिर से लिखे), तो आपको बहुत सारा टेक्स्ट प्राप्त होता है। एक सामान्य सुरक्षा गार्ड (एक पारंपरिक AI मॉडल) एक बार में केवल एक छोटा नोट ही पढ़ सकता है। यदि नोट बहुत लंबा है, तो उन्हें उसे फिट करने के लिए अंत का हिस्सा काट देना पड़ता है या शुरुआत को अनदेखा करना पड़ता है। इसका मतलब है कि वे महत्वपूर्ण संदर्भ (context) खो देते हैं।

समाधान: AllLinLog

इस शोध पत्र के लेखकों ने एक नया सुरक्षा तंत्र बनाया है जिसे AllLinLog कहा जाता है। यह ऊपर दी गई समस्याओं को तीन मुख्य तरीकों से हल करता है:

1. रसीदों को "वैसी ही" पढ़ना (पुनः लेखन के बिना)

बिखरी हुई रसीदों को साफ-सुथरे टेम्प्लेट में बदलने के बजाय, AllLinLog कच्चे टेक्स्ट (raw text) को ठीक वैसा ही पढ़ता है जैसा वह दिखाई देता है।

  • उदाहरण: कल्पना कीजिए कि एक सुपर-स्मार्ट अनुवादक है जो बिना सफाई किए, हाथ से लिखे नोट्स को उनकी स्थानीय भाषा, गलतियों और अजीब प्रतीकों के साथ भी पढ़ सकता है।
  • यह कैसे मदद करता है: यह टेक्स्ट को "गलत समझने" की गलती नहीं करता। यह हर शब्द, संख्या और प्रतीक को सुरक्षित रखता है, जिससे यह सुनिश्चित होता है कि कोई भी महत्वपूर्ण सुराग फेंका न जाए।

2. "लीनियर" सुपर-ब्रेन (लंबे नोट्स को संभालना)

कच्चा टेक्स्ट पढ़ने की सबसे बड़ी चुनौती यह है कि ये नोट्स हजारों शब्दों के लंबे हो सकते हैं। एक मानक AI दिमाग (जिसे ट्रांसफार्मर कहा जाता है) जल्दी ही घबरा जाता है। उसका प्रयास घातीय (exponentially) रूप से बढ़ता है—जैसे एक स्टेडियम में हर किसी से हाथ मिलाना; यदि स्टेडियम का आकार दोगुना हो जाता है, तो प्रयास चार गुना बढ़ जाता है। यह बहुत धीमा और मेमोरी-भूखा हो जाता है।

AllLinLog एक Linear Self-Attention Encoder का उपयोग करता है।

  • उदाहरण: कल्पना कीजिए कि एक मानक AI एक फोन बुक में हर नाम को दूसरे हर नाम के साथ तुलना करके संबंध खोजने की कोशिश कर रहा है। इसमें बहुत समय लगता है।
  • AllLinLog की ट्रिक: यह एक "स्मार्ट शॉर्टकट" का उपयोग करता है। हर शब्द की हर दूसरे शब्द से तुलना करने के बजाय, यह जानकारी को एक छोटे, प्रबंधनीय सारांश में संकुचित (compress) कर देता है, जबकि संबंधों को बनाए रखता है। यह एक ऐसे लाइब्रेरियन की तरह है जो मुख्य कथानक को खोए बिना 1,000 पन्नों की किताब को तुरंत 10 पन्नों के रूप में संक्षिप्त कर सकता है।
  • परिणाम: चाहे लॉग छोटा हो या एक विशाल उपन्यास, सिस्टम एक स्थिर और तेज़ गति से काम करता है। डेटा बड़ा होने पर यह धीमा नहीं होता।

3. संतुलन बनाना (असंतुलन को ठीक करना)

वास्तविक जीवन में, हवाई अड्डे के अधिकांश दिन उबाऊ होते हैं (सामान्य लॉग), और केवल कुछ ही मिनटों में संकट (anomalies) आता है। यदि आप एक सुरक्षा गार्ड को केवल उबाऊ दिनों पर प्रशिक्षित करते हैं, तो वे आलसी हो जाएंगे और दुर्लभ आपात स्थितियों को चूक जाएंगे।

  • समाधान: शोध पत्र में Random Oversampling नामक तकनीक का उपयोग किया गया है।
  • उदाहरण: कल्पना कीजिए कि आप एक गार्ड को एक विशिष्ट प्रकार के चोर को पहचानने के लिए प्रशिक्षित कर रहे हैं। आपके पास चोर की केवल 10 तस्वीरें हैं लेकिन निर्दोष लोगों की 1,000 तस्वीरें हैं। गार्ड को बेहतर प्रशिक्षित करने के लिए, आप एक निर्दोष व्यक्ति की 1 फोटो के लिए चोर की 4 प्रतियां बनाते हैं। अब, गार्ड "बुरे आदमी" को पर्याप्त बार देखता है ताकि वह यह सीख सके कि क्या देखना है, बिना "अच्छे लोगों" से अभिभूत हुए।

उन्होंने क्या पाया?

शोधकर्ताओं ने सुपर कंप्यूटर और क्लाउड सर्वर (BGL, HDFS और Thunderbird नामक डेटासेट) के वास्तविक दुनिया के डेटा पर AllLinLog का परीक्षण किया।

  • सटीकता (Accuracy): यह परीक्षण किया गया सबसे सटीक सिस्टम था। इसने लगभग हर एक विसंगति (anomaly) को ढूंढ लिया (कुछ परीक्षणों में 99.9% सटीकता), और उन सभी पिछले तरीकों को पीछे छोड़ दिया जो पहले लॉग को "फिर से लिखने" की कोशिश करते थे।
  • गति (Speed): क्योंकि यह "लीनियर" शॉर्टकट का उपयोग करता है, यह बहुत तेज़ है।
    • उदाहरण: यदि पुराने AI को लॉग के एक बैच की जांच करने में 10 सेकंड लगते, तो AllLinLog ने इसे 1 सेकंड से भी कम समय में कर दिया।
  • मेमोरी: यह बहुत कम कंप्यूटर मेमोरी का भी उपयोग करता है। जब लॉग का बैच बड़ा होता गया, तो पुराने AI का मेमोरी उपयोग विस्फोट की तरह बढ़ा, लेकिन AllLinLog शांत और कुशल बना रहा।

सारांश

AllLinLog कंप्यूटर की समस्याओं को पहचानने का एक नया तरीका है। बिखरे हुए कंप्यूटर लॉग को पहले साफ करने (जिससे अक्सर गलतियाँ होती हैं) के बजाय, यह सीधे कच्चे टेक्स्ट को पढ़ता है। यह एक विशेष "लीनियर" दिमाग का उपयोग करता है जो धीमा या भ्रमित हुए बिना बहुत सारे टेक्स्ट को संभाल सकता है, और यह खुद को दुर्लभ, खतरनाक घटनाओं पर विशेष ध्यान देने के लिए प्रशिक्षित करता है। परिणाम स्वरूप, यह एक ऐसा सिस्टम है जो तेज़ है, अधिक सटीक है, और काम करने के लिए कोई भी जानकारी फेंकने की आवश्यकता नहीं रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →