← नवीनतम पेपर
🤖 AI

Anomaly Detection and Root Cause Analysis for Microservice Systems

यह थीसिस नवीन एंड-टू-एंड फ्रेमवर्क (BARO, EventADL, और TORAI) के माध्यम से पांच प्रमुख सीमाओं को संबोधित करते हुए, सर्विस कॉल ग्राफ की आवश्यकता के बिना विविध ऑब्जर्वेबिलिटी डेटा का लाभ उठाकर, माइक्रोसर्विस सिस्टम के लिए स्वचालित विसंगति पहचान (anomaly detection) और मूल कारण विश्लेषण (root cause analysis) को आगे बढ़ाती है, साथ ही भविष्य के अनुसंधान को मानकीकृत करने के लिए RCAEval बेंचमार्क और व्यवस्थित मूल्यांकन का परिचय देती है।

मूल लेखक: Luan Pham

प्रकाशित 2026-08-11
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Luan Pham

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

इंटरनेट की कल्पना एक विशाल, हलचल भरे शहर के रूप में करें जहाँ आपके द्वारा उपयोग किया जाने वाला प्रत्येक ऐप एक अलग मोहल्ला है। पुराने दिनों में, ये मोहल्ले एक ही विशाल, दीवार वाले शहर (एक "मोनोलिथ") का हिस्सा थे। यदि बेकरी में आग लग जाती, तो पूरा शहर अंधेरे में डूब सकता था, लेकिन कम से कम आप जानते थे कि कहाँ देखना है। हालाँकि, आज हमने उस शहर को हजारों छोटे, स्वतंत्र गाँवों से बदल दिया है जिन्हें "माइक्रोसर्विसेज" कहा जाता है। वे आपकी ऑनलाइन शॉपिंग या वीडियो स्ट्रीमिंग को काम करने में मदद करने के लिए एक-दूसरे से लगातार बात करते हैं। समस्या क्या है? यदि एक छोटा सा गाँव गड़बब कर देता है, तो यह एक ऐसी लहर पैदा कर सकता है जिससे पूरा शहर क्रैश हो सकता है, जिससे लोडिंग का समय बढ़ जाता है या पूरी तरह से ब्लैकआउट हो जाता है। इस डिजिटल शहर को चलाने के लिए, इंजीनियरों को सुपर-स्मार्ट जासूसों की तरह काम करने की आवश्यकता होती है। उन्हें यह पहचानना होता है कि समस्या कब शुरू हुई (जिसे "एनोमली डिटेक्शन" या विसंगति का पता लगाना कहा जाता है) और फिर यह पता लगाना होता है कि किस गाँव ने मुसीबत शुरू की (जिसे "रूट कॉज एनालिसिस" या मूल कारण विश्लेषण कहा जाता है)। लेकिन हर सेकंड उड़ते हुए लाखों डेटा पॉइंट्स के साथ—जैसे ट्रैफिक की गिनती, बिजली का उपयोग और त्रुटि संदेश—इंसानों के लिए मैन्युअल रूप से घास के ढेर में सुई ढूँढना असंभव है।

यह थीसिस, जिसे क्वी लुआन फाम (Qui Luan Pham) द्वारा लिखा गया है, इन डिजिटल शहरों के लिए एक स्वचालित जासूसी प्रणाली बनाने की चुनौती से निपटती है। लेखक का तर्क है कि अधिकांश वर्तमान जासूसी उपकरण दोषपूर्ण हैं क्योंकि वे "समस्या को पहचानने" और "दोषी को खोजने" को दो अलग-अलग कार्यों के रूप में देखते हैं, और अक्सर यह मान लेते हैं कि पहला काम पूरी तरह से किया गया था। वास्तव में, स्वचालित डिटेक्टर शोर (noise) से भ्रमित हो जाते हैं या समय का थोड़ा गलत अनुमान लगा लेते हैं, जो पूरी जांच को बिगाड़ देता है। पेपर यह भी बताता है कि कई मौजूदा उपकरण इस बात पर निर्भर करते हैं कि गाँवों के बीच कैसे संबंध हैं, जिसका एक सटीक नक्शा होना अक्सर वास्तविक दुनिया में असंभव होता है। इसे हल करने के लिए, लेखक ने तीन नए, स्मार्ट जासूसी उपकरण और उन्हें टेस्ट करने के लिए एक विशाल, मानकीकृत "प्रशिक्षण मैदान" विकसित किया है।

तीन नए जासूसी उपकरण

यह थीसिस तीन अलग-अलग तरीकों का परिचय देती है, जिनमें से प्रत्येक को विभिन्न प्रकार के सुरागों और डेटा के विभिन्न स्तरों के उतार-चढ़ाव को संभालने के लिए डिज़ाइन किया गया है।

1. BARO: द मेट्रिक डिटेक्टिव (मापन संबंधी जासूस)
"मेट्रिक्स" को सिस्टम के महत्वपूर्ण संकेतों के रूप में सोचें: हृदय गति (CPU उपयोग), सांस लेने की गति (लेटेंसी), और शरीर का तापमान (त्रुटि दर)। पहला उपकरण, BARO, इन महत्वपूर्ण संकेतों को पढ़ने के लिए डिज़ाइन किया गया है। पिछले जासूस हृदय गति को देखते थे, चिल्लाते थे "हार्ट अटैक!", और तुरंत कारण खोजने की कोशिश करते थे, यह मानते हुए कि अलार्म 100% सटीक था। BARO अलग है। यह जानता है कि अलार्म अस्थिर हो सकते हैं। यह "मल्टीवेरिएट बायेसियन ऑनलाइन चेंज पॉइंट डिटेक्शन" नामक एक विशेष सांख्यिकीय तकनीक का उपयोग करता है ताकि यह देख सके कि सभी महत्वपूर्ण संकेत एक साथ कैसे चलते हैं। यदि हृदय गति बढ़ती है लेकिन सांस लेना शांत रहता है, तो यह केवल एक गलत अलार्म हो सकता है। लेकिन यदि सब कुछ एक साथ बदलता है, तो यह जानता है कि वास्तव में कोई समस्या हो रही है। भले ही अलार्म कुछ सेकंड पहले या बाद में बज जाए, BARO के पास एक "रोबस्ट स्कोरर" है जो अभी भी यह पता लगा सकता है कि कौन सा गाँव दोषी है। यह एक ऐसे जासूस की तरह है जो घबराता नहीं है यदि गवाह समय के बारे में थोड़ा अनिश्चित हो; वे फिर भी मामला सुलझा सकते हैं।

2. EventADL: द इवेंट डिटेक्टिव (घटना संबंधी जासूस)
जबकि महत्वपूर्ण संकेत (vital signs) बेहतरीन हैं, कभी-कभी असली सुराग "इवेंट्स" में होते हैं—जैसे कि लोग क्या विशिष्ट कार्य करते हैं, जैसे "यूजर X ने एक फ़ाइल डिलीट की" या "सर्वर Y को रीस्टार्ट किया गया।" अधिकांश पिछले उपकरणों ने इन इवेंट लॉग्स को अनदेखा किया या उन्हें अव्यवस्थित टेक्स्ट की तरह माना। EventADL पहला उपकरण है जो इवेंट्स को एक संरचित कहानी की तरह मानता है। इसने एक प्रमुख क्लाउड कंपनी में 522 वास्तविक घटनाओं का विश्लेषण करके सीखा है। यह पैटर्न देखता है कि किसने, किस संसाधन के साथ क्या किया। उदाहरण के लिए, यह एक ऐसा पैटर्न देख सकता है जहाँ एक विशिष्ट सुरक्षा समूह (security group) को हटाया जाता है, जिसके तुरंत बाद एक सर्वर शुरू होने में विफल हो जाता है। यह एक "स्टोरी मैप" (इंटरवेंशन ग्राफ) बनाता है ताकि यह दिखाया जा सके कि कैसे एक क्रिया आपदा का कारण बनी। यह उपकरण "ओपन-बॉक्स" है, जिसका अर्थ है कि यह केवल यह नहीं कहता कि "कुछ गलत है"; बल्कि यह बताता है कि "क्यों" हुआ, जिससे इंजीनियरों के लिए इस पर भरोसा करना और इसे ठीक करना बहुत आसान हो जाता है।

3. TORAI: द मल्टीमॉडल डिटेक्टिव (बहुविध जासूस)
वास्तविक दुनिया में, कभी-कभी नक्शा अधूरा होता है। कुछ गाँव "ब्लाइंड स्पॉट" होते हैं—शायद वे पुराने हैं, या उन्हें किसी तीसरे पक्ष द्वारा चलाया जा रहा है, और हम उनके आंतरिक लॉग या ट्रेस नहीं देख सकते। अधिकांश उपकरण विफल हो जाते हैं यदि वे पूरे नक्शे को नहीं देख पाते। TORAI वह अंतिम जासूस है जो टूटे हुए नक्शे के साथ भी काम करता है। यह सभी उपलब्ध सुरागों को जोड़ता है: महत्वपूर्ण संकेत (मेट्रिक्स), एक्शन लॉग्स (इवेंट्स), और वे कुछ ट्रेस जो उसके पास उपलब्ध हैं। यह सेवाओं को उनके लक्षणों की "गंभीरता" के आधार पर समूहित करता है और "कॉज़ल रैंकिंग" नामक विधि का उपयोग करता है ताकि मूल कारण का पता लगाया जा सके, भले ही वह हर कनेक्शन को न देख पा रहा हो। यह एक ऐसे जासूस की तरह है जो रहस्य सुलझा सकता है भले ही आधे गवाह गायब हों, केवल बचे हुए कुछ सुरागों को जोड़कर।

प्रशिक्षण मैदान: RCAEval

इन नए जासूसों को बेहतर साबित करने के लिए, लेखक ने केवल कुछ परीक्षण नहीं किए। उन्होंने RCAEval बनाया, जो इस क्षेत्र के लिए पहला मानकीकृत "प्रशिक्षण मैदान" है। इससे पहले, प्रत्येक शोधकर्ता अपने स्वयं के अलग-अलग डेटासेट और नियमों का उपयोग करता था, जिससे यह तुलना करना असंभव था कि वास्तव में कौन सबसे अच्छा है। RCAEval तीन अलग-अलग डिजिटल शहरों में 735 विभिन्न विफलता परिदृश्यों की एक विशाल लाइब्रेरी प्रदान करता है, साथ ही मुकाबला करने के लिए 15 अलग-अलग "बेसलाइन" जासूसी विधियाँ भी देता है। यह एक मानकीकृत ओलंपिक ट्रैक बनाने जैसा है ताकि हर धावक का निष्पक्ष रूप से मूल्यांकन किया जा सके।

परीक्षणों ने क्या दिखाया

लेखक ने इन बेंचमार्क सिस्टम पर BARO, EventADL और TORAI को कड़े परीक्षणों से गुजारा।

  • BARO ने मूल कारण खोजने में मौजूदा तरीकों से लगातार बेहतर प्रदर्शन किया, भले ही प्रारंभिक अलार्म थोड़ा गलत हो। इसने साबित किया कि समय की त्रुटियों के प्रति मजबूत होना महत्वपूर्ण है।
  • EventADL ने दिखाया कि संरचित इवेंट्स को देखना एक गेम-चेंजर है, जिससे विसंगतियों को पहचानने और उन्हें समझाने में बहुत उच्च सटीकता प्राप्त हुई।
  • TORAI ने प्रदर्शित किया कि रहस्य सुलझाने के लिए आपको एक पूर्ण नक्शे की आवश्यकता नहीं है; यह मूल कारण का पता लगा सका भले ही सिस्टम के कुछ हिस्से अदृश्य थे।

हालाँकि, पेपर में यह भी पाया गया कि सभी मौजूदा तरीके एक समान नहीं हैं। लेखक ने 21 अलग-अलग "कॉज़ल इन्फरेंस" (कारण-प्रभाव निकालने वाले) विधियों पर एक बड़ा अध्ययन किया। उन्होंने पाया कि कई लोकप्रिय उपकरण संघर्ष करते हैं जब सिस्टम बहुत बड़ा हो जाता है (200 से अधिक सेवाएँ) या जब डेटा अव्यवस्थित होता है। कुछ विधियाँ अविश्वसनीय रूप से धीमी थीं, जो एक ऐसी समस्या को हल करने में घंटों लगा देती थीं जिसे सेकंडों में हल होना चाहिए था, जबकि अन्य पूरी तरह से विफल हो गईं यदि डेटा सटीक नहीं था।

निष्कर्ष

यह थीसिस बताती है कि डिजिटल शहरों को ठीक करने का भविष्य विभिन्न प्रकार के सुरागों (मेट्रिक्स, इवेंट्स और ट्रेस) को मिलाने और ऐसे उपकरण बनाने में है जो अपूर्ण डेटा को संभालने के लिए पर्याप्त मजबूत हों। लेखक ने केवल नए उपकरण ही नहीं बनाए; उन्होंने उन्हें निष्पक्ष रूप से टेस्ट करने के लिए बुनियादी ढांचा भी तैयार किया। हालांकि यह पेपर यह दावा नहीं करता है कि इसने दुनिया की हर समस्या को हल कर दिया है, लेकिन यह एक ठोस, पुनरुत्पादित (reproducible) आधार प्रदान करता है जो इस क्षेत्र को "अनुमान लगाने" से "जानने" की ओर ले जाता है। यह दिखाता है कि सही सांख्यिकीय युक्तियों और सभी प्रकार के डेटा को देखने की इच्छा के साथ, हम ऐसे सिस्टम बना सकते हैं जो पहले की तुलना में बहुत तेज़ी से खुद को पहचान और ठीक कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →