← नवीनतम पेपर
🤖 machine learning

Graph-Free Root Cause Analysis

यह शोध पत्र PRISM को प्रस्तुत करता है, जो एक ग्राफ-मुक्त ढांचा (graph-free framework) है जो सैद्धांतिक गारंटी प्रदान करके और वास्तविक दुनिया के डेटासेट में काफी अधिक सटीकता और गति प्राप्त करके मौजूदा विसंगति-स्कोर-आधारित (anomaly-score-based) मूल कारण विश्लेषण विधियों की सीमाओं को दूर करता है।

मूल लेखक: Luan Pham

प्रकाशित 2026-01-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Luan Pham

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हलचल भरे अस्पताल के मैनेजर हैं। अचानक, इमरजेंसी रूम ओवरफ्लो होने लगता है, सर्जरी की लाइटें टिमटिमाती हैं, और फार्मेसी के कंप्यूटर फ्रीज हो जाते हैं। आपको तुरंत यह पता लगाने की जरूरत है कि ऐसा क्यों हो रहा है, अन्यथा पूरा अस्पताल ढह सकता है।

यह रूट कॉज एनालिसिस (RCA) की समस्या है। डिजिटल दुनिया में, "अस्पताल" जटिल कंप्यूटर सिस्टम (जैसे ऑनलाइन शॉपिंग साइट या बैंकिंग ऐप्स) होते हैं जो सैकड़ों छोटे, जुड़े हुए प्रोग्रामों से बने होते हैं जिन्हें "माइक्रोसर्विसेज" कहा जाता है। जब एक टूटता है, तो वह अक्सर दूसरों को भी तोड़ देता है।

पुराना तरीका: सबसे तेज़ चीख के आधार पर अनुमान लगाना

परंपरागत रूप से, जब चीजें गलत होती हैं, तो इंजीनियर "एनोमली स्कोर" (विसंगति स्कोर) की एक सूची देखते हैं। इसे ऐसे समझें जैसे लोगों से भरा एक कमरा चिल्ला रहा हो। पुराना तरीका यह मानता है कि जो व्यक्ति सबसे ज़ोर से चिल्ला रहा है, वही मुसीबत शुरू करने वाला है।

पेपर की समस्या: यह धारणा अक्सर गलत होती है।
कल्पना कीजिए कि बेसमेंट में एक पाइप में छोटा सा रिसाव (रूट कॉज) है। यह धीरे-धीरे टपकता है। लेकिन क्योंकि पानी एक लंबे, संकरे पाइप से बहता है, इसलिए यह दबाव बनाता है और लॉबी में एक विशाल बाढ़ का द्वार तोड़ देता है।

  • बेसमेंट का रिसाव (रूट कॉज): चुपचाप टपकता है। कम "चीख" (कम एनोमली स्कोर)।
  • लॉबी की बाढ़ (डाउनस्ट्रीम प्रभाव): एक विशाल जलप्रपात। तेज़ "चीख" (बड़ा एनोमली स्कोर)।

यदि आप केवल सबसे तेज़ चीख सुनने के लिए दौड़ते हैं, तो आप लॉबी में बाढ़ को ठीक करने के लिए भाग जाएंगे, और उस छोटे से रिसाव को मिस कर देंगे जिसने यह सब शुरू किया था जो बेसमेंट में है। पेपर इसे "फैन-इन" (fan-in) समस्या कहता है: छोटी देरी या त्रुटियां जमा होकर बड़ी दिख सकती हैं और आगे की ओर (downstream) बहुत बड़ी लग सकती हैं, जिससे सिस्टम भ्रमित हो जाता है।

नया समाधान: PRISM (दो आँखों वाला जासूस)

लेखक एक नया फ्रेमवर्क प्रस्तावित करते हैं जिसे PRISM कहा जाता है। केवल सबसे तेज़ चीख सुनने के बजाय, PRISM सिस्टम के हर हिस्से के लिए दो अलग-अलग प्रकार के "सबूतों" को देखता है:

  1. आंतरिक गुण (Internal Properties - "अंतर्मन की भावना"): ये वे चीजें हैं जो एक घटक (component) के अंदर हो रही हैं जिन्हें अन्य घटक नहीं देख सकते। उदाहरण के लिए: CPU उपयोग, मेमोरी स्तर, या आंतरिक कोड अवस्थाएं।
  2. बाहरी गुण (External Properties - "सार्वजनिक चेहरा"): ये वे चीजें हैं जिन्हें अन्य घटक देख सकते हैं। उदाहरण के लिए: जवाब देने में लगने वाला समय (लेटेंसी) या क्रैश होने की दर (एरर रेट)।

जादुई अंतर्दृष्टि:

  • असली अपराधी (रूट कॉज): इसके दोनों—अपने अंतर्मन (आंतरिक) और अपने सार्वजनिक चेहरे (बाहरी) में—समस्या होती है। यह अंदर से बीमार है, और बाहर से भी अजीब व्यवहार कर रहा है।
  • मासूम राहगीर (प्रभावित घटक): वे अंदर से ठीक दिखते हैं (उनका अंतर्मन स्वस्थ है), लेकिन वे बाहर अजीब व्यवहार करते हैं क्योंकि वे बीमार घटक की प्रतिक्रिया दे रहे होते हैं।

उपमा:
बुखार से पीड़ित एक व्यक्ति के बारे में सोचें।

  • बीमार व्यक्ति (रूट कॉज़): उन्हें अंदर से गर्मी महसूस होती है (आंतरिक) और उनकी त्वचा लाल और जलती हुई दिखती है (बाहरी)।
  • उनके बगल वाला व्यक्ति (प्रभावित): वे अंदर से ठीक महसूस करते हैं (आंतरिक), लेकिन वे घबरा रहे हैं और पसीना बहा रहे क्योंकि वे आग के पास खड़े हैं (बाहरी)।

PRISM उस घटक को खोजता है जो अंदर और बाहर दोनों तरफ से "बीमार" है। यह उन घटकों को अनदेखा कर देता है जो केवल बाहर "घबराए" हुए हैं।

यह कैसे काम करता है (बिना किसी मानचित्र के)

आमतौर पर, इन पहेलियों को सुलझाने के लिए, आपको एक सटीक मानचित्र (डिपेंडेंसी ग्राफ) की आवश्यकता होती है जो दिखाता है कि प्रत्येक हिस्सा दूसरे से कैसे जुड़ा है। लेकिन विशाल, बदलते हुए सिस्टम में, किसी के पास भी सटीक मानचित्र नहीं होता है।

PRISM विशेष है क्योंकि इसे मानचित्र की आवश्यकता नहीं है। यह केवल डेटा को देखता है: "कौन आंतरिक रूप से अजीब व्यवहार कर रहा है? कौन बाहरी रूप से अजीब व्यवहार कर रहा है?" इन दो संकेतों को जोड़कर, यह बिना मानचित्र के भी अपराधी का पता लगा सकता है।

परिणाम: तेज़ और सटीक

लेखकों ने नौ अलग-अलग सिस्टम (जैसे ऑनलाइन बुटीक और टिकट बुकिंग ऐप) से 735 वास्तविक दुनिया के विफलता मामलों पर PRISM का परीक्षण किया।

  • सटीकता: PRISM ने 68% बार सटीक रूट कॉज को पहली पसंद (नंबर 1 गेस) के रूप में पाया। सबसे अच्छा पिछला तरीका केवल 19% बार ही सही था। यह एक बहुत बड़ी छलांग है (258% सुधार)।
  • गति: यह अविश्वसनीय रूप से तेज़ है। समस्या का निदान करने में इसे लगभग 8 मिलीसेकंड (पलक झपकने से भी कम समय) लगता है। कुछ अन्य तरीकों में सेकंड या मिनट लग सकते हैं।

यह क्यों महत्वपूर्ण है

वास्तविक दुनिया में, जब कोई सिस्टम विफल होता है, तो हर सेकंड मायने रखता है। यदि आप यह पता लगाने में 30 सेकंड बिताते हैं कि कौन सा कंप्यूटर खराब है, तो आप हजारों डॉलर खो सकते हैं या, जैसा कि पेपर में उल्लेख किया गया है, यहाँ तक कि जीवन को भी खतरे में डाल सकते हैं (जैसे अस्पताल के सिस्टम में)।

PRISM "बेसमेंट में लीक होने वाले पाइप" को खोजने का एक सरल, तेज़ और अत्यधिक सटीक तरीका प्रदान करता है, भले ही लॉबी में मौजूद "बाढ़" सबसे ज़ोर से चिल्ला रही हो, और भले ही आपके पास इमारत का कोई ब्लूप्रिंट न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →