← नवीनतम पेपर
🤖 machine learning

EvoCause: LLM-Guided Evolution of Causal Graphs for Root Cause Analysis

EvoCause एक नवीन ढांचा है जो जटिल प्रणालियों में मूल कारण विश्लेषण (root cause analysis) में सुधार के लिए विशेषज्ञ निदान लेबल (expert diagnosis labels) का उपयोग करके कॉज़ल ग्राफ को पुनरावृत्ति से परिष्कृत करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिसे एक नए विशेषज्ञ-एनोटेटेड बेंचमार्क (TeleRCA) द्वारा मान्य किया गया है और जो पारंपरिक कॉज़ल डिस्कवरी विधियों की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्रदर्शित करता है।

मूल लेखक: Lei Zan, Keli Zhang, Shifeng Xie, Jiale Zheng, Zehao Xiao, Zhiwei Dong, Ke Zhang, Ruichu Cai, Malik Tiomoko, Lujia Pan

प्रकाशित 2026-07-31
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lei Zan, Keli Zhang, Shifeng Xie, Jiale Zheng, Zehao Xiao, Zhiwei Dong, Ke Zhang, Ruichu Cai, Malik Tiomoko, Lujia Pan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, उच्च-तकनीकी अंतरिक्ष यान के कप्तान हैं। अचानक, जहाज का कंप्यूटर हजारों अलार्म के साथ चिल्लाने लगता है: "इंजन गर्म है!", "हल्का दबाव गिर रहा है!", "नेविगेशन में गड़बड़ी!" यह शोर का एक अराजक तूफान है। आपका काम, जिसे रूट कॉज एनालिसिस (RCA) कहा जाता है, यह पता लगाना है कि किस छोटी, विशिष्ट अलार्म ने इस पूरे मलबे को शुरू किया ताकि आप जहाज को टकराने से बचाने के लिए उसे ठीक कर सकें। वास्तविक दुनिया में, यह टेलीकम्युनिकेशन नेटवर्क और क्लाउड सिस्टम में हर दिन होता है। जब एक हिस्सा टूटता है, तो यह त्रुटियों का एक डोमिनो प्रभाव (domino effect) शुरू कर देता है।

इस समस्या को हल करने के लिए, वैज्ञानिक अक्सर यह समझने के लिए एक "मानचित्र" बनाने की कोशिश करते हैं कि अलार्म एक-दूसरे को कैसे ट्रिगर करते हैं, जैसे कि गलतियों का एक वंशावली वृक्ष (family tree)। वे अतीत के डेटा से इस मानचित्र को सीखने के लिए गणित का उपयोग करते हैं। लेकिन समस्या यह है कि गणित पूर्ण नहीं है। कभी-कभी, मानचित्र में गलत रेखाएं होती हैं या कनेक्शन गायब होते हैं। आमतौर पर, यदि मानचित्र गलत है, तो कंप्यूटर भटक जाता है। लेकिन क्या होगा यदि आप एक मानव विशेषज्ञ से पूछ सकें, "हे, आपने पिछली बार इसे मूल कारण बताया था, लेकिन आपका मानचित्र कहता है कि यह नहीं था," और फिर उस फीडबैक के आधार पर मानचित्र को ठीक करने के लिए एक सुपर-स्मार्ट AI का उपयोग करें? यह बिल्कुल वही प्रश्न है जिसे यह शोध पत्र संबोधित करता है: कैसे एक रफ, गणित द्वारा बनाए गए त्रुटि मानचित्र को मानव बुद्धिमत्ता और एक शक्तिशाली लैंग्वेज AI का उपयोग करके पॉलिश किया जाए, ताकि यह भविष्य की आपदाओं को ठीक करने के लिए एक अत्यधिक प्रभावी मार्गदर्शक बन सके।


समस्या: अराजकता का "टूटा हुआ मानचित्र"

धागे की एक विशाल, उलझी हुई गेंद की कल्पना करें जहाँ हर गांठ एक अलार्म है। जब एक गांठ खिंचती है, तो वह दूसरों को भी खींच लेती है। सिस्टम को ठीक करने के लिए, आपको उस सबसे पहली गांठ को ढूंढना होगा जो खींची गई थी। वैज्ञानिकों ने इतिहास से धागे के पैटर्न को सीखने के लिए एल्गोरिदम का उपयोग करके इसे सुलझाने की कोशिश की है। वे इसे "कॉज़ल ग्राफ" (causal graph) कहते हैं—एक फैंसी तरीका यह बताने का कि कौन सा अलार्म किसे कारण बनता है।

हालाँकि, ये केवल गणित पर आधारित मानचित्र अक्सर अस्त-व्यस्त होते हैं। वे दो अलार्मों के बीच एक रेखा खींच सकते हैं जो वास्तव में एक-दूसरे से कभी बात ही नहीं करते, या वे एक गुप्त शॉर्टकट को मिस कर सकते हैं। इससे भी बदतर यह है कि ये मानचित्र आमतौर पर "फिक्स्ड" होते हैं। एक बार जब कंप्यूटर मानचित्र बना लेता है, तो वह उसी पर टिका रहता है, भले ही कोई मानव विशेषज्ञ पिछले किसी संकट को देखकर कहे, "नहीं, वह कारण नहीं था; यह था!" पुराने तरीके विशेषज्ञ की आवाज़ को अनदेखा कर देते हैं।

समाधान: EvoCause, "मानचित्र सुधारक"

इस शोध पत्र के लेखक EvoCause (इवोकॉज - इवॉल्व कॉज़ल ग्राफ) नामक एक नया सिस्टम पेश करते हैं। EvoCause को एक शानदार संपादक के रूप में सोचें जो एक मानचित्र के रफ ड्राफ्ट को लेता है और उसे तब तक फिर से लिखता है जब है जब तक कि वह कार्य के लिए यथासंधिक सटीक न हो जाए, और इसके लिए एक विशेष उपकरण का उपयोग करता है: एक लार्ज लैंग्वेज मॉडल (LLM)।

यहाँ उनके तरीके में कहानी कैसे आगे बढ़ती है:

  1. रफ ड्राफ्ट (चरण I): सबसे पहले, सिस्टम मानक गणितीय उपकरणों का उपयोग करके एक बुनियादी मानचित्र बनाता है कि अलार्म एक-दूसरे को कैसे ट्रिगर करते हैं। यह मानचित्र एक अच्छी शुरुआत है, लेकिन यह पूर्ण नहीं है।
  2. विशेषज्ञ समीक्षा (चरण II): अब जादू आता है। सिस्टम पिछले आपदाओं के ढेर को देखता है जहाँ मानव विशेषज्ञों ने पहले ही कहा था, "यही वास्तविक मूल कारण है।" यह विशेषज्ञों के उत्तरों की तुलना अपने रफ मैप के अनुमानों से करता है।
    • मेल न खाना (The Mismatch): यदि मानचित्र कहता है "अलार्म A ने क्रैश का कारण बनाया," लेकिन विशेषज्ञ कहता है "नहीं, अलार्म B अपराधी था," तो सिस्टम जान जाता है कि मानचित्र गलत है।
    • LLM का काम: मानचित्र को बस डिलीट करने के बजाय, सिस्टम एक सुपर-स्मार्ट AI (LLM) से सुधार के सुझाव मांगता है। AI उस विसंगति और अलार्म के नामों (जैसे "सर्वर ओवरलोड" या "नेटवर्क लैग") को देखता है और कहता है, "आह! शायद हमें B से A तक एक रेखा खींचने की आवश्यकता है, या A से C तक की रेखा को हटाने की आवश्यकता है।"
    • सुरक्षा जांच: AI के सुझाव अनुमान मात्र होते हैं, इसलिए एक सख्त, नियम का पालन करने वाला कंप्यूटर प्रोग्राम उनकी जांच करता है। यह सुनिश्चित करता है कि नया मानचित्र असंभव लूप (जैसे A कारण है B का, B कारण है C का, और C कारण है A का) न बनाए और नाम भी मेल खाएं। यदि सुझाव सुरक्षित है, तो मानचित्र को अपडेट कर दिया जाता है।
  3. अंतिम मानचित्र: सिस्टम इस प्रक्रिया को दोहराता है, विभिन्न संपादन आज़माता है, जब तक कि उसे वह मानचित्र न मिल जाए जो विशेषज्ञों के पिछले निदानों से सबसे बेहतर मेल खाता हो। यह ध्यान देना महत्वपूर्ण है कि विशेषज्ञों का फीडबैक अक्सर संभावनाओं को केवल कुछ अच्छे मानचित्रों तक सीमित कर देता है, न कि किसी एक एकल "परफेक्ट" मानचित्र की ओर इशारा करता है। EvoClause उस मानचित्र को खोजता है जो काम के लिए सबसे अच्छा है।

परिणाम: एक स्मार्ट मानचित्र

लेखकों ने इस विचार का परीक्षण दो तरह से किया: नकली डेटा के साथ जहाँ उन्हें "सच्चा" उत्तर पता था, और इंडोनेशिया में एक विशाल दूरसंचार नेटवर्क के वास्तविक डेटा के साथ।

नकली डेटा पर:
उन्होंने ज्ञात नियमों वाले 10 अलग-अलग नकली संसार बनाए। जब उन्होंने एक बुनियादी गणितीय मानचित्र से शुरुआत की और EvoCause को उसे परिष्कृत करने दिया, तो परिणाम प्रभावशाली थे। सिस्टम वास्तविक मूल कारण खोजने में बहुत बेहतर हो गया।

  • इसने सही मूल अलार्म खोजने की सटीकता में 11.59 प्रतिशत अंक का सुधार किया।
  • इसने किसी विशिष्ट घटना के लिए पूरे सही मूल कारणों के सेट को प्राप्त करने की सटीकता में 9.40 प्रतिशत अंक का सुधार किया।
  • इसने मानचित्र को भी अधिक सटीक बनाया, गलत रेखाओं की संख्या को मापने योग्य मात्रा में कम किया।

वास्तविक डेटा पर (TeleRCA):
लेखकों ने TeleRCA नामक एक नया, विशाल डेटासेट भी जारी किया है, जिसमें 194 अलग-अलग अलार्म प्रकारों और 5,621 संसाधनों से 485,681 अलार्म इवेंट्स शामिल हैं। यह वास्तविक दुनिया के नेटवर्क अराजकता का एक खजाना है।

  • जब उन्होंने इस वास्तविक डेटा पर EvoCause को लागू किया, तो सुधार और भी बड़ा था। एक बुनियादी मानचित्र से शुरू होकर, उन्होंने सही मूल अलार्म खोजने की सटीकता को 65.18% से बढ़ाकर 92.58% कर दिया।
  • उन्होंने यह भी परीक्षण किया कि क्या AI को अलार्म के नामों (जैसे "CPU ओवरहीट") को जानने की आवश्यकता है या केवल नंबरों से काम चल जाएगा। उन्होंने पाया कि नामों को जानने से मदद मिली! जब उन्होंने नामों को छिपा दिया और गुमनाम आईडी का उपयोग किया, तो सटीकता 6.12 प्रतिशत अंक गिर गई। यह बताता है कि AI मानचित्र को ठीक करने के बारे में स्मार्ट अनुमान लगाने के लिए अलार्म नामों के अर्थ का उपयोग करता है।

इसका क्या अर्थ है

यह शोध पत्र दिखाता है कि हमें "केवल गणित" वाले मानचित्रों और "केवल मानव" अनुमानों के बीच चुनाव करने की आवश्यकता नहीं है। उन्हें मिलाकर, हमें कुछ बेहतर मिलता है। LLM एक रचनात्मक संपादक के रूप में कार्य करता है जो मानव फीडबैक के आधार पर मानचित्र को ठीक करने का सुझाव देता है, जबकि एक सख्त कंप्यूटर यह सुनिश्चित करता है कि मानचित्र तार्किक बना रहे।

महत्वपूर्ण बात यह है कि एक बार मानचित्र परिष्कृत हो जाने के बाद, सिस्टम को अब AI या मानव विशेषज्ञों की आवश्यकता नहीं होती है। यह बस भविष्य की आपदाओं की भविष्यवाणी करने के लिए अंतिम, पॉलिश किए गए मानचित्र का उपयोग करता है। यह एक छात्र को सड़क के नियम सिखाने जैसा है; एक बार जब वे सीख जाते हैं, तो वे बिना किसी शिक्षक के बगल में बैठे, खुद सुरक्षित रूप से गाड़ी चला सकते हैं।

लेखक सावधानी बरतते हुए कहते हैं कि उन्होंने सब कुछ "हल" नहीं किया है। उन्होंने पाया कि विशेषज्ञों का फीडबैक आमतौर पर संभावनाओं को अच्छे मानचित्रों के एक सेट तक सीमित कर देता है, लेकिन यह हमेशा एक एकल "परफेक्ट" मानचित्र की ओर इशारा नहीं करता है। हालांकि, उनका तरीका एक ऐसा मानचित्र खोजता है जो नेटवर्क को ठीक करने के काम के लिए अविश्वसनीय रूप से अच्छा काम करता है, जिससे यह हमारी जुड़ी हुई दुनिया को सुचारू रूप से चलाने के लिए एक शक्तिशाली नया उपकरण बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →