← नवीनतम पेपर
💻 computer science

Cloud-OpsBench: A Reproducible Benchmark for Agentic Root Cause Analysis in Cloud Systems

Cloud-OpsBench एक पुनरुत्पादक (reproducible), बड़े पैमाने का बेंचमार्क है जो क्लाउड सिस्टम के एक नियत डिजिटल ट्विन (deterministic digital twin) को बनाने के लिए स्टेट स्नैपशॉट पैराडाइम (State Snapshot Paradigm) का उपयोग करता है, जो एजेंटिक रूट कॉज एनालिसिस (agentic Root Cause Analysis) के मूल्यांकन को सक्षम बनाता है और अगली पीढ़ी के SRE अनुसंधान को प्रशिक्षित करने और मानकीकृत करने के लिए एक आधारभूत बुनियादी ढांचे के रूप में कार्य करता है।

मूल लेखक: Yilun Wang, Guangba Yu, Haiyu Huang, Zirui Wang, Yujie Huang, Pengfei Chen, Michael R. Lyu

प्रकाशित 2026-03-03
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yilun Wang, Guangba Yu, Haiyu Huang, Zirui Wang, Yujie Huang, Pengfei Chen, Michael R. Lyu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो "द क्लाउड" (The Cloud) नामक एक विशाल, हाई-टेक शहर में रहस्य सुलझाने की कोशिश कर रहे हैं। यह शहर हजारों छोटे, अदृश्य श्रमिकों (माइक्रोसर्विसेज) से बना है जो आपके पसंदीदा ऐप्स को चलाने के लिए काम करते हैं। कभी-कभी चीजें टूट जाती हैं: एक वेबसाइट बंद हो जाती है, वीडियो रुकने लगता है, या भुगतान विफल हो जाता है।

आपका काम है रूट कॉज एनालिसिस (RCA): यह पता लगाना कि ठीक क्या टूटा है।

लंबे समय तक, हमने कंप्यूटरों को पुराने तरीकों से जासूस बनाना सीखने की कोशिश की। लेकिन नई पीढ़ी की एआई (जिसे एजेंटिक एआई कहा जाता है) अलग है। उन्हें केवल एक रिपोर्ट पढ़ने के बजाय, सक्रिय जांचकर्ता होना चाहिए। उन्हें इंसानी इंजीनियरों की तरह इधर-उधर घूमना, सवाल पूछना, लॉग्स की जांच करना और सिद्धांतों का परीक्षण करने में सक्षम होना चाहिए।

समस्या? हमारे पास यह परीक्षण करने का कोई अच्छा तरीका नहीं था कि ये एआई जासूस वास्तव में कितना अच्छा काम कर रहे हैं।

वर्तमान परीक्षणों के साथ समस्या

पेपर तर्क देता है कि इन एआई जासूसों के लिए मौजूदा परीक्षण तीन मुख्य तरीकों से दोषपूर्ण हैं:

  1. "स्टैटिक फोटो" की समस्या: अधिकांश परीक्षण एआई को स्थिर डेटा का एक विशाल ढेर देते हैं (जैसे अपराध होने के बाद शहर का एक फोटो एल्बम)। एआई केवल फोटो पढ़ता है। उसे कुछ करने का मौका नहीं मिलता। यह एक जासूस को अपराध स्थल पर जाने या गवाहों से बात करने देने के बजाय, केवल पुलिस रिपोर्ट का ट्रांसक्रिप्ट पढ़ने के लिए कहने जैसा है।
  2. "रोलरकोस्टर" की समस्या: अन्य परीक्षण एआई को एक लाइव, वास्तविक समय के शहर में रखते हैं। लेकिन असली शहर अराजक होते हैं! कभी हवा चलती है, तो कभी बिना किसी कारण के ट्रैफिक जाम हो जाता है। यदि एआई विफल हो जाता है, तो क्या वह इसलिए हुआ क्योंकि वह मूर्ख था, या इसलिए क्योंकि टेस्ट ही शोर-शराबे वाला और अनुचित था? आप दो जासूसों की निष्पक्ष तुलना नहीं कर सकते यदि एक का परीक्षण शांत दिन पर किया गया हो और दूसरे का तूफानी दिन पर।
  3. "लकी गेस" (किस्मत से सही अनुमान) की समस्या: वर्तमान परीक्षण केवल इस बात की परवाह करते हैं कि एआई ने सही उत्तर दिया या नहीं। उन्हें इस बात से फर्क नहीं पड़ता कि वह वहां कैसे पहुँचा। एक एआई किस्मत से या भ्रम (hallucination) के आधार पर सही उत्तर तक पहुँच सकता है, और फिर भी उसे परफेक्ट स्कोर मिल सकता है। हमें यह जानने की जरूरत है कि क्या उसने एक तार्किक मार्ग का पालन किया या वह सिर्फ भाग्यशाली था।

समाधान: क्लाउड-ऑप्सबेंच (Cloud-OpsBench)

लेखक एक नया, सुपर-एडवांस्ड टेस्टिंग ग्राउंड पेश करते हैं जिसे Cloud-OpsBench कहा जाता है। यह कैसे काम करता है, इसके लिए कुछ मजेदार उपमाओं का उपयोग करते हैं:

1. "टाइम-ट्रैवलिंग क्राइम सीन" (स्टेट स्नैपशॉट पैराडाइम)

कल्पना कीजिए कि आपके पास एक जादुई कैमरा है जो अपराध होने के ठीक उसी सेकंड में शहर को समय में फ्रीज कर सकता है। आप सब कुछ का एक परफेक्ट, 3D स्नैपशॉट लेते हैं: ट्रैफिक, मौसम, लोगों की स्थिति और टूटी हुई लाइटें।

  • जादू: अब आप इस स्नैपशॉट को बार-बार चला (replay) सकते हैं। हर बार जब आप इसे चलाते हैं, तो ट्रैफिक बिल्कुल उसी जगह होता है, और टूटी हुई लाइट भी उसी स्थान पर होती है।
  • लाभ: यह एआई को एक डिटरमिनिस्टिक (निश्चित) वातावरण देता है। यह एक अराजक लाइव शहर नहीं है; यह एक परफेक्ट, फ्रीज किया हुआ "डिजिटल ट्विन" है। एआई टूल्स (जैसे kubectl, जो जासूस की टॉर्च है) चला सकता है ताकि चीजों की जांच की जा सके। यदि वह पूछता है, "तापमान क्या है?" तो उत्तर हमेशा एक ही रहेगा। यह इसे 100% पुनरुत्पादनीय (reproducible) और निष्पक्ष बनाता है।

2. "452 अलग-अलग अपराध"

शोधकर्ताओं ने 452 विशिष्ट विफलता परिदृश्यों की एक लाइब्रेरी बनाई है।

  • कुछ आसान हैं (जैसे बल्ब का जलना)।
  • कुछ कठिन हैं (जैसे एक छिपी हुई सिग्नल त्रुटि के कारण होने वाला जटिल ट्रैफिक जाम)।
  • वे "कुबरनेट्स" (Kubernetes) शहर (क्लाउड का ऑपरेटिंग सिस्टम) के हर हिस्से को कवर करते हैं।

3. "गोल्ड स्टैंडर्ड" जासूस (प्रोसेस-सेंट्रिक इवैल्यूएशन)

यह सबसे महत्वपूर्ण हिस्सा है। अतीत में, यदि कोई एआई सही उत्तर का अनुमान लगा लेता था, तो उसे गोल्ड स्टार मिलता था।
Cloud-OpsBench में, एआई को उसके गंतव्य पर नहीं, बल्कि उसकी यात्रा पर ग्रेड दिया जाता है।

  • उपमा: एक गणित के टेस्ट की कल्पना करें। यदि एक छात्र सही उत्तर देता है लेकिन अपने काम में "2 + 2 = 5" लिखता है, तो उसे शून्य अंक मिलते हैं।
  • Cloud-OpsBench एआई के चरणों की तुलना मानव विशेषज्ञों द्वारा बनाए गए "गोल्ड स्टैंडर्ड" पथ से करता है। क्या एआई ने सही लॉग्स की जांच की? क्या उसने सही सवाल पूछे? क्या उसने तथ्य बनाने (hallucinating) से परहेज किया? यदि एआई सही उत्तर प्राप्त करता है लेकिन एक अजीब, अतार्किक पथ लेता है, तो उसे कम स्कोर मिलता है।

उन्होंने क्या सीखा? (निष्कर्ष)

पेपर ने कई एआई मॉडलों (बड़े, महंगे और छोटे, सस्ते दोनों) का इस नए बेंचमार्क पर परीक्षण किया। यहाँ आश्चर्यजनक परिणाम दिए गए हैं:

  • गति ही सब कुछ नहीं है: जो एआई सबसे तेज़ समाप्त हुआ, वह अक्सर गलत उत्तर देता था। सबसे अच्छे जासूस वे थे जिन्होंने अपना समय लिया, अपने काम की दोबारा जांच की, और निष्कर्ष पर पहुँचने में जल्दबाजी नहीं की।
  • छोटे मॉडल "व्याकरणिक" रूप से कमजोर हैं: छोटे एआई मॉडल अक्सर जानते थे कि क्या करना है लेकिन वे इसमें विफल रहे कि इसे कैसे कहना है। वे एक टूल का उपयोग करने की कोशिश करेंगे लेकिन कमांड गलत टाइप करेंगे (जैसे एक जासूस टॉर्च का उपयोग करने की कोशिश करता है लेकिन उसे चालू करना भूल जाता है)।
  • दिखाना, बताना नहीं: जब उन्होंने एआई को अन्य जासूसों द्वारा समान अपराधों को सुलझाने के उदाहरण देकर (उन्हें कदम दिखाना) सिखाया, तो एआई बहुत बेहतर हो गया। केवल उन्हें एक मैनुअल पढ़ने (डिक्लेरेटिव नॉलेज) के लिए देने से उतना लाभ नहीं हुआ।
  • रेडंडेंसी (अतिरेक) अच्छी है: सबसे अच्छे एआई जासूसों ने केवल न्यूनतम काम नहीं किया। उन्होंने यह सुनिश्चित करने के लिए "अतिरिक्त" जांच की कि वे गलत न हों। थोड़ा दोहराव करना उन्हें अधिक विश्वसनीय बनाने में मदद करता है।

यह क्यों मायने रखता है?

Cloud-OpsBench एआई इंजीनियरों के लिए एक फ्लाइट सिम्युलेटर की तरह है।

  • सुरक्षा: वास्तविक क्लाउड सिस्टम खतरनाक होते हैं। यदि कोई एआई किसी समस्या को ठीक करने की कोशिश करता है और गलती करता है, तो वह लाखों लोगों के लिए इंटरनेट क्रैश कर सकता है। Cloud-OpsBench हमें एक सुरक्षित, फ्रीज किए गए सिमुलेशन में एआई को प्रशिक्षित करने की अनुमति देता जहाँ गलतियों का कोई महत्व नहीं है।
  • प्रशिक्षण: यह "अच्छे जासूसी कार्य" का एक विशाल डेटासेट प्रदान करता है जिसका उपयोग छोटे, सस्ते एआई मॉडलों को विशेषज्ञ इंजीनियर बनने के लिए सिखाने के लिए किया जा सकता है।
  • भविष्य: यह हमें ऐसी एआई बनाने में मदद करता है जो केवल अनुमान नहीं लगाती, बल्कि वास्तव में सोचती है, तर्क करती है और सत्यापित करती है, ठीक वैसे ही जैसे एक मानव विशेषज्ञ करता है।

संक्षेप में, Cloud-OpsBench एक निष्पक्ष, सुरक्षित और कठोर जिम है जहाँ हम अपने एआई जासूसों को प्रशिक्षित और परीक्षण कर सकते हैं ताकि यह सुनिश्चित हो सके कि वे हमारी डिजिटल दुनिया को बचाने के लिए तैयार हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →