← नवीनतम पेपर
🤖 AI

SREGym: A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios

यह शोध पत्र SREGym को प्रस्तुत करता है, जो एक मॉड्यूलर, ओपन-सोर्स, हाई-फिडेलिटी लाइव बेंचमार्क है जिसे वास्तविक दुनिया के क्लाउड-नेटिव स्टैक्स पर बनाया गया है, जो साइट रिलायबिलिटी इंजीनियरिंग (SRE) में AI एजेंटों के प्रदर्शन का कड़ाई से मूल्यांकन करने के लिए जटिल विफलता परिदृश्यों का अनुकरण करता है।

मूल लेखक: Jackson Clark, Yiming Su, Saad Mohammad Rafid Pial, Yifang Tian, Lily Gniedziejko, Hans-Arno Jacobsen, Yinfang Chen, Tianyin Xu

प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jackson Clark, Yiming Su, Saad Mohammad Rafid Pial, Yifang Tian, Lily Gniedziejko, Hans-Arno Jacobsen, Yinfang Chen, Tianyin Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास बहुत बुद्धिमान, AI-संचालित मैकेनिकों की एक टीम है। उनका काम एक विशाल, जटिल, उड़ते हुए अंतरिक्ष यान (एक आधुनिक क्लाउड कंप्यूटिंग सिस्टम) को ठीक करना है, जबकि वह हवा में ही उड़ रहा हो। ये AI मैकेनिक जहाज बनाने के लिए कोड लिखने में बेहतर हो रहे हैं, लेकिन असली परीक्षा यह है: क्या वे वास्तव में जहाज को ठीक कर सकते हैं जब वह उड़ान के दौरान टूटने लगे?

यह शोध पत्र SREGYM को पेश करता है, जो विशेष रूप से इन AI मैकेनिकों को टेस्ट करने के लिए बनाया गया एक उच्च-दांव वाला प्रशिक्षण मैदान (training ground) है।

यहाँ इस पेपर में कही गई बातों का विवरण दिया गया, जिसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:

1. समस्या: "बहुत आसान" टेस्ट

पहले, इन AI मैकेनिकों के लिए परीक्षण एक टूटे हुए इंजन की स्थिर तस्वीर देने और पूछने जैसा था, "इसमें क्या गलत है?"

  • दोष: वास्तविक जीवन एक स्थिर तस्वीर नहीं है। वास्तविक दुनिया में, इंजन अजीब सी आवाज़ कर सकता है (एक व्याकुलता/distraction), ईंधन का गेज झपकी ले सकता है (एक झूठ), और समस्या एक टूटे हुए तार और एक बंद फिल्टर के एक साथ होने का मिश्रण हो सकती है।
  • परिणाम: पुराने टेस्ट बहुत सरल थे। वे AI को एक वास्तविक प्रोडक्शन सिस्टम की अराजकता के लिए तैयार नहीं करते थे।

2. समाधान: SREGYM (एक "लाइव फायर" सिम्युलेटर)

लेखकों ने SREGYM बनाया है, जो एक IT आपदाओं के लिए फ्लाइट सिम्युलेटर की तरह है।

  • यह लाइव है: एक स्थिर तस्वीर के बजाय, AI को एक वास्तविक, चलते हुए सिस्टम के साथ इंटरैक्ट करना होता है।
  • यह अव्यवस्थित (Messy) है: सिम्युलेटर "शोर" (noise) डालता है। कल्पना कीजिए कि AI एक पाइप में रिसाव ढूंढने की कोशिश कर रहा है, लेकिन तभी कोई पास में दीवारें पीट रहा है, औज़ार गिरा रहा है, और लाइटें चमका रहा है। AI को यह समझना होगा कि कौन सा शोर असली समस्या है और कौन सा केवल एक व्याकुलता।
  • यह गहरा (Deep) है: समस्याएँ केवल "ऐप क्रैश हो गया" तक सीमित नहीं हैं। सिम्युलेटर सिस्टम के भीतर गहराई में चीजों को तोड़ सकता है, जैसे ऑपरेटिंग सिस्टम, हार्डवेयर (डिस्क ड्राइव), या नेटवर्क, न कि केवल सॉफ्टवेयर कोड।

3. "ट्रैप्स" (Traps) के तीन प्रकार

पेपर में तीन विशिष्ट तरीकों पर प्रकाश डाला गया जिनसे वे सिम्युलेटर को कठिन बनाते हैं, जो यह दर्शाता है कि कैसे एक वास्तविक आपात स्थिति भ्रमित करने वाली हो सकती है:

  • "घोस्ट" समस्या (Metastable Failure): कल्पना कीजिए कि एक कार ठीक चलती है जब तक कि आप एक निश्चित गति तक नहीं पहुँच जाते, फिर वह हिलने लगती है, और भले ही आप अपनी गति कम कर दें, वह हिलती रहती है। AI को यह समझना होगा कि यह कंपन केवल एक रैंडम ग्लिच नहीं है; यह एक विशिष्ट सेटिंग के कारण होने वाला एक स्व-स्थायी लूप (self-sustaining loop) है।
  • "दोहरी मुसीबत" (Concurrent Failures): दो चीजें एक साथ टूट जाती हैं। एक मामूली समस्या है (एक चेतावनी लाइट), और दूसरी एक बड़ी समस्या है (जैसे टायर पंक्चर होना)। AI को चेतावनी लाइट को अनदेखा करना होगा और पहले टायर ठीक करने पर ध्यान देना होगा।
  • "चेन रिएक्शन" (Correlated Failures): एक टूटा हुआ हिस्सा पाँच अन्य हिस्सों को विफल कर देता है। AI को उस एकल टूटी हुई कड़ी तक पहुँचना होगा जिसने इस श्रृंखला को शुरू किया, न कि केवल पाँचों लक्षणों को ठीक करने की कोशिश करनी होगी।

4. टेस्ट के परिणाम: AI संघर्ष करता है

शोधकर्ताओं ने तीन अलग-अलग AI "मैकेनिकों" को इस सिम्युलेटर के माध्यम से गुजारा (90 अलग-अलग परिदृश्य)। यहाँ क्या हुआ:

  • वे सरल चीजों में अच्छे हैं: यदि समस्या एक साधारण सॉफ्टवेयर टाइपो (typo) है, तो AI ठीक-ठाक प्रदर्शन करते हैं।
  • वे शोर में खो जाते हैं: जब व्याकुलता (जैसे एक कंप्यूटर क्रैश होना जो असली कारण नहीं है) होती है, तो AI अक्सर विचलित हो जाते हैं और गलत चीज़ को ठीक करने की कोशिश करते हैं।
  • वे गहरी चीजों को मिस कर देते हैं: जब समस्या हार्डवेयर (जैसे एक खराब डिस्क ड्राइव) में गहरी होती है या परतों के बीच एक जटिल अंतःक्रिया होती है, तो AI अक्सर गलत अनुमान लगाते हैं। वे हार्डवेयर के बजाय सॉफ्टवेयर एप्लिकेशन को दोष देने लगते हैं।
  • "लालची" गलती (The "Greedy" Mistake): AI अक्सर गेंद के पीछे भागते कुत्ते की तरह व्यवहार करते हैं। वे पहली अजीब चीज़ देखते हैं (एक लक्षण), मान लेते हैं कि वही समस्या है, और बिना गहराई से देखे तुरंत उसे ठीक करने की कोशिश करते हैं कि क्या वह केवल किसी और चीज़ का साइड इफेक्ट है।

5. निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि हालांकि AI कोड लिखने में महान है, लेकिन यह अभी भी जटिल, वास्तविक दुनिया की सिस्टम विफलताओं को ठीक करने के लिए प्राथमिक मैकेनिक बनने के लिए तैयार नहीं है

  • वर्तमान AI मॉडल निदान (diagnosis) को केवल लगभग 39% से 73% बार सही करते हैं।
  • वे सुधार (fix) को लगभग 57% से 78% बार सही करते हैं।
  • जब आप दोनों चरणों को मिलाते हैं (निदान और सुधार), तो सफलता दर काफी कम हो जाती है, विशेष रूप से "अव्यवस्थित" (messy) परिदृश्यों में।

सारांश

SREGYM एक नया, यथार्थवादी जिम है जहाँ AI एजेंट टूटे हुए सिस्टम को ठीक करने का अभ्यास कर सकते हैं। पेपर दिखाता है कि हालांकि ये AI एजेंट बुद्धिमान हैं, लेकिन वे वर्तमान में शोर से आसानी से विचलित हो जाते हैं, गहरे हार्डवेयर मुद्दों के लिए संघर्ष करते हैं, और अक्सर गलत चीज़ को ठीक करते हैं। यह जिम अब अन्य शोधकर्ताओं के लिए भविष्य के बेहतर AI मैकेनिकों को प्रशिक्षित करने के लिए उपयोग करने हेतु खुला है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →