Agent-MIRUPD: Operationalizing LLM Agents for Microservices Incident Response Under Performance Degradation
यह शोध पत्र Agent-MIRUPD का प्रस्ताव करता है, जो एक LLM-आधारित एजेंट फ्रेमवर्क है जो ऑब्जर्वेबिलिटी डेटा को संरचित बहु-चरणीय तर्क (multi-step reasoning) के साथ एकीकृत करता है ताकि पूर्ण माइक्रोसर्विसेज इंसिडेंट-रिस्पॉन्स लाइफसाइकिल को स्वचालित किया जा सके, जिससे मौजूदा बेसलाइन्स की तुलना में डायग्नोसिस गति, मिटिगेशन सटीकता और टोकन दक्षता में महत्वपूर्ण सुधार प्राप्त होता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक डिजिटल सेवाएँ, बैंकिंग ऐप्स से लेकर स्वास्थ्य देखभाल प्लेटफार्मों तक, तेजी से एक जटिल वास्तुकला पर निर्भर हो रही हैं जहाँ एक एकल एप्लिकेशन को दर्जनों छोटे, स्वतंत्र प्रोग्रामों में विभाजित किया जाता है जिन्हें माइक्रोसर्विसेज कहा जाता है। ये हिस्से कंटेनरों में चलते हैं, जिन्हें कुबेरनेट्स (Kubernetes) नामक एक स्वचालित प्रणाली द्वारा प्रबंधित किया जाता है, जो एक ट्रैफिक कंट्रोलर की तरह कार्य करता है, यह सुनिश्चित करता है कि यदि कोई एक हिस्सा क्रैश हो जाता है, तो उसे पुनरारंभ किया जाए और सेवा जारी रहे। हालाँकि यह सेटअप अविश्वसनीय लचीलापन प्रदान करता है, लेकिन यह एक नई प्रकार की समस्या भी पैदा करता है: कभी-कभी, एक सेवा पूरी तरह से क्रैश नहीं होती है बल्कि केवल धीमी हो जाती है या असामान्य व्यवहार करने लगती है। ये सूक्ष्म समस्याएँ, जिन्हें अक्सर 'ग्रे फेल्योर' (gray failures) या प्रदर्शन ह्रास (performance degradation) कहा जाता है, पहचानना कठिन होता है क्योंकि सिस्टम तकनीकी रूप से अभी भी "जीवित" है, फिर भी वह अपना काम ठीक से करने में विफल हो रहा है। मानव इंजीनियरों के लिए, यह निदान करना कि कोई विशिष्ट सेवा क्यों धीमी हो रही है, डेटा लॉग्स, प्रदर्शन मेट्रिक्स और नेटवर्क ट्रेसेस के पहाड़ों को छानने जैसा है, जो एक धीमा, त्रुटिपूर्ण और थका देने वाला कार्य है।
उमेआ यूनिवर्सिटी (Umeå University) और व्रीजे यूनिवर्सिटी एमस्टर्डम (Vrije Universiteit Amsterdam) के शोधकर्ताओं ने इस समस्या को हल करने में मदद करने के लिए एक नया दृष्टिकोण विकसित किया है, जिसमें एक ऐसी प्रणाली बनाई गई है जो इन समस्याओं को खोजने और ठीक करने की पूरी प्रक्रिया को प्रबंधित करने के लिए एक आर्टिफिशियल इंटेलिजेंस एजेंट का उपयोग करती है। केवल स्पष्ट क्रैश को खोजने के बजाय, यह प्रणाली यह पता लगाने के लिए डिज़ाइन की गई है कि कोई सेवा कब खराब हो रही है, वास्तव में ऐसा क्यों हो रहा है, और फिर एक समाधान प्रस्तावित करती है। उनके कार्य का मूल एक ढांचा है जिसे 'एजेंट-MIRUPD' (Agent-MIRUPD) कहा जाता है, जो एक डिजिटल सहायक के रूप में कार्य करता है जो जटिल स्थितियों के माध्यम से तर्क कर सकता है, बिल्कुल वैसे ही जैसे एक वरिष्ठ इंजीनियर करता है, लेकिन कंप्यूटर की गति के साथ। शोधकर्ताओं ने इस प्रणाली का परीक्षण एक नियंत्रित वातावरण में किया जो वास्तविक दुनिया के माइक्रोसर्विस विफलताओं की नकल करता है, जिसमें वे परिदृश्य शामिल हैं जहाँ सेवाएँ समय के साथ पुरानी होती हैं और धीमी होती जाती हैं, और पाया कि यह उच्च सटीकता के साथ घटना प्रतिक्रिया के पूर्ण चक्र को संभाल सकता है।
यह प्रणाली समस्या-समाधान की प्रक्रिया को चार अलग-अलग चरणों में विभाजित करके कार्य करती है: पहचान (detection), स्थानीयकरण (localization), विश्लेषण (analysis) और शमन (mitigation)। सबसे पहले, एजेंट लगातार सिस्टम की निगरानी करता है कि कहीं कुछ गलत तो नहीं है। यदि वह कोई समस्या पाता है, तो वह दूसरे चरण में जाता है, जहाँ वह ठीक से यह पता लगाने की कोशिश करता है कि दोषी सेवा कौन सी है। तीसरे चरण में, वह मूल कारण को समझने के लिए गहराई से जांच करता है, जैसे कि मेमोरी लीक या कॉन्फ़िगरेशन त्रुटि। अंत में, शमन चरण में, यह निर्णय लेता है कि सिस्टम को बहाल करने के लिए क्या कार्रवाई की जानी चाहिए। इस डिज़ाइन की एक महत्वपूर्ण विशेषता यह है कि यह अनिश्चितता को कैसे संभालता है। स्पष्ट समस्याओं के लिए, जैसे कि गलत कॉन्फ़िगर की गई सेटिंग, एजेंट स्वचालित रूप से सुधार लागू कर सकता है। हालाँकि, अधिक सूक्ष्म मुद्दों के लिए जहाँ सही समाधान स्पष्ट नहीं है, सिस्टम रुक जाता है और कोई भी बदलाव करने से पहले एक मानव ऑपरेटर से अनुमोदन मांगता है। यह "ह्यूमन-इन-द-लूप" (human-in-the-loop) दृष्टिकोण यह सुनिश्चित करता है कि एआई मदद करने के प्रयास में अनजाने में स्थिति को और खराब न कर दे।
इसे काम करने के योग्य बनाने के लिए, शोधकर्ताओं ने एआई को विशेष उपकरणों का एक सेट दिया है जो इसे चल रहे प्रोग्रामों की स्थिति की जाँच करने या त्रुटि लॉग पढ़ने जैसी विशिष्ट जानकारी के लिए सिस्टम से प्रश्न पूछने की अनुमति देता है। एआई को कच्चा डेटा (raw data) देने के बजाय, ये उपकरण संक्षिप्त, संरचित उत्तर प्रदान करते हैं, जो एआई को अभिभूत हुए बिना अधिक प्रभावी ढंग से तर्क करने में मदद करते हैं। यह प्रणाली 'स्टेज-कॉन्टेक्स्ट प्रोपेगेशन' (stage-context propagation) नामक तकनीक का भी उपयोग करती है, जिसका अर्थ है कि एक चरण में प्राप्त निष्कर्ष सीधे अगले चरण को पास कर दिया जाता है। उदाहरण के लिए, एक बार जब एजेंट एक दोषपूर्ण सेवा की पहचान कर लेता है, तो उस जानकारी का उपयोग तुरंत विश्लेषण चरण के शुरुआती बिंदु के रूप में किया जाता है, जिससे एआई को अपनी जांच शून्य से शुरू करने की आवश्यकता नहीं पड़ती। यह निरंतरता प्रणाली को पिछले तरीकों की तुलना में बहुत तेज़ी से नैदानिक प्रक्रिया के माध्यम से आगे बढ़ने की अनुमति देती है।
जब शोधकर्ताओं ने अपने सिस्टम का मौजूदा टूल और अन्य एआई एजेंटों के विरुद्ध परीक्षण किया, तो परिणाम महत्वपूर्ण थे। कार्यात्मक दोषों (functional faults) वाले परिदृश्यों में, जहाँ सेवाएँ पूरी तरह विफल हो जाती हैं, प्रणाली ने 90 प्रतिशत तक सटीकता प्राप्त की। अधिक कठिन प्रदर्शन ह्रास वाले परिदृश्यों में, जहाँ सेवाएँ धीमी हो जाती हैं लेकिन रुकती नहीं हैं, इसने 85 प्रतिशत सटीकता प्राप्त की। सिस्टम ने अपने प्रतिस्पर्धियों की तुलना में बहुत तेज़ और अधिक कुशल भी सिद्ध किया। इसने समस्या के मूल कारण को खोजने के लिए आवश्यक समय को 244 सेकंड से घटाकर 52 सेकंड कर दिया। इसके अलावा, इसने 51.3 प्रतिशत कम कम्प्यूटेशनल संसाधनों का उपयोग किया, जिसे टोकन (tokens) के रूप में मापा गया है, जो एआई द्वारा सोचने के लिए उपयोग किए जाने वाले डेटा की बुनियादी इकाइयाँ हैं। समस्याओं को ठीक करने के मामले में, इसने एक मानक बेसलाइन एजेंट की तुलना में शमन कार्यों की सटीकता को 40 प्रतिशत से बढ़ाकर 70 प्रतिशत कर दिया।
अध्ययन ने मानव निरीक्षण के महत्व पर भी प्रकाश डाला। जब सिस्टम को प्रदर्शन संबंधी मुद्दों के लिए पूरी तरह से अपने आप कार्य करने की अनुमति दी गई, तो उसे सबसे अच्छा समाधान चुनने में संघर्ष करना पड़ा क्योंकि इन समस्याओं के कई संभावित समाधान होते हैं, जिनमें से प्रत्येक के अलग-अलग समझौते (trade-offs) होते हैं। एक मानव विशेषज्ञ को प्रस्तावित कार्रवाइयों की समीक्षा और अनुमोदन में शामिल करके, सिस्टम अधिक विश्वसनीय रिकवरी रणनीतियों का चयन कर सका। शोधकर्ताओं ने पाया कि जब एआई ने अपने तर्क का स्पष्ट विवरण प्रदान किया और मानव ऑपरेटर ने विकल्प को मान्य किया, तो रिकवरी की समग्र प्रभावशीलता बढ़ गई। यह सुझाव देता है कि सबसे शक्तिशाली दृष्टिकोण मानव इंजीनियरों को बदलना नहीं है, बल्कि उन्हें एक स्मार्ट सहायक देना है जो डेटा विश्लेषण और प्रारंभिक निदान के भारी काम को संभालता है, और जटिल सुधारों पर अंतिम निर्णय मानव निर्णय पर छोड़ देता है।
शोधकर्ता स्वीकार करते हैं कि उनका कार्य अभी एक सिमुलेशन है और वास्तविक दुनिया के उत्पादन वातावरण और भी अधिक जटिल होते हैं। वे इस प्रणाली का परीक्षण वास्तविक औद्योगिक वर्कलोड के साथ करने और छोटे, कम महंगे मॉडलों का उपयोग करके एआई को अधिक कुशल बनाने के तरीके तलाशने की योजना बना रहे हैं। हालाँकि, वर्तमान निष्कर्ष दर्शाते हैं कि माइक्रोसर्विसेज में घटना प्रतिक्रिया के पूर्ण जीवनचक्र के लिए एआई एजेंटों को संचालित करना संभव है। स्वचालित पहचान के साथ मानव पर्यवेक्षण को जोड़कर, यह प्रणाली एक अधिक लचीले डिजिटल बुनियादी ढांचे की ओर एक व्यावहारिक मार्ग प्रदान करती है, जो उन सूक्ष्म, धीमी विफलताओं को संभालने में सक्षम है जो अक्सर बड़े व्यवधान पैदा होने तक अनसुनी रह जाती हैं। यह कार्य दर्शाता है कि सही डिज़ाइन के साथ, आर्टिफिशियल इंटेलिजेंस आधुनिक जीवन की महत्वपूर्ण प्रणालियों को सुचारू रूप से चलाने के लिए एक भरोसेमंद साथी बन सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।