Runtime Risk Detection and Control for AI Agents and LLM Applications
यह लेख AgentGuard AI v2.4.0 का एक आर्टिफैक्ट-आधारित केस स्टडी प्रस्तुत करता है, जो एक शोध प्रोटोटाइप है जो AI एजेंटों के लिए रनटाइम जोखिम पहचान और नियंत्रण तंत्र को संचालित करता है, जबकि एक निरीक्षण योग्य शासन उपकरण के रूप में इसकी उपयोगिता को उजागर करता है और विशिष्ट पुनरुत्पादकता दोषों की पहचान करता है जो उत्पादन प्रभावशीलता के दावों को बाधित करते हैं।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर प्रोग्राम केवल सवालों के जवाब ही नहीं देते, बल्कि जानकारी जुटाने, निर्णय लेने और अपने आप कार्य करने के लिए डिजिटल दुनिया में सक्रिय रूप से जाते हैं। इन्हें एआई एजेंट (AI agents) के रूप में जाना जाता है। वे डिजिटल कर्मचारियों की तरह हैं जो कई छोटे चरणों को जोड़कर उड़ान बुक कर सकते हैं, डेटा का विश्लेषण कर सकते हैं, या स्मार्ट उपकरणों को नियंत्रित कर सकते हैं। हालाँकि, यह नई क्षमता एक विशिष्ट प्रकार का खतरा भी लाती है। क्योंकि ये एजेंट इंटरनेट से जानकारी पढ़ सकते हैं और उस पर कार्रवाई कर सकते हैं, इसलिए एक हानिरहित दिखने वाली वेबसाइट के भीतर छिपा हुआ एक चतुर छल एजेंट को कुछ हानिकारक करने के लिए trick कर सकता है, जैसे डेटा चुराना या फ़ाइलें हटाना। समस्या यह है कि जब तक कोई इंसान गलती को नोटिस करता है, तब तक एजेंट पहले ही नुकसान पहुँचा चुका हो सकता है। इसे रोकने के लिए, हमें इन एजेंटों को काम करते समय देखने, यह पहचानने के लिए कि वे कब किसी जोखिम भरे कदम उठाने वाले हैं, और मानव द्वारा जाँच करने से पहले उन्हें रोकने का एक तरीका चाहिए।
यह एक शोध परियोजना है जिसका नाम 'एजेंटगार्ड एआई' (AgentGuard AI) है, जो इस चुनौती से निपटती है। शोधकर्ताओं ने, जो भारत के एक विश्वविद्यालय से काम कर रहे हैं, एक प्रोटोटाइप सिस्टम बनाया है जिसे इन स्वायत्त कार्यक्रमों के लिए एक वॉचडॉग (watchdog) के रूप में कार्य करने के लिए डिज़ाइन किया गया है। उनका लक्ष्य एक पूर्ण सुरक्षा उत्पाद बनाना नहीं था, बल्कि एक ऐसा कामकाजी मॉडल बनाना था जो यह दिखा सके कि जोखिम भरे व्यवहार का पता लगाने, उस व्यवहार के खतरे को स्कोर करने और आगे क्या करना है, यह तय करने के तीन महत्वपूर्ण विचारों को कैसे जोड़ा जाए। वे यह देखना चाहते थे कि क्या वे एक ऐसा सिस्टम बना सकते हैं जो न केवल परेशानी का पता लगाता है, बल्कि हर निर्णय का एक स्पष्ट, अपरिवर्तनीय रिकॉर्ड भी रखता है, ताकि मनुष्य बाद में ठीक से समीक्षा कर सकें कि वास्तव में क्या हुआ और क्यों। इसका परिणाम एक ऐसे सॉफ्टवेयर टूल का विस्तृत विवरण है जो एआई एजेंटों की अराजक दुनिया में व्यवस्था और मानवीय निरीक्षण लाने का प्रयास करता है।
उनके द्वारा बनाया गया सिस्टम, जिसका नाम एजेंटगार्ड एआई है, डिजिटल एजेंटों के लिए एक कंट्रोल टॉवर की तरह काम करता है। यह एजेंट के काम करने के दौरान घटनाओं के प्रवाह (stream of events) पर नज़र रखता है। यह उन विशिष्ट पैटर्न को खोजता है जो खतरे का संकेत देते हैं, जैसे कि एक एजेंट द्वारा किसी गुप्त फ़ाइल तक पहुँचने की कोशिश करना या किसी भ्रमित करने वाले निर्देश का पालन करना जो कि एक जाल हो सकता है। जब यह कुछ संदिग्ध पाता है, तो यह केवल एक रेड फ्लैग (चेतावनी) ही नहीं उठाता; बल्कि यह एक जोखिम स्कोर (risk score) की गणना करता है। यह स्कोर हवा में से निकाला गया कोई एकल नंबर नहीं है। इसके बजाय, यह छह अलग-अलग कारकों का एक संयोजन है, जिसमें एजेंट के टूल्स कितने जोखिम भरे हैं, सिस्टम कितना सुरक्षित है, और उपयोगकर्ता का व्यवहार कैसा है, शामिल हैं। इन कारकों को एक साथ तौला जाता है ताकि एक अंतिम स्कोर प्राप्त हो सके जो सिस्टम को बताता है कि स्थिति कितनी गंभीर है।
एक बार जोखिम स्कोर की गणना हो जाने के बाद, सिस्टम निर्णय चरण में चला जाता है। इसके पास चार संभावित अवस्थाएँ (states) हैं जिन्हें वह रिकमेंड (अनुशंसा) कर सकता है: यह एजेंट को जारी रखने दे सकता है, कड़ी निगरानी रख सकता है, एजेंट के कार्यों को प्रतिबंधित कर सकता है, या कार्रवाई को पूरी तरह से ब्लॉक कर सकता है। महत्वपूर्ण रूप से, यह सिस्टम पारदर्शी होने के लिए डिज़ाइन किया गया है। यह प्रारंभिक अलर्ट से लेकर अंतिम अनुशंसा तक के हर चरण का एक विस्तृत लॉग रखता है। यह विभिन्न लोगों को अलग-अलग भूमिकाएँ रखने की अनुमति देता है; एक मैनेजर नियमों को बदल सकता है, एक रिसर्चर परीक्षण चला सकता है, और एक रिव्यूअर (समीक्षक) लॉग्स को देख सकता है ताकि कार्यों को स्वीकृत या अस्वीकृत किया जा सके। सिस्टम में गोपनीयता सुविधाएँ भी शामिल हैं, जैसे कि लॉग्स में बातचीत के संवेदनशील हिस्सों को छिपाना, और यह रिकॉर्ड का एक डिजिटल "चेन" बनाता है जो इतिहास के साथ छेड़छाड़ करना बहुत कठिन बना देता है।
यह देखने के लिए कि क्या यह विचार वास्तव में काम करता है, शोधकर्ताओं ने एक विशिष्ट प्रयोग चलाया। उन्होंने वास्तविक एजेंटों या वास्तविक हैकर्स का उपयोग नहीं किया। इसके बजाय, उन्होंने वास्तविक घटनाओं को उत्पन्न करने के लिए एक इन-बिल्ट सिम्युलेटर का उपयोग किया। इनमें से पच्चीस नकली घटनाएँ थीं। इनमें से कुछ घटनाएँ सुरक्षित थीं, जबकि कुछ हमलों की तरह दिखने के लिए डिज़ाइन की गई थीं। सिस्टम ने इन घटनाओं को प्रोसेस किया और साक्ष्य का एक पूरा पैकेज तैयार किया, जिसमें कच्चा डेटा (raw data), जोखिम स्कोर, अलर्ट और अंतिम निर्णय शामिल थे। शोधकर्ताओं ने इस पैकेज का सावधानीपूर्वक निरीक्षण किया, और सिस्टम द्वारा अपनी स्क्रीन पर दिखाए गए विवरण की तुलना डिजिटल फ़ाइलों में सहेजे गए विवरण से की।
निरीक्षण से पता चला कि सिस्टम वास्तव में सभी कड़ियों को जोड़ सकता है। इसने सफलतापूर्वक एक घटना ली, जोखिम को स्कोर किया, एक अनुशंसा की, और साक्ष्य को इस तरह से सहेजा कि बाद में समीक्षा की जा सके। इसने साबित किया कि बुनियादी वर्कफ़्लो संभव है। हालाँकि, परीक्षण ने कुछ महत्वपूर्ण खामियों को भी उजागर किया जो इसे एक तैयार सुरक्षा उपकरण बनने से रोकते हैं। शोधकर्ताओं ने पाया कि सिस्टम पूरी तरह से सुसंगत (consistent) नहीं था। उदाहरण के लिए, स्क्रीन ने जोखिम-स्कोरिंग के नियमों का एक संस्करण दिखाया, लेकिन सहेजी गई फ़ाइल ने एक अलग संस्करण दिखाया। एक अन्य मामले में, सिस्टम ने कहा कि वह एक उच्च-जोखिम वाली कार्रवाई को ब्लॉक करेगा, लेकिन सहेजे गए रिकॉर्ड ने कहा कि वह केवल मानव समीक्षा के लिए पूछेगा। इन विसंगतियों का अर्थ है कि यदि आप बाद में प्रयोग को फिर से चलाने की कोशिश करते हैं, तो आपको बिल्कुल वही परिणाम नहीं मिलेगा, जो कि किसी भी सिस्टम के लिए एक बड़ी समस्या है जो विश्वसनीय होने का दावा करता है।
इसके अलावा, सिस्टम में वास्तविक प्रमाण के लिए आवश्यक कुछ आवश्यक विवरणों की कमी थी। इसने परीक्षण घटनाओं को उत्पन्न करने के लिए उपयोग किए गए विशिष्ट 'रैंडम सीड' (random seed) को रिकॉर्ड नहीं किया, न ही इसने चल रहे कंप्यूटर कोड के सटीक संस्करण को रिकॉर्ड किया। इन विवरणों के बिना, दूसरे शोधकर्ता के लिए परिणामों को सत्यापित करने के लिए प्रयोग को ठीक से फिर से बनाना असंभव है। अध्ययन में यह भी उल्लेख किया गया कि सिस्टम एक एकल कंप्यूटर पर एक साधारण सिमुलेशन के रूप में चल रहा था, न कि एक जटिल, उच्च-गति वाली सेवा के रूप में जो वास्तविक दुनिया के ट्रैफिक को संभाल सके। यह एक शोध प्रोटोटाइप था, न कि एक तैयार उत्पाद।
शोधकर्ता बहुत स्पष्ट थे कि उनके काम ने क्या हासिल किया और क्या नहीं। उन्होंने यह साबित नहीं किया कि उनका सिस्टम वास्तविक हैकर्स को रोक सकता है या यह अन्य सुरक्षा उपकरणों से बेहतर है। उन्होंने वास्तविक लोगों के साथ परीक्षण नहीं किया कि वे अलर्ट की समीक्षा करते समय क्या करते हैं या क्या इससे उनके कार्यभार में कमी आती है या उनके निर्णयों में सुधार होता है। उन्होंने जो सिद्ध किया वह यह था कि वे एक ऐसा ढांचा बना सकते हैं जो डिटेक्शन, स्कोरिंग और मानवीय समीक्षा को एक एकल, निरीक्षण योग्य प्रक्रिया में जोड़ता है। उन्होंने दिखाया कि एक डिजिटल ट्रेल बनाना संभव है जो एक जोखिम भरी घटना को मानवीय निर्णय से जोड़ता है, लेकिन उन्होंने यह भी दिखाया कि एक ऐसा सिस्टम बनाना जो सुसंगत, पुनरुत्पादनीय (reproducible) और वास्तविक दुनिया के लिए तैयार हो, बहुत अधिक काम की मांग करता है।
इस अध्ययन का मूल्य इसकी ईमानदारी में निहित है। एक पॉलिश किए हुए, पूर्ण समाधान को प्रस्तुत करने के बजाय, शोधकर्ताओं ने एक कामकाजी मॉडल प्रस्तुत किया और फिर उसे यह दिखाने के लिए खोलकर देखा कि वह कहाँ मजबूत और कहाँ कमजोर है। उन्होंने प्रदर्शित किया कि हालांकि गवर्नेंस-अवेयर एआई वॉचडॉग का विचार सही है, लेकिन विवरण अत्यंत महत्वपूर्ण होते हैं। एक सिस्टम जो एआई एजेंटों की रक्षा करने का दावा करता है, उसे अपने रिकॉर्ड को व्यवस्थित रखना चाहिए, यह सुनिश्चित करना चाहिए कि उसके नियम लगातार लागू हों, और मनुष्यों को उसके निर्णयों पर भरोसा करने के लिए पर्याप्त जानकारी प्रदान करनी चाहिए। जब तक इन हिस्सों को ठीक नहीं किया जाता, तब तक यह सिस्टम अनुसंधान के लिए एक शक्तिशाली उपकरण और भविष्य के लिए एक ब्लूप्रिंट है, लेकिन अभी तक वर्तमान के लिए एक ढाल नहीं है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।