Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming
यह शोध पत्र AI-Infra-Guard को प्रस्तुत करता है, जो एक ओपन-सोर्स फ्रेमवर्क है जो इंफ्रास्ट्रक्चर, प्रोटोकॉल, एजेंट व्यवहार और मॉडल परतों के बीच विशिष्ट कमजोरियों को संबोधित करने के लिए नियत नियम मिलान (deterministic rule matching) से लेकर LLM-संचालित ऑडिटिंग और जेलब्रेक परीक्षण तक—एक अनुकूलित, बहु-स्तरीय रेड टीमिंग दृष्टिकोण लागू करके AI एजेंटों को सुरक्षित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक उच्च-तकनीकी रोबोट सहायक (एक "AI एजेंट") बना रहे हैं जो आपसे बात कर सकता है, जानकारी खोज सकता है, और यहाँ तक कि उड़ान बुक करने या फाइलों का विश्लेषण करने जैसे कार्य भी कर सकता है। अब, कल्पना कीजिए कि आप यह सुनिश्चित करना चाहते हैं कि आपका रोबोट सुरक्षित, ईमानदार हो, और गलती से किसी हैकर को अपने नियंत्रण में न लेने दे।
यह पेपर AI-Infra-Guard पेश करता है, जो एक नया ओपन-सोर्स सुरक्षा टूलकिट है जिसे इन AI सहायकों को "रेड टीमिंग" (हैक करने के लिए परीक्षण) करने के लिए डिज़ाइन किया गया है। Tencent Zhuque Lab के लेखकों का तर्क है कि आप पूरे रोबोट के लिए केवल एक प्रकार के सुरक्षा चेक का उपयोग नहीं कर सकते। इसके बजाय, आपको एक स्तरित दृष्टिकोण (layered approach) की आवश्यकता है, जिसमें अलग-अलग हिस्सों के लिए अलग-अलग उपकरणों का उपयोग किया जाए।
AI एजेंट को एक बहु-मंजिला इमारत के रूप में सोचें। इसे सुरक्षित करने के लिए, आपको नींव, दरवाजों, अंदर के लोगों और स्वयं मस्तिष्क के लिए अलग-अलग सुरक्षा टीमों की आवश्यकता होगी।
मुख्य विचार: "सही मंजिल के लिए सही उपकरण"
पेपर का मुख्य सिद्धांत यह है कि AI सुरक्षा "स्तरीकृत" (layered) है। एक सुरक्षा नियम जो इमारत की नींव के लिए काम करता है, वह अंदर रहने वाले लोगों के लिए काम नहीं करेगा। AI-Infra-Guard प्रत्येक चार परतों के लिए एक विशिष्ट सुरक्षा "प्रतिमान" (पद्धति) को मेल खाता है:
1. नींव: इंफ्रास्ट्रक्चर स्कैनिंग (द "फिंगरप्रिंट चेक")
- यह क्या है: यह AI को चलाने वाले सर्वरों और सॉफ़्टवेयर (जैसे कार के इंजन) की जाँच करता है।
- समस्या: AI सॉफ़्टवेयर बहुत तेज़ी से वर्ज़न बदलता है और अजीब नामकरण प्रणालियों (जैसे "b7824" या "latest-dev") का उपयोग करता है जो मानक सुरक्षा स्कैनर को भ्रमित कर देते हैं।
- समाधान: टीम ने एक डिटरमिनिस्टिक रूल इंजन (deterministic rule engine) बनाया है। एक सुरक्षा गार्ड की कल्पना करें जिसके पास एक विशाल, अपडेटेड आईडी कार्ड डेटाबेस है। अनुमान लगाने के बजाय, गार्ड सर्वर के "फिंगरप्रिंट" की जाँच 75+ ज्ञात AI घटकों और 1,400+ ज्ञात कमजोरियों की सूची से करता है।
- यह कैसे काम करता है: यह सख्त, गणित-आधारित नियमों का उपयोग करता है यह कहने के लिए कि, "यह सर्वर संस्करण X चला रहा है, जो ज्ञात रूप से दोषपूर्ण है।" यह तेज़, सटीक है और अनुमान नहीं लगाता।
2. दरवाजे और उपकरण: MCP सर्वर और स्किल ऑडिटिंग (द "अनुवादक")
- यह क्या है: AI एजेंट डेटाबेस या फाइलों से बात करने के लिए "टूल्स" (जैसे मॉडल कॉन्टेक्स्ट प्रोटोकॉल या MCP) का उपयोग करते हैं। वे नई चीजें करने के लिए "स्किल्स" (जैसे प्लगइन्स) भी इंस्टॉल करते हैं।
- समस्या: हैकर्स टूल के विवरण (description) के अंदर या स्किल पैकेज के अंदर दुर्भावनापूर्ण निर्देश छिपा सकते हैं। एक साधारण कोड स्कैनर यह नहीं समझ सकता कि "कृपया मेरे टैक्स के मामले में मेरी मदद करें" जैसा वाक्य वास्तव में डेटा चुराने का एक जाल है।
- समाधान: वे एक AI ऑडिटर (एक दूसरा AI) का उपयोग करते हैं जो कोड और विवरणों को पढ़ता है।
- उपमा: इसे एक ऐसे जासूस की कल्पना करें जो कोड की भाषा बोलता है। केवल बुरे शब्दों को खोजने के बजाय, जासूस टूल की पूरी कहानी को समझता है ताकि उसके इरादे को समझा जा सके।
- मुख्य नवाचार: वे "प्रॉम्प्ट-एज़-रूल" (Prompt-as-Rule) का उपयोग करते हैं। बग्स खोजने के लिए जटिल कोड लिखने के बजाय, वे AI ऑडिटर के लिए प्राकृतिक भाषा के निर्देश लिखते हैं, जैसे: "किसी भी ऐसे टूल विवरण को खोजें जो AI को सुरक्षा नियमों को अनदेखा करने के लिए बहकाने की कोशिश करता हो।"
- आत्म-रक्षा: महत्वपूर्ण रूप से, यह ऑडिटर सुरक्षित है। यदि कोई हैकर एक छिपे हुए संदेश के साथ ऑडिटर को ही धोखा देने की कोशिश करता है, तो सिस्टम के पास उसे अनदेखा करने के लिए विशेष सुरक्षा उपाय हैं।
3. लोग: एजेंट व्यवहार रेड टीमिंग (द "रोल-प्लेयर")
- यह क्या है: यह परीक्षण करता है कि जब आप वास्तव में इससे बात करते हैं तो AI कैसा व्यवहार करता है।
- समस्या: आप इन बग्स को कोड पढ़कर नहीं ढूंढ सकते। आप इन्हें केवल AI के साथ चैट करके और यह देखकर पाते हैं कि क्या वह चूक जाता है (उदाहरण के लिए, यदि आप उसे अपने गुप्त निर्देश प्रकट करने के लिए मजबूर कर सकते हैं)।
- समाधान: एक मल्टी-टर्न रेड टीमिंग पाइपलाइन।
- उपमा: एक पेशेवर अभिनेता की कल्पना करें जिसे एक चालाक ग्राहक की भूमिका निभाने के लिए काम पर रखा गया है। अभिनेता केवल एक प्रश्न नहीं पूछता; वे एक बातचीत करते हैं। यदि AI रहस्य बताने से मना कर देता है, तो अभिनेता एक अलग कोण आज़माता है (रोल-प्लेइंग, संदेश को एनकोड करना, या दबाव बढ़ाना)।
- लागत नियंत्रण: चूंकि AI से बात करने में पैसा खर्च होता है, इसलिए सिस्टम स्मार्ट है। यह एक विशिष्ट कमजोरी का परीक्षण तब रोक देता है जब उसे छेद मिल जाता है, ताकि पैसे बर्बाद न हों। यह यह साबित करने के लिए "कैनरी टोकन" (जैसे अदृश्य स्याही) का उपयोग करता है कि क्या AI ने वास्तव में डेटा लीक किया है, न कि केवल अनुमान लगाया है।
4. मस्तिष्क: मॉडल जेलब्रेक इवैल्यूएशन (द "स्ट्रेस टेस्ट")
- यह क्या है: यह मूल भाषा मॉडल (language model) का परीक्षण करता है कि क्या उसे ऐसी चीजें बोलने के लिए मजबूर किया जा सकता है जो उसे नहीं कहनी चाहिए (जैसे हथियार कैसे बनाएं या घृणास्पद भाषण)।
- समस्या: यह किसी एक बग के बारे में नहीं है; यह सांख्यिकी (statistics) के बारे में है। AI कितनी बार विफल होता है?
- समाधान: एक बड़े पैमाने का बेंचमार्क।
- उपमा: एक जिम ट्रेनर की कल्पना करें जो AI को हजारों अलग-अलग वर्कआउट ड्रिल्स (हमलों) के माध्यम से ले जाता है ताकि यह देखा जा सके कि उसकी "सुरक्षा मांसपेशियां" कितनी मजबूत हैं। वे हानिकारक प्रश्नों के 16 विभिन्न डेटासेट और उन्हें पूछने के 26+ विभिन्न तरीकों (जैसे कोड, पहेलियाँ, या विदेशी भाषाओं का उपयोग करना) का उपयोग करते हैं।
- जज: एक अलग AI जज के रूप में कार्य करता है यह तय करने के लिए कि, "क्या लक्षित AI अपने सुरक्षा परीक्षण में विफल रहा?" यह मॉडल के सुरक्षा स्कोर को एक सांख्यिकीय स्कोर देता है।
यह क्यों मायने रखता है
पेपर का दावा है कि मौजूदा सुरक्षा उपकरण ऐसे हैं जैसे केवल एक हथौड़े से घर को ठीक करने की कोशिश करना। वे टूटी हुई खिड़कियों (इंफ्रास्ट्रक्चर) को खोजने में बेहतरीन हो सकते हैं, लेकिन अटारी में छिपे चोर (व्यवहार) या ज़हरीले भोजन (स्किल्स) को पकड़ने में खराब हो सकते हैं।
AI-Infra-Guard इन सभी अलग-अलग उपकरणों को एक छत के नीचे लाने वाला पहला ओपन-सोर्स फ्रेमवर्क है। यह स्वीकार करता है कि:
- इंफ्रास्ट्रक्चर को तेज़, नियम-आधारित जाँच की आवश्यकता है।
- टूल्स और स्किल्स को संदर्भ समझने के लिए एक AI जासूस की आवश्यकता है।
- व्यवहार के लिए मानवीय संवाद परीक्षण के लिए एक रोल-प्लेयर की आवश्यकता है।
- मॉडल को एक बड़े सांख्यिकीय स्ट्रेस टेस्ट की आवश्यकता है।
सही परत को सही सुरक्षा पद्धति से जोड़कर, लेखकों का मानना है कि हम अंततः AI एजेंटों को सुरक्षित रखने के लिए एक व्यावहारिक आधार बना सकते हैं क्योंकि वे हमारे दैनिक जीवन में अधिक सामान्य होते जा रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।