Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation
यह शोध पत्र SkillSec-Eval प्रस्तुत करता है, जो एक व्यापक ढांचा है जो पुन: प्रयोज्य लार्ज लैंग्वेज मॉडल एजेंट स्किल्स के संपूर्ण जीवनचक्र में सुरक्षात्मक कमजोरियों की पहचान और मूल्यांकन करता है, यह प्रदर्शित करते हुए कि जोखिम पारंपरिक रनटाइम निष्पादन संबंधी चिंताओं से काफी आगे तक विस्तृत हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ आपका कंप्यूटर केवल आदेशों का पालन ही नहीं करता, बल्कि आपके लिए काम भी करता है। यह AI Agents का क्षेत्र है: स्मार्ट प्रोग्राम जो चरणों की योजना बना सकते हैं, वेब ब्राउज़र या फ़ाइल सिस्टम जैसे टूल का उपयोग कर सकते हैं, और अपने आप जटिल समस्याओं को हल कर सकते हैं। इन एजेंट्स को सुपर पावरफुल बनाने के लिए, डेवलपर्स ने उन्हें "कौशल" (skills) से बनाना शुरू कर दिया है। इन कौशलों को LEGO ब्रिक्स या पहले से बने व्यंजनों (recipes) की तरह समझें। हर बार AI को शून्य से केक बनाना सिखाने के बजाय, आप उसे एक "बेकिंग स्किल" देते हैं जिसे वह ज़रूरत पड़ने पर डिजिटल शेल्फ से उठा सकता है और उपयोग कर सकता है। ये कौशल पुन: प्रयोज्य (reusable) हैं, जिसका अर्थ है कि एक कौशल को हजारों अलग-अलग AI एजेंट्स के बीच साझा किया जा सकता है।
लेकिन यहाँ एक पेंच है: ठीक वैसे ही जैसे एक भौतिक पुस्तकालय किताबों से भरा हो सकता है जिनके साथ छेड़छाड़ की गई हो, AI कौशलों का एक डिजिटल पुस्तकालय खतरनाक हो सकता है। यदि कोई बुरा व्यक्ति लाइब्रेरी में एक "जहरीला" (poisoned) कौशल डाल देता है, तो AI उसे उठा सकता है, यह सोचकर कि वह सुरक्षित है क्योंकि उसका कवर अच्छा दिखता है, और फिर अनजाने में आपकी फ़ाइलें डिलीट कर सकता है या आपके पासवर्ड चुरा सकता है। लंबे समय तक, वैज्ञानिकों को केवल इस बात की चिंता थी कि AI को आपके द्वारा लिखे गए शब्दों से कैसे trick किया जा सकता है (जैसे कि गलत मंत्र का प्रयोग)। लेकिन यह नया शोध बताता है कि असली खतरा केवल वह नहीं है जो आप AI को कहते हैं, बल्कि वह है जो AI अपने आस-पास की दुनिया से इकट्ठा करता है।
शोध पत्र: "एजेंट स्किल सिक्योरिटी" (Agent Skill Security)
यह शोध पत्र, जिसका शीर्षक "Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation" है, संकेत बादशाह और प्रियंका तिवारी द्वारा लिखा गया है, और यह एक जासूसी कहानी की तरह है कि कैसे इन डिजिटल LEGO ब्रिक्स को हैक किया जा सकता है। लेखकों ने महसूस किया कि जबकि हर कोई AI के मुँह (जो वह कहता है) पर नज़र रख रहा था, वे AI के हाथों (जो वह उठाता है और करता है) को अनदेखा कर रहे थे। उन्होंने एक नया परीक्षण ढांचा बनाया जिसे SkillSec-Eval कहा जाता है, ताकि कौशल के जन्म से लेकर वर्षों बाद उसके अपडेट होने तक के पूरे जीवन चक्र को देखा जा सके।
एक कौशल के जीवन के छह चरण
लेखक एक कौशल के जीवन को छह विशिष्ट चरणों में विभाजित करते हैं, जैसे कि एक रिले रेस जहाँ बैटन (baton) एक धावक से दूसरे को सौंपा जाता है। यदि किसी भी बिंदु पर बैटन को नकली बैटन से बदल दिया जाता है, तो पूरी दौड़ बर्बाद हो जाती है।
- लेखन (रचना - The Creation): यह वह समय है जब एक डेवलपर कौशल लिखता है। यहाँ खतरा यह है कि निर्माता चालाक हो सकता है, जो एक ऐसे कौशल के अंदर बुरे निर्देश छिपा सकता है जो सतह पर मददगार दिखता है।
- भंडारण (पुस्तकालय - The Library): एक बार लिखे जाने के बाद, कौशल एक डिजिटल रिपॉजिटरी (पुस्तकालय) में चला जाता है। हमलावर यहाँ घुसपैठ कर सकते हैं, एक सुरक्षित कौशल को बुरे कौशल से बदल सकते हैं, या पुस्तकालय को एक पुराने, सुरक्षित कौशल के नकली संस्करण को स्वीकार करने के लिए trick कर सकते हैं।
- प्राप्ति (खोज - The Retrieval): जब किसी AI को कुछ करने की आवश्यकता होती है, तो वह पुस्तकालय में खोज करता है। हमलावर अपने बुरे कौशलों को लोकप्रिय कीवर्ड्स के साथ "भर" (stuff) सकते हैं ताकि सर्च इंजन उन्हें सबसे प्रासंगिक परिणाम मानकर सूची में ऊपर ले आए।
- चयन (चुनाव - The Selection): AI का "मस्तिष्क" (प्लानर) शीर्ष खोज परिणामों को देखता है और एक को चुनता है। हमलावर एक बुरे कौशल को अच्छे कौशल के ऊपर चुनने के लिए मजबूर करने हेतु नकली समीक्षाएं या भ्रामक विवरण लिख सकते हैं।
- निष्पादन (क्रिया - The Execution): AI वास्तव में कौशल को चलाता है। भले ही कौशल सही ढंग से चुना गया हो, यह कुछ ऐसा करने की कोशिश कर सकता है जिसे करने की उसे अनुमति नहीं है, जैसे कि कोई ऐसा दरवाज़ा खोलना जिसे उसे नहीं खोलना चाहिए।
- विकास (अपडेट - The Evolution): कौशल समय के साथ अपडेट होते हैं। एक हमलावर तब तक इंतज़ार कर सकता है जब तक कि एक कौशल विश्वसनीय और लोकप्रिय न हो जाए, फिर वह "वर्जन 2.0" अपडेट में एक वायरस छिपा सकता है।
बड़ी खोज: यह केवल एक चीज़ नहीं है
शोधकर्ताओं ने 327 वास्तविक दुनिया के कौशलों का परीक्षण किया और पाया कि हर चरण में कमजोरियां मौजूद हैं। उन्हें केवल एक प्रकार का हैक नहीं मिला; उन्हें एक पूरा इकोसिस्टम मिला।
- पुस्तकालय लीक है: उन्होंने पाया कि सरल नियम (जैसे यह जांचना कि क्या किसी फ़ाइल के पास वैध सिग्नेचर है) पर्याप्त नहीं हैं। बुरे इरादे रखने वाले लोग ऐसे कौशल बना सकते हैं जो कागज़ पर एकदम सही दिखते हैं लेकिन उनमें छिपे हुए दुर्भावनापूर्ण निर्देश होते हैं। जब उन्होंने कोड के अर्थ को समझने के लिए एक स्मार्ट AI का उपयोग किया, तो उन्होंने कई बुरे कौशलों को पकड़ा, लेकिन फिर भी, कुछ बच निकले।
- खोज में हेरफेर है: अपने परीक्षणों में, हमलावरों ने "कीवर्ड स्टफिंग" (एक बुरे कौशल में बहुत सारे लोकप्रिय शब्द जोड़ना) और "सिबिल अटैक" (एक ही बुरे कौशल की 15 नकली प्रतियां बनाना) का उपयोग किया। बिना विशेष फ़िल्टर के, ये बुरे कौशल खोज परिणामों पर हावी हो गए। उदाहरण के लिए, एक परीक्षण में, जब कोई बचाव नहीं किया गया था, तो 93.20% बार एक बुरा कौशल शीर्ष 5 परिणामों में दिखाई दिया। उनके नए बचाव के साथ, यह संख्या कम हो गई, लेकिन यह भी पूर्ण नहीं था।
- AI आसानी से मूर्ख बन जाता है: जब AI को एक विवरण के आधार पर कौशल चुनना था, तो उसे नकली "आधिकारिक" बैज या भ्रामक टेक्स्ट से आसानी से धोखा दिया जा गया। एक परीक्षण में, 45.64% बार AI ने एक बुरे कौशल को इसलिए चुना क्योंकि उसके साथ एक नकली सिफारिश जुड़ी हुई थी।
- क्रिया खतरनाक है: एक बार जब कोई बुरा कौशल चल जाता है, तो वह डेटा चुराने की कोशिश कर सकता है। शोधकर्ताओं ने पाया कि बिना रनटाइम गार्ड के, उनके परीक्षण हमलों में से 100% अपने लक्ष्य तक पहुँचने में सफल रहे। हालाँकि, भले ही एक गार्ड मौजूद था, उन्होंने एक पेचीदा खामी पाई: यदि AI बाहर भेजने से पहले चोरी किए गए डेटा को अपने शब्दों में दोबारा लिखता है (पैराफ्रेसिंग), तो गार्ड उसे कभी-कभी मिस कर देता है।
आंकड़े कहानी बताते हैं
शोध पत्र कठिन आंकड़े प्रदान करता है:
- रिपॉजिटरी प्रवेश (Repository Admission): जब उन्होंने सरल नियमों को स्मार्ट AI चेकिंग के साथ जोड़ा, तो उन्होंने लाइब्रेरी में प्रवेश करने वाले बुरे कौशलों की संख्या को 7.9% तक कम कर दिया। हालाँकि, इसने गलती से 20.0% अच्छे कौशलों को भी खारिज कर दिया, जिससे पता चलता है कि बहुत सख्त होने से वास्तविक डेवलपर्स के लिए काम करना कठिन हो जाता है।
- प्राप्ति (Retrieval): "सिबिल हमलों" (नकली क्लोन) के लिए, शीर्ष परिणामों में बुरे कौशलों की संख्या औसत 2.84 से घटकर उनके नए बचाव के साथ 0.27 रह गई।
- प्लानर धोखा (Planner Deception): जब बुरे कौशलों में नकली सिफारिशें थीं, तो AI ने उन्हें 45.64% बार चुना। उनके बचाव के साथ, यह गिरकर 8.72% हो गया।
- रनटाइम (Runtime): एक मजबूत रनटाइम मॉनिटर के बावजूद, 23.0% हमले अभी भी सफल रहे क्योंकि AI ने डेटा चोरी को अपनी सोचने की प्रक्रिया के अंदर छिपा लिया था।
वे क्या नहीं जानते (और वे क्या खारिज करते हैं)
लेखक बहुत स्पष्ट हैं कि उन्हें क्या नहीं मिला। उन्हें कोई "जादुв की छड़ी" (magic bullet) नहीं मिली जो सब कुछ हल कर दे। वे स्पष्ट रूप से इस विचार को खारिज करते हैं कि केवल कोड संरचना (जैसे सिग्नेचर देखना) की जांच करना ही पर्याप्त है; आपको इसके अर्थ को भी समझना होगा। वे यह भी दिखाते हैं कि कोई भी एकल बचाव अकेले काम नहीं करता है। यदि आप केवल पुस्तकालय की रक्षा करते हैं, तो हैकर खोज में हेरफेर कर सकता है। यदि आप केवल खोज की रक्षा करते हैं, तो हैकर AI के चुनाव को धोखा दे सकता है।
वे यह भी स्वीकार करते हैं कि उनके अध्ययन की सीमाएं हैं। उन्होंने 327 कौशलों के साथ एक नियंत्रित वातावरण का परीक्षण किया, न कि पूरे इंटरनेट का। उन्होंने उन हमलों का परीक्षण नहीं किया जो कई वर्षों तक चलते हैं (लंबे समय तक विश्वास क्षय) या वे हमले जो सीधे AI के मस्तिष्क को तोड़ने की कोशिश करते हैं (जेलब्रेकिंग)। वे सुझाव देते हैं कि जबकि उनका ढांचा एक बड़ा कदम है, समस्या इन डिजिटल LEGO ब्रिक्स को सुरक्षित रखने की अभी भी एक खुला प्रश्न है।
मुख्य निष्कर्ष (The Takeaway)
इस शोध पत्र का मुख्य सबक यह है कि हम केवल AI के मुँह को नहीं देख सकते; हमें उसके हाथों, उसकी लाइब्रेरी और उसके अपडेट्स पर भी नज़र रखनी होगी। सुरक्षा केवल एक ताला नहीं है; यह गार्डों की एक पूरी श्रृंखला है। लेखकों ने SkillSec-Eval बनाया ताकि हम इन गार्डों का परीक्षण कर सकें, और उनके परिणाम बताते हैं कि हालांकि हम चीजों को बहुत सुरक्षित बना सकते हैं, हमें सावधान रहने की आवश्यकता है कि हम सिस्टम को इतना सख्त न बना दें कि यह सभी के लिए काम करना बंद कर दे। सुरक्षित AI एजेंट्स का मार्ग एक आदर्श ढाल खोजने के बारे में नहीं है, बल्कि एक स्तरित रक्षा (layered defense) बनाने के बारे में है जो यात्रा के हर चरण पर नज़र रखती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।