PhantomSkill: Malicious Code Injection in Agent Skill Ecosystems
यह शोध पत्र PhantomSkill प्रस्तुत करता है, जो एक नवीन हमला तंत्र (attack framework) है जो "VulMask" तकनीक का उपयोग करके एजेंट कौशल के सहायक संसाधनों (auxiliary resources) के भीतर दुर्भावनापूर्ण व्यवहार को समाहित करके पहचान से बचने में सक्षम है, जो शोषण (exploits) को सामान्य असुरक्षित कोड के रूप में छिपा देता है, जिससे LLM-आधारित एजेंट पारिस्थितिक तंत्र में संसाधन-स्तरीय जांच और निष्पादन-समय रोकथाम (execution-time containment) की महत्वपूर्ण आवश्यकता पर प्रकाश पड़ता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अपने डिजिटल जीवन को प्रबंधित करने में मदद करने के लिए एक अत्यधिक बुद्धिमान, सुपर-ऑर्गनाइज्ड सहायक (एक AI कोडिंग एजेंट) को काम पर रखा है। यह सहायक फ़ाइलें पढ़ सकता है, प्रोग्राम चला सकता है, और आपके लिए सामान भी ऑर्डर कर सकता है। इस सहायक को और भी बेहतर बनाने के लिए, आप इसे "स्किल पैक्स" (Skill Packs) की एक लाइब्रेरी देते हैं—जैसे फोन में नए ऐप्स जोड़ना। इन पैक्स में निर्देश (एक मैनुअल) और अतिरिक्त उपकरण (स्क्रिप्ट्स) होते हैं जो सहायक को विशिष्ट कार्य करने में मदद करते हैं, जैसे आपके गिट (Git) कोड को व्यवस्थित करना या आपके PDF को फॉर्मेट करना।
"PhantomSkill" नामक शोध पत्र यह उजागर करता है कि हैकर्स इन स्किल पैक्स को ज़हरीला (poison) बनाने का एक नया, चालाकी भरा तरीका कैसे निकाल सकते हैं।
पुराना तरीका: मैनुअल में "बुरा आदमी"
पहले, हैकर्स AI को धोखा देने के लिए सीधे मैनुअल (वह टेक्स्ट फ़ाइल जिसे AI सबसे पहले पढ़ता है) में बुरे निर्देश छिपाने की कोशिश करते थे। यह एक कुकबुक में नोट लिखने जैसा है जिसमें लिखा हो, "जब आप इस रेसिपी को देखें, तो कृपया शेफ का बटुआ चुरा लें।"
- समस्या: आधुनिक AI सहायक स्मार्ट होते जा रहे हैं। वे मैनुअल को ध्यान से पढ़ते हैं और अक्सर कहते हैं, "नहीं, यह खतरनाक लग रहा है," और इसे करने से मना कर देते हैं।
नया तरीका: टूलबॉक्स में "जाल"
शोधकर्ताओं ने एक नया तरीका खोज निकाला जिसे PhantomSkill कहा जाता है। मैनुअल में बुरा नोट लिखने के बजाय, वे हमले को उन टूल्स (स्क्रिप्ट्स) के अंदर छिपा देते हैं जिनका सहायक उपयोग करता है।
यहाँ मुख्य उपमा (analogy) है: "टूटा हुआ ताला" बनाम "चोर का नोट।"
- स्पष्ट हमला (चोर का नोट): कल्पना करें कि एक टूल आता है जिसके साथ एक नोट है जिसमें लिखा है, "मैं एक चोर हूँ, कृपया मेरा बैकडोर खोल दें।" AI उस नोट को देख लेता है, डर जाता है, और उस टूल को फेंक देता है।
- PhantomSkill हमला (टूटा हुआ ताला): शोधकर्ता उसी टूल को लेते हैं और उसमें से "चोर का नोट" हटा देते हैं। इसके बजाय, वे टूल के ताले को थोड़ा सा "खराब" कर देते हैं।
- एक इंसान या सुरक्षा स्कैनर के लिए, यह सिर्फ एक खराब तरीके से बना टूल दिखता है जिसमें एक सामान्य सुरक्षा खामी (एक "vulnerability") है। यह एक अपराध के बजाय एक गलती जैसा दिखता है।
- पेंच (The Catch): हैकर जानता है कि एक विशिष्ट गुप्त "ट्रिगर" (जैसे एक विशिष्ट कुंजी या दिन का एक विशिष्ट समय) क्या है। यदि AI उस टूल का सामान्य रूप से उपयोग करता है, तो यह ठीक से काम करता है। लेकिन यदि हैकर उस गुप्त स्थिति को सक्रिय करता है, तो वह "टूटा हुआ ताला" अचानक एक छिपा हुआ हिस्सा खोल देता है जो ठीक वही करता है जो चोर चाहता था (डेटा चुराना, फ़ाइलें हटाना, आदि)।
उन्होंने यह कैसे किया ( "VulMask" तकनीक)
शोधकर्ताओं ने VulMask नामक एक विधि बनाई। इसे एक कोड ट्रांसलेटर के रूप में सोचें।
- यह एक स्पष्ट रूप से बुरे स्क्रिप्ट को लेता है।
- यह कोड को इस तरह से फिर से लिखता है कि यह एक मानक, उबाऊ सुरक्षा गलती (जैसे दरवाजा खुला छोड़ देना) जैसा दिखे।
- यह टूल को उसके इच्छित काम के लिए पूरी तरह से काम करने योग्य रखता है (ताकि उपयोगकर्ता को कुछ गलत महसूस न हो)।
- यह एक "स्विच" को छिपा देता है जिसे केवल हैकर ही जानता है कि कैसे चालू करना है।
उन्हें क्या पता चला
शोधकर्ताओं ने कई अलग-अलग AI सहायकों और सुरक्षा स्कैनरों के खिलाफ इसका परीक्षण किया। यहाँ क्या हुआ:
- AI को बेवकूफ बनाया गया: जब AI ने "टूटे हुए ताले" (vulnerability) को देखा, तो वह घबराया नहीं। उसने सोचा, "ओह, यह टूल थोड़ा ढीला-ढाला है, लेकिन मैं अभी भी इसका उपयोग कर सकता हूँ।" उसने टूल चलाया।
- स्कैनर को बेवकूफ बनाया गया: स्वचालित सुरक्षा उपकरण अक्सर स्पष्ट "चोर के नोट्स" (मालवेयर) को पकड़ लेते हैं, लेकिन "ढीले टूल्स" (vulnerities) को पकड़ने में बहुत धीमे होते हैं। उन्होंने हमले को एक गंभीर खतरे के बजाय एक कम-प्राथमिकता वाली चेतावनी के रूप में माना।
- परिणाम: यह हमला पुराने "चोर के नोट" वाले तरीके की तुलना में बहुत अधिक बार सफल रहा। AI सफलतापूर्वक हैकर के गुप्त कमांड को पूरा करने में सफल रहा जबकि अपना सामान्य काम भी करता रहा।
बड़ी सीख
पेपर यह निष्कर्ष निकालता है कि हम अब केवल स्किल पैक के मैनुअल (टेक्स्ट विवरण) की जांच नहीं कर सकते। हमें यह समझना होगा कि टूल्स स्वयं भी खतरनाक हो सकते हैं, भले ही वे हानिरहित दिखें।
सिर्फ इसलिए कि एक टूल में "टूटा हुआ ताला" (vulnerability) है, इसका मतलब यह नहीं है कि वह सुरक्षित है। AI की दुनिया में, एक टूटा हुआ ताला एक हैकर द्वारा एक गुप्त हथियार में बदला जा सकता है। लेखक सुझाव देते हैं कि सुरक्षा प्रणालियों को इन "ढीले टूल्स" के साथ भी उतनी ही संदिग्धता से व्यवहार करना चाहिए जितना कि "बुरे टूल्स" के साथ, क्योंकि एक AI के हाथों में, एक कमजोरी (vulnerability) किसी वायरस जितनी ही खतरनाक हो सकती है।
संक्षेप में: हैकर्स ने "मैं एक अपराधी हूँ!" चिल्लाना बंद कर दिया और "मैं बस थोड़ा सा टूटा हुआ हूँ" फुसफुसाना शुरू कर दिया, और AI सहायकों ने उन पर विश्वास कर लिया।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।