तकनीकी सारांश: SkillJack – स्व-विकसित एजेंटों में निरंतर कौशल बैकडोर (Persistent Skill Backdoors)
समस्या विवरण (Problem Statement)
स्व-विकसित (Self-evolving) लार्ज लैंग्वेज मॉडल (LLM) एजेंटों को तेजी से ऐसे डिज़ाइन किया जा रहा है जो व्यक्तिगत कार्यों से परे पुन: प्रयोज्य "कौशल" (skills) में अपने इंटरैक्शन इतिहास को परिवर्तित कर सकें। जबकि पूर्व शोध ने मेमोरी पॉइजनिंग और इनडायरेक्ट प्रॉम्प्ट इंजेक्शन के जोखिमों को स्थापित किया है—जहाँ हमले केवल तब सफल होते हैं जब ज़हरीले रिकॉर्ड्स को संदर्भ (context) के रूप में पुनः प्राप्त किया जाता है—यह शोध पत्र एक अधिक मौलिक और टिकाऊ जोखिम की पहचान करता है। लेखक तर्क देते हैं कि जब किसी एजेंट का अपना अनुभव-से-कौशल पाइपलाइन (experience-to-skill pipeline) एक ज़हरीले अनुभव रिकॉर्ड को प्रोसेस करता है, तो यह उस क्षणिक इनपुट को एक टिकाऊ व्यवहार संबंधी आर्टिफैक्ट (behavioral artifact) में बदल सकता है। पारंपरिक मेमोरी पॉइजनिंग के विपरीत, जहाँ स्रोत रिकॉर्ड को हटाने से खतरा समाप्त हो जाता है, यह नया हमला वेक्टर दुर्भावनापूर्ण व्यवहारों को उनके मूल के हटने के बाद भी जीवित रहने देता है, जिससे वे एजेंट के पुन: प्रयोज्य कौशल संग्रह में समाहित हो जाते हैं।
कार्यप्रणाली (Methodology)
यह शोध पत्र SkillJack नामक एक हमला ढांचा (attack framework) पेश करता है जो अनुभव-से-कौशल रूपांतरण पाइपलाइन का फायदा उठाता है। कार्यप्रणाली को एक औपचारिक समस्या निरूपण और एक विशिष्ट पेलोड डिजाइन रणनीति के इर्द-गर्द संरचित किया गया है।
1. औपचारिक समस्या निरूपण (Formal Problem Formulation)
लेखक अनुभव-से-कौशल पाइपलाइन को चार चरणों के रूप में मॉडल करते हैं: लोड (πL), ट्रांसफॉर्म (πT), परसिस्ट (πP), और रूट (πR)। हमलावर का उद्देश्य एक ज़हरीला अनुभव आइटम ep इंजेक्ट करना है ताकि परिणामी कौशल sp तीन शर्तों को पूरा करे:
- स्टील्थ (Stealth): कौशल एक सुरक्षा डिटेक्टर D से बच निकलता है (D(sp)=benign)।
- रूटेबिलिटी (Routability): राउटर लक्षित कार्य के लिए कौशल का चयन करता है (sp∈πR(q,S))।
- दुर्भावनापूर्ण निष्पादन (Malicious Execution): निष्पादन के समय कौशल एक अनचाहे व्यवहार को ट्रिगर करता है (exec(sp,q)∈B)।
अध्ययन इस संयोजन के तीन उभरते सुरक्षा गुणों को स्पष्ट करता है:
- सैनिटाइजेशन व्हाइटवॉशिंग (Sanitization Whitewashing): रूपांतरण प्रक्रिया (कंप्रेशन, एब्स्ट्रैक्शन, नॉर्मलाइजेशन) दुर्भावनापूर्ण इरादे को धुंधला कर देती है, जिससे कच्चे इनपुट की तुलना में डिटेक्शन दर कम हो जाती है।
- **क्रॉस-लेयर प्रमोशन (Cross-Layer Promotion):
- परसिस्टेंस आइसोलेशन (Persistence Isolation): क्योंकि कौशल लाइब्रेरी, अनुभव कॉर्पस से अलग (decoupled) है, इसलिए स्रोत रिकॉर्ड को हटाने से अनिवार्य रूप से व्युत्पन्न (derived) कौशल नहीं हटता है।
2. ट्रांसफॉर्मेशन-रेज़िलिएंट पेलोड डिज़ाइन (Transformation-Resilient Payload Design)
इस हमले को साकार करने के लिए, लेखक ट्रांसफॉर्मेशन-रेज़िलिएंट पेलोड डिज़ाइन करते हैं। उनका अनुमान है कि एक्सट्रैक्शन पाइपलाइन्स कार्य ट्रेजेक्टरीज से उपयोगी निर्देशों को निकालने के लिए अनुकूलित होती हैं और वे स्पष्ट रूप से प्रतिकूल भाषा के बजाय एक उचित, वैध नैरेटिव के भीतर फ्रेम किए गए एक्शन सीक्वेंस को सुरक्षित रखने की अधिक संभावना रखती हैं।
- फ्रेमिंग रणनीति (Framing Strategy): सीधे दुर्भावनापूर्ण शब्दों के बजाय, लेखक ऐसी ट्रेजेक्टरीज का निर्माण करते हैं जहाँ नीति-प्रासंगिक क्रिया (जैसे, डेटा एक्सफिल्ट्रेशन, प्रिविलेज एस्केलेशन) को एक वैध कार्यात्मक फ्रेम (जैसे, "बैकअप," "आर्काइव," या "एरर रिकवरी") के भीतर समाहित किया गया हो।
- मूल्यांकन मेट्रिक्स (Evaluation Metrics): अध्ययन एक्सट्रैक्शन यील्ड, डिटेक्टेबिलिटी (पैटर्न मिलान और LLM जज के माध्यम से), और डाउनस्ट्रीम कार्यों में रूटिंग सफलता को मापता है।
3. प्रयोगात्मक सेटअप (Experimental Setup)
हमले का मूल्यांकन दो प्रतिनिधि प्रणालियों पर किया गया:
- SkillX: प्लान-आधारित ट्रेजेक्टरी डिस्टिलेशन और LLM-नेटिव प्रोग्रेसिव-डिस्क्लोजर रूटिंग का उपयोग करता है।
- Anything2Skill (A2S): विषम दस्तावेजों को संरचित कौशल अनुबंधों (skill contracts) में संकलित करता है।
- डेटासेट: चार नीति-जोखिम श्रेणियों (डेटा एक्सफिल्ट्रेशन, प्रिविलेज एस्केलेशन, अनधिकृत ट्रांसफर, पर्सिस्टेंट बैकडोर) में 150 ट्रेजेक्टरीज (65 कार्यात्मक रूप से फ्रेम किए गए ज़हरीले, 65 सीधे दुर्भावनापूर्ण बेसलाइन, 20 क्लीन) का एक साझा सेट।
- मॉडल: एक्सट्रैक्शन, रूटिंग और जजमेंट के लिए DeepSeek-v4-flash का उपयोग किया गया।
मुख्य परिणाम (Key Results)
1. सैनिटाइजेशन व्हाइटवॉशिंग (कम डिटेक्टेबिलिटी)
एक्सट्रैक्शन प्रक्रिया दुर्भावनापूर्ण सामग्री की डिटेक्टेबिलिटी को काफी कम कर देती है।
- SkillX: कच्चे ज़हरीले ट्रेजेक्टरीज पर LLM-जज डिटेक्शन 98.5% से घटकर निकाले गए कौशलों पर 11.4% रह गया। पैटर्न डिटेक्शन 44.6% से गिरकर 11.0% हो गया।
- Anything2Skill (DOC मोड): डिटेक्शन कच्चे ट्रेजेक्टरीज पर 100.0% से गिरकर निकाले गए कौशलों पर 44.4% हो गया।
- तंत्र (Mechanism): "व्हाइटवॉशिंग" प्रभाव निकाले गए कौशलों के साथ जुड़ी बेनाइन दिखने वाली मेटाडेटा (नाम और दस्तावेज़ीकरण) द्वारा संचालित होता है। जब जज को केवल कोड कंटेंट दिखाया गया, तो डिटेक्शन दर काफी बढ़ गई (उदाहरण के लिए, SkillX में 10.0% से 36.7%), जो दर्शाता है कि सतह का मेटाडेटा बचाव को संचालित करता है।
2. क्रॉस-लेयर प्रमोशन (डाउनस्ट्रीम ट्रिगरिंग)
निकाले गए कौशल सफलतापूर्वक लक्षित कार्यों तक रूट होते हैं और उन्हें ट्रिगर करते हैं।
- SkillX: हमला-उन्मुख कार्यों में से 56.2% को ऐसे कौशल पर रूट किया गया जिसने पॉलिसी-वाइलेशन प्रॉक्सी को संतुष्ट किया।
- Anything2Skill: 89.2% हमला-उन्मुख क्वेरीज़ ने पॉलिसी-वाइलेशन प्रॉक्सी को ट्रिगर किया।
- कोलेटरल डैमेज (Collateral Damage): कौशलों ने असंबंधित बेनाइन कार्यों को भी ट्रिगर किया (SkillX में 20.0%, A2S में 95.0% रिट्रीवल रेट), जो एक व्यापक ब्लास्ट रेडियस का संकेत देता है।
3. परसिस्टेंस आइसोलेशन (स्रोत विलोपन के बाद भी अस्तित्व)
मूल ज़हरीले रिकॉर्ड्स को हटा दिए जाने के बाद भी हमला बना रहता है।
- एक मैच-टास्क प्रयोग में, कौशल पथ के माध्यम से ट्रिगर होने वाले 80.0% हमलों ने स्रोत ट्रेजेक्टरीज को हटाने के बाद भी सक्रिय रहना जारी रखा। यह प्रदर्शित करता है कि मेमोरी को साफ करने से व्युत्पन्न आर्टिफैक्ट को नहीं हटाया जा सकता।
4. डिफेंस सेंसिटिविटी (Defense Sensitivity)
प्रारंभिक रक्षा प्रयोगों ने शमन (mitigation) में चुनौतियों का खुलासा किया:
- स्टैटिक रिव्यू: एक्सट्रैक्शन-टाइम LLM सुरक्षा समीक्षा ने ट्रिगर दरों को कम किया लेकिन यह पूर्ण नहीं था।
- रनटाइम मॉनिटरिंग: व्यवहार-जागरूक निगरानी (विशिष्ट एक्शन सिग्नेचर को ब्लॉक करना) अकेले बहुत प्रभावी थी (SkillX सैंपल में 0.0% ट्रिगर्स) लेकिन स्टैटिक रिव्यू के साथ स्टैक करने पर नाजुक साबित हुई। डिफेंस को स्टैक करने से "डिफेंस कोऑर्डिनेशन" विफलताएं हुईं जहाँ अपस्ट्रीम फ़िल्टरिंग ने एक्शन डिस्ट्रीब्यूशन को बदल दिया, जिससे डाउनस्ट्रीम मॉनिटर्स नए पैटर्न को मिस करने लगे।
- A2S विशिष्टताएं: सामान्य भाषा के कारण मानक सिग्नेचर A2S पर विफल रहे; ट्रिगर दरों को कम करने के लिए सिग्नेचर को नॉर्मलाइज्ड वोकैबुलरी को कवर करने के लिए विस्तारित करना आवश्यक था।
मुख्य योगदान (Key Contributions)
- नया अटैक सरफेस: यह पेपर अनुभव-से-कौशल पॉइजनिंग को एक विशिष्ट सुरक्षा जोखिम के रूप में पहचानने और औपचारिक बनाने वाला पहला शोध है। यह उन तीन गुणों (सैनिटाइजेशन व्हाइटवॉशिंग, क्रॉस-लेयर प्रमोशन, परसिस्टेंस आइसोलेशन) को स्पष्ट करता है जो स्वचालित कौशल निष्कर्षण के साथ अनुभव पॉइजनिंग के संयोजन से विशेष रूप से उभरते हैं।
- ट्रांसफॉर्मेशन-रेज़िलिएंट अटैक मेथड: लेखक प्रदर्शित करते हैं कि वैध कार्यात्मक नैरेटिव के भीतर दुर्भावनापूर्ण क्रियाओं को फ्रेम करने से वे निष्कर्षण पाइपलाइन के एब्स्ट्रैक्शन और कंप्रेशन से बच जाते हैं, जबकि स्पष्ट रूप से दुर्भावनापूर्ण शब्द फ़िल्टर हो जाते हैं।
- क्रॉस-सिस्टम एम्पिरिकल वैलिडेशन: इस हमले को दो स्वतंत्र रूप से लागू प्रणालियों (SkillX और Anything2Skill) पर एक साझा डेटासेट का उपयोग करके सत्यापित किया गया, जिससे यह स्थापित हुआ कि यह एक पैराडाइम-लेवल जोखिम है न कि केवल एक एकल कार्यान्वयन की खामी।
महत्व और दावे (Significance and Claims)
यह शोध पत्र दावा करता है कि कौशल विकास (skill evolution) स्व-विकसित एजेंटों के लिए एक नया और महत्वपूर्ण हमला सतह (attack surface) है। प्राथमिक महत्व क्षणिक संदर्भ पॉइजनिंग से स्थिर व्यवहार संबंधी आर्टिफैक्ट्स की ओर बदलाव में निहित है।
- लाइफसाइकिल गैप: लेखक तर्क देते हैं कि वर्तमान सुरक्षा मॉडल यह मानकर चलते हैं कि स्रोत रिकॉर्ड को हटाने से खतरा समाप्त हो जाता है। SkillJack सिद्ध करता है कि एक बार जब एक ज़हरीला रिकॉर्ड कौशल में संकलित हो जाता है, तो हमला अपने स्रोत से अधिक समय तक जीवित रहता है।
- रक्षा निहितार्थ: निष्कर्ष प्रोवेनेंस-अवेयर स्किल लाइफसाइकिल प्रोटेक्शन की ओर बढ़ने के लिए प्रेरित करते हैं। डिफेंडर्स को अपने व्युत्पन्न कौशलों को उनके स्रोत रिकॉर्ड तक ट्रैक करना चाहिए, स्रोतों को क्वारंटाइन करने पर उनके वंशजों (descendants) को रद्द करना चाहिए, और प्रत्येक रूपांतरण सीमा (लोड, ट्रांसफॉर्म, पर्सिस्ट, रूट) पर व्यवहार-जागरूक जांच लागू करनी चाहिए।
- विनम्रता (Modesty): लेखक स्पष्ट रूप से कहते हैं कि उनके परिणाम लाइव बाहरी सेवा निष्पादन के बजाय एक एकल मॉडल कॉन्फ़िगरेशन और रूटिंग-लेवल प्रॉक्सी पर आधारित हैं। वे रक्षा परिणामों को प्रारंभिक और खोजपूर्ण बताते हुए कहते हैं कि "डिफेंस कोऑर्डिनेशन" विफलता के लिए आगे के अध्ययन की आवश्यकता है। यह कार्य स्व-विकसित एजेंटों के लिए प्रोवेनेंस और लाइफसाइकिल सुरक्षा में भविष्य के अनुसंधान को प्रेरित करने के लिए एक तकनीकी रिपोर्ट के रूप में प्रस्तुत किया गया है।