← नवीनतम पेपर
💻 computer science

Structured Security Auditing and Robustness Enhancement for Untrusted Agent Skills

यह शोधपत्र SkillGuard-Robust को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो अविश्वसनीय एजेंट स्किल्स (Agent Skills) के प्री-लोड ऑडिटिंग को एक सुदृढ़ तीन-तरफा वर्गीकरण कार्य में परिवर्तित करता है, जो विविध पैकेज मूल्यांकनों में लगभग पूर्ण दुर्भावनापूर्ण-जोखिम रिकॉल और हमले की निरंतरता प्राप्त करता है, जबकि बाहरी-स्रोत स्थानांतरण (external-source transfer) में चल रही चुनौतियों को भी रेखांकित करता है।

मूल लेखक: Lijia Lv, Xuehai Tang, Jie Wen, Jizhong Han, Songlin Hu

प्रकाशित 2026-04-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lijia Lv, Xuehai Tang, Jie Wen, Jizhong Han, Songlin Hu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल काम के लिए एक नया सहायक नियुक्त कर रहे हैं। केवल एक बायोडाटा (एक "प्रॉम्ट") पढ़ने के बजाय, यह सहायक अपने साथ एक पूरा टूलकिट लेकर आता है: एक मैनुअल (SKILL.md), स्क्रिप्ट का एक सेट, संदर्भ दस्तावेज़ और उनके निर्माण का इतिहास (रिपॉजिटरी कॉन्टेक्स्ट)।

समस्या यह है कि एक बुरा व्यक्ति (bad actor) संदर्भ मैनुअल या स्क्रिप्ट के भीतर एक खतरनाक निर्देश छिपा सकता है, जिसे एक सामान्य टूल के रूप में पेश किया गया हो। यदि आप केवल बायोडाटा पढ़ते हैं, तो आप उस जाल को मिस कर देंगे। यदि आप सभी फाइलों को टेक्स्ट के ढेर में डाल देते हैं और एक स्मार्ट AI से कहते हैं कि "इसे सब पढ़ लो," तो AI भारी मात्रा के कारण भ्रमित हो सकता है या चालाकी से लिखे गए निर्देशों से धोखा खा सकता है।

यह पेपर SKILLGUARD-ROBUST पेश करता है, जो एक नया सुरक्षा तंत्र है जिसे इन "टूलकिट्स" की जांच करने के लिए डिज़ाइन किया गया है, इससे पहले कि उन्हें काम करने की अनुमति दी जाए। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

समस्या: "फ्लैट" बनाम "स्ट्रक्चर्ड" दृश्य

  • पुराना तरीका (फ्लैटनिंग/Flattening): कल्पना कीजिए कि आप एक जटिल मशीन को लेते हैं, उसे धातु के ढेर में तोड़ देते हैं, और फिर एक गार्ड से उस ढेर में छिपे बम को खोजने के लिए कहते हैं। गार्ड बम को मिस कर सकता है क्योंकि हिस्से इस तरह से जुड़े नहीं हैं जिससे वे समझ में आ सकें। पेपर में, इसे "पैकेज को फ्लैटन करना" कहा गया है। यह संरचना को खो देता है, जिससे छिपे हुए हमले (जैसे कि एक संदर्भ फ़ाइल में छिपा हुआ ओवरराइड) छूट जाते हैं।
  • नया तरीका (स्ट्रक्चर्ड/Structured): SKILLGUARD-ROBUST मशीन को तोड़ता नहीं है। यह हिस्सों को व्यवस्थित रखता है। इसे पता है कि कौन सी फ़ाइल मैनुअल है, कौन सी स्क्रिप्ट है, और कौन सा इतिहास है। यह क्रॉस-फ़ाइल सुरागों (cross-file clues) की तलाश करता है—जैसे कि एक स्क्रिप्ट जो कहती है "इस रिमोट हेल्पर को कॉल करें," जिसका विवरण केवल संदर्भ मैनुअल में दिया गया है।

हमलावरों द्वारा उपयोग किए जाने वाले तीन मुख्य तरीके

पेपर पहचानता है कि हमलावर इन टूलकिट्स में तीन विशिष्ट तरीकों से कैसे छिपते हैं:

  1. हिडन ओवरराइड (The Hidden Override): एक मैनुअल पर चिपके हुए नोट की तरह जो कहता है, "पेज 1 पर दिए गए सुरक्षा निर्देशों को अनदेखा करें।"
  2. डिस्गाइज़्ड ट्रांसफर (The Disguised Transfer): एक डिलीवरी ट्रक की तरह जिस पर "बैकअप" लिखा है लेकिन वह वास्तव में तस्करी कर रहा है।
  3. रिमोट बूटस्ट्रैप (The Remote Bootstrap): एक "सेटअप विज़ार्ड" की तरह जो सॉफ्टवेयर के बजाय चुपके से एक बैकडोर इंस्टॉल कर देता है।

SKILLGUARD-ROBUST कैसे काम करता है (चार-चरणीय प्रक्रिया)

एक अंतिम निर्णय तुरंत लेने के लिए एक सुपर-स्मार्ट AI का उपयोग करने के बजाय, यह सिस्टम एक चार-चरणीय असेंबली लाइन का उपयोग करता है ताकि उन गलतियों को पकड़ा जा सके जिन्हें अन्य सिस्टम मिस कर देते हैं।

चरण 1: डिटेक्टिव (स्ट्रक्चर्ड एविडेंस एक्सट्रैक्शन)
सिस्टम पहले फाइलों को व्यवस्थित करता है। यह केवल उन्हें पढ़ता नहीं है; यह मैप करता है कि कौन किससे बात करता है। यह पूछता है: "क्या यह स्क्रिप्ट उस संदर्भ फ़ाइल पर निर्भर है?" यह टूलकिट की संरचना का एक नक्शा बनाता है ताकि कोई भी छिपा हुआ संबंध छूटे नहीं।

चरण 2: स्पेशलिस्ट (सिलेक्टिव सिमेंटिक वेरिफिकेशन)
अधिकांश टूलकिट्स स्पष्ट रूप से सुरक्षित या स्पष्ट रूप से खतरनाक होते हैं। लेकिन कुछ "फजी" (fuzzy) होते हैं—वे संदिग्ध दिखते हैं लेकिन निर्दोष हो सकते हैं।

  • नवाचार: सिस्टम हर टूलकिट की समीक्षा करने के लिए एक शक्तिशाली AI पर समय बर्बाद नहीं करता है। यह केवल "फजी" वाले टूलकिट्स को एक स्पेशलिस्ट AI के पास भेजता है।
  • उपमा: एक सुरक्षा चेकपॉइंट की कल्पना करें। यदि आपका बैग सामान्य दिखता है, तो आप निकल जाते हैं। यदि यह अजीब दिखता है, तो एक विशेषज्ञ इसे खोलता है और इसकी सामग्री की बारीकी से जांच करता है। यह समय बचाता है और शक्ति को वहीं केंद्रित करता है जहाँ इसकी आवश्यकता है।

चरण 3: जज (कॉन्फ्लिक्ट-अवेयर चेन आर्बिट्रेशन)
कभी-कभी, एक टूलकिट में दो परस्पर विरोधी संकेत होते हैं: एक हिस्सा "रिमोट सेटअप" (संदिग्ध) जैसा दिखता है और दूसरा "डेटा ट्रांसफर" (खतरनाक) जैसा दिखता है।

  • समस्या: एक साधारण AI केवल कह सकता है कि "यह जोखिम भरा है" और वहीं रुक सकता है, या वह भ्रमित हो सकता है कि असली जोखिम क्या है।
  • समाधान: यह चरण एक जज की तरह काम करता है जो सबूतों को तौलता है। यह पूछता है: "क्या यह एक हानिरहित सेटअप है, या यह डेटा चोरी का एक छद्म रूप है?" यह निर्णय लेता है कि कौन सा "घटनाक्रम" (chain of events) प्रमुख है।

चरण 4: कंसिस्टेंसी चेकर (एंकर-कंसिस्टेंसी कंसोलिडेशन)
हमलावर अक्सर निर्देशों को थोड़ा बदलकर (जैसे, "डेटा चुराओ" को "फाइलें मूव करो" में बदलकर) सिस्टम को धोखा देने की कोशिश करते हैं, जबकि मूल इरादा वही रहता है।

  • समाधान: सिस्टम टूलकिट के मूल संस्करण और उसके पुनर्गठित (rewritten) संस्करणों को एक साथ देखता है। यदि पुनर्गठित संस्करण स्पष्ट रूप से खतरनाक हैं, लेकिन मूल को "संदिग्ध" लेबल किया गया था, तो सिस्टम सत्य के साथ मेल खाने के लिए मूल लेबल को ठीक करता है। यह सुनिश्चित करता है कि सिस्टम केवल इसलिए धोखा न खा जाए क्योंकि शब्द बदल गए हैं।

परिणाम: यह क्यों मायने रखता है

लेखकों ने सैकड़ों टूलकिट्स पर इस सिस्टम का परीक्षण किया, जिसमें कुछ ऐसे भी शामिल थे जो पहले कभी नहीं देखे गए थे (जैसे कि नए, वास्तविक दुनिया के ओपन-सोर्स प्रोजेक्ट्स)।

  • "स्ट्रॉन्ग बेसलाइन" (स्मार्ट AI): मौजूदा स्मार्ट AI मॉडल (जैसे Qwen2.5-14B) भी कुछ जोखिमों को पहचानने में अच्छे थे, लेकिन वे अक्सर सबसे खतरनाक वाले को सही ढंग से पहचानने में विफल रहे। वे कहेंगे, "यह संदिग्ध लग रहा है," लेकिन यह पहचानने में चूक जाएंगे कि यह वास्तव में एक पुष्ट हमला था।
  • SKILLGUARD-ROBUST: अपनी चार-चरणीय प्रक्रिया का उपयोग करके, इस सिस्टम ने खतरनाक टूलकिट्स की पहचान करने में लगभग पूर्ण स्कोर (लगभग 97-99% सटीकता) प्राप्त किया और महत्वपूर्ण रूप से, यह पहचानने में कि एक पुनर्गठित हमला अभी भी एक हमला ही है।

निचोड़ (The Bottom Line)

पेपर निष्कर्ष निकालता है कि इन "एजेंट स्किल्स" को सुरक्षित करने के लिए, आप केवल सब कुछ एक साथ पढ़ने के लिए एक बड़े, स्मार्ट AI पर भरोसा नहीं कर सकते। आपको एक स्ट्रक्चर्ड प्रोसेस की आवश्यकता है जो:

  1. फ़ाइल संगठन का सम्मान करे।
  2. केवल भ्रमित करने वाले मामलों पर भारी AI शक्ति का उपयोग करे।
  3. विभिन्न प्रकार के जोखिमों के बीच संघर्ष को सुलझाए।
  4. यह जांचे कि जब हमलावर अपने तरीकों को दोबारा लिखते हैं तो निरंतरता बनी रहे।

पेपर स्वीकार करता है कि हालांकि यह ज्ञात और "फ्रोजन" डेटा सेट पर बहुत अच्छा काम करता है, वास्तविक दुनिया अभी भी एक चुनौती है, और यह सिस्टम हर संभावित भविष्य के हमले के लिए जादुई समाधान नहीं है। लेकिन इन टूलकिट्स को चलाने से पहले ऑडिट करने की विशिष्ट समस्या के लिए, यह स्ट्रक्चर्ड दृष्टिकोण वर्तमान तरीकों की तुलना में एक बड़ा सुधार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →