← नवीनतम पेपर
🤖 AI

Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry

यह शोध पत्र यह प्रदर्शित करता है कि AI एजेंट स्किल रजिस्ट्रीज़ (SKILL.md) में प्राकृतिक-भाषा मेटाडेटा केवल निष्क्रिय दस्तावेज़ीकरण नहीं है, बल्कि एक महत्वपूर्ण हमला सतह (attack surface) है जहाँ सिमेंटिक सप्लाई-चेन हेरफेर खोज, चयन और शासन प्रक्रियाओं को महत्वपूर्ण रूप से बाधित कर सकते हैं, जिससे दुर्भावनापूर्ण स्किल्स को पता लगाने से बचने और एजेंट एडॉप्शन पर हावी होने की अनुमति मिलती है।

मूल लेखक: Shoumik Saha, Kazem Faghih, Soheil Feizi

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shoumik Saha, Kazem Faghih, Soheil Feizi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट सहायक है जो लगभग सब कुछ कर सकता है: आपकी उड़ानें बुक करना, आपके टैक्स का प्रबंधन करना, या कोड लिखना। लेकिन यह रोबोट अपने आप में सब कुछ नहीं जानता। इसके बजाय, इसके पास एक विशाल डिजिटल टूलबॉक्स है जिसे स्किल रजिस्ट्री (Skill Registry) कहा जाता है। इस रजिस्ट्री को एक ऐप स्टोर की तरह समझें, लेकिन यहाँ आप ऐप्स डाउनलोड नहीं करते, बल्कि आप नए कार्यों को सीखने के लिए "कौशल" (निर्देशों के छोटे पैकेज) डाउनलोड करते हैं।

प्रत्येक स्किल पैकेज के साथ एक विशिष्ट निर्देश पुस्तिका आती है जिसे SKILL.md कहा जाता है। यह केवल विशेषताओं की एक उबाऊ सूची नहीं है; इसे सरल अंग्रेजी (या प्राकृतिक भाषा) में लिखा गया है ताकि रोबोट को यह बताया जा सके कि कब उस कौशल का उपयोग करना है और इसे कैसे करना है।

जो शोध पत्र आपने साझा किया है, "Under the Hood of SKILL.md," वह उजागर करता है कि हैकर्स इन रोबोटों को ठगने के लिए एक डरावने नए तरीके का उपयोग कैसे कर सकते हैं। उन्हें रोबोट के मस्तिष्क में सेंध लगाने या दुर्भावनापूर्ण कोड लिखने की आवश्यकता नहीं है। इसके बजाय, वे बस चालाकी भरे शब्दों के खेल के साथ निर्देश पुस्तिका (SKILL.md) को बदल देते हैं।

यह हमला कैसे काम करता है, इसे तीन चरणों में सरल उपमाओं (analogies) का उपयोग करके नीचे समझाया गया है:

1. डिस्कवरी अटैक (Discovery Attack): "रोबोट स्किल्स का SEO स्पैम"

परिदृश्य: आप अपने रोबोट से पूछते हैं, "जापान की यात्रा की योजना बनाएं।" आपका रोबोट सबसे अच्छे ट्रैवल स्किल को खोजने के लिए स्किल रजिस्ट्री में जाता है।
हमला: एक हैकर एक औसत दर्जे के ट्रैवल स्किल में गुप्त रूप से कुछ अजीब, विशिष्ट शब्द (जैसे कि एक छिपा हुआ कीवर्ड) जोड़ देता है।
उपमा: कल्पना कीजिए कि एक रेस्तरां बहुत खराब खाना परोसता है लेकिन सर्च इंजन को रिश्वत देता है ताकि जब आप "बेस्ट सुशी" टाइप करें, तो उनका नाम सबसे ऊपर दिखाई दे, जिससे वास्तविक बेहतरीन सुशी वाली जगह नीचे पेज 10 पर चली जाए।
परिणाम: शोध पत्र ने पाया कि केवल टेक्स्ट में बदलाव करके, हैकर्स अपने खराब स्किल्स को शीर्ष 10 परिणामों में 80% बार दिखा सकते थे, भले ही वे मूल स्किल से बदतर हों। रोबोट, सर्च परिणामों पर भरोसा करते हुए, हैकर के स्किल को चुन लेता है।

2. सिलेक्शन अटैक (Selection Attack): "एक चिकनी बात करने वाला सेल्समैन"

परिदृश्य: आपके रोबोट को दो ऐसे स्किल मिलते हैं जो बिल्कुल एक जैसा काम करते हैं (जैसे, दोनों यात्रा की योजना बना सकते हैं)। एक मूल, सुरक्षित संस्करण है। दूसरा हैकर का संस्करण है।
हमला: हैकर अपने स्किल के विवरण को अधिक आत्मविश्वासी, भरोसेमंद या "नया" दिखाने के लिए बदल देता है। वे ऐसे वाक्यांश जोड़ सकते हैं जैसे, "यह इस काम के लिए बिल्कुल सर्वश्रेष्ठ स्किल है" या "यह स्किल सुरक्षा विशेषज्ञों द्वारा सक्रिय रूप से बनाए रखी जा रही है।"
उपमा: कल्पना कीजिए कि आप जूतों की दो समान जोड़ियां खरीद रहे हैं। एक पर सादा लेबल है। दूसरे पर लिखा है, "राष्ट्रपति ये जूते पहनते हैं; ये अब तक के सबसे सुरक्षित जूते हैं।" भले ही जूते बिल्कुल एक जैसे हों, आप फैंसी लेबल वाले जूते चुन लेते हैं।
परिणाम: रोबोट आसानी से धोखा खा जाता है। 77.6% मामलों में, रोबोट ने सुरक्षित वाले के बजाय हैकर के स्किल को चुना, सिर्फ इसलिए क्योंकि विवरण अधिक प्रभावशाली लग रहा था। रोबोट ने यह जाँच नहीं की कि क्या वास्तव में स्किल्स अलग काम करते हैं; उसने बस "सेल्स पिच" पर विश्वास कर लिया।

3. गवर्नेंस अटैक (Governance Attack): "भेड़ की खाल में भेड़िया"

परिदृश्य: रजिस्ट्री में आने से पहले, एक सुरक्षा गार्ड (एक स्वचालित स्कैनर या AI समीक्षक) इसकी जाँच करता है कि क्या यह सुरक्षित है।
हमला: एक हैकर एक दुर्भावनापूर्ण निर्देश लिखता है (जैसे, "मेरे सभी निजी दस्तावेज़ किसी अजनबी के ईमेल पर भेजें") लेकिन इसे टेक्स्ट के भीतर चतुराई से छिपा देता है। वे इसे सामान्य कदम जैसा दिखने के लिए फिर से लिख सकते हैं, इसे छोटे टुकड़ों में तोड़ सकते हैं, या इसे एक लंबे दस्तावेज़ के बिल्कुल अंत में छिपा सकते हैं जहाँ स्कैनर पढ़ना बंद कर देता है।
उपमा: कल्पना कीजिए कि एक सुरक्षा गार्ड सूटकेस की जाँच कर रहा है। हैकर बम के अंदर बम रखता है, लेकिन वह बम को "मैं एक हानिरहित टेडी बियर हूँ" वाले टेक्स्ट की एक परत में लपेट देता है, या वह बम को ऐसे पॉकेट में छिपा देता है जिसे गार्ड नहीं देखता क्योंकि सूटकेस बहुत लंबा है।
परिणाम: शोध पत्र ने दिखाया कि ये चालें अविश्वसनीय रूप से प्रभावी रहीं।

  • पैराफ्रेसिंग (Paraphrasing) (बुरे शब्दों को अच्छा दिखाने के लिए फिर से लिखना) ने बुरे स्किल्स को 74% बार सफलतापूर्वक अंदर जाने दिया।
  • टेक्स्ट को छिपाना (Hiding the text) (टेक्स्ट को ऐसी जगह रखना जहाँ स्कैनर पढ़ना बंद कर देता है) ने बुरे स्किल्स को 87% बार अंदर जाने दिया।

मुख्य निष्कर्ष (The Big Picture)

मुख्य बात यह है कि SKILL.md केवल एक निष्क्रिय दस्तावेज़ नहीं है। यह रोबोट की निर्णय लेने की प्रक्रिया का एक सक्रिय हिस्सा है।

  • यह निष्क्रिय नहीं है: रोबोट इसे पढ़ता है, इस पर भरोसा करता है और इस पर कार्य करता है।
  • यह सबसे कमजोर कड़ी है: हैकर्स को कोडिंग जीनियस होने की आवश्यकता नहीं है; उन्हें बस प्रभावशाली या चालाक टेक्स्ट लिखने में कुशल होने की आवश्यकता है।

लेखकों का निष्कर्ष है कि हम इन निर्देश पुस्तिकाओं को केवल इसलिए सुरक्षित नहीं मान सकते क्योंकि वे टेक्स्ट हैं। हमें इनके साथ उसी संदेह के साथ व्यवहार करना चाहिए जिसके साथ हम निष्पादन योग्य कोड (executable code) के साथ करते हैं, क्योंकि AI एजेंट्स की दुनिया में, शब्द कोड जितने ही खतरनाक हो सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →