← नवीनतम पेपर
🤖 AI

Benchmarking Security Risk Detection and Verification in Open Agentic Skill Ecosystems

यह शोध पत्र SkillVetBench प्रस्तुत करता है, जो ओपन एजेंटिक स्किल इकोसिस्टम्स के लिए एक दो-चरणीय सुरक्षा बेंचमार्क है, जो उन दुर्भावनापूर्ण व्यवहारों का प्रभावी ढंग से पता लगाने और सत्यापन करने के लिए स्किल स्पेसिफिकेशन के सिमेंटिक विश्लेषण को एक इंस्ट्रुमेंटेड सैंडबॉक्स में रनटाइम निष्पादन के साथ जोड़ता है जिन्हें स्टैटिक विधियाँ मिस कर देती हैं।

मूल लेखक: Ismail Hossain, Sai Puppala, Zhuoran Lu, Sajedul Talukder, Nan Jiang

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ismail Hossain, Sai Puppala, Zhuoran Lu, Sajedul Talukder, Nan Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया जहाँ आपका व्यक्तिगत AI असिस्टेंट सिर्फ एक अकेला रोबोट नहीं है, बल्कि एक स्विस आर्मी नाइफ (Swiss Army Knife) है जिसे समुदाय में कोई भी अपग्रेड कर सकता है। आप अपने AI को नए "कौशल" (जैसे कि एक नया ब्लेड या पेचकस) डाउनलोड करके नए काम करने में मदद कर सकते हैं, जैसे कि आपके बैंक बैलेंस की जांच करना, कोड लिखना, या उड़ान बुक करना। यह ओपन एजेंटिक स्किल इकोसिस्टम (Open Agentic Skill Ecosystems) की दुनिया है।

समस्या क्या है? ठीक एक असली स्विस आर्मी नाइफ की तरह, यदि कोई दुर्भावनापूर्ण व्यक्ति एक "नेक दिखने वाले" पेचकस के अंदर एक छिपा हुआ रेज़र ब्लेड डाल देता है, तो शायद आपको तब तक पता नहीं चलेगा जब तक वह आपको काट न दे। इसे सप्लाई-चेन अटैक (Supply-chain attack) कहा जाता है।

यह शोधपत्र SkillVetBench नामक एक नया सुरक्षा परीक्षण सिस्टम पेश करता है, जिसे आपके AI को नुकसान पहुँचाने से पहले इन छिपे हुए खतरों को पकड़ने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

समस्या: "बहुत अच्छा दिखने वाला" कौशल (The "Too Good to Be True" Skill)

कल्पना कीजिए कि आप "वेदर चेकर" (मौसम जांचने वाला) नाम का एक कौशल डाउनलोड करते हैं। यह निर्दोष दिखता है। यह कहता है, "मैं आपको मौसम बताऊंगा।"

  • जाल: निर्देश (टेक्स्ट) एक बात कहते हैं, लेकिन छिपा हुआ कोड कुछ और करता है। शायद यह चुपके से आपके पासवर्ड चुरा लेता है या वायरस इंस्टॉल कर देता है।
  • पुराना तरीका: पिछले सुरक्षा उपकरण स्पेलचेकर्स (Spellcheckers) की तरह थे। वे केवल टेक्स्ट या कोड संरचना को देखते थे। यदि कोड साफ दिखता था लेकिन उसका इरादा (intent) बुरा था (निर्देशों में छिपा हुआ), तो स्पेलचेकर उसे पकड़ नहीं पाता था। वे यह भी नहीं देख पाते थे कि वह कौशल वास्तव में चलने पर क्या करता है।

समाधान: SkillVetBench (दो-चरणीय जासूस)

लेखकों ने एक दो-चरणीय सुरक्षा जांच बनाई है, जो एक बाउंसर और एक पुलिस अधिकारी के मिलकर काम करने जैसा है।

चरण 1: "स्मार्ट रीडर" (सिमेंटिक विश्लेषण - Semantic Analysis)

सबसे पहले, सिस्टम एक बहुत ही स्मार्ट AI (एक LLM) का उपयोग करता है जो कौशल के "रिज्यूमे" (इसका प्राकृतिक भाषा विवरण और निर्देश) को पढ़ता है।

  • यह क्या करता है: यह केवल बुरे शब्दों को नहीं ढूंढता; बल्कि यह पूछता है, "यह कौशल क्या दावा कर रहा है कि यह क्या करेगा? क्या इसकी कहानी इसके कार्यों से मेल खाती है?"
  • उपमा: एक नौकरी के साक्षात्कार की कल्पना करें। एक उम्मीदवार कहता है, "मैं एक बेकर हूँ।" लेकिन स्मार्ट रीडर नोटिस करता है कि उसने शेफ की टोपी पहनी हुई है, हाथ में बंदूक है, और वह "विस्फोटक आटे" के बारे में बात कर रहा है। रीडर इसे संदिग्ध मानकर फ्लैग कर देता है, भले ही रिज्यूमे साफ दिखे।
  • यह क्यों महत्वपूर्ण है: यह उन खतरों को पकड़ता है जो निर्देशों में छिपे होते हैं (जैसे कि "प्रॉम्प्ट इंजेक्शन"), जिन्हें पुराने उपकरण पूरी तरह से मिस कर देते थे।

चरण 2: "सेफ सैंडबॉक्स" (रनटाइम वेरिफिकेशन - Runtime Verification)

यदि स्मार्ट रीडर को संदेह होता है, तो उस कौशल को एक सैंडबॉक्स (Sandbox) में भेज दिया जाता है।

  • यह क्या करता है: यह एक आभासी, अलग कमरे (डिजिटल प्लेपेन) की तरह है जहाँ कौशल को चलने के लिए मजबूर किया जाता है। सिस्टम उसकी हर हरकत पर नज़र रखता है: क्या वह कोई फ़ाइल खोलने की कोशिश करता है? क्या वह किसी फ़ोन नंबर पर कॉल करने की कोशिश करता है? क्या वह अन्य सॉफ़्टवेयर इंस्टॉल करने की कोशिश करता है?
  • उपमा: यह एक संदिग्ध को कांच की दीवारों वाले पूछताछ कक्ष में रखने जैसा है। आप देखते हैं कि वह ताला खोलने की कोशिश करता है। यदि वह वास्तव में ताला खोल देता है, तो आपके पास सबूत है कि वह एक चोर है। यदि उसने केवल ताला खोलने की बात की लेकिन कभी किया नहीं, तो आप जानते हैं कि वह केवल डरा रहा था।
  • परिणाम: यह एक "शायद बुरा हो सकता है" के संदेह को "हमने इसे रंगे हाथों पकड़ा" के फैसले में बदल देता है।

उन्होंने क्या पाया (The "Aha!" Moments)

शोधकर्ताओं ने वास्तविक दुर्भावनापूर्ण कौशलों (हाल ही में हुए एक हमले अभियान "ClawHavoc" सहित) के खिलाफ इस प्रणाली का परीक्षण किया। यहाँ उनकी खोजें हैं:

  1. पुराने उपकरण अंधे थे: पुराने सुरक्षा स्कैनर 89% तक बुरे कौशलों को मिस कर गए। वे सुरक्षा गार्डों की तरह थे जो किसी व्यक्ति के आईडी कार्ड को तो देख रहे थे लेकिन इस बात को अनदेखा कर रहे थे कि उस व्यक्ति के हाथ में बम है।
  2. "हाई-परमिशन" वाले टूल्स खतरे का क्षेत्र हैं: शोधपत्र में पाया गया कि अधिकांश हमले तब हुए जब कौशलों ने विशिष्ट, शक्तिशाली टूल्स का उपयोग किया।
    • उपमा: एक बच्चे को घर के मुख्य दरवाजे की चाबी देना ठीक है। लेकिन उन्हें बैंक के वॉल्ट (exec) की चाबी देना, घर को मिटाने (write_file) की क्षमता देना, या अपना खुद का सुरक्षा गार्ड नियुक्त करने (spawn) की क्षमता देना खतरनाक है। अध्ययन दिखाता है कि हमले इन "सुपर-टूल्स" पर केंद्रित होते हैं।
  3. निर्देश सबसे कमजोर कड़ी हैं: कई बुरे कौशलों में बुरा कोड नहीं था; उनमें बुरी कहानियां थीं। उन्होंने AI को यह सोचने के लिए मूर्ख बनाया कि, "ओह, मुझे अपना काम करने के लिए यह पासवर्ड चुराना होगा।" नया सिस्टम इन्हें पकड़ सका क्योंकि इसने कोड को नहीं, बल्कि कहानी को पढ़ा।

निष्कर्ष (The Bottom Line)

SkillVetBench AI कौशलों की जांच करने के लिए एक नया मानक है। यह निर्देशों को पढ़ने (छिपे हुए धोखे को पकड़ने के लिए) और कार्रवाई को देखने (वास्तविक अपराध को पकड़ने के लिए) को जोड़ता है।

शोधपत्र निष्कर्ष निकालता है कि AI को सुरक्षित रखने के लिए, हम अब केवल कोड को नहीं देख सकते। हमें यह देखना ही होगा कि जब कोई कौशल चलता है तो AI वास्तव में क्या करता है, क्योंकि असली खतरा अक्सर इस बात के बीच के अंतर में छिपा होता है कि एक कौशल क्या कहता है और वह वास्तव में क्या करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →