← नवीनतम पेपर
🤖 AI

Formal Analysis and Supply Chain Security for Agentic AI Skills

यह शोध पत्र SkillFortify को प्रस्तुत करता है, जो एजेंटिक AI स्किल सप्लाई चेन के लिए पहला औपचारिक विश्लेषण ढांचा है, जो एक नवीन हमलावर मॉडल, सुदृढ़ स्टैटिक विश्लेषण और क्षमता-आधारित सैंडबॉक्सिंग को जोड़ता है ताकि दुर्भावनापूर्ण स्किल्स का पता लगाने में 100% शुद्धता और शून्य फॉल्स पॉजिटिव प्राप्त किया जा सके, जो मौजूदा ह्यूरिस्टिक टूल्स द्वारा छोड़ी गई महत्वपूर्ण सुरक्षा खामियों को संबोधित करता है।

मूल लेखक: Varun Pratap Bhardwaj

प्रकाशित 2026-03-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Varun Pratap Bhardwaj

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक उच्च-तकनीकी रोबोट सहायक बना रहे हैं। यह रोबोट अविश्वसनीय रूप से स्मार्ट है, लेकिन विशिष्ट कार्य करने के लिए जैसे कि "फ्लाइट बुक करना" या "मेरे बैंक स्टेटमेंट का विश्लेषण करना", आपको छोटे सॉफ्टवेयर एड-ऑन डाउनलोड करने होंगे जिन्हें "Skills" कहा जाता है।

इन Skills को अपने फोन पर मौजूद ऐप्स की तरह समझें, लेकिन एक भयानक अंतर के साथ: जब आप एक सामान्य ऐप इंस्टॉल करते हैं, तो वह आमतौर पर अपने स्वयं के एक छोटे से 'सैंडबॉक्स' में रहता है। लेकिन जब आप एक AI Skill इंस्टॉल करते हैं, तो आप वास्तव में उस कोड के टुकड़े को अपने पूरे घर, अपने बैंक खाते और अपनी डायरी की चाबियाँ सौंप रहे होते हैं, और फिर अपने रोबोट को कहते हैं, "जाओ, इसे मेरी मदद करने के लिए उपयोग करो।"

समस्या: AI ऐप्स का "वाइल्ड वेस्ट" (अराजक दुनिया)

पेपर एक संकट का वर्णन करता है जो 2026 की शुरुआत में हुआ था। क्योंकि हर कोई ये AI रोबोट बनाने की होड़ में था, इसलिए लोग बिना यह जांचे कि वे सुरक्षित हैं या नहीं, ओपन मार्केटप्लेस से Skills डाउनलोड करने लगे।

  • हमला: हैकर्स ने इसे भांप लिया। उन्होंने "ClawHavoc" नामक एक बड़ा अभियान चलाया जहाँ उन्होंने 1,200 से अधिक नकली, दुर्भावनापूर्ण (malicious) Skills अपलोड किए। ये केवल बग्स नहीं थे; ये डिजिटल चोर थे जिन्हें पासवर्ड और रहस्य चुराने के लिए डिज़ाइन किया गया था।
  • वर्तमान सुरक्षा उपायों की विफलता: सुरक्षा उद्योग ने इसे "ह्यूरिस्टिक" (heuristic) उपकरणों के साथ ठीक करने की कोशिश की। कल्पना कीजिए कि एक सुरक्षा गार्ड जो केवल उन लोगों को देखता है जिन्होंने लाल टोपियाँ पहनी हैं (एक ज्ञात बुरा पैटर्न)। यदि कोई चोर नीली टोपी पहनता है, तो गार्ड उसे अंदर जाने देता है। पेपर बताता है कि वर्तमान उपकरण इस गार्ड की तरह हैं: वे केवल उसी को पकड़ सकते हैं जिसे उन्होंने पहले देखा है। वे यह सिद्ध नहीं कर सकते कि कोई टूल सुरक्षित है; वे केवल यह कह सकते हैं, "मैंने लाल टोपी नहीं देखी।"

समाधान: SkillFortify (द "मैथमेटिकल बॉडीगार्ड")

लेखकों ने SkillFortify नामक एक नया टूल बनाया। केवल लाल टोपियों को खोजने के बजाय, SkillFortify एक गणितीय बॉडीगार्ड की तरह काम करता है जो 100% निश्चितता के साथ सिद्ध करता है कि एक Skill वह कुछ भी नहीं कर सकता जो उसे स्पष्ट रूप से करने की अनुमति नहीं दी गई है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करके यहाँ दिया गया है:

1. "DY-Skill" हमलावर (द अल्टीमेट चोर)

अपनी सुरक्षा का परीक्षण करने के लिए, लेखकों ने एक सैद्धांतिक "अल्टीमेट चोर" (एक प्रसिद्ध गणित मॉडल जिसे Dolev-Yao कहा जाता है) का आविष्कार किया। यह चोर संदेशों को रोक सकता है, नए संदेश बना सकता है और सिस्टम को धोखा दे सकता है।

  • उपमा: कल्पना कीजिए कि एक बैंक वॉल्ट का परीक्षण करने के लिए दुनिया के सबसे स्मार्ट और रचनात्मक चोर को काम पर रखना। यदि आपका वॉल्ट इस विशिष्ट चोर को रोक सकता है, तो आप जानते हैं कि यह किसी और को भी रोक लेगा। SkillFortify यह सिद्ध करता है कि हैकर कितना भी चतुर क्यों न हो, वह नियमों को नहीं तोड़ सकता।

2. "कैपेबिलिटी लैटिस" (द आईडी बैच सिस्टम)

प्रत्येक Skill को एक ID बैच पहनना होता है जिसमें यह सूचीबद्ध होता है कि वह क्या कर सकता है।

  • उपमा: कल्पना कीजिए कि एक होटल है।
    • एक हाउसकीपिंग बैच आपको कमरे साफ करने के लिए प्रवेश करने देता (फाइलें Read/Write करना)।
    • एक गेस्ट बैच आपको लॉबी में प्रवेश करने देता (डेटा Read करना)।
    • एक मैनेजर बैच आपको लोगों को नौकरी से निकालने देता (एडमिन)।
    • नियम: यदि कोई Skill दावा करता है कि उसके पास "हाउसकीपिंग" बैच है, लेकिन उसका कोड "मैनेजर के ऑफिस" को खोलने की कोशिश करता है, तो SkillFortify इसे तुरंत रोक देता है। यह गणितीय रूप से सिद्ध करता है कि Skill मैनेजर के ऑफिस तक पहुँच नहीं सकता, भले ही Skill सिस्टम को धोखा देने की कोशिश करे।

3. "डिपेंडेंसी ग्राफ" (द फैमिली ट्री ऑफ ट्रस्ट)

AI Skills को अक्सर काम करने के लिए अन्य Skills पर निर्भर रहना पड़ता है (जैसे, एक "ट्रैवल एजेंट" Skill को "वेदर" Skill की आवश्यकता होती है)।

  • उपमा: कल्पना कीजिए कि आप एक ठेकेदार को काम पर रख रहे हैं। आप उनके लाइसेंस की जांच करते हैं। लेकिन क्या होगा यदि वे एक सब-कॉन्ट्रैक्टर को काम पर रखते हैं जो एक अपराधी है?
    • SkillFortify शामिल प्रत्येक कोड के टुकड़े का एक फैमिली ट्री (वंशवृक्ष) बनाता है।
    • यह पूरे पेड़ को एक साथ जांचने के लिए एक शक्तिशाली मैथ सॉल्वर (SAT) का उपयोग करता है। यह पूछता है: "यदि मैं इस पूरे परिवार को इंस्टॉल करता हूँ, तो क्या परिवार के पेड़ में किसी का आपराधिक रिकॉर्ड है?" यदि हाँ, तो यह पूरे इंस्टॉलेशन को ब्लॉक कर देता है।

4. "ट्रस्ट स्कोर" (द रेप्यूटेशन सिस्टम)

सभी Skills एक समान नहीं होते। कुछ नए और अज्ञात हैं; अन्य पुराने और भरोसेमंद हैं।

  • उपमा: कोड के लिए क्रेडिट स्कोर के बारे में सोचें।
    • क्या लेखक ने अपना नाम हस्ताक्षरित किया? (Provenance)
    • क्या इसका उपयोग हजारों लोगों द्वारा बिना किसी समस्या के किया गया है? (Community)
    • क्या यह गणितीय परीक्षण में पास हुआ? (Behavioral)
    • ट्विस्ट: यदि किसी Skill को एक साल से अपडेट नहीं किया गया है, तो उसका ट्रस्ट स्कोर घटने (decay) लगता है, ठीक वैसे ही जैसे शेल्फ पर रखा फल सड़ने लगता है। यह डेवलपर्स को अपने Skills को ताज़ा और सुरक्षित रखने के लिए मजबूर करता है।

परिणाम: यह क्यों मायने रखता है

लेखकों ने अपने टूल का परीक्षण 540 अलग-अलग Skills (आधे अच्छे, आधे बुरे) पर किया।

  • स्कोर: इसने बुरे स्किल्स में से 97% को पकड़ा।
  • जादू: इसमें 0% फॉल्स पॉजिटिव (False Positives) थे। इसने कभी भी एक अच्छे Skill को बुरा होने का आरोप नहीं लगाया।
  • गति: इसने 1,000 Skills को एक सेकंड के दसवें हिस्से से भी कम समय में चेक किया।

बड़ी तस्वीर

पेपर का तर्क है कि हम अब AI Skills को साधारण ऐप्स की तरह नहीं मान सकते। क्योंकि इन Skills के पास हमारे प्रतिनिधि के रूप में कार्य करने की उच्च विशेषाधिकार (privileges) शक्ति है, हमें गणितीय गारंटी की आवश्यकता है, न कि केवल "सर्वश्रेष्ठ अनुमानों" की।

SkillFortify पहला ऐसा टूल है जो कहता है: "मैं केवल यह नहीं सोचता कि यह सुरक्षित है; मेरे पास एक गणितीय प्रमाण है कि इस कोड के लिए आपको नुकसान पहुँचाना असंभव है।" यह AI एड-ऑन्स की अराजक, जोखिम भरी दुनिया को एक सुरक्षित, विनियमित वातावरण में बदल देता है जहाँ हम अंततः अपने डिजिटल सहायकों पर भरोसा कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →