← नवीनतम पेपर
🤖 AI

ColluSkill: Adversarial Cross-Skill Composition for Evading Agent Skill Scanners

यह शोध पत्र ColluSkill प्रस्तुत करता है, जो एक ऐसा एडवर्सरियल फ्रेमवर्क है जो दुर्भावनापूर्ण इरादों को परस्पर निर्भर, स्थानीय रूप से सौहार्दपूर्ण सब-पेलोड्स में विभाजित करके मौजूदा स्किल स्कैनर्स से बचता है, और ChainGuard का प्रस्ताव देता है, जो वर्कफ़्लो-स्तरीय जोखिमों का विश्लेषण करके इन क्रॉस-स्किल कंपोज़िशन हमलों को प्रभावी ढंग से कम करने वाला एक संदर्भ-जागरूक रक्षा तंत्र है।

मूल लेखक: Puyu Zeng, Simeng Qin, Jingzhi Li, Ju Jia, Zheli Liu, Xiaojun Jia

प्रकाशित 2026-08-11
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Puyu Zeng, Simeng Qin, Jingzhi Li, Ju Jia, Zheli Liu, Xiaojun Jia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ आपका कंप्यूटर केवल आदेशों का पालन ही नहीं करता, बल्कि उसके पास "कौशल" (skills) का एक टूलबॉक्स भी है जिसे वह उठा सकता है और उपयोग कर सकता है। इन कौशलों को लेगो ब्रिक्स (Lego bricks) या आपके फोन के ऐप्स की तरह समझें: एक "फाइल खोजें" का ईंट, एक "ईमेल भेजें" की ईंट, या एक "दस्तावेज़ पढ़ें" की ईंट। इन्हें एजेंट स्किल्स (Agent Skills) कहा जाता है, और ये स्मार्ट कंप्यूटर प्रोग्रामों (जिन्हें AI एजेंट्स के रूप में जाना जाता है) को जटिल कार्यों को करने के लिए इन उपकरणों को आपस में जोड़ने की अनुमति देते हैं। लेकिन, ठीक वास्तविक जीवन की तरह, बॉक्स में मौजूद हर उपकरण सुरक्षित नहीं होता है। कुछ छिपे हुए जाल हो सकते हैं जो आपके रहस्यों को चुराने या आपके होमवर्क को डिलीट करने के लिए बनाए गए हों। चीजों को सुरक्षित रखने के लिए, हमारे पास स्किल स्कैनर्स (Skill Scanners) हैं—डिजिटल सुरक्षा गार्ड जो किसी भी नए टूल को आपके टूलबॉक्स में आने देने से पहले उसकी जांच करते हैं। वे निर्देशों और कोड को देखते हैं ताकि यह सुनिश्चित किया जा सके कि अंदर कुछ भी चालाकी से छिपा हुआ न हो। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह यह है: क्या होगा यदि बुरे लोग एक बड़ा, स्पष्ट जाल छिपाने की कोशिश नहीं करते, बल्कि इसके बजाय तीन या चार छोटे, मासूम दिखने वाले टुकड़ों को चुपके से शामिल कर देते हैं जो केवल तब खतरनाक होते हैं जब उन्हें एक साथ जोड़ा जाता है?

यह बिल्कुल वही है जिसे पेपर ColluSkill एक्सप्लोर करता है। लेखकों ने उन सुरक्षा गार्डों को धोखा देने का एक चतुर तरीका खोजा है। उन्होंने पाया कि वर्तमान स्कैनर उन बाउंसरों की तरह हैं जो क्लब में प्रवेश करने वाले हर व्यक्ति की एक-एक करके जांच करते हैं। यदि कोई व्यक्ति अपने आप में निर्दोष दिखता है, तो उसे अंदर जाने दिया जाता है। लेकिन शोधकर्ताओं ने दिखाया कि आप एक खतरनाक योजना को कई छोटे, मासूम दिखने वाले हिस्सों में विभाजित कर सकते हैं। व्यक्तिगत रूप से, प्रत्येक हिस्सा बाउंसर की जांच पास कर लेता है। लेकिन एक बार जब वे सभी अंदर आ जाते हैं और सही क्रम में काम करते हैं, तो वे एक खतरनाक हमले के रूप में वापस जुड़ जाते हैं। पेपर इसे ColluSkill कहता है, जो एक खतरनाक योजना को "सहयोगी" (colluding) कौशलों की एक श्रृंखला में तोड़ने का एक ढांचा है। यह एक स्मार्ट AI का उपयोग करता है ताकि यह योजना बनाई जा सके कि ये टुकड़े कैसे फिट होते हैं और फिर यह उन्हें तब तक बदलता रहता है जब तक कि वे स्कैनर के लिए पूरी तरह से सुरक्षित न दिखने लगें, भले ही वे काम शुरू होते ही तबाही मचाने के लिए तैयार हों।

वापसी में मुकाबला करने के लिए, पेपर एक नया रक्षक पेश करता है जिसे ChainGuard कहा जाता है। केवल एक टूल को अलग से जांचने के बजाय, ChainGuard पूरी तस्वीर देखता है: "टूलबॉक्स में पहले से कौन से टूल्स मौजूद हैं? यह नया टूल उनके साथ कैसे जुड़ता है?" यह एक ऐसे सुरक्षा गार्ड की तरह है जो न केवल आपकी आईडी चेक करता है, बल्कि यह भी पूछता है, "आप किससे मिल रहे हैं, और आप मिलकर क्या करने की योजना बना रहे हैं?" शोधकर्ताओं ने अपने विचारों का परीक्षण छह अलग-अलग सुरक्षा स्कैनरों पर किया और पाया कि उनका तरीका अविश्वसनीय रूप से प्रभावी था। ColluSkill हमला औसतन 96.0% बार स्कैनरों से बच निकलने में सफल रहा, जबकि पुराने हमलों के तरीके केवल लगभग 37.8% बार ही सफल हो पाते थे। हालाँकि, जब उन्होंने ChainGuard का उपयोग किया, तो हमले की सफलता दर नाटकीय रूप से गिरकर 22.5% हो गई, जबकि इसने 99.5% अच्छे, हानिरहित टूल्स को भी गुजरने दिया।

चालाक लेगो सेट की कहानी

आइए गहराई से समझते हैं कि यह सब कैसे काम करता है, एक बहुत ही विशिष्ट प्रकार की डकैती की कहानी का उपयोग करते हुए।

समस्या: "बहुत-स्मार्ट" सुरक्षा गार्ड
कल्पना कीजिए कि आप एक उच्च-सुरक्षा वाली इमारत में एक वर्जित "डेटा एक्सफिल्ट्रेशन स्क्रिप्ट" (एक प्रोग्राम जो आपके रहस्य चुराता है) को चुपके से ले जाने की कोशिश कर रहे हैं। दरवाजे पर सुरक्षा गार्ड के पास एक स्कैनर है। यदि आप "चोरी किया गया डेटा" लेबल वाला एक बड़ा, लाल बॉक्स लाते हैं, तो स्कैनर चिल्लाता है, "ब्लॉक!" और आपको रोक देता है।

शोधकर्ताओं ने पाया कि वर्तमान सुरक्षा स्कैनर बिल्कुल इसी गार्ड की तरह काम करते हैं। वे एक समय में एक कौशल की जांच करते हैं। वे इसके निर्देशों, इसकी अनुमतियों और इसके कोड की जांच करते हैं। यदि एक अकेला कौशल सुरक्षित दिखता है, तो उसे "पास" मिल जाता है। समस्या यह है कि ये गार्ड पूरी टीम को नहीं देखते। उन्हें यह एहसास नहीं होता कि यदि आप तीन अलग-अलग लोग लाते हैं, जिनमें से प्रत्येक एक पहेली का एक छोटा, हानिरहित टुकड़ा ले जा रहा है, तो वे तीनों एक बार अंदर जाने के बाद उस वर्जित पहेली को जोड़ने में सक्षम हो सकते हैं।

हमला: ColluSkill (छलावरण का मास्टर)
लेखकों ने ColluSkill नामक एक विधि बनाई है जो इस ब्लाइंड स्पॉट का फायदा उठाने के लिए है। इसे एक मास्टर चोर के रूप में सोचें जो एक बड़ा बम लाने के बजाय, तीन अलग-अलग, मासूम दिखने वाली चीजें लाने का निर्णय लेता है:

  1. कौशल A (द स्काउट): "मैं बस कमरे की फाइलों को देखना चाहता हूँ।" (मासूम दिखता है)।
  2. कौशल B (द स्क्राइब): "मैं बस जो देखता हूँ उसे लिखना चाहता हूँ।" (मासूम दिखता है)।
  3. कौशल C (द मैसेंजर): "मैं बस बाहर एक संदेश भेजना चाहता हूँ।" (मासूम दिखता है)।

व्यक्तिगत रूप से, सुरक्षा स्कैनर प्रत्येक की जांच करता है और कहता है, "ज़रूर, यह ठीक है।" लेकिन यहाँ ट्रिक है: ColluSkill एक स्मार्ट AI का उपयोग करता है ताकि यह योजना बनाई जा सके कि ये तीनों कैसे जुड़ते हैं।

  • कौशल A एक गुप्त फ़ाइल पाता है।
  • कौशल A उस फ़ाइल को कौशल B को सौंपता है।
  • कौशल B फ़ाइल की सामग्री को एक संदेश में लिखता है।
  • कौशल B उस संदेश को कौशल C को सौंपता है।
  • कौशल C संदेश को बाहर भेज देता है।

ColluSkill का जादू दो चरणों में है:

  1. चेन प्लानिंग (Chain Planning): AI सही क्रम तय करता है ताकि "खतरा" फैला हुआ रहे। कोई भी एकल कौशल अपने आप में कुछ बुरा नहीं करता; वे बस चीजें आगे बढ़ाते हैं।
  2. स्कैनर फीडबैक (Scanner Feedback): AI कौशलों को चुपके से डालने की कोशिश करता है। यदि स्कैनर किसी एक को फ्लैग करता है (जैसे, "कौशल C थोड़ा संदिग्ध लग रहा है"), तो AI इसे अधिक मासूम दिखने के लिए फिर से लिखता है, और फिर से प्रयास करता है। यह तब तक ऐसा करता रहता है जब तक कि प्रत्येक हिस्सा जांच पास न कर ले।

अपने परीक्षणों में, यह विधि भयानक रूप से प्रभावी थी। जब उन्होंने इन श्रृंखलाओं को छह अलग-अलग वास्तविक दुनिया के स्कैनरों के सामने आज़माया, तो ColluSkill 96.0% बार सफल रहा। इसकी तुलना में पुराने तरीकों से, जो बिना इस स्मार्ट प्लानिंग के केवल कोड को विभाजित करते थे, केवल लगभग 36.7% बार सफलता मिली। शोधकर्ताओं ने पाया कि केवल कोड को विभाजित करना पर्याप्त नहीं था; प्लानिंग और रीराइटिंग ही वह चीज़ थी जिसने अंतर पैदा किया।

रक्षा: ChainGuard (द डिटेक्टिव)
तो, हम इसे कैसे रोक सकते हैं? पेपर ChainGuard का प्रस्ताव करता है। केवल लोगों को एक-एक करके जांचने वाले गार्ड के बजाय, ChainGuard एक जासूस है जो पूरे समूह को देखता है।

जब कोई नया कौशल प्रवेश करना चाहता है, तो ChainGuard पूछता है: "कमरे में पहले से कौन है? वे क्या कर रहे हैं?"

  • यदि कौशल C (द मैसenger) प्रवेश करने की कोशिश करता है, तो ChainGuard स्थापित कौशलों को देखता है और देखता है कि कौशल A (द स्काउट) और कौशल B (द स्क्राइब) पहले से ही वहां हैं।
  • उसे एहसास होता है: "रुको जरा। यदि A रहस्य खोजता है, B उन्हें लिखता है, और C उन्हें भेज देता है, तो यह एक चोरी की चेन है!"
  • भले ही C अपने आप में निर्दोष दिखता हो, ChainGuard इसे ब्लॉक कर देता है क्योंकि यह उन अन्यों के साथ मिलकर क्या कर सकता है, इस कारण से।

परिणाम प्रभावशाली थे। जब शोधकर्ताओं ने ChainGuard का उपयोग किया, तो ColluSkill हमले की सफलता दर 96.0% से गिरकर 22.5% हो गई। महत्वपूर्ण बात यह है कि ChainGuard ने सब कुछ ब्लॉक नहीं किया; इसने अभी भी 99.5% अच्छे, हानिरहित वर्कफ़्लो को गुजरने दिया। इसने घर बनाने वाले दोस्तों की टीम और डकैती की योजना बनाने वाली चोरों की टीम के बीच अंतर करना सीख लिया।

क्या यह वास्तव में वास्तविक दुनिया में काम करता है?
शोधकर्ताओं ने केवल सुरक्षा स्कैनर पर ही नहीं रुक गए। उन्होंने परीक्षण किया कि क्या ये चालाक श्रृंखलाएं वास्तव में OpenCode, Claude Code, और Codex जैसे वास्तविक AI कोडिंग टूल्स पर चल सकती हैं। उन्होंने पाया कि श्रृंखलाएं पूरी तरह से काम करती हैं। OpenCode पर, हमला श्रृंखलाएं (attack chains) 89.5% बार सफलतापूर्वक सक्रिय हुईं (GPT-5.5 के साथ)। यह साबित करता है कि खतरा केवल सैद्धांतिक नहीं है; यदि कोई बुरा व्यक्ति इस पद्धति का उपयोग करता है, तो वे वास्तव में इन कंप्यूटरों पर इन हमलों को अंजाम दे सकते हैं।

निष्कर्ष
पेपर निष्कर्ष निकालता है कि हमारे पास एक नए प्रकार की सुरक्षा समस्या है। हम केवल यह जांच नहीं कर सकते कि एक अकेला टूल सुरक्षित है या नहीं; हमें यह जांचना होगा कि कौशलों का एक समूह सुरक्षित है या नहीं जब वे एक साथ काम करते हैं। ColluSkill हमला दिखाता है कि एक बुरी योजना को छोटे, मासूम टुकड़ों में विभाजित करना वर्तमान सुरक्षा प्रणालियों को बायपास करने का एक बहुत शक्तिशाली तरीका है। लेकिन अच्छी खबर यह है कि ChainGuard एक रास्ता दिखाता है: यदि हम यह देखना शुरू करते हैं कि टूल्स कैसे जुड़ते और इंटरैक्ट करते हैं, तो हम इन चालाक श्रृंखलाओं को नुकसान पहुँचाने से पहले पकड़ सकते हैं। शोधकर्ता सुझाव देते हैं कि AI सुरक्षा का भविष्य केवल बेहतर स्कैनरों के बारे में नहीं है, बल्कि स्मार्ट, संदर्भ-जागरूक (context-aware) गार्डों के बारे में है जो पूरी कहानी को समझते हैं, न कि केवल व्यक्तिगत अध्यायों को।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →