← नवीनतम पेपर
💻 computer science

MalSkillBench: A Runtime-Verified Benchmark of Malicious Agent Skills

यह शोध पत्र MalSkillBench को प्रस्तुत करता है, जो 3,944 दुर्भावनापूर्ण AI एजेंट कौशलों से युक्त पहला रनटाइम-सत्यापित बेंचमार्क है, यह प्रदर्शित करने के लिए कि वर्तमान डिटेक्शन टूल्स कोड और निर्देशों का संयुक्त रूप से विश्लेषण करने में विफल रहते हैं, जिससे एजेंट सप्लाई चेन को सुरक्षित करने के लिए टास्क इंटेंट (कार्य हेतु इरादा), कोड और प्रॉम्प्ट्स के बीच तर्क करने वाले एक नए दृष्टिकोण की आवश्यकता उत्पन्न होती है।

मूल लेखक: Wenbo Guo, Wei Zeng, Chengwei Liu, Xiaojun Jia, Yijia Xu, Lei Tang, Yong Fang, Yang Liu

प्रकाशित 2026-06-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenbo Guo, Wei Zeng, Chengwei Liu, Xiaojun Jia, Yijia Xu, Lei Tang, Yong Fang, Yang Liu

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने सॉफ्टवेयर लिखने में मदद करने के लिए एक सुपर-स्मार्ट रोबोट असिस्टेंट को काम पर रखा है। इस रोबोट को और भी शक्तिशाली बनाने के लिए, आप इसे इंटरनेट से "कौशल" (skills) डाउनलोड करने की अनुमति देते हैं—जैसे कि छोटे ऐप्स या प्लगइन्स जो रोबोट को विशिष्ट कार्य करने के बारे में बताते हैं, जैसे कि "टैक्स की गणना करना" या "इस दस्तावेज़ को फॉर्मेट करना।"

ये कौशल एक रेसिपी कार्ड (साधारण अंग्रेजी में लिखे गए निर्देश) और एक किचन अप्लायंस (वास्तविक कोड जो चलता है) से चिपके हुए एक छोटे ऐप की तरह हैं।

समस्या: "जहरीली रेसिपी" (The Poisoned Recipe)

शोधकर्ताओं ने पाया है कि हैकर्स इन कौशलों को ज़हरीला बना रहे हैं। वे ऐसे नकली कौशल बनाते हैं जो मददगार दिखते हैं लेकिन उनमें छिपे हुए जाल होते हैं।

  • कोड का जाल (The Code Trap): "किचन अप्लायंस" वाला हिस्सा गुप्त रूप से आपके पासवर्ड चुरा सकता है या आपकी फाइलें डिलीट कर सकता है।
  • निर्देश का जाल (The Instruction Trap): "रेसिपी कार्ड" वाला हिस्सा रोबोट को उसके सुरक्षा नियमों को अनदेखा करने या कुछ ऐसा करने के लिए धोखा दे सकता है जो उसे नहीं करना चाहिए, जैसे कि आपका निजी डेटा किसी अजनबी को भेजना।

डरावनी बात यह है कि ये दोनों जाल अक्सर मिलकर काम करते हैं। एक कौशल रेसिपी कार्ड पर निर्दोष दिख सकता है लेकिन उसके साथ एक खतरनाक मशीन जुड़ी हो सकती है, या इसके विपरीत।

बड़ी खाई: हमारे पास एक अच्छा टेस्ट नहीं था

अब तक, सुरक्षा विशेषज्ञ जो इन रोबोट कौशलों के लिए "स्किल डिटेक्टर्स" (इन रोबलों के लिए एंटीवायरस सॉफ्टवेयर की तरह) बनाने की कोशिश कर रहे थे, वे बिना किसी दिशा के काम कर रहे थे।

  • उनके पास परीक्षण करने के लिए बुरे कौशलों की सूची पर्याप्त बड़ी नहीं थी।
  • उनके पास मौजूद कुछ बुरे कौशल मुख्य रूप से एक ही प्रकार के थे (जैसे कि नकली "क्रिप्टो" घोटाले), इसलिए डिटेक्टर्स उन कौशलों को पकड़ने में बहुत अच्छे हो गए लेकिन अन्य किसी भी चीज़ को पकड़ने में बहुत खराब।
  • यह एक फायर अलार्म का परीक्षण करने जैसा था, जो केवल टोस्ट जलने के धुएं पर किया गया हो, और फिर यह दावा करना कि वह ग्रीस विस्फोट से होने वाली आग को भी पकड़ लेगा।

समाधान: MalSkillBench (द स्ट्रेस टेस्ट)

लेखकों ने MalSkillBench बनाया, जो इन दुर्भावनापूर्ण कौशलों के लिए पहला विशाल, सत्यापित परीक्षण मैदान है।

उन्होंने इसे कैसे बनाया:

  1. फैक्ट्री: उन्होंने हजारों नकली दुर्भावनापूर्ण कौशल उत्पन्न करने के लिए एक AI का उपयोग किया।
  2. सैंडबॉक्स: उन्होंने केवल यह अनुमान नहीं लगाया कि कोई कौशल बुरा है या नहीं। उन्होंने वास्तव में उस कौशल को एक सुरक्षित, अलग डिजिटल पिंजरे (एक "सैंडबॉक्स") के भीतर चलाया।
  3. प्रमाण: यदि कौशल ने पिंजरे के अंदर चलते समय कुछ बुरा किया (जैसे कि फाइल चुराने की कोशिश की या रोबोट को धोखा देने की कोशिश की), तो उसे एक "सत्यापित" (verified) लेबल मिला। यदि वह बुरा काम करने में विफल रहा, तो उन्होंने उसे फिर से कोशिश करने के लिए फैक्ट्री में वापस भेज दिया।

अंत में, उनके पास 3,944 सत्यापित बुरे कौशल और 4,000 अच्छे कौशल थे, जो 108 अलग-अलग प्रकार के हमलों को कवर करते हैं।

उन्होंने क्या पाया

जब उन्होंने इन नए, विशाल परीक्षण के विरुद्ध वर्तमान सुरक्षा उपकरणों का परीक्षण किया, तो परिणाम आश्चर्यजनक थे:

  1. कोड को पकड़ना आसान है, शब्दों को पकड़ना कठिन है: डिटेक्टर्स बुरे कोड (जैसे फ़ाइल में वायरस) को पकड़ने में बहुत अच्छे हैं लेकिन बुरे निर्देशों (जैसे रेसिपी में एक चाल) को पकड़ने में बहुत खराब हैं। बम को देखना एक झूठ को देखने से कहीं अधिक आसान है।
  2. "वाइल्ड" डेटा एक झूठ है: यदि आप डिटेक्टर्स का परीक्षण केवल इंटरनेट पर पाए गए कुछ बुरे कौशलों पर करते हैं, तो आपको गलत उत्तर मिलेगा। एक सुरक्षा उपकरण वाइल्ड डेटा पर हीरो की तरह दिख रहा था, लेकिन पूरे MalSkillBench पर परीक्षण करने पर, वह वास्तव में सबसे खराब में से एक निकला। यह एक ऐसे डॉक्टर की तरह था जो केवल सर्दी का इलाज करता है और सोचता है कि वह सब कुछ ठीक करने में जीनियस है, जब तक कि उसे एक टूटी हुई टांग वाले मरीज को नहीं दिया जाता।
  3. पुराने उपकरण फिट नहीं बैठते: आप केवल नियमित सॉफ़्टवेयर (बुरे कोड को पकड़ने के लिए) या केवल चैटबॉट्स (खराब प्रॉम्प्ट को पकड़ने के लिए) के लिए डिज़ाइन किए गए उपकरणों का उपयोग नहीं कर सकते हैं। एक दुर्भावनापूर्ण कौशल एक हाइब्रिड है। केवल समस्या के एक हिस्से के लिए उपकरण का उपयोग करने से दूसरा हिस्सा खुला रह जाता है।
  4. असली खतरा: सबसे खतरनाक कौशल केवल फाइलें चुराना नहीं हैं; वे रोबोट के दिमाग को धोखा देना हैं। कुछ कौशल रोबोट की पहचान को फिर से लिखने, उसके लक्ष्यों को बदलने या उसे उसके सुरक्षा नियमों को अनदेखा करने के लिए मजबूर करने की कोशिश करते हैं। वर्तमान उपकरण इन "माइंड-हैकिंग" हमलों के प्रति लगभग अंधे हैं।

निष्कर्ष (The Bottom Line)

हमारे AI सहायकों को सुरक्षित रखने के लिए, हमें केवल कोड को या केवल निर्देशों को नहीं देखना है। हमें उनके बीच के संबंध को समझना होगा: क्या यह निर्देश इस कार्य के लिए सही है, या यह एक चाल है?

यह पेपर डेवलपर्स को बेहतर डिटेक्टर्स बनाने में मदद करने के लिए पहला वास्तविक "स्ट्रेस टेस्ट" प्रदान करता है जो इन हाइब्रिड ट्रिक्स को पहचान सकें, न कि केवल पुराने, अधूरे डेटा के आधार पर अनुमान लगा सकें। उन्होंने अपना सारा डेटा और उपकरण सार्वजनिक कर दिए हैं ताकि अन्य लोग इस पहेली को सुलझाने में मदद कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →