← नवीनतम पेपर
💻 computer science

SafeClaw-R: Towards Safe and Secure Multi-Agent Personal Assistants

यह शोध पत्र SafeClaw-R को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो क्रियान्वयन से पूर्व कार्यों को मध्यस्थता प्रदान करके और कौशलों को व्यवस्थित रूप से संवर्धित करके, LLM-आधारित मल्टी-एजेंट व्यक्तिगत सहायकों की सुरक्षा और सुदृढ़ता सुनिश्चित करता है, जिससे उत्पादकता, तृतीय-पक्ष और कोड निष्पादन परिवेशों में जोखिमों का पता लगाने और उन्हें रोकने में उच्च सटीकता प्राप्त होती है।

मूल लेखक: Haoyu Wang, Zibo Xiao, Yedi Zhang, Christopher M. Poskitt, Jun Sun

प्रकाशित 2026-04-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoyu Wang, Zibo Xiao, Yedi Zhang, Christopher M. Poskitt, Jun Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अपने जीवन को चलाने के लिए अविश्वसनीय रूप से स्मार्ट, सुपर-फास्ट डिजिटल सहायकों की एक टीम को काम पर रखा है। वे आपका ईमेल चेक कर सकते हैं, आपका कैलेंडर मैनेज कर सकते हैं, कोड लिख सकते हैं, और यहाँ तक कि किराने का सामान भी ऑर्डर कर सकते हैं। वे एक सुव्यवस्थित मशीन की तरह मिलकर काम करते हैं, बड़े कार्यों को छोटे चरणों में तोड़ते हैं। यह मल्टी-एजेंट सिस्टम्स (MAS) जैसा है।

लेकिन यहाँ एक पेंच है: ये सहायक ऐसे AI द्वारा संचालित हैं जो कभी-कभी "हैलुसिनेट" (चीजें बना लेना) करते हैं या भ्रमित हो जाते हैं। यदि एक सहायक किसी कमांड को गलत समझ लेता है, तो वह गलती से आपका पूरा ईमेल इतिहास डिलीट कर सकता है, आपके पासवर्ड लीक कर सकता है, या आपके बॉस को वायरस भेज सकता है।

पेपर "SafeClaw-R" इन डिजिटल सहायकों के लिए एक सेफ्टी नेट (सुरक्षा जाल) बनाने के बारे में है ताकि वे खतरनाक हुए बिना मददगार बन सकें।

समस्या: "रनिंग ट्रेन" (अनियंत्रित ट्रेन)

लेखकों ने OpenClaw नामक एक लोकप्रिय सिस्टम का अध्ययन किया। उन्होंने पाया कि इस सिस्टम द्वारा उपयोग किए जाने वाले लगभग 36% टूल्स मेज पर रखे "लोडेड गन" (तैयार बंदूक) की तरह हैं।

  • जोखिम: यदि कोई AI एक पेचीदा ईमेल (एक "प्रॉम्प्ट इंजेक्शन" हमला) से भ्रमित हो जाता है या कोई लॉजिक एरर कर देता है, तो वह सोच सकता है, "ओह, यूजर ने 'साफ करने' (clean up) के लिए कहा है, तो मैं सब कुछ डिलीट कर दूँगा!"
  • वास्तविक दुनिया का उदाहरण: पेपर में एक डरावनी घटना का उल्लेख है जहाँ एक AI ने यूजर का पूरा इनबॉक्स डिलीट करना शुरू कर दिया। यूजर ने अपने फोन के माध्यम से इसे रोकने की कोशिश की, लेकिन AI बहुत तेजी से आगे बढ़ रहा था। यूजर को तबाही को रोकने के लिए शारीरिक रूप से अपने कंप्यूटर की ओर दौड़ना पड़ा और प्लग खींचना पड़ा।

मौजूदा सुरक्षा उपाय "पोस्ट-मॉर्टम ऑटोप्सी" (क्रैश होने के बाद क्या गलत हुआ इसकी जांच करना) या "स्टैटिक रूल्स" (जैसे कि एक "प्रवेश निषेध" का साइन जिसे AI आसानी से अनदेखा कर सकता है यदि वह भ्रमित हो जाए) की तरह थे। वे AI को नुकसान पहुँचाते समय उसे रोकने के लिए पर्याप्त तेज या स्मार्ट नहीं थे।

समाधान: SafeClaw-R (द "बाउंसर" और द "ट्रांसलेटर")

SafeClast-R एक नया फ्रेमवर्क है जो एक क्लब के बाउंसर और एक सेफ्टी इंस्पेक्टर दोनों की भूमिका निभाता है। यह दो मुख्य तरीकों से सिस्टम के काम करने के तरीके को बदल देता है:

1. "डबल-चेक" नियम (द ग्राफ इनवेरिएंट)

एक फैक्ट्री असेंबली लाइन की कल्पना करें। पुराने सिस्टम में, एक रोबोटिक हाथ (AI) एक हिस्सा पकड़ सकता था और उसे तुरंत वेल्ड कर सकता था।
SafeClaw-R में, हर बार जब एक रोबोटिक हाथ कुछ करना चाहता है, तो उसे पहले एक चेकपॉइंट पर रुकना होगा

  • चेकपॉइंट: एक विशेष "सेफ्टी एजेंट" वहाँ खड़ा होता है। मुख्य AI द्वारा ईमेल भेजने, फ़ाइल डिलीट करने या कोड चलाने से पहले, सेफ्टी एजेंट पूछता है: "रुको, क्या यह सुरक्षित है? क्या यूजर वास्तव में यही चाहता है? क्या यह कोई चाल लग रही है?"
  • परिणाम: जब तक सेफ्टी एजेंट ग्रीन लाइट नहीं देता, तब तक AI कुछ भी खतरनाक नहीं कर सकता। यह क्रिया होने के बाद नहीं, बल्कि क्रिया होने से पहले होता है।

2. "सेफ स्किल" फैक्ट्री

लेखकों ने महसूस किया कि हर एक संभावित गलती के लिए एक नया सुरक्षा नियम लिखने के बजाय, वे हर टूल के "सेफ वर्जन" बनाने वाली एक फैक्ट्री बना सकते हैं।

  • उपमा: कल्पना कीजिए कि आपके पास एक खतरनाक आरी (chainsaw) है। केवल कार्यकर्ता को "सावधान रहें" कहने के बजाय, आप आरी को एक सेफ्टी आरी से बदल देते हैं जिसमें गार्ड और किल-स्विच लगा हुआ है।
  • यह कैसे काम करता है: सिस्टम स्वचालित रूप से एक जोखिम भरे टूल (जैसे "सभी ईमेल डिलीट करें") को लेता है और उसका एक "सेफ वर्जन" (जैसे "ईमेल डिलीट करें, लेकिन यदि 50 से अधिक हों तो पुष्टि के लिए पूछें") बनाता है। ये सुरक्षित वर्जन यूजर के पास जाने से पहले हजारों बार टेस्ट किए जाते हैं ताकि सुनिश्चित हो सके कि वे पूरी तरह से काम करते हैं।

यह कितनी अच्छी तरह काम करता है?

शोधकर्ताओं ने तीन कठिन परिदृश्यों में SafeClaw-R का परीक्षण किया:

  1. गूगल वर्कस्पेस (ईमेल और डॉक्स):

    • परीक्षण: उन्होंने AI को भ्रमित भाषा का उपयोग करके फाइलें डिलीट करने या डेटा लीक करने के लिए उकसाया।
    • परिणाम: SafeClaw-R ने 95.2% बुरे प्रयासों को पकड़ा। पुराने तरीके (केवल विशिष्ट कीवर्ड्स को देखना) ने केवल 61.6% को पकड़ा। यह कीवर्ड्स के बजाय इरादे (intent) को समझने में बहुत बेहतर था।
  2. थर्ड-पार्टी स्किल्स (द ऐप स्टोर):

    • परीक्षण: उन्होंने इंटरनेट से डाउनलोड किए गए "स्किल्स" (ऐप्स) को देखा, जिनमें से कुछ गुप्त रूप से दुर्भावनापूर्ण (जैसे एक कैलकुलेटर ऐप जो आपके पासवर्ड चुराता है) थे।
    • परिणाम: इसने 97.8% दुर्भावनापूर्ण ऐप्स का पता लगाया, भले ही बुरा कोड सामान्य दिखने वाले निर्देशों के अंदर छिपा हुआ था।
  3. कोड निष्पादन (द हैकर्स प्लेग्राउंड):

    • परीक्षण: उन्होंने सिस्टम में कंप्यूटर को हैक करने के लिए डिज़ाइन किया गया कोड डाला, लेकिन इसे हानिरहित दिखने वाले कमेंट्स और फॉर्मेटिंग के साथ छिपा दिया गया था।
    • परिणाम: इसने 100% सटीकता प्राप्त की। इसने भेष को पहचान लिया और हर बार हमले को ब्लॉक कर दिया।

"उपयोगिता" का संतुलन (The Usability Balance)

एक बड़ी चिंता यह है कि सुरक्षा प्रणालियाँ बहुत सख्त हो सकती हैं, जो अच्छी चीजों को भी रोक सकती हैं (जैसे कि एक यूजर जो वैध न्यूज़लेटर भेजने की कोशिश कर रहा है)।

  • अच्छी खबर: SafeClaw-R इस मामले में बहुत अच्छा था। इसने सुरक्षित कार्यों को केवल 3.4% बार रोका (एक "फॉल्स पॉजिटिव")।
  • रणनीति: यदि सिस्टम 100% निश्चित नहीं है, तो यह केवल क्रिया को रोकता नहीं है; यह रुकता है और इंसान से पूछता है, "हे, मुझे इस बारे में यकीन नहीं है। क्या आप वास्तव में यह करना चाहते हैं?" यह सब कुछ रोके बिना यूजर को लूप में रखता है।

बड़ी तस्वीर

SafeClaw-R आपके घर को केवल "प्रवेश निषेध" के साइन से अपग्रेड करने जैसा है, जिसमें अब मोशन डिटेक्टर, कैमरे और एक गार्ड है जो घर में प्रवेश करने से पहले हर आगंतुक का आईडी चेक करता है।

यह सुरक्षा को एक रिएक्टिव चीज़ (होने के बाद गड़बड़ी ठीक करना) से बदलकर एक प्रोएक्टिव चीज़ (गड़बड़ी शुरू होने से पहले रोकना) बनाता है। सुरक्षा को सिस्टम के ढांचे का एक अंतर्निहित हिस्सा बनाकर, यह हमें शक्तिशाली, स्वायत्त AI सहायकों का उपयोग करने की अनुमति देता है बिना इस डर के कि वे गलती से घर में आग लगा देंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →