← नवीनतम पेपर
🤖 AI

AgentWall: A Runtime Safety Layer for Local AI Agents

यह शोध पत्र AgentWall को पेश करता है, जो स्थानीय AI एजेंटों के लिए एक ओपन-सोर्स रनटाइम सुरक्षा परत है जो मानव निरीक्षण के साथ घोषणात्मक नीतियों (declarative policies) के विरुद्ध प्रस्तावित कार्यों को इंटरसेप्ट और मूल्यांकित करती है, जिससे प्रमुख विकास परिवेशों में 92.9% प्रवर्तन सटीकता और सब-मिलीसेकंड ओवरहेड प्राप्त होता है।

मूल लेखक: Ashwin Aravind

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ashwin Aravind

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अपने कंप्यूटर में मदद करने के लिए एक बेहद बुद्धिमान, अति-उत्साही सहायक को काम पर रखा है। यह सहायक अविश्वसनीय रूप से स्मार्ट है और आपकी फ़ाइलें पढ़ सकता है, कोड लिख सकता है, प्रोग्राम इंस्टॉल कर सकता है, और यहाँ तक कि इंटरनेट भी ब्राउज़ कर सकता है। हालाँकि, क्योंकि वह मदद करने के लिए बहुत उत्सुक है, वह गलती से आपके महत्वपूर्ण दस्तावेज़ों को डिलीट कर सकता है, गलती से कोई वायरस इंस्टॉल कर सकता है, या आपकी बात का गलत मतलब निकालकर आपका निजी बैंक अकाउंट खोलने की कोशिश कर सकता है।

यही वह समस्या है जिसे AgentWall हल करता है।

यहाँ इस पेपर के विचारों का रोज़मर्रा के उदाहरणों (analogies) का उपयोग करके एक सरल विवरण दिया गया है:

समस्या: "अति-उत्साही इंटर्न" (The Over-Eager Intern)

वर्तमान में, जब डेवलपर्स अपने कंप्यूटर पर AI एजेंटों का उपयोग करते हैं, तो वे इन एजेंटों को अपनी हार्ड ड्राइव और टूल्स तक सीधी पहुँच दे देते हैं। यह एक नए इंटर्न को पूरे ऑफिस, सर्वर रूम और CEO की डेस्क की चाबियाँ देने जैसा है, और बस यह कहना कि, "जाओ, जो गड़बड़ है उसे ठीक कर दो।"

यदि इंटर्न भ्रमित हो जाता है, किसी फर्जी ईमेल (एक "प्रॉम्ट इंजेक्शन") के झांसे में आ जाता है, या बस एक गलत अनुमान लगा लेता है, तो वह वास्तविक नुकसान पहुँचा सकता है। मौजूदा सुरक्षा उपाय सर्वर रूम पर "छूना मना है" का बोर्ड लगाने जैसे हैं, लेकिन अगर इंटर्न को लगता है कि वह मदद कर रहा है, तो वह उन्हें अनदेखा कर सकता है।

समाधान: "सुरक्षा गार्ड और गेटकीपर" (The Security Guard & Gatekeeper)

AgentWall आपके AI सहायक और आपके कंप्यूटर के बीच एक स्मार्ट सुरक्षा गार्ड की तरह काम करता है। यह AI को सोचने या योजना बनाने से नहीं रोकता; यह बस तब तक कुछ भी करने से रोकता है जब तक कि गार्ड उस योजना की जाँच न कर ले।

इसे एक क्लब के बाउंसर की तरह समझें:

  1. AI वह मेहमान है जो अंदर आने की कोशिश कर रहा है।
  2. आपका कंप्यूटर वह क्लब है।
  3. AgentWall वह बाउंसर है जो मेहमान का आईडी चेक करता है और पूछता है, "आप क्या करने की कोशिश कर रहे हैं?"

यह कैसे काम करता है (तीन नियम)

जब AI कहता है, "मैं इस फ़ाइल को डिलीट करना चाहता हूँ" या "मैं यह नया प्रोग्राम इंस्टॉल करना चाहता हूँ," तो AgentWall रुकता है और एक नियम पुस्तिका (rulebook) की जाँच करता है। फिर यह तीन में से एक निर्णय लेता है:

  1. ग्रीन लाइट (अनुमति दें - Allow): "यह सुरक्षित लग रहा है। आप आगे बढ़ सकते हैं।"
    • उदाहरण: AI आपके प्रोजेक्ट फोल्डर में एक टेक्स्ट फ़ाइल पढ़ना चाहता है। गार्ड कहता है, "ज़रूर, यह ठीक है।"
  2. रेड लाइट (मना करें - Deny): "बिल्कुल नहीं। यह खतरनाक है।"
    • उदाहरण: AI आपकी पासवर्ड फ़ाइल को डिलीट करने की कोशिश करता है या ऐसा कमांड चलाता है जिससे आपकी हार्ड ड्राइव खाली हो जाए। गार्ड कहता है, "बिल्कुल नहीं," और इसे तुरंत रोक देता है।
  3. येलो लाइट (पूछें - Ask): "यह जोखिम भरा है। मुझे मालिक से पूछना होगा।"
    • उदाहरण: AI एक नया सॉफ्टवेयर पैकेज इंस्टॉल करना चाहता है। गार्ड कहता है, "मैं निर्णय नहीं ले सकता। मैं आपकी स्क्रीन पर एक मैसेज दिखाऊँगा और पूछूँगा, 'क्या आप यह करना चाहते हैं?'"

यह अलग क्यों है?

अधिकांश सुरक्षा उपकरण AI को गलत चीज़ें कहने से रोकने की कोशिश करते हैं। AgentWall AI को गलत चीज़ें करने से रोकता है।

  • "ग्लास वॉल" (कांच की दीवार) का उदाहरण: कल्पना करें कि AI एक कांच की दीवार के पीछे है। वह सब कुछ देख सकता है और उन चीज़ों की ओर इशारा कर सकता है जिन्हें वह बदलना चाहता है, लेकिन वह उन्हें छू नहीं सकता। AgentWall वह दीवार है जो केवल तभी एक छोटा सा झरोखा खोलती है जब आप (इंसान) कहते हैं, "हाँ, यह ठीक है।"

इस पेपर में वास्तव में क्या टेस्ट किया गया?

लेखकों ने एक वर्किंग प्रोटोटाइप (जैसे इस सुरक्षा गार्ड का बीटा वर्शन) बनाया और 14 अलग-अलग परिदृश्यों के साथ इसका परीक्षण किया। यहाँ उनके निष्कर्ष दिए गए हैं:

  • यह काम करता है: इसने लगभग हर टेस्ट में (93% सटीकता के साथ) खतरनाक कार्यों (जैसे सिस्टम फ़ाइलें डिलीट करना या पासवर्ड चुराना) को सफलतापूर्वक रोका।
  • यह तेज़ है: गार्ड नियमों की जाँच इतनी तेज़ी से (एक मिलीसेकंड से भी कम समय में) करता है कि आपको देरी का अहसास भी नहीं होता। यह एक ऐसे बाउंसर की तरह है जो बिना लाइन में खड़ा किए तुरंत आईडी चेक कर देता है।
  • यह रिकॉर्ड रखता है: जब भी AI कुछ करने की कोशिश करता है, AgentWall उसे एक "डायरी" में लिख देता है। यदि बाद में कुछ गलत होता है, तो आप डायरी देखकर देख सकते हैं कि AI ने क्या करने की कोशिश की थी और उसे क्यों रोका गया था।
  • यह अनुकूलनीय (Adaptable) है: आप AI के काम करते समय भी नियमों को बदल सकते हैं। यदि आप तय करते हैं कि, "वास्तव में, आज और फ़ाइलें डिलीट नहीं करनी हैं," तो आप नियम पुस्तिका को अपडेट कर सकते हैं, और गार्ड बिना कंप्यूटर को रीस्टार्ट किए तुरंत उसे लागू करता है।

यह क्या नहीं है?

पेपर स्पष्ट रूप से बताता है कि AgentWall क्या नहीं है:

  • यह कोई जादुई ढाल नहीं है जो आपके कंप्यूटर को 100% हैक-प्रूफ बना दे।
  • यह AI को ठीक नहीं करता यदि AI केवल "मूर्खतापूर्ण" या भ्रमित है; यह बस मूर्खतापूर्ण विचारों को वास्तविक कार्यों में बदलने से रोकता है।
  • यह आपकी सावधानी की आवश्यकता को खत्म नहीं करता; यह बस आपको एक सुरक्षा जाल (safety net) देता है।

मुख्य निष्कर्ष (The Bottom Line)

जैसे-जैसे AI एजेंट स्मार्ट होते जा रहे हैं और हमारे कंप्यूटरों पर अधिक काम करना शुरू कर रहे हैं, हमें यह सुनिश्चित करने के तरीके की आवश्यकता है कि वे अनजाने में सब कुछ खराब न कर दें। AgentWall एक ऐसा टूल है जो AI के विचारों और आपके कंप्यूटर के कार्यों के बीच एक "सुरक्षा परत" (safety layer) रखता है, यह सुनिश्चित करता है कि हर कदम की जाँच, अनुमोदन और रिकॉर्ड किया जाए। यह एक अनियंत्रित AI को एक सहायक, पर्यवेक्षित (supervised) असिस्टेंट में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →