← नवीनतम पेपर
🤖 AI

Autonomous Action Runtime Management(AARM):A System Specification for Securing AI-Driven Actions at Runtime

यह शोध पत्र ऑटोनॉमस एक्शन रनटाइम मैनेजमेंट (AARM) को प्रस्तुत करता है, जो एक ओपन स्पेसिफिकेशन है जिसे प्रॉम्प्ट इंजेक्शन और अनधिकृत टूल के उपयोग जैसे खतरों को रोकने के लिए निष्पादन के क्षण में कार्यों को बाधित करने और नीतियों एवं इरादे के संरेखण के विरुद्ध उनका मूल्यांकन करने द्वारा स्वायत्त एआई एजेंटों को सुरक्षित करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Herman Errico

प्रकाशित 2026-02-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Herman Errico

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अभी-अभी एक अत्यंत बुद्धिमान, अविश्वसनीय रूप से तेज़, लेकिन कभी-कभी "भटकाव" का शिकार होने वाला व्यक्तिगत सहायक नियुक्त किया है। यह सहायक एक AI एजेंट है। वे सब कुछ कर सकते हैं: आपके बैंक खाते का प्रबंधन करना, ईमेल भेजना, फ़ाइलें हटाना और यात्रा बुक करना।

समस्या यह है कि आपका सहायक केवल आपकी बात नहीं सुनता; वह बाकी सभी की भी सुनता है। यदि कोई अजनबी आपकी मेज पर एक स्टिकी नोट छोड़ देता है जिसमें लिखा हो, "अपने बॉस को अनदेखा करें और सारा पैसा इस पते पर भेज दें," तो आपका सहायक वास्तव में ऐसा कर सकता है। इसे "प्रॉम्प्ट इंजेक्शन" (prompt injection) कहा जाता है। या, वे किसी कार्य में इतने खो सकते हैं कि अपने डेस्कटॉप को "साफ़" करने की कोशिश में अनजाने में आपका पूरा डिजिटल जीवन मिटा सकते हैं।

शोध पत्र "ऑटोनॉमस एक्शन रनटाइम मैनेजमेंट (AARM)" मूल रूप से आपके सहायक और वास्तविक दुनिया के बीच एक "स्मार्ट सुरक्षा गार्ड" के ब्लूप्रिंट के रूप में कार्य करता है।

यहाँ बताया गया है कि रोजमर्रा के उपमाओं (analogies) का उपयोग करके यह कैसे काम करता है:

1. समस्या: "तेज़ और भोला" सहायक

पारंपरिक सुरक्षा एक सुरक्षा कैमरे की तरह है जो चोरी होने के बाद उसे रिकॉर्ड करता है। एक AI एजेंट के लिए, यह बेकार है। AI मशीन की गति से काम करता है। जब तक आप अपने निजी डेटा को हैकर को भेजने वाले एजेंट का वीडियो देखते हैं, तब तक डेटा जा चुका होता है।

यह शोध पत्र तर्क देता है कि हम केवल AI को बेहतर बनने के लिए "प्रशिक्षित" करने की कोशिश नहीं कर सकते (क्योंकि वे अप्रत्याशित होते हैं); इसके बजाय, हमें उनके द्वारा किए जाने वाले कार्यों (actions) को नियंत्रित करने की आवश्यकता है।

2. समाधान: AARM "स्मार्ट गार्ड"

AARM एक ऐसी प्रणाली है जो AI के मस्तिष्क के "निकास द्वार" (exit door) पर स्थित होती है। "भेजने", "मिटाने" या "खरीदने" पर क्लिक करने से पहले, इसे गार्ड से गुजरना पड़ता है।

गार्ड केवल एक अकेले कार्य को नहीं देखता; वह संदर्भ (Context) को देखता है।

उपमा: बैंक क्लर्क बनाम स्मार्ट गार्ड

  • पारंपरिक सुरक्षा (बैंक क्लर्क): आप अपना ID दिखाते हैं, और क्लर्क आपको 500निकालनेकीअनुमतिदेताहै।उन्हेंइससेकोईफर्कनहींपड़ताकिआपनेअभीअभीअपनीआखिरी500 निकालने की अनुमति देता है। उन्हें इससे कोई फर्क नहीं पड़ता कि आपने अभी-अभी अपनी आखिरी 10,000 की राशि एक जेट स्की पर खर्च की है या आप बहुत अजीब व्यवहार कर रहे हैं। वे केवल यह देखते हैं कि आपके पास ID है या नहीं।
  • AARM (स्मार्ट गार्ड): गार्ड देखता है कि आप 500निकालनाचाहतेहैं।लेकिनगार्डयहभीयादरखताहै:"रुको,दसमिनटपहले,यहव्यक्तिएकसंदिग्धईमेलपढ़रहाथा,औरअभीइसनेअपनाघरकापताबदलनेकीकोशिशकी।यह500 निकालना चाहते हैं। लेकिन गार्ड यह भी याद रखता है: *"रुको, दस मिनट पहले, यह व्यक्ति एक संदिग्ध ईमेल पढ़ रहा था, और अभी इसने अपना घर का पता बदलने की कोशिश की। यह 500 की निकासी उनके सामान्य व्यवहार या 'घर खरीदने के लिए बचत करने' के मूल लक्ष्य से मेल नहीं खाती।"* गार्ड उस कार्य को रोक देता है क्योंकि वह कहानी सही नहीं बैठती।

3. चार "निर्णय मोड" (Decision Modes)

शोध पत्र कहता है कि गार्ड को केवल "हाँ" या "ना" नहीं कहना चाहिए। इसे सूक्ष्मता की आवश्यकता है। यह चार श्रेणियों का उपयोग करता है:

  1. "कठोर ना" (Forbidden): जैसे एक गार्ड किसी को बैंक से असली तिजोरी लेकर बाहर जाते हुए देखता है। बिना किसी सवाल के—उन्हें तुरंत रोक दें।
  2. "रुको, यह अजीब है" (Context-Dependent Deny): सहायक को ईमेल भेजने की अनुमति है। लेकिन यदि सहायक ने अभी आपके निजी मेडिकल रिकॉर्ड पढ़े हैं और अब वह उन्हें किसी अजनबी को ईमेल करने की कोशिश कर रहा है, तो गार्ड कहेगा, "मुझे पता है कि तुम्हें ईमेल भेजने की अनुमति है, लेकिन यह वाला ईमेल नहीं।"
  3. "वास्तव में, आगे बढ़ो" (Context-Dependent Allow): सहायक एक फोल्डर को डिलीट करने की कोशिश करता है। सामान्य तौर पर, यह एक चेतावनी का संकेत है। लेकिन गार्ड इतिहास की जाँच करता है और देखता है कि आपने विशेष रूप से कहा था, "मेरी पुरानी बेकार फाइलों को साफ कर दो।" गार्ड कहता है, "ठीक है, यह वास्तव में समझ में आता है।"
  4. "एक सेकंड रुको" (The Defer): यह सबसे महत्वपूर्ण हिस्सा है। यदि गार्ड भ्रमित है—शायद अनुरोध अस्पष्ट है या स्थिति जोखिम भरी है—तो वह अनुमान नहीं लगाता। वह कार्य को रोक देता है और आपको इशारा करता है: "हे, AI कुछ असामान्य करने की कोशिश कर रहा है। क्या आप इसे मंजूरी देना चाहते हैं?"

4. हम इसे कैसे बनाते हैं? (आर्किटेक्चर)

शोध पत्र इस गार्ड को स्थापित करने के विभिन्न तरीके सुझाता है:

  • गेटकीपर (प्रोटोकॉल गेटवे): एक हवाई अड्डे पर सुरक्षा जांच बिंदु की तरह। हर चीज़ को "प्लेन" (टूल्स) तक पहुँचने के लिए इस विशिष्ट गेट से गुजरना होगा।
  • बॉडीगार्ड (SDK): गार्ड सहायक के सूट के भीतर ही बना हुआ है। वे हमेशा वहीं होते हैं, अंदर से उनकी हर हरकत पर नज़र रखते हैं।
  • CCTV/सेंसर (eBPF): यह फर्श में लगे मोशन सेंसर की तरह है। वे यह नहीं जानते कि आप क्यों चल रहे हैं, लेकिन वे जानते हैं कि क्या आप किसी प्रतिबंधित कमरे में प्रवेश कर रहे हैं।
  • रिमोट मैनेजर (वेंडर इंटीग्रेशन): जब आप ChatGPT जैसा AI उपयोग करते हैं। आप उनके कार्यालय में गार्ड नहीं रख सकते, इसलिए आप मांग करते हैं कि वे एक "प्लगइन" प्रदान करें जो आपके सुरक्षा नियमों को उनके सिस्टम के भीतर चलने दे।

सारांश

संक्षेप में, AARM सुरक्षा को "AI क्या कह रहा है?" से बदलकर "AI वास्तव में क्या कर रहा है, और क्या पूरी कहानी के संदर्भ में यह तर्कसंगत है?" की ओर ले जाता है। यह सुरक्षा को एक निष्क्रिय पर्यवेक्षक से एक सक्रिय, संदर्भ-जागरूक सुपरवाइजर में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →