← नवीनतम पेपर
🤖 AI

Before the Tool Call: Deterministic Pre-Action Authorization for Autonomous AI Agents

यह शोध पत्र ओपन एजेंट पासपोर्ट (OAP) को प्रस्तुत करता है, जो एक नियतात्मक (deterministic), नीति-आधारित ढांचा है जो अनधिकृत कार्यों को रोकने के लिए निष्पादन से पहले स्वायत्त एआई टूल कॉल्स को इंटरसेप्ट और अधिकृत करता है, जो कम विलंबता (latency) बनाए रखते हुए प्रतिकूल परीक्षणों में सोशल इंजीनियरिंग हमलों के विरुद्ध 100% सुरक्षा प्रदर्शित करता है।

मूल लेखक: Uchi Uchibeke

प्रकाशित 2026-03-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Uchi Uchibeke

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Deterministic Pre-Action Authorization for Autonomous AI Agents" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ हिंदी अनुवाद दिया गया है।

बड़ी समस्या: AI एजेंटों के पास चाबियाँ तो हैं, लेकिन बाउंसर नहीं हैं

कल्पना कीजिए कि आपने अपने व्यवसाय को चलाने के लिए एक सुपर-स्मार्ट रोबोट सहायक (एक AI एजेंट) को काम पर रखा है। आपने इस रोबोट को अपने कार्यालय, अपने बैंक खाते और अपने ईमेल की मास्टर चाबी दे दी है।

  • वर्तमान स्थिति: आप रोबोट से कहते हैं, "सावधान रहना और कुछ भी बुरा मत करना।" आप आशा करते हैं कि इसकी ट्रेनिंग (इसका "alignment") इसे इतना समझदार बना देगी कि यह सही-गलत का अंतर जान सके।
  • हकीकत: यदि कोई हैकर रोबोट के कान में कोई चालाकी भरी बात फुसफुसा देता है (इसे "prompt injection" कहते हैं), तो रोबोट भ्रमित हो सकता है। वह सोच सकता है, "ओह, बॉस ने कहा है कि इस अजनबी को $50,000 भेज दो!" और वह बस ऐसा कर देता है।

पेपर का तर्क है कि उम्मीद करना कोई सुरक्षा रणनीति नहीं है। सिर्फ इसलिए कि रोबोट को लगता है कि वह सही काम कर रहा है, इसका मतलब यह नहीं है कि वह वास्तव में सही काम कर रहा है। हमें एक ऐसी प्रणाली की आवश्यकता है जो रोबोट द्वारा वास्तविक रूप से कार्य करने से पहले हर एक क्रिया की जाँच करे, चाहे रोबोट कुछ भी सोच रहा हो।

समाधान: "ओपन एजेंट पासपोर्ट" (OAP)

लेखक एक नई प्रणाली प्रस्तावित करते हैं जिसे OAP कहा जाता है। इसे एक डिजिटल बाउंसर या सुरक्षा चेकपॉइंट के रूप में समझें जो रोबोट और वास्तविक दुनिया के बीच खड़ा है।

यह कैसे काम करता है, इसके लिए बैंक वॉल्ट (तिजोरी) का उदाहरण देखें:

  1. रोबोट (एजेंट): तिजोरी खोलना चाहता है और पैसे निकालना चाहता है।
  2. पुराना तरीका: रोबोट बस तिजोरी के पास जाता है। यदि वह आत्मविश्वासी दिखता है, तो तिजोरी खुल जाती है। (यह खतरनाक है)।
  3. OAP वाला तरीका:
    • तिजोरी को छूने से पहले, रोबोट को एक चेकपॉइंट पर रुकना होगा।
    • रोबोट अपना पासपोर्ट दिखाता है (एक डिजिटल आईडी कार्ड जो बताता है कि उसे वास्तव में क्या करने की अनुमति है)।
    • चेकपॉइंट रोबोट के अनुरोध को देखता है: "तुम $50,000 निकालना चाहते हो?"
    • चेकपॉइंट पासपोर्ट को देखता है: "तुम्हारा पासपोर्ट कहता है कि तुम प्रतिदिन केवल $500 ही निकाल सकते हो।"
    • निर्णय: चेकपॉइंट दरवाजा बंद कर देता है। "अस्वीकृत (Denied)।"
    • परिणाम: रोबोट कभी तिजोरी तक पहुँच ही नहीं पाता। क्रिया होने से पहले ही उसे रोक दिया जाता है।

यह अन्य सुरक्षा विधियों से अलग क्यों है?

पेपर सुरक्षा के तीन अलग-अलग तरीकों की तुलना करता है, जिसके लिए घर की सुरक्षा का उदाहरण दिया गया है:

विधि उदाहरण (Analogy) यह क्या करती है इसमें क्या कमी है
मॉडल अलाइनमेंट (ट्रेनिंग) कुत्ते को काटने से रोकने के लिए सिखाना। आप रोबोट को अच्छा बनने के लिए प्रशिक्षित करते हैं। यदि कोई अजनबी कुत्ते को बहला-फुसला ले, तो वह काट सकता है। यह 100% विश्वसनीय नहीं है।
सैंडबॉक्स्ड एक्जीक्यूशन (पिंजरा) कुत्ते को कांच के पिंजरे में रखना। यदि कुत्ता काटता भी है, तो वह केवल कांच को काट सकता है। वह बाहर के लोगों को चोट नहीं पहुँचा सकता। कुत्ता पिंजरे के अंदर चीजें तोड़ सकता है। यह कुत्ते को काटने की कोशिश करने से नहीं रोकता।
प्री-एक्शन ऑथोराइजेशन (OAP) दरवाजे पर एक सुरक्षा गार्ड। गार्ड प्रवेश करने से पहले कुत्ते की आईडी और आगंतुक की आईडी की जाँच करता है। यदि नियम पूरे नहीं होते हैं, तो दरवाजा बंद रहता है। यह कुत्ते को काटने के बारे में सोचने से नहीं रोकता, लेकिन यह काटने की क्रिया को होने से रोकता है।

मुख्य अंतर्दृष्टि: आपको इन तीनों की आवश्यकता है। लेकिन पेपर का तर्क है कि "सुरक्षा गार्ड" (Pre-Action Authorization) वह लापता कड़ी है जो वर्तमान प्रणालियों में नहीं है।

"पासपोर्ट" कैसे काम करता है

एजेंट पासपोर्ट एक डिजिटल दस्तावेज़ है जो एक सख्त अनुबंध (contract) के रूप में कार्य करता है। यह कहता है:

  • आप कौन हैं: (पहचान/Identity)
  • आप क्या कर सकते हैं: (जैसे, "फाइलें पढ़ना," "ईमेल भेजना")
  • आप क्या नहीं कर सकते: (जैसे, " $500 से अधिक ट्रांसफर करना," "देश X, Y, Z को पैसा भेजना")
  • नियम: "यदि आप नियमों को तोड़ने की कोशिश करते हैं, तो सिस्टम स्वचालित रूप से 'ना' कहेगा।"

यह प्रणाली डिटरमिनिस्टिक (Deterministic) है। यह एक भारी शब्द है जिसका अर्थ है: "यदि इनपुट समान हैं, तो उत्तर हमेशा वही रहेगा।"

  • AI के विपरीत, जो अनुमान लगा सकता है या भ्रमित (hallucinate) हो सकता है, पासपोर्ट प्रणाली एक गणितीय समीकरण की तरह है। 2+22 + 2 हमेशा $4होताहै।यदिनियमकहताहैकि" होता है। यदि नियम कहता है कि "500 से अधिक का ट्रांसफर नहीं," तो यह हमेशा $501 के ट्रांसफर को ब्लॉक करेगा, भले ही AI इसे अनुमति देने के लिए गिड़गिड़ाए।

प्रमाण: "वॉल्ट" टेस्ट

लेखकों ने एक लाइव गेम में इस प्रणाली का परीक्षण किया जिसे APort Vault CTF कहा जाता है।

  • सेटअप: उन्होंने एक नकली बैंक बनाया जिसमें किसी के भी AI को धोखा देकर पैसे चुराने के लिए $5,000 का इनाम रखा गया।
  • हमलावर: 1,151 लोगों ने AI को पैसा ट्रांसफर करने के लिए मनाने हेतु "सोशल इंजीनियरिंग" (चालाकी, झूठ और दबाव) का उपयोग करने की कोशिश की।
  • परिणाम:
    • जब AI ही एकमात्र सुरक्षा थी, तो हमलावर 74.6% बार सफल रहे।
    • जब OAP पासपोर्ट जोड़ा गया, तो हमलावर 0% बार सफल हुए।
    • हमलावर AI को पैसे माँगने के लिए बहलाने में सफल रहे, लेकिन पासपोर्ट सिस्टम ने कहा, "नहीं, यह तुम्हारे नियमों में नहीं है," और उसे ब्लॉक कर दिया।

आपको इसकी परवाह क्यों करनी चाहिए?

यह केवल हैकर्स के बारे में नहीं है। यह जवाबदेही (Accountability) के बारे में है।

  • सुरक्षा: यह हैकर्स को AI को धोखा देकर पैसे चुराने या डेटा डिलीट करने से रोकता है।
  • अनुपालन (Compliance): यह सुनिश्चित करता है कि AI कानूनों (जैसे GDPR) और कंपनी के नियमों (जैसे "बजट से अधिक खर्च न करें") का पालन करे।
  • विश्वास: यह हमें हर निर्णय के लिए एक "हस्ताक्षरित रसीद" देता है। यदि कुछ गलत होता है, तो हमारे पास किसका क्या प्रयास था और क्यों रोका गया, इसका एक सटीक रिकॉर्ड होता है।

निष्कर्ष

पेपर कहता है: AI के "अच्छे" होने पर भरोसा करना बंद करें। इसके बजाय, एक ऐसी प्रणाली बनाएँ जहाँ AI का "बुरा" होना असंभव हो क्योंकि नियमों को एक अलग, अटूट चेकपॉइंट द्वारा लागू किया जाता है।

यह आपके किशोर बच्चे के तेज़ गाड़ी न चलाने की उम्मीद करने और कार में एक 'स्पीड गवर्नर' लगाने के बीच का अंतर है जो भौतिक रूप से कार को 65 मील प्रति घंटे से ऊपर जाने से रोकता है। ओपन एजेंट पासपोर्ट AI के लिए वही स्पीड गवर्नर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →