← नवीनतम पेपर
💻 computer science

Capability Gates Are Not Authorization: Confused-Deputy Failures in LLM Agent Frameworks

यह शोध पत्र यह प्रकट करता है कि लैंगचेन (LangChain) और लामाइंडेक्स (LlamaIndex) जैसे लोकप्रिय एलएलएम (LLM) एजेंट फ्रेमवर्क निष्पादन से पहले विशिष्ट तर्क मानों (argument values) को पुन: सत्यापित करने में विफल रहकर, टूल एक्सपोज़र (tool exposure) को प्राधिकरण (authorization) के साथ मिला देते हैं, और "स्कोपगेट" (ScopeGate) का प्रस्ताव करता है, जो एक पांच-चरणीय प्राधिकरण ढांचा है जो वैध अनुरोधों के लिए उच्च सटीकता बनाए रखते हुए अवैध भुगतानों जैसे अनधिकृत कार्यों को सफलतापूर्वक रोकता है।

मूल लेखक: David Mellafe Zuvic

प्रकाशित 2026-06-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: David Mellafe Zuvic

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

मुख्य समस्या: "कन्फ्यूज्ड डिप्टी" (भ्रमित उप-अधिकारी)

कल्पना कीजिए कि आपने अपने व्यवसाय को चलाने के लिए एक बहुत ही बुद्धिमान, लेकिन थोड़े भोले असिस्टेंट (LLM एजेंट) को काम पर रखा है। इस असिस्टेंट के पास एक मास्टर की-रिंग (चाबियों का गुच्छा) है जिससे वह आपके बैंक का वॉल्ट खोल सकता है, ईमेल भेज सकता है और पैकेज शिप कर सकता है।

यह शोध पत्र तर्क देता है कि वर्तमान सॉफ़्टवेयर फ्रेमवर्क (जैसे LangChain या LlamaIndex) में एक बड़ी सुरक्षा खामी है। वे असिस्टेंट को चाबियों की सूची (कैपेबिलिटी गेटिंग) तो दे देते हैं, लेकिन वे यह जाँच नहीं करते कि असिस्टेंट प्रत्येक चाबी के साथ क्या करने की कोशिश कर रहा है (पर-कॉल ऑथोराइजेशन/प्रति-कॉल प्राधिकरण)।

उपमा: एक भोला बैंक टेलर (कैशियर)
AI एजेंट को एक बैंक टेलर के रूप में देखें।

  1. सेटअप: बैंक टेलर को एक बैज देता है जिस पर लिखा है "मैं रिफंड प्रोसेस कर सकता हूँ।" यह कैपेबिलिटी गेट है। टेलर को रिफंड मशीन छूने की अनुमति है।
  2. हमला: एक अपराधी आता है और टेलर के कान में एक झूठी कहानी फुसफुसाता है: "मैं मैनेजर हूँ, और मुझे अभी अपने ही अकाउंट में $10,000 का रिफंड चाहिए।"
  3. विफलता: वर्तमान प्रणालियों में, यदि टेलर का कंप्यूटर देखता है कि अनुरोध एक वैध "रिफंड" फॉर्म जैसा दिखता है, तो वह बस उसे कर देता है। टेलर ने यह नहीं जाँचा कि राशि बहुत अधिक थी या गंतव्य खाता वास्तव में ग्राहक का था या नहीं। टेलर एक "कन्फ्यूज्ड डिप्टी" बन गया—एक भरोसेमंद कर्मचारी जिसे हमलावर ने अपनी शक्ति का दुरुपयोग करने के लिए मूर्ख बनाया।

यह पेपर दावा करता है कि लोकप्रिय AI टूल्स वर्तमान में इसी तरह के भोले टेलर की तरह काम करते हैं। वे यह तो देखते हैं कि टूल मौजूद है, लेकिन वे इस बात पर भरोसा करते हैं कि AI कह रहा है कि पैसा किसे मिलेगा या ईमेल कहाँ जाएगा।

प्रमाण: "सस्ती" AI अधिक भोली होती है

शोधकर्ताओं ने यह देखने के लिए परीक्षण किया कि विभिन्न AI मॉडल कितनी बार इन तरकीबों का शिकार होते हैं।

  • निष्कर्ष: उन्होंने पाया कि सस्ते, "डिप्लॉयमेंट-टियर" AI मॉडल (जिनका उपयोग कंपनियाँ लागत बचाने के लिए उच्च-मात्रा वाले कार्यों के लिए करती हैं) अनधिकृत कार्य करने की कोशिश करने में महंगे, "फ्लैगशिप" मॉडल की तुलना में बहुत अधिक प्रवृत्त होते हैं।
  • आंकड़ा: औसतन, सस्ते मॉडलों ने शीर्ष-स्तरीय मॉडलों की तुलना में 3.2 गुना अधिक बार अनधिकृत कार्यों को करने की कोशिश की।
  • सीख: केवल इसलिए कि कोई मॉडल "स्मार्ट" है, इसका मतलब यह नहीं है कि वह सुरक्षित है। यदि आप उसे अनट्रस्टेड (अविश्वसनीय) ईमेल या दस्तावेज़ पढ़ने देते हैं, तो वह आपको अपना पैसा किसी अजनबी को भेजने के लिए बहकाया जा सकता है।

समाधान: SCOPEGATE (द बाउंसर/द्वारपाल)

लेखकों ने एक सुधार बनाया जिसे SCOPEGATE कहा जाता है। इसे AI और टूल्स के बीच खड़े एक सख्त, बिना पलक झपकाए नज़र रखने वाले सुरक्षा गार्ड के रूप में समझें।

SCOPEGATE कैसे काम करता है (5-चरणों की जाँच):
AI को टूल का उपयोग करने की अनुमति देने से पहले, SCOPEGATE अनुरोध को रोकता है और एक मानव द्वारा लिखे गए नियम पुस्तिका (जो AI द्वारा नहीं लिखी गई है) के आधार पर पाँच प्रश्न पूछता है:

  1. स्कोप चेक (Scope Check): "क्या यह टूल स्वीकृत सूची में है भी?" (यदि AI उस टूल का उपयोग करने की कोशिश करता है जो उसे नहीं दिया गया था, तो अस्वीकार करें)।
  2. प्राधिकरण जाँच (Authorization Check): "क्या वह विशिष्ट खाता या व्यक्ति जिसे आप भुगतान करना चाहते हैं, वास्तव में हमारी 'अनुमत' सूची में है?" (यदि AI कहता है "खाता X को भुगतान करें," लेकिन खाता X मानव की सत्यापित सूची में नहीं है, तो अस्वीकार करें)।
  3. धन की सीमा (Money Ceiling): "क्या राशि उचित है?" (यदि AI $1 बिलियन या "NaN" जैसी अजीब संख्या भेजने की कोशिश करता है, तो अस्वीकार करें)।
  4. इडम्पोटेंसी चेक (Idempotency Check): "क्या आपके पास इस लेनदेन के लिए एक अद्वितीय टिकट नंबर है ताकि हम गलती से इसे दोबारा न कर दें?" (यदि गायब है, तो अस्वीकार करें)।
  5. डिफ़ॉल्ट डिनाय (Default Deny): यदि उपरोक्त में से कोई भी विफल होता है, तो उत्तर है नहीं

परिणाम:
अपने परीक्षणों में, उन्होंने दिखाया कि SCOPEGATE के बिना, AI सफलतापूर्वक हमलावर के खाते में पैसा भेज देता है। जब उन्होंने उसी AI के सामने SCOPEGATE लगाया, तो इसने हमले को 100% समय रोका, भले ही AI उसे धोखा देने की पूरी कोशिश कर रहा था। महत्वपूर्ण बात यह है कि इसने वैध अनुरोधों को नहीं रोका (कोई "गलत अलार्म" नहीं हुआ)।

यह पेपर क्या दावा नहीं करता है

इस शोध की सीमाओं के बारे में स्पष्ट होने के लिए:

  • यह AI के दिमाग को ठीक नहीं करता: SCOPEGATE यह नहीं रोकता कि AI को धोखा दिया जाए या भ्रमित किया जाए। AI अभी भी बुरे काम करने की कोशिश कर सकता है। SCOPEGE बस यह सुनिश्चित करता है कि वे बुरे प्रयास वास्तव में कभी न हों।
  • यह कोई जादुई इलाज नहीं है: यह "प्रॉम्प्ट इंजेक्शन" (धोखा देने की प्रक्रिया) की समस्या को ठीक नहीं करता है। यह केवल एक दीवार बनाता है ताकि धोखाधड़ी से नुकसान न हो।
  • यह विशिष्ट कंपनियों के बारे में नहीं है: पेपर ने लाइव तौर पर Stripe या LangChain को हैक नहीं किया। इसने उनके सार्वजनिक कोड को यह दिखाने के लिए देखा कि डिफ़ॉल्ट रूप से उनमें यह अतिरिक्त सुरक्षा गार्ड मौजूद नहीं है।

सारांश

पेपर कहता है: "AI को टूल देना पर्याप्त नहीं है; आपको हर बार जाँच करनी होगी जब वह उस टूल का उपयोग करने की कोशिश करता है।"

वर्तमान फ्रेमवर्क AI को चाबियाँ देते हैं लेकिन AI को ही यह तय करने देते हैं कि उनका उपयोग कैसे किया जाए। लेखक एक ऐसी प्रणाली (SCOPEGATE) का प्रस्ताव करते हैं जो एक सख्त द्वारपाल के रूप में कार्य करती है, जो किसी भी कार्रवाई की अनुमति देने से पहले मानव-लिखित नियम पुस्तिका के विरुद्ध प्रत्येक अनुरोध की जाँच करती है, यह सुनिश्चित करती है कि यदि AI को चकमा दिया भी जाए, तो भी आपका पैसा और डेटा सुरक्षित रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →