← नवीनतम पेपर
🤖 AI

CAGE: Certified Authorization under Typed-Return Uncertainty for Tool-Using Agents

CAGE टूल-उपयोग करने वाले LLM एजेंटों के लिए एक प्रमाणन ढांचा (certification framework) है जो यह सुनिश्चित करता है कि अधिकृत क्रियाएं संयुक्त डिस्क्रीट बाइंडिंग दोषों (discrete binding faults) और निरंतर संख्यात्मक विचलन (continuous numerical drift) के तहत भी वैध बनी रहें, जिससे सीधे संयुक्त पड़ोस (joint neighborhoods) को प्रमाणित किया जाता है, और इस प्रकार उन फाल्स पॉजिटिव्स (false positives) को समाप्त किया जाता है जो श्रेणीबद्ध (categorical) और संख्यात्मक चैनलों को अलग-अलग मानने से उत्पन्न होते हैं।

मूल लेखक: Blaise Delattre, Cong Wang, Yang Cao

प्रकाशित 2026-08-03
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Blaise Delattre, Cong Wang, Yang Cao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तकनीकी सारांश: CAGE (टाइप्ड-रिटर्न अनिश्चितता के तहत प्रमाणित प्राधिकरण)

1. समस्या विवरण

यह शोध पत्र टूल-उपयोग करने वाले लार्ज लैंग्वेज मॉडल (LLM) एजेंटों में एक महत्वपूर्ण भेद्यता (vulnerability) को संबोधित करता है। जबकि तैनात किए गए एजेंट हार्नेस तेजी से रनटाइम अनुमति गेटों (runtime permission gates) का उपयोग कर रहे हैं ताकि टूल कॉल्स को अधिकृत किया जा सके, ये गेट्स केवल एक ही समय बिंदु पर देखे गए (observed) टूल रिटर्न और प्रस्तावित क्रिया का मूल्यांकन करते हैं। वे अवशिष्ट बाइंडिंग अनिश्चितता (residual binding uncertainty) को ध्यान में रखने में विफल रहते हैं: यह संभावना कि एजेंट द्वारा देखा गया प्रमाणित रिकॉर्ड (z~\tilde{z}), "सही ढंग से बाउंड" रिटर्न (zz^\star) से भिन्न हो सकता है, जो मामूली असेंबली दोषों (जैसे, पुराने प्रोवेनेंस टैग, स्कीमा मिसमैच, या रेस कंडीशंस) और बाउंडेड न्यूमेरिकल ड्रिफ्ट (bounded numerical drift) के कारण हो सकता है।

मुख्य समस्या यह है कि एक क्रिया देखे गए रिकॉर्ड के तहत सुरक्षित दिखाई दे सकती है और यहाँ तक कि डिस्क्रीट (कैटेगोरिकल) और कंटीन्यूअस (न्यूमेरिकल) परिवर्तनों के लिए अलग-अलग जाँचों के तहत भी सुरक्षित हो सकती है, फिर भी इन परिवर्तनों के संयुक्त रूप से (jointly) होने पर असुरक्षित हो सकती है। लेखक इसे जॉइंट-गैप अटैक (joint-gap attack) कहते हैं। मौजूदा रक्षा प्रणालियाँ, जो अक्सर अविश्वसनीय टेक्स्ट को शुद्ध करने या पॉइंटवाइज क्रियाओं का मूल्यांकन करने पर केंद्रित होती हैं, इन विशिष्ट सिमेंटिक अनिश्चितताओं के विरुद्ध निर्णय सीमा (decision boundary) को असुरक्षित छोड़ देती हैं।

2. कार्यप्रणाली: CAGE

लेखक CAGE (एग्जीक्यूशन के लिए प्रमाणित प्राधिकरण गेट) का प्रस्ताव करते हैं, जो एक रनटाइम मॉनिटर है जो प्राधिकरण के विषय को देखे गए बिंदु (z~,a)(\tilde{z}, a) से बदलकर एक जॉइंट नेबरहुड (joint neighborhood) Bd,ϵ(z~)B_{d,\epsilon}(\tilde{z}) में स्थानांतरित कर देता है। एक क्रिया aa तभी अधिकृत की जाती है जब वह इस नेबरहुड के भीतर प्रत्येक संभावित सही ढंग से बाउंड रिटर्न के लिए सुरक्षित रहती है।

जॉइंट नेबरहुड (The Joint Neighborhood)

नेबरहुड को दो बजटों द्वारा परिभाषित किया गया है:

  • डिस्क्रीट बजट (dd): यह अधिकतम dd स्वीकार्य बाइंडिंग दोषों (जैसे, एक एकल प्रोवेनेंस स्वैप या पॉलिसी पैक कन्फ्यूजन) की अनुमति देता है।
  • कंटीन्यूअस बजट (ϵ\epsilon): यह मानक सत्यापन के बाद संख्यात्मक क्षेत्रों (जैसे, रिस्क स्कोर, राशि) में बाउंडेड 2\ell_2 ड्रिफ्ट की अनुमति देता है।

नॉन-कंपोजिशन थ्योरम (The Non-Composition Theorem)

एक केंद्रीय सैद्धांतिक योगदान यह प्रमाण है कि चैनलों का अलग-अलग प्रमाणन कंपोज़ (compose) नहीं होता है

  • थ्योरम 1: एक सुरक्षा प्रेडिकेट मूल डिस्क्रीट स्टेट के सभी कंटीन्यूअस परिवर्तनों के तहत सुरक्षित हो सकता है और मूल कंटीन्यूअस वैल्यू के सभी डिस्क्रीट स्वैप्स के तहत भी सुरक्षित हो सकता है, फिर भी एक संयुक्त डिस्क्रीट स्वैप और कंटीन्यूअस शिफ्ट के तहत असुरक्षित हो सकता है।
  • निहितार्थ: मार्जिनल सर्टिफिकेट्स (टेक्स्ट और नंबर्स को अलग-अलग चेक करना) असंगत (unsound) हैं। रक्षा को डिस्क्रीट और कंटीन्यूअस परिवर्तनों के कार्टेशियन उत्पाद (Cartesian product) को प्रमाणित करना चाहिए।

CAGE एल्गोरिदम

CAGE, डिस्क्रीट नेबरहुड के सटीक एन्यूमरेशन (exact enumeration) के बाद सटीक प्रमाणन (sound certification) के कंटीन्यूअस ब्रांच के माध्यम से कार्य करता है:

  1. एन्यूरेट (Enumerate): डिस्क्रीट नेबर्स का परिमित सेट Nd(s)={s:Ddisc(s,s)d}N_d(s) = \{s' : D_{disc}(s, s') \le d\} कंप्यूट करें।
  2. ब्रांच प्रमाणित करें (Certify Branches): प्रत्येक डिस्क्रीट नेबर ss' के लिए, प्रमाणित करें कि क्रिया ϵ\epsilon-बॉल के भीतर सभी कंटीन्यूअस परिवर्तनों xx' के लिए सुरक्षित है।
  3. निर्णय (Decision): क्रिया को केवल तभी अनुमति दें यदि प्रत्येक ब्रांच अपने कंटीन्यूअस सर्टिफिकेशन टेस्ट को पास करती है।

धारणा सीढ़ी (The Assumption Ladder - Backends)

नीति की प्रकृति (एग्जीक्यूटेबल बनाम लर्नड) के आधार पर CAGE विभिन्न बैकएंड्स का समर्थन करता है:

  • CAGE-Exact (रंग 1): इसका उपयोग तब किया जाता है जब नीति एक एग्जीक्यूटेबल प्रेडिकेट (जैसे, Rego या डिसीजन टेबल में एफ़ाइन बाधाएं) होती है। यह ϵ\epsilon-बॉल पर बाधाओं के सटीक गणितीय सत्यापन को निष्पादित करता है। यह पॉलिसी-सर्टिफाइड है।
  • CAGE-Lip (रंग 2): इसका उपयोग लर्नड गेट्स (इम्प्लिसिट पॉलिसियों) के लिए किया जाता है। यह एक 1-Lipschitz न्यूरल नेटवर्क आर्किटेक्चर का उपयोग करता है। यह लिप्सचिट्ज़ मार्जिन (hθ>Lcertϵh_\theta > L_{cert}\epsilon) के आधार पर गेट के निर्णय को प्रमाणित करता है। यह गेट-सर्टिफाइड है और एक मापे गए गेट-पॉलिसी फिडेलिटी धारणा के तहत साउंड है।
  • CAGE-RS (रंग 3): इसका उपयोग ब्लैक-बॉक्स गेट्स के लिए किया जाता है। यह कंटीन्यूअस बॉल पर संभाव्य गारंटी प्रदान करने के लिए रैंडमाइज्ड स्मूथिंग (Randomized Smoothing) लागू करता है। यह भी गेट-सर्टिफाइड है।

3. मुख्य योगदान

  1. रोबस्ट ऑथोराइजेशन का औपचारिककरण: पेपर टूल-रिटर्न के बाद प्राधिकरण को बाउंडेड सिमेंटिक अनिश्चितता के तहत एक निर्णय के रूप में औपचारिक रूप देता है, यह सिद्ध करते हुए कि रिटर्न-डिपेंडेंट सुरक्षा के लिए वास्तविक रिटर्न का निरीक्षण आवश्यक है (प्रपोजिशन 1)।
  2. नॉन-कंपोजिशन प्रूफ: लेखक सिद्ध करते हैं कि कैटेगोरिकल और न्यूमेरिकल चैनलों के मार्जिनल सर्टिफिकेट्स उनके संयुक्त उत्पाद पर सुरक्षा का संकेत नहीं देते हैं, जिससे "जॉइंट-गैप विटनेस" के अस्तित्व की पहचान होती है (थ्योरम 1)।
  3. सर्टिफाइड मॉनिटर विद अज़म्पशन लैडर: CAGE एक एकीकृत ढांचा प्रदान करता है जो डिस्क्रीट स्पेस को सटीक रूप से एन्यूरेट करता है और कंटीन्यूअस स्पेस को विभिन्न बैकएंड्स (Exact, Lipschitz, Smoothing) का उपयोग करके प्रमाणित करता है, जिससे लर्नड गेट्स के लिए भी एक साउंडनेस फ्लोर सुनिश्चित होता है।
  4. मेज़र्ड सेफ्टी केस: यह कार्य इंजेक्टेड फॉल्ट्स पर कैलिब्रेटेड एक कठोर सुरक्षा मामला (safety case) प्रदान करता है, जो यह प्रदर्शित करता है कि CAGE उपयोगी स्वायत्तता बनाए रखते हुए 'फॉल्स अलाउ' (गलत अनुमति) को हटा देता है।

4. प्रयोगात्मक परिणाम

मूल्यांकन सिंथेटिक सेटिंग्स, पॉलिसी-एज़-कोड (Open Policy Agent, GoRules), रेगुलेटरी फ्रेमवर्क्स (PSD2/AML), और वास्तविक ट्रांजैक्शन डेटा (IEEE-CIS) तक फैला हुआ है।

  • जॉइंट-गैप विटनेस का अस्तित्व: अध्ययन पुष्टि करता है कि जॉइंट-गैप विटनेस हर सेटिंग में मौजूद हैं, जो 3.5% से 12% की प्राकृतिक आवृत्ति पर होते हैं।
  • साउंडनेस (Soundness): सभी सेटिंग्स में, CAGE एक सर्टिफाइड फॉल्स अलाउ (CFA) दर 0 प्राप्त करता है। इसके विपरीत, पॉइंटवाइज गेट्स और मार्जिनल कंपोजिशन बेसलाइन इन असुरक्षित विटनेस को उच्च दर पर (अक्सर विटनेस सेट के 100% तक) स्वीकार करते हैं।
  • स्वायत्तता (Autonomy): सख्त सुरक्षा गारंटी के बावजूद, CAGE महत्वपूर्ण स्वायत्तता बनाए रखता है:
    • CAGE-Exact पॉलिसी-एज़-कोड सेटिंग्स में 22–34% और नेचुरल ट्रैफिक में 57% रोबस्ट-सेफ निर्णयों को स्वायत्त रूप से क्लियर करता है।
    • लर्नड बैकएंड्स (Lip/RS) ऑपरेटिंग पॉइंट की सख्ती के आधार पर 6.5–37% स्वायत्तता बनाए रखते हैं।
  • एंड-टू-एंड वैलिडेशन: लाइव सिस्टम टेस्ट (Kubernetes, MCP राइट पाथ, AML इंजन) में, CAGE उन असुरक्षित साइड इफेक्ट्स (जैसे, अनधिकृत डिप्लॉयमेंट, ओवर-कोटा राइट्स) को सफलतापूर्वक ब्लॉक करता है जिन्हें अन-गेटेड या पॉइंटवाइज-गेटेड एजेंटों द्वारा स्वीकार कर लिया गया था।
  • एडैप्टिव अटैक्स: CAGE उन एडैप्टिव हमलावरों के खिलाफ भी साउंड रहता है जो पॉलिसी और बजट को जानते हैं, जबकि लर्नड पॉइंट गेट्स कुछ सिंथेटिक हमलों में उच्च फॉल्स-अलाउ दर (कुछ मामलों में 98% तक) का सामना करते हैं।

5. महत्व और दावे

पेपर का दावा है कि CAGE अनिश्चित टाइप्ड-रिटर्न वाले निर्णयों के लिए एक कैलिब्रेटेड ऑथोराइजेशन मैकेनिज्म प्रदान करता है। इसका महत्व निम्नलिखित में निहित है:

  • लॉजिकल गैप को बंद करना: यह पहले सिस्टम के रूप में संयुक्त नेबरहुड को औपचारिक रूप से प्रमाणित करता है, जो उस भेद्यता को संबोधित करता है जिसे पॉइंटवाइज और मार्जिनल डिफेंस मिस कर देते हैं।
  • व्यावहारिक तैनाती: एक "अज़म्पशन लैडर" प्रदान करके, यह सैद्धांतिक रूप से पूर्ण एग्जीक्यूटेबल पॉलिसियों और व्यावहारिक लर्नड गेट्स के बीच के अंतर को पाटता है, जिससे स्पष्ट फिडेलिटी स्थितियों के तहत भी औपचारिक गारंटी मिलती है।
  • ऑपरेशनल रियलिज्म: यह कार्य औपचारिक गारंटी को परिचालन पूर्वशर्तों (जैसे, डेटा की नवीनता, कंस्ट्रक्टर की अखंडता) से स्पष्ट रूप से अलग करता है। यह दावा करने के बजाय कि यह पूर्ण प्रतिरक्षा प्रदान करता है, यह मात्रात्मक रूप से बताता है कि जब ये पूर्वशर्तें विफल होती हैं (जैसे, यदि डेटा स्टेलेनेस घोषित बजट से अधिक हो जाती है), तो "अवशिष्ट जोखिम" क्या है।

लेखक अपनी बाहरी वैधता (external validity) के दावों के बारे में विनम्र हैं: वे तैनात-शैली के पाइपलाइनों में जॉइंट-गैप हमलों के अस्तित्व, व्यवहार्यता और तंत्र को प्रदर्शित करते हैं, लेकिन यह दावा नहीं करते हैं कि उन्होंने सभी वास्तविक दुनिया के एजेंटिक सिस्टमों में इन विशिष्ट दोषों की व्यापकता को मापा है। वे निष्कर्ष निकालते हैं कि जहाँ भी टाइप्ड-रिटर्न अनिश्चितता को मापा और लागू किया जा सकता है, वहाँ CAGE एक आवश्यक रनटाइम कंट्रोल है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →