← नवीनतम पेपर
🤖 AI

Efficient and Sound Probabilistic Verification for AI Agents

यह शोध पत्र वितरण रूप से सुदृढ़ अनुकूलन (डिस्ट्रीब्यूशनली रोबस्ट ऑप्टिमाइज़ेशन) पर आधारित एक सुदृढ़ और कुशल ढांचे को प्रस्तुत करता है जो स्वतंत्रता संबंधी धारणाओं पर निर्भर रहे बिना नीति उल्लंघन की संभावनाओं पर कठोर ऊपरी सीमाएँ कंप्यूट करके एआई एजेंटों के संभाव्य सत्यापन को सक्षम बनाता है, जिससे सुरक्षा-उपयोगिता व्यापार-समझौतों (सिक्योरिटी-यूटिलिटी ट्रेड-ऑफ) में पूर्ववर्ती विधियों से बेहतर प्रदर्शन होता है।

मूल लेखक: Alaia Solko-Breslin, Pramod Kaushik Mudrakarta, Mihai Christodorescu, Somesh Jha, Krishnamurthy Dj Dvijotham

प्रकाशित 2026-06-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alaia Solko-Breslin, Pramod Kaushik Mudrakarta, Mihai Christodorescu, Somesh Jha, Krishnamurthy Dj Dvijotham

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने डिजिटल जीवन को प्रबंधित करने में मदद करने के लिए एक अत्यधिक बुद्धिमान लेकिन थोड़े घबराए हुए रोबोटिक सहायक को काम पर रख रहे हैं। यह रोबोट आपकी फाइलों को पढ़ सकता है, ईमेल भेज सकता है और अन्य कंप्यूटरों से बात कर सकता है। आप चाहते हैं कि यह सहायक मददगार हो, लेकिन आपको यह भी सुनिश्चित करना होगा कि यह गलती से आपकी गुप्त रेसिपी या आपके निजी बैंक विवरण गलत व्यक्ति को न भेज दे।

समस्या यह है कि जो उपकरण रोबोट उपयोग करता है (जैसे कि एक "संवेदनशील डेटा डिटेक्टर") वे पूरी तरह से सटीक नहीं हैं। कभी-कभी वे कहते हैं, "मुझे 60% यकीन है कि यह फाइल निजी है," और कभी-ते कहते हैं, "मुझे 40% यकीन है।"

पुराना तरीका: "सब-या-कुछ-नहीं" वाला गेटकीपर

पहले, सुरक्षा प्रणालियाँ एक क्लब के सख्त बाउंसर की तरह काम करती थीं। यदि रोबोट के डिटेक्टर ने कहा, "40% संभावना है कि यह निजी है," तो बाउंसर को एक बाइनरी (दो विकल्पों वाला) निर्णय लेना पड़ता था:

  • विकल्प A: 40% को अनदेखा करें और रोबोट को फाइल भेजने दें (जोखिम भरा!)।
  • विकल्प B: सबसे बुरा मान लें और फाइल को ब्लॉक कर दें, भले ही वह शायद सुरक्षित हो (परेशान करने वाला!)।

यह निर्णय लेने के लिए, बाउंसर को एक मनमाना "कटऑफ लाइन" चुनना पड़ता था। यदि जोखिम 50% से ऊपर था, तो वे इसे ब्लॉक कर देते थे; यदि नीचे था, तो वे इसे जाने देते थे। यह कमरे के तापमान को केवल "गर्म" या "ठंडा" कहकर मापने जैसा है। आप सारी बारीकियां खो देते हैं। यदि आपके पास दो संदेश हैं, जिनमें से प्रत्येक के निजी होने की 40% संभावना है, तो पुराना सिस्टम दोनों को जाने दे सकता था क्योंकि दोनों में से कोई भी 50% की रेखा को पार नहीं कर पाया था। लेकिन यदि आप उन्हें मिला देते हैं, तो गुप्त जानकारी लीक होने का कुल जोखिम वास्तव में बहुत अधिक हो सकता है। पुराना सिस्टम इसे मिस कर देता था क्योंकि वह प्रत्येक साक्ष्य को अलग-थलग देखता था।

नया तरीका: "मौसम पूर्वानुमानकर्ता"

यह शोध पत्र एक नए, स्मार्ट सुरक्षा तंत्र को पेश करता है। एक बाउंसर के बजाय, एक मौसम पूर्वानुमानकर्ता की कल्पना करें जो तूफान की संभावना का अनुमान लगाने के लिए पूरे दिन के पूर्वानुमान को देखता है।

  1. पूरी कहानी सुनना: एक समय में एक फाइल की जांच करने के बजाय, यह सिस्टम रोबोट की पूरी यात्रा (उसका "ट्रैजेक्टरी") को देखता है। यह पूछता है: "यदि रोबोट A करता है, फिर B, फिर C करता है, तो कुल कितनी संभावना है कि कोई गुप्त जानकारी लीक हो जाएगी?"
  2. अनजान चीजों को संभालना: सिस्टम जानता है कि रोबोट के उपकरण आपस में जुड़े हो सकते हैं। उदाहरण के लिए, यदि "संवेदनशील डेटा डिटेक्टर" एक बार विफल हो जाता है, तो वह अगली फाइल पर भी विफल हो सकता है क्योंकि वे समान हैं। पुराने सिस्टम मानते थे कि हर गलती पूरी तरह से यादृच्छिक (रैंडम) और स्वतंत्र सिक्का उछालने जैसी थी। यह नया सिस्टम कहता है, "हम निश्चित रूप से नहीं जानते कि उनकी गलतियाँ कैसे संबंधित हैं, इसलिए आइए सबसे खराब स्थिति (worst-case scenario) को मान लें जहाँ वे सभी एक साथ घटित होती हैं।"
  3. "साउंड" गारंटी: लेखक अपने तरीके को "साउंड" (sound) कहते हैं। इसे एक सुरक्षा जाल के रूप में समझें। सिस्टम अधिकतम संभावित जोखिम की गणना करता है। यदि सिस्टम कहता है, "जोखिम अधिकतम 30% है," तो आप 100% सुनिश्चित हो सकते हैं कि वास्तविक जोखिम 30% या उससे कम है। यह कम हो सकता है (शायद 10%), लेकिन यह कभी भी इससे अधिक नहीं होगा। यह "फॉल्स नेगेटिव्स" को रोकता है जहाँ एक खतरनाक क्रिया चुपके से निकल जाती है।

यह कैसे काम करता है (जादुई गणित)

रोबोट के दिमाग को फ्रीज किए बिना यह करने के लिए, लेखक एक चतुर गणितीय ट्रिक का उपयोग करते हैं जिसे सेमीडेफिनेट प्रोग्रामिंग (SDP) कहा जाता है।

  • समस्या: घटनाओं के हर संभावित संयोजन के लिए सटीक जोखिम की गणना करना समुद्र में आती हुई लहरों के बीच रेत के हर एक कण को गिनने जैसा है। इसमें बहुत अधिक समय लगता है।
  • समाधान: रेत के हर कण को गिनने के बजाय, सिस्टम रेत के ढेर के "आकार" को देखता है। यह जोखिमों के औसत और उनके फैलाव (विचरण/variance) को ट्रैक करता है। इन "सेकंड-ऑर्डर मोमेंट्स" (एक फैंसी तरीका यह कहने का कि "जोखिम कितना डगमगाता है") पर ध्यान केंद्रित करके, यह खतरे के क्षेत्र के चारों ओर एक सटीक, सुरक्षित सीमा बहुत तेज़ी से बना सकता है।

परिणाम: बेहतर संतुलन

शोधकर्ताओं ने वास्तविक दुनिया के परिदृश्यों पर इसका परीक्षण किया जहाँ रोबोटों को फाइलें प्रबंधित करनी थीं और ईमेल भेजने थे। उन्होंने अपने नए "मौसम पूर्वानुमानकर्ता" की तुलना निम्नलिखित से की:

  • पुराना बाउंसर (डिटरमिनिस्टिक): अक्सर सुरक्षित कार्यों को ब्लॉक कर देता था या खतरनाक कार्यों को मिस कर देता था।
  • "सिक्का उछालने वाला" (मोंटे कार्लो): यह मानता था कि सभी त्रुटियां रैंडम और स्वतंत्र हैं। इसने अक्सर खतरे को कम करके आंका, जिससे सुरक्षा लीक हुए।
  • "सुपर-कंप्यूटर" (सटीक अनुकूलन): बहुत सटीक लेकिन वास्तविक समय में उपयोग करने के लिए बहुत धीमा।

विजेता: नए SDP सिस्टम ने "गोल्डिलॉक्स" ज़ोन (बीच का रास्ता) खोज लिया। यह वास्तविक समय में चलने के लिए पर्याप्त तेज़ था, सुरक्षित होने के लिए पर्याप्त सुरक्षित था (सुपर-कंप्यूटर के बराबर), और सुरक्षित कार्यों को जाने देने के लिए पर्याप्त स्मार्ट था (बेहतर उपयोगिता)।

कमी (सीमाएं)

पेपर दो मुख्य सीमाओं को स्वीकार करता है:

  1. लंबी यात्राएं: यदि रोबोट एक बहुत लंबे, जटिल मिशन पर जाता है जिसमें कई चरण होते हैं, तो "सबसे खराब स्थिति" का अनुमान इतना रूढ़िवादी हो सकता है कि वह बस यह कह देता है, "जोखिम 100% है," और सब कुछ ब्लॉक कर देता है। यह एक ऐसे मौसम पूर्वानुमानकर्ता की तरह है जो, बादल वाले दिनों के एक सप्ताह के बाद, अगले महीने के लिए भविष्यवाणी करता है कि "निश्चित रूप से बारिश होगी," भले ही धूप निकली हो।
  2. टूल कन्फ्यूजन (उपकरण भ्रम): सिस्टम को यह जानने की आवश्यकता है कि प्रत्येक उपकरण क्या करता है (जैसे, "यदि मैं एक फाइल कॉपी करता हूँ, तो कॉपी उतनी ही संवेदनशील है जितनी मूल फाइल")। यदि रोबोट एक अजीब, कस्टम स्क्रिप्ट का उपयोग करता है जिसे सुरक्षा प्रणाली नहीं समझती है, तो सिस्टम उसे सुरक्षित रूप से सत्यापित नहीं कर सकता है।

सारांश

संक्षेप में, यह पेपर AI एजेंटों को एक नए प्रकार का "सुरक्षा हेलमेट" देता है। अस्थिर डेटा के आधार पर कठोर, बाइनरी निर्णय लेने के बजाय, यह हेलमेट इस बात की एक गारंटीकृत ऊपरी सीमा की गणना करता है कि सुरक्षा उल्लंघन की कितनी संभावना है। यह पूरे चित्र को देखकर, यह देखते हुए कि विभिन्न जोखिम कैसे जुड़े हो सकते हैं, और तेज़ और सुरक्षित रहने के लिए स्मार्ट गणित का उपयोग करके ऐसा करता है। यह AI एजेंटों को लापरवाह हुए बिना अधिक सहायक होने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →