FAVA: Formal Authorization for Verified Agents with Evidence-Backed Permission Graphs
FAVA एक औपचारिक प्राधिकरण ढांचा (formal authorization framework) है जो प्राकृतिक भाषा के कार्यों को संरचित अनुमति ग्राफ़ (structured permission graphs) में अनुवादित करके सुरक्षित LLM एजेंट निष्पादन सुनिश्चित करता है, जिन्हें फिर अनधिकृत कार्यों को होने से पहले रोकने के लिए एक SMT सॉल्वर का उपयोग करके सुरक्षा नीतियों के विरुद्ध गणितीय रूप से सत्यापित किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ आपका कंप्यूटर केवल आदेशों का पालन ही नहीं करता, बल्कि उन पर वास्तव में सोचता भी है, जैसे कि कोई डिजिटल जासूस या कोडिंग जादूगर जटिल कार्यों की योजना बना रहा हो। यह AI एजेंटों का क्षेत्र है, जो लार्ज लैंग्वेज मॉडल्स (LLMs) द्वारा संचालित स्मार्ट प्रोग्राम हैं जो फाइलों को पढ़ सकते हैं, कोड लिख सकते हैं और यहाँ तक कि दूसरे कंप्यूटरों से बात भी कर सकते हैं। लेकिन यहाँ एक पेंच है: ये एजेंट अविश्वसनीय रूप से रचनात्मक होते हैं, जिसका अर्थ है कि वे कभी-कभी बहुत उत्साहित हो सकते हैं और अनजाने में कुछ खतरनाक काम कर सकते हैं, जैसे महत्वपूर्ण फाइलों को डिलीट करना या गुप्त पासवर्ड गलत व्यक्ति को भेज देना।
इन डिजिटल सहायकों को नियंत्रण में रखने के लिए, हम आमतौर पर "अनुमति पर्चियों" (permission slips) का उपयोग करते हैं। इन्हें एक सरल नियमों की सूची के रूप में समझें: "आप इस फ़ाइल को पढ़ सकते हैं, लेकिन आप उसे छू नहीं सकते।" हालाँकि, वास्तविक जीवन अस्त-व्यस्त है। कभी-कभी कोई कार्य तभी सुरक्षित होता है यदि आप अपना होमवर्क पूरा करने के बाद उसे करते हैं, या सुरक्षित होता है केवल यदि आपके पास कोई गुप्त कुंजी नहीं है। इन्हें संदर्भ-निर्भर (context-dependent) नियम कहा जाता है। समस्या यह है कि पुराने ज़माने की अनुमति सूचियाँ बहुत कठोर हैं; वे एक व्यस्त दिन के "यदि यह, तो वह" वाले तर्क को नहीं समझ सकतीं। यदि हम इन एजेंटों को उनके कार्यों की कहानी समझने के लिए प्रशिक्षित नहीं कर सकते, तो वे बिना यह समझे भी नियमों को तोड़ सकते हैं। इसीलिए वैज्ञानिक बेहतर सुरक्षा प्रणालियाँ बनाने की दौड़ में हैं जो केवल व्यक्तिगत चरणों को ही नहीं, बल्कि पूरी कहानी को ट्रैक कर सकें।
यहाँ FAVA (फॉर्मल ऑथोराइजेशन फॉर वेरिफाइड एजेंट्स) आता है, जो इन AI एजेंटों के लिए एक परम बाउंसर (bouncer) के रूप में डिज़ाइन किया गया सुरक्षा तंत्र है। AI एजेंट को केवल यह कहने पर भरोसा करने के बजाय कि, "मैं वादा करता हूँ कि मैं सुरक्षित रहूँगा," FAVA एक अत्यंत सख्त, गणित-प्रेमी रेफरी की तरह काम करता है जो हर कदम को होने से पहले ही जाँच लेता है।
FAVA कैसे काम करता है, इसे एक मज़ेदार उपमा (analogy) का उपयोग करके समझते हैं: कल्पना कीजिए कि AI एजेंट एक रसोई में एक शेफ है जो एक जटिल भोजन बनाना चाहता है।
अनुवादक (Permission IR): सबसे पहले, शेफ अपनी रेसिपी एक बिखरे हुए, हस्तलिखित नोट (प्राकृतिक भाषा कार्य) में लिखता है। FAVA के पास एक अनुवादक है जो इस बिखरे हुए नोट को पढ़ता है और इसे एक सख्त, संरचित ब्लूप्रिंट में बदल देता है जिसे Permission IR कहा जाता है। यह ब्लूप्रिंट केवल यह नहीं कहता कि "चिकन पकाओ"; यह कहता है "चिकन (एसेट) का उपयोग सूप (एक्शन) बनाने के लिए करें, लेकिन केवल तभी जब चूल्हा चालू हो (कॉन्टेक्स्ट), और कभी भी कच्चे चिकन को सलाद के संपर्क में न आने दें (सेफ्टी रूल)।"
मैप मेकर (Permission Graph): इसके बाद, FAVA उस ब्लूप्रिंट को लेता है और एक विस्तृत मानचित्र बनाता है जिसे Permission Graph कहा जाता है। इस मानचित्र पर, प्रत्येक सामग्री और उपकरण एक बिंदु है, और नियम उन्हें जोड़ने वाली रेखाएँ हैं। यदि शेफ किसी "गुप्त मसाले" (संवेदनशील डेटा) का उपयोग करने की कोशिश करता है, तो मानचित्र लाल रंग से चमक उठता है। यदि शेफ भोजन को खिड़की से बाहर फेंकने (डेटा इंटरनेट पर भेजने) की कोशिश करता है, तो मानचित्र जाँचता है कि क्या उसके पास "कचरा अनुमति" (trash permit) है।
गणित का जज (SMT Authorizer): यह सबसे शानदार हिस्सा है। FAVA केवल अनुमान नहीं लगाता; यह एक शक्तिशाली गणित इंजन (एक SMT सॉल्वर) का उपयोग करके मानचित्र की जाँच करता है। यह पूछता है, "क्या यह गणितीय रूप से संभव है कि यह शेफ अभी नियमों को तोड़ दे?" यदि उत्तर "हाँ, ऐसा एक तरीका है जिससे वे रहस्य लीक कर सकते हैं" है, तो सिस्टम तुरंत ब्रेक लगा देता है और कहता है, "रुको! यहाँ आपने कहाँ गलती की है, यह देखो।" यदि उत्तर "नहीं, नियम सुरक्षित हैं" है, तो शेफ को हरी झंडी मिल जाती है।
शोधकर्ताओं ने FAF में कई पेचीदा परिदृश्यों में परीक्षण किया, जिसमें वास्तविक दुनिया के कोडिंग कार्य और सुरक्षा चुनौतियाँ शामिल थीं। उन्होंने पाया कि FAVA अपने काम में अविश्वसनीय रूप से कुशल है। अपने परीक्षणों में, इसने उन खतरनाक कार्यों को सफलतापूर्वक पकड़ा जिन्हें अन्य सुरक्षा प्रणालियाँ छोड़ देती थीं, और यह 90.5% तक सफल रहा। यह विशेष रूप से उन जटिल स्थितियों को पकड़ने में अच्छा था जहाँ खतरा घटनाओं के क्रम या छिपी हुई शर्तों पर निर्भर था।
हालाँकि, FAVA कोई जादू नहीं है। शोध पत्र स्पष्ट रूप से बताता है कि प्रणाली शुरुआती अनुवादक पर निर्भर करती है कि वह शेफ के बिखरे हुए नोट्स को सही ढंग से पढ़े। यदि अनुवादक कोई महत्वपूर्ण विवरण भूल जाता है (जैसे यह भूल जाना कि चूल्हा टूटा हुआ है), तो गणित का जज त्रुटि को नहीं पकड़ पाएगा। इसके अलावा, क्योंकि FAVA बहुत सावधान है, यह कभी-कभी केवल सुनिश्चित होने के लिए सुरक्षित कार्यों को भी ब्लॉक कर देता है (एक "फॉल्स अलार्म"), लेकिन लेखक कहते हैं कि रहस्यों को सुरक्षित रखने के लिए यह एक उचित समझौता है। उन्होंने दिखाया कि जबकि अन्य प्रणालियाँ या तो बहुत सी बुरी चीज़ों को होने देती हैं या आँख बंद करके सब कुछ ब्लॉक कर देती हैं, FAVA ने अस्पष्ट निर्देशों को गणितीय रूप से सत्यापित मानचित्र में बदलकर एक सही संतुलन बनाया।
संक्षेप में, FAVA यह सिद्ध करता है कि हम AI एजेंटों को केवल उनके व्यवहार की आशा करके नहीं, बल्कि उन्हें एक गणितीय रूप से जांचे गए भूलभुलैया (maze) से गुजरने के लिए मजबूर करके सुरक्षित बना सकते हैं जहाँ उनके हर कदम को लिया जाने से पहले सत्यापित किया जाता है। यह आपके डिजिटल सहायक को एक सीटबेल्ट और एक GPS देने जैसा है जो "STOP!" चिल्लाता है जैसे ही आप खाई की ओर गाड़ी चलाने की कोशिश करते हैं, यह सुनिश्चित करते हुए कि सबसे रचनात्मक AI भी सीमाओं के भीतर रहे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।