Autoformalization of Agent Instructions into Policy-as-Code
यह शोध पत्र एक LLM-आधारित ऑटोफॉर्मलाइजेशन पाइपलाइन प्रस्तुत करता है जो प्राकृतिक भाषा एजेंट निर्देशों और नीतियों को औपचारिक रूप से सत्यापित सिडर पॉलिसी लैंग्वेज (Cedar Policy Language) कोड में अनुवादित करता है, जो संभाव्य गार्डरेल्स (probabilistic guardrails) और हस्तलिखित प्रतीकात्मक प्रवर्तन (hand-coded symbolic enforcement) दोनों से बेहतर स्केलेबल और कठोर सुरक्षा गारंटी प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अपने मेडिकल रिकॉर्ड्स को संभालने के लिए एक बहुत ही स्मार्ट, बहुत तेज़ रोबोटिक असिस्टेंट को काम पर रखा है। यह रोबोट शक्तिशाली है; यह फाइलों को पढ़ सकता है, नए नोट्स लिख सकता है, और जानकारी प्राप्त करने के लिए अन्य टूल्स को कॉल कर सकता है। लेकिन क्योंकि यह इतना शक्तिशाली है, यदि यह भ्रमित हो जाता है या इसे धोखा दिया जाता है, तो यह गलती से किसी मरीज का इतिहास मिटा सकता है या गलत व्यक्ति के लिए प्रिस्क्रिप्शन लिख सकता है।
वर्तमान सुरक्षा विधियों के साथ समस्या यह है कि यह एक बच्चे को सुरक्षित रहने के लिए केवल यह बताने जैसा है कि, "कृपया सावधान रहें!" या इस उम्मीद में कि कोई शिक्षक ध्यान देगा यदि वह कुछ गलत करता है। कभी-कभी रोबोट चेतावनी को अनदेखा कर देता है, या शिक्षक उसे देख नहीं पाता है।
यह शोध पत्र सुरक्षा का एक नया तरीका प्रस्तुत करता है: पॉलिसी-एज़-कोड (Policy-as-Code)। केवल रोबोट को अंग्रेजी में निर्देश देने के बजाय, लेखक उन नियमों को एक सख्त, गणितीय "कानून की किताब" में अनुवाद करते हैं जिससे रोबोट बहस नहीं कर सकता।
उन्होंने इसे कैसे किया, यहाँ एक रचनात्मक उपमा दी गई है:
"वेरिफिकेशन सैंडविच" (Verification Sandwich)
लेखकों ने अव्यवस्थित मानवीय निर्देशों को सख्त रोबोटिक कानूनों में बदलने के लिए तीन-परत वाला सिस्टम बनाया है। वे इसे वेरिफिकेशन सैंडविच कहते हैं।
निचला बन (द ग्राउंडिंग लेयर - The Grounding Layer):
इससे पहले कि रोबोट नियमों का पालन कर सके, उसे यह जानना होगा कि "सामग्री" क्या है। यह परत रोबोट के टूल्स और वास्तविक दुनिया की वस्तुओं (जैसे "मरीज", "डॉक्टर", या "प्रिस्क्रिप्शन") को देखती है और एक सख्त डिक्शनरी बनाती है। यह सुनिश्चित करती है कि जब रोबोट "मरीज" कहता है, तो उसका वास्तव में मतलब डेटाबेस में मौजूद एक वास्तविक व्यक्ति से है, न कि किसी काल्पनिक नाम से।मीट (द मॉडल लेयर - The Model Layer):
यहीं पर "स्मार्ट" वाला हिस्सा होता है। एक बड़ा AI मॉडल (रोबोट का मस्तिष्क) मानवीय निर्देशों को पढ़ता है (जैसे, "एलर्जी की जांच किए बिना कभी प्रिस्क्रिप्शन न लिखें") और उन्हें सख्त कानून की किताब की भाषा (जिसे Cedar कहा जाता है) में अनुवाद करने की कोशिश करता है। इसे एक कविता को कानूनी अनुबंध में बदलने की कोशिश करने वाले अनुवादक के रूप में समझें।ऊपरी बन (द सेफ्टी लेयर - The Safety Layer):
यह सबसे महत्वपूर्ण हिस्सा है। अनुवादित कानून की किताब को केवल स्वीकार नहीं किया जाता है; इसे दो आलोचकों द्वारा एक टॉर्चर टेस्ट (कठोर परीक्षण) से गुजरना पड़ता है:- कठोर आलोचक (रोबोट वकील - The Hard Critic): यह एक कंप्यूटर प्रोग्राम है जो सिंटैक्स त्रुटियों की जाँच करता है। यह पूछता है: "क्या यह वाक्य व्याकरण की दृष्टि से सही है? क्या यह खुद का खंडन करता है? क्या इसका पालन करना असंभव है?" यदि कानून की किताब में कोई टाइपो (लिखने की गलती) है, तो यह आलोचक इसे तुरंत खारिज कर देता है।
- कोमल आलोचक (मानवीय न्यायाधीश - The Soft Critic): यह एक अन्य AI है जो मूल मानवीय निर्देशों और नई कानून की किताब को पढ़ता है ताकि यह देख सके कि क्या वे एक जैसा "महसूस" करते हैं। यह पूछता है: "क्या यह सख्त नियम वास्तव में वही मतलब रखता है जो इंसान चाहता था, या अनुवादक ने नियम की भावना को गलत समझ लिया है?"
यदि कानून की किताब दोनों आलोचकों को पास कर लेती है, तो इसे स्वीकृत कर दिया जाता है। यदि नहीं, तो सिस्टम वापस लूप में जाता है, त्रुटियों को ठीक करता है, और फिर से प्रयास करता है।
परिणाम: एक डिजिटल बाउंसर (Digital Bouncer)
एक बार जब नियम स्वीकृत हो जाते हैं, तो उन्हें एक "पॉलिसी इंजन" में लोड कर दिया जाता है। इस इंजन को एक क्लब के बाउंसर के रूप में समझें।
- हर बार जब रोबोट सहायक कुछ करने की कोशिश करता है (जैसे "प्रिस्क्रिप्शन लिखना"), तो उसे बाउंसर से पूछना पड़ता है।
- बाउंसर इस बात की परवाह नहीं करता कि रोबोट क्या कहता है या वह क्या सोचता है कि अच्छा विचार है। बाउंसर केवल सख्त कानून की किताब को देखता है।
- यदि कोई क्रिया नियम तोड़ती है, तो बाउंसर तुरंत "ना" कहता है। रोबोट बात करके अपनी बात नहीं मनवा सकता, भले ही उसे किसी हैकर द्वारा धोखा दिया गया हो।
उन्होंने क्या परीक्षण किया
लेखकों ने इस प्रणाली का परीक्षण MedAgentBench नामक एक मेडिकल बेंचमार्क पर किया। उन्होंने अपने स्वचालित "बा बाउंसर" की तुलना एक पिछले तरीके से की जहाँ मनुष्यों को सुरक्षा नियम मैन्युअल रूप से लिखने पड़ते थे।
- पुराना तरीका: मनुष्यों ने 23 विशिष्ट परिदृश्यों के लिए नियम लिखे। रोबोट उन 23 के लिए सुरक्षित था, लेकिन अन्य 65 नियमों को तोड़ सकता था।
- नया तरीका: उनकी प्रणाली ने सभी 88 परिदृश्यों के लिए स्वचालित रूप से नियम उत्पन्न किए।
- परिणाम: जब उन्होंने रोबोट को गलतियाँ करने के लिए उकसाने की कोशिश की (जैसे एलर्जी की जांच किए बिना प्रिस्क्रिप्शन लिखना), तो उनकी प्रणाली ने पुराने मैनुअल सिस्टम की तुलना में बहुत अधिक बार गलत कार्यों को रोका। वास्तव में, जब रोबोट ने बिना अनुमति के डेटा लिखने की कोशिश की, तो उनकी प्रणाली ने उन विशिष्ट प्रयासों के लिए 100% बार इसे ब्लॉक कर दिया।
यह क्यों मायने रखता है
यह शोध पत्र तर्क देता है कि यह दृष्टिकोण अधिक सुरक्षित है क्योंकि:
- यह अनुमान नहीं है: अन्य सुरक्षा उपकरणों के विपरीत जो संभावना (जैसे, "मुझे लगता है कि यह 90% सुरक्षित है") पर निर्भर करते हैं, यह प्रणाली गणित पर निर्भर है। या तो यह क्रिया को अनुमति देती है या नहीं देती है।
- इसे धोखा देना कठिन है: क्योंकि नियम रोबोट के "मस्तिष्क" के बाहर हैं, इसलिए कोई हैकर रोबोट को नियमों को अनदेखा करने के लिए मजबूर नहीं कर सकता। बाउंसर रोबोट से अलग है।
- यह स्केल (विस्तार) कर सकता है: मनुष्य हर संभव स्थिति के लिए हजारों नियम नहीं लिख सकते। यह प्रणाली स्वचालित रूप से हजारों प्राकृतिक भाषा नियमों को कोड में अनुवाद कर सकती है।
संक्षेप में, यह शोध पत्र दिखाता है कि "कृपया सावधान रहें" को "यहाँ सुरक्षित रहने का सटीक गणितीय सूत्र है" में बदलकर, हम ऐसे AI एजेंट बना सकते हैं जिन्हें धोखा देना बहुत कठिन है और जो स्वास्थ्य सेवा जैसे उच्च-दांव वाले वातावरण में बहुत अधिक विश्वसनीय हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।