Position: A Three-Layer Probabilistic Assume-Guarantee Architecture Is Structurally Required for Safe LLM Agent Deployment
यह स्थिति पत्र (position paper) तर्क देता है कि LLM एजेंटों का सुरक्षित परिनियोजन संरचनात्मक रूप से एक तीन-स्तरीय, अनुबंध-आधारित संभाव्यता आर्किटेक्चर की मांग करता है ताकि विशिष्ट सुरक्षा आयामों—सिमेंटिक इंटेंट (semantic intent), पर्यावरणीय वैधता (environmental validity), और गतिशील व्यवहार्यता (dynamical feasibility)—को लागू किया जा सके, क्योंकि कोई भी एकल एब्स्ट्रैक्शन लेयर एक साथ इन तीनों की गारंटी नहीं दे सकती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ एक सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके पेपर की व्याख्या दी गई है।
मुख्य समस्या: एक सुरक्षा कवच पर्याप्त नहीं है
कल्पना कीजिए कि आप अपने घर को चलाने के लिए एक बहुत ही बुद्धिमान लेकिन थोड़े अनिश्चित (unpredictable) रोबोटिक बटलर को काम पर रख रहे हैं। आप उसे कार्यों की एक सूची देते हैं: "रसोई में जाओ, पानी लाओ, और दादी तक पहुँचाओ।"
यह पेपर तर्क देता है कि इस रोबोट को केवल एक सुरक्षा जाँच (जैसे कि एक अकेला "स्टॉप" साइन या एक नियम पुस्तिका) के माध्यम से सुरक्षित रखना संरचनात्मक रूप से असंभव है। आप उस एकल जाँच को कितना भी स्मार्ट क्यों न बना लें, वह किसी न किसी बिंदु पर विफल हो ही जाएगी क्योंकि रोबोट को तीन अलग-अलग प्रकार के खतरों का सामना तीन अलग-अलग समय पर करना पड़ता है।
इसे एक हवाई अड्डे पर तीन-चरणीय सुरक्षा चेकपॉइंट की तरह समझें। आप एक यात्री के पासपोर्ट, उनके सामान और उनके विमान उड़ाने की क्षमता को एक ही सटीक क्षण में चेक नहीं कर सकते। आपको इसे क्रम में करना होगा।
सुरक्षा की तीन परतें
लेखक प्रस्तावित करते हैं कि हमें सुरक्षा की तीन अलग-अलग "परतों" की आवश्यकता है, जिनमें से प्रत्येक एक अलग चीज़ को अलग समय पर जाँचती है। वे इसे थ्री-लेयर प्रोबेबिलिस्टिक आर्किटेक्चर (Three-Layer Probabilistic Architecture) कहते हैं।
1. यूजर लेयर: "इरादा जाँच" (रोबोट के हिलने से पहले)
- यह क्या जाँचता है: क्या योजना समझदारी भरी है? क्या यह विनम्र है? क्या यह नियमों का पालन करती है?
- उपमा: कल्पना कीजिए कि एक मानवीय संपादक (human editor) आपकी कहानी प्रकाशित होने से पहले पढ़ रहा है। वे जाँचते हैं: "क्या आपने रोबोट को पानी लाने के लिए कहा? हाँ। क्या आपने दादी को चोट पहुँचाने के लिए कहा? नहीं। क्या योजना तार्किक है?"
- इसे अपनी अलग परत की आवश्यकता क्यों है: रोबोट अभी तक हिला भी नहीं है। उसे नहीं पता कि गलियारा अवरुद्ध है या बाहर बारिश हो रही है। वह केवल वही जानता है जो आपने कहा है। यह परत रोबोट को एक खराब योजना (जैसे "कैमरा चालू रखकर बाथरूम में जाना") शुरू करने से ही रोक देती है।
2. ऑपरेशनल लेयर: "दुनिया की जाँच" (रोबोट के कार्य करने से पहले)
- यह क्या जाँचता है: क्या इस योजना के लिए दुनिया अभी सुरक्षित है?
- उपमा: कल्पना कीजिए कि एक ट्रैफिक कंट्रोलर लाइव रडार देख रहा है। एडिटर ने "रसोई तक जाने" की योजना को मंजूरी दे दी है, लेकिन ट्रैफिक कंट्रोलर देखता है कि हॉल में एक विशाल पेड़ गिर गया है। वे कहते हैं, "रुको! तुम अभी वहाँ नहीं जा सकते।"
- इसे अपनी अलग परत की आवश्यकता क्यों है: एडिटर (लेयर 1) उस पेड़ को नहीं देख सका क्योंकि जब योजना लिखी गई थी तब वह वहाँ नहीं था। रोबोट को वर्तमान दुनिया (सेंसर, कैमरे) को देखना होगा ताकि वह जान सके कि आगे बढ़ना सुरक्षित है या नहीं।
3. फंक्शनल लेयर: "क्रिया जाँच" (रोबोट के चलते समय)
- यह क्या जाँचता है: क्या रोबोट उस क्षण में सुरक्षित रूप से चल रहा है?
- उपमा: कल्पना कीजिए कि कार के अंदर एक सीटबेल्ट और एयरबैग सिस्टम है। भले ही योजना अच्छी थी और सड़क साफ थी, लेकिन हवा के एक अचानक झोंके से कार को धक्का लग सकता है। यह परत वह भौतिक तंत्र है जो दुर्घटना से बचने के लिए रोबोट की गति को तुरंत ठीक करता है।
- इसे अपनी अलग परत की आवश्यकता क्यों है: ट्रैफिक कंट्रोलर (लेयर 2) यह अनुमान नहीं लगा सकता कि अचानक कोई फिसलन होगी या कोई व्यक्ति रोबोट के सामने आ जाएगा। यह परत भौतिक वास्तविकता के प्रति तुरंत प्रतिक्रिया देती है।
आप इन्हें मिला क्यों नहीं सकते
पेपर एक मजबूत गणितीय दावा करता है: आप इन तीन परतों को एक में नहीं मिला सकते।
- "टाइम ट्रैवल" की समस्या: "दुनिया" (लेयर 2) को जाँचने के लिए, आपको दुनिया को देखना आवश्यक है। लेकिन "इरादे" (लेयर 1) को जाँचने के लिए, आपको दुनिया को देखने से पहले करना होता है। यदि आप दोनों को एक साथ करने की कोशिश करते हैं, तो या तो आप इरादे को बहुत देर से जाँच रहे हैं (जब तक कि रोबोट ने हिलना शुरू न कर दिया हो) या दुनिया को बहुत जल्दी जाँच रहे हैं (इससे पहले कि आप जान सकें कि दुनिया वास्तव में कैसी दिखती है)।
- "ब्लैक बॉक्स" की समस्या: रोबोट (LLM) अप्रत्याशित है। वह भ्रमित (hallucinate) हो सकता है या गलती कर सकता है। यदि आप एक बड़े सुरक्षा जाल पर भरोसा करते हैं, और उस जाल में एक छेद है, तो पूरा सिस्टम विफल हो जाता है। तीन अलग-अलग जाल होने से, यदि एक में छेद है, तो दूसरे गलती को पकड़ सकते हैं।
"कॉन्ट्रैक्ट" (अनुबंध) प्रणाली
लेखक सुझाव देते हैं कि इन परतों को कॉन्ट्रैक्ट्स (Contracts) का उपयोग करके एक-दूसरे से बात करनी चाहिए।
- लेयर 1 एक कॉन्ट्रैक्ट साइन करती है: "मैं वादा करती हूँ कि यह योजना सोचने के लिए सुरक्षित है।"
- लेयर 2 एक कॉन्ट्रैक्ट साइन करती है: "मैं वादा करती हूँ कि दुनिया में प्रवेश करना सुरक्षित है।"
- लेयर 3 एक कॉन्ट्रैक्ट साइन करती है: "मैं वादा करती हूँ कि क्रिया को निष्पादित करना सुरक्षित है।"
यदि लेयर 1 अपना कॉन्ट्रैक्ट तोड़ती है, तो लेयर 2 को जाँच करने की आवश्यकता ही नहीं है। यदि लेयर 2 अपना कॉन्ट्रैक्ट तोड़ती है, तो लेयर 3 रोबोट को तुरंत रोक देती है। यह सुरक्षा की एक ऐसी श्रृंखला बनाता है जहाँ कुल सुरक्षा इन तीनों परतों के मिलकर काम करने का परिणाम होती है।
शेष चुनौतियाँ
पेपर स्वीकार करता है कि यह एक ब्लूप्रिंट है, कोई तैयार उत्पाद नहीं। वास्तविक जीवन में उपयोग करने से पहले तीन बड़ी बाधाओं को हल करना बाकी है:
- संभावनाओं की गणना: यह गणना करना कठिन है कि प्रत्येक लेयर "कितनी सुरक्षित" है क्योंकि रोबोट का व्यवहार हर बार बदल जाता है (यह सिक्का उछालने जैसा नहीं है)।
- बदलते नियम: यदि रोबोट का वातावरण बदलता है (जैसे, फर्नीचर खिसक जाता है), तो सुरक्षा नियमों को पूरे सिस्टम को तोड़े बिना सहजता से बदलने की आवश्यकता हो सकती है।
- टीम वर्क: यह सिस्टम एक रोबोट के लिए डिज़ाइन किया गया है। यदि आपके पास एक-दूसरे से बात करने वाले रोबोटों की एक टीम है, तो वे एक-दूसरे को धोखा दे सकते हैं, और हमारे पास अभी इसके लिए कोई सुरक्षा परत नहीं है।
सारांश
पेपर कहता है: AI रोबोटों के लिए एक विशाल "सुरक्षा कवच" बनाने की कोशिश करना बंद करें। इसके बजाय, तीन अलग-अलग, विशिष्ट कवच बनाएँ जो एक विशिष्ट क्रम में काम करते हैं:
- योजना की जाँच करें (क्या विचार अच्छा है?)
- दुनिया की जाँच करें (क्या वातावरण सुरक्षित है?)
- क्रिया की जाँच करें (क्या गति सुरक्षित है?)
इन जाँचों को अलग करके ही हम वास्तव में गारंटी दे सकते हैं कि एक AI रोबोट किसी को चोट नहीं पहुँचाएगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।