The Two Boundaries: Why Behavioral AI Governance Fails Structurally
यह शोध पत्र तर्क देता है कि व्यवहारिक एआई गवर्नेंस (behavioral AI governance) संरचनात्मक रूप से विफल होता है क्योंकि नीतियों के विरुद्ध मनमाने प्रोग्राम प्रभावों को सत्यापित करना अनिर्णायक (undecidable) है (राइस के प्रमेय के अनुसार), और "कोटर्मिनस गवर्नेंस" (coterminous governance) का प्रस्ताव देता है—जो कंप्यूटेशन को प्रभावों से अलग करने वाला एक वास्तुशिल्प पृथक्करण है जहाँ गवर्नेंस को निष्पादन पाइपलाइन में अंतर्निहित किया जाता है—जो क्षमता और नीति सीमाओं के मिसअलाइनमेंट से उत्पन्न होने वाले अपरिहार्य जोखिमों और अक्षमताओं को समाप्त करने का एकमात्र समाधान है।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "The Two Boundaries: Why Behavioral AI Governance Fails Structurally" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ अनुवाद दिया गया है।
मुख्य समस्या: "दो सीमाओं" का बेमेल होना (The "Two Boundaries" Mismatch)
कल्पना कीजिए कि आपके पास एक बहुत शक्तिशाली रोबोट है जो लगभग सब कुछ कर सकता है: ईमेल भेज सकता है, पैसे स्थानांतरित कर सकता है, या डेटाबेस रिकॉर्ड बदल सकता है। इसे सुरक्षित रखने के लिए, आप एक बाड़ (गवर्नेंस) लगाते हैं ताकि उसे बताया जा सके कि वह क्या करने की अनुमति है।
पेपर का तर्क है कि आज बनाए जा रहे लगभग हर AI सिस्टम में, दो अलग-अलग बाड़ें होती हैं जो आपस में मेल नहीं खातीं:
- क्षमता की बाड़ (Capability Fence - रोबोट क्या कर सकता है): यह रोबोट के टूल्स और कोड द्वारा निर्धारित होती है। यदि रोबोट के पास ईमेल भेजने का टूल है, तो वह ईमेल भेज सकता है।
- नियम की बाड़ (Rule Fence - रोबोट को क्या करने की अनुमति है): यह उन सुरक्षा नियमों और फिल्टरों द्वारा निर्धारित होती है जो आपने लिखे हैं।
समस्या: ये दोनों बाड़ें लगभग कभी भी एक ही आकार या आकार की नहीं होतीं।
- "जोखिम क्षेत्र" (Risk Zone - अनियंत्रित क्षमता): कभी-कभी रोबोट के पास एक ऐसा टूल होता है जिसका वह उपयोग कर सकता है, लेकिन आपके नियमों ने उस विशिष्ट टूल को कवर नहीं किया होता है। यह ऐसा है जैसे रोबोट के पास एक गुप्त दरवाज़ा (back door) है जिसके बारे में आपके सुरक्षा गार्ड को पता ही नहीं है। रोबोट चुपके से निकल जाता है, और बुरा प्रभाव पड़ता है।
- "थिएटर ज़ोन" (Theater Zone - गवर्नेंस थिएटर): कभी-कभी आपके नियम इस बात पर बहुत सख्त होते हैं कि रोबोट क्या नहीं कर सकता। यह एक सुरक्षा गार्ड की तरह है जो "उड़ने" की जाँच कर रहा है जबकि रोबोट के पास पंख ही नहीं हैं। आप उन चीजों पर पुलिसिंग करने में ऊर्जा बर्बाद कर रहे हैं जो संभव ही नहीं हैं, जबकि असली खतरे (बैक डोर) खुले रह जाते हैं।
पेपर कहता है कि इसे अधिक गार्ड या अधिक नियम जोड़कर ठीक करने की कोशिश करने से केवल "थिएटर" बड़ा होता है और "जोखिम" थोड़ा छोटा होता है, लेकिन यह अंतर कभी ठीक नहीं होता।
आप रोबोट को सिर्फ "देख" क्यों नहीं सकते (गणित की समस्या)
आप सोच सकते हैं, "हम एक सुपर-स्मार्ट मॉनिटर क्यों नहीं बनाते जो रोबोट को देखता रहे और अगर वह कुछ बुरा करता है तो उसे रोक दे?"
पेपर यह समझाने के लिए एक प्रसिद्ध गणितीय नियम का उपयोग करता है जिसे राइस का प्रमेय (Rice's Theorem) कहा जाता है, जो बताता है कि बुद्धिमान और लचीले AI के लिए यह असंभव क्यों है।
- उपमा (Analogy): कल्पना कीजिए कि आप केवल स्क्रिप्ट देखकर किसी फिल्म के अंत का अनुमान लगाने की कोशिश कर रहे हैं। यदि फिल्म छोटी और सरल है, तो आप अंत का अनुमान लगा सकते हैं। लेकिन यदि फिल्म एक अनंत, जटिल कहानी है जो दर्शकों के आधार पर बदलती रहती है, तो कोई भी एल्गोरिदम फिल्म चलने से पहले 100% निश्चितता के साथ अंत की भविष्यवाणी नहीं कर सकता।
- परिणाम: क्योंकि AI इतना लचीला है (यह अपना खुद का कोड लिख सकता है और टूल्स को नए तरीकों से मिला सकता है), आप पहले से यह गणितीय रूप से सिद्ध नहीं कर सकते कि कोई विशिष्ट कार्य सुरक्षित होगा। आप केवल अनुमान लगा सकते हैं। और क्योंकि आप केवल अनुमान लगा सकते हैं, इसलिए हमेशा एक संभावना बनी रहती है कि रोबोट कुछ ऐसा बुरा करे जिसे आपके मॉनिटर ने नहीं देखा।
समाधान: "ऑर्डर टेकर" बनाम "शेफ" (The "Order Taker" vs. The "Chef")
पेपर एक संरचनात्मक समाधान प्रस्तावित करता है। रोबोट को बुरा करने से रोकने के लिए उसे देखने के बजाय, आप इस बात को बदलते हैं कि रोबोट कैसे बनाया गया है।
पुराना तरीका (व्यवहार संबंधी गवर्नेंस - Behavioral Governance):
रोबोट एक शेफ (Chef) है जिसके पास चूल्हा, चाकू और गैस तक सीधी पहुँच है। आप उनके बगल में एक क्लिपबोर्ड लेकर खड़े होते हैं, और यदि वे गलत सामग्री की ओर हाथ बढ़ाते हैं, तो आप "रुको!" चिल्लाते हैं।
- दोष: शेफ आपके चिल्लाने से पहले गैस पकड़ सकता है, या वे खाना बनाने का एक नया तरीका ढूंढ सकते हैं जो आपने अपने क्लिपबोर्ड पर नहीं लिखा था।
नया तरीका (संरचनात्मक गवर्नेंस / सहवर्ती गवर्नेंस - Structural Governance / Coterminous Governance):
आप शेफ को रसोई (Kitchen) से अलग कर देते हैं।
- शेफ (गणना/Computation): AI को केवल सोचने और एक रेसिपी (एक "निर्देश") लिखने की अनुमति है। उसके पास चूल्हा, चाकू या गैस छूने के लिए कोई हाथ नहीं हैं। उसका कोई भौतिक अस्तित्व (physical hands) नहीं है।
- ऑर्डर टेकर (Governance Boundary): एक अलग, सख्त सिस्टम उस रेसिपी को प्राप्त करता है। वह जाँच करता है: "क्या इस रेसिपी में सही सामग्रियां हैं? क्या यह सुरक्षित है?"
- यदि हाँ, तो ऑर्डर टेकर रसोई में जाता है और भोजन बनाता है।
- यदि नहीं, तो ऑर्डर टेकर रेसिपी को फेंक देता है।
यह क्यों काम करता है:
- AI कुछ भी बुरा नहीं कर सकता क्योंकि उसके पास दुनिया को छूने के लिए वास्तव में टूल्स ही नहीं हैं।
- हर एक क्रिया ऑर्डर टेकर के माध्यम से ही होनी चाहिए।
- यहाँ कोई "जोखिम क्षेत्र" नहीं है क्योंकि AI के पास कोई गुप्त बैक डोर नहीं है।
- यहाँ कोई "थिएटर ज़ोन" नहीं है क्योंकि ऑर्डर टेकर केवल उन रेसिपी की जाँच करता है जिन्हें वास्तव में पकाया जा सकता है।
"निगरानी" (Monitoring) पर्याप्त क्यों नहीं है
पेपर यह भी समझाता है कि केवल AI जो करता है उसे "लॉग" करना या "रिकॉर्ड" करना गवर्नेंस नहीं माना जा सकता।
- उपमा: एक बैंक में सुरक्षा कैमरे की कल्पना करें। यदि कैमरा एक लुटेरे को देखता है, तो वह अपराध को रिकॉर्ड करता है। लेकिन कैमरे ने चोरी को रोका नहीं।
- गणित: यदि एक कैमरा 99% चोरियों को पकड़ लेता है, तो यह सुनने में बहुत अच्छा लगता है। लेकिन यदि बैंक में प्रतिदिन 1,000 लेनदेन होते हैं, तो इस बात की संभावना लगभग 100% है कि कम से कम एक चोरी उस 1% के गैप से निकल जाएगी।
- बिंदु: आपको क्रिया होने के बाद उसे रिकॉर्ड करने के बजाय, क्रिया होने से पहले उसे रोकना होगा।
निष्कर्ष (The Bottom Line)
पेपर निष्कर्ष निकालता है कि AI को वास्तव में शासित करने के लिए, आपको मौजूदा सिस्टम के ऊपर केवल अधिक फिल्टर या नियम जोड़ने की आवश्यकता नहीं है। आपको सिस्टम को इस तरह से पुनर्गठित (rebuild) करना होगा ताकि AI केवल चीजें मांग सके, और एक अलग, सख्त गेटकीपर (gatekeeper) तय करे कि वे चीजें होंगी या नहीं।
- यदि सीमाएं मेल खाती हैं: तो AI डिज़ाइन द्वारा सुरक्षित है (स्ट्रक्चरल गवर्नेंस)।
- यदि सीमाएं मेल नहीं खाती हैं: तो आप चाहे कितने भी नियम जोड़ लें, हमेशा कुछ जोखिम और कुछ व्यर्थ प्रयास बना रहेगा (बिहेवियरल गवर्नेंस)।
लेखकों ने गणितीय रूप से Coq (कंप्यूटर कोड) का उपयोग करके यह सिद्ध किया है कि यह "ऑर्डर टेकर" दृष्टिकोण ही एकमात्र तरीका है जिससे यह गारंटी दी जा सकती है कि प्रत्येक क्रिया नियंत्रित (governed) है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।