Cryptographic certificates of validity for trustworthy AI
यह शोधपत्र संक्षिप्त क्रिप्टोग्राफिक प्रमाणपत्र उत्पन्न करके विश्वसनीय एजेंटिक एआई (agentic AI) के लिए एक रूपरेखा प्रस्तावित करता है जो गणितीय रूप से यह सिद्ध करते हैं कि एक एजेंट के कार्य औपचारिक रूप से निर्दिष्ट नीतियों का अनुपालन करते हैं, जिससे पुन: निष्पादन या एजेंट में विश्वास के बिना स्वतंत्र सत्यापन सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ इस शोध पत्र (paper) का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।
मुख्य विचार: व्यक्ति पर नहीं, प्रमाण (Proof) पर भरोसा करें
कल्पना कीजिए कि आप अपने लिए फ्लाइट बुक करने के लिए एक रोबोट को काम पर रख रहे हैं। अतीत में, हम रोबोट्स (या AI एजेंट्स) पर इसलिए भरोसा करते थे क्योंकि हमें पता होता था कि उन्हें किसने बनाया है या उनके पास एक डिजिटल सिग्नेचर होता था जो कहता था, "मैं कंपनी X से हूँ।"
लेकिन क्या होगा अगर रोबोट में कोई खराबी (bug) हो, या वह एक "बाइज़ेंटाइन" (Byzantine) रोबोट हो (एक फैंसी शब्द जिसका अर्थ है ऐसा रोबोट जो अजीब या दुर्भावनापूर्ण व्यवहार कर सकता है)? एक सिग्नेचर केवल यह प्रमाणित करता है कि संदेश किसने भेजा है, न कि यह कि संदेश सही या सुरक्षित है।
मर्डोक गैब्बे (Murdoch Gabbay) का पेपर AI पर भरोसा करने का एक नया तरीका प्रस्तावित करता है: रोबोट की पहचान पर भरोसा करने के बजाय, हम एक क्रिप्टोग्राफिक सर्टिफिकेट (cryptographic certificate) पर भरोसा करते हैं जो यह सिद्ध करता है कि रोबोट का कार्य नियमों का पालन करता है।
इसे इस तरह समझें:
- पुराना तरीका: आप एक शेफ पर इसलिए भरोसा करते हैं क्योंकि उसने एक विशिष्ट टोपी पहनी है और उसके पास लाइसेंस है। आप उम्मीद करते हैं कि उसने सूप में ज़हर नहीं मिलाया होगा।
- नया तरीका: शेफ आपको एक सीलबंद, अटूट रसीद थमाता है। यह रसीद गणितीय रूप से प्रमाणित करती है कि सूप सही तापमान पर, सही सामग्री के साथ पकाया गया था, और उसमें कोई ज़हर नहीं मिलाया गया था। आपको शेफ का नाम जानने या उसे खाना बनाते हुए देखने की ज़रूरत नहीं है; आपको बस रसीद चेक करनी है।
यह कैसे काम करता है: "जादुई अनुवादक" (The "Magic Translator")
पेपर इन रसीदों को बनाने की तीन-चरणीय प्रक्रिया का वर्णन करता है।
1. नियम लिखना (The "Law")
सबसे पहले, हम उन नियमों को लिखते हैं जिनका पालन हम चाहते हैं कि AI करे (जैसे, "कभी भी $500 से अधिक खर्च न करें" या "केवल उन्हीं देशों की उड़ान भरें जहाँ यात्रा संबंधी चेतावनी न हो") और उन्हें लॉजिक (logic) नामक एक सख्त गणितीय भाषा में लिखते हैं।
- उपमा: कल्पना कीजिए कि आप एक बोर्ड गेम के नियमों को ऐसी भाषा में लिख रहे हैं जिसे कंप्यूटर पूरी तरह समझ सके, जिससे "शायद" या "मुझे लगता है" जैसी कोई गुंजाइश न रहे।
2. अनुवाद (The "Compiler")
इसके बाद, हम एक विशेष टूल (कंपाइलर) का उपयोग करते हैं जो उन तार्किक नियमों को एक गणितीय पहेली (math puzzle) में अनुवाद करता है।
- जादू: पेपर एक चतुर ट्रिक समझाता है जहाँ "सत्य" (True) का अर्थ संख्या 0 हो जाता है, और "असत्य" (False) का अर्थ एक धनात्मक संख्या (positive number) हो जाता है।
- उपमा: एक तराजू की कल्पना करें। यदि AI ने नियमों का पालन किया, तो तराजू बिल्कुल शून्य पर संतुलित होगा। यदि AI ने कोई नियम तोड़ा, तो तराजू झुक जाएगा और एक भारी, धनात्मक संख्या दिखाएगा। लक्ष्य यह सिद्ध करना है कि तराजू शून्य पर है।
3. सर्टिफिकेट (The "Receipt")
AI (या एक सहायक) गणितीय पहेली को हल करता है और एक छोटा, क्रिप्टोग्राफिक प्रमाण (proof) उत्पन्न करता है। यह प्रमाण कहता है, "मेरे पास एक गुप्त समाधान है जो तराजू को शून्य पर संतुलित करता है।"
- खास बात: एक सत्यापनकर्ता (verifier - वह व्यक्ति जो AI की जाँच कर रहा है) इस छोटे से प्रमाण को देखकर तुरंत जान सकता है कि नियमों का पालन किया गया था। उन्हें AI के निजी विचारों को देखने की आवश्यकता नहीं है, उन्हें AI के पूरे कैलकुलेशन को दोबारा चलाने की आवश्यकता नहीं है, और उन्हें AI पर भरोसा करने की आवश्यकता नहीं है। वे बस गणित की जाँच करते हैं।
एक ठोस उदाहरण: दो की शक्ति (The Power of Two)
पेपर यह दिखाने के लिए कि यह कैसे काम करता है, (2 की घात 2) की गणना करने का एक सरल उदाहरण उपयोग करता है।
कल्पना कीजिए कि AI दावा करता है, ""।
यह साबित करने के लिए कि यह झूठ नहीं है, AI केवल "4" नहीं कहता। वह एक डेरिवेशन ट्री (derivation tree) (चरण-दर-चरण इतिहास) प्रदान करता है:
- चरण 1: (प्रारंभिक बिंदु)।
- चरण 2: (चरण 1 के आधार पर)।
- चरण 3: (चरण 2 के आधार पर)।
क्रिप्टोग्राफिक सर्टिफिकेट यह प्रमाणित करता है कि ये चरण सही ढंग से जुड़े हुए हैं। यदि AI कोई चरण छोड़ने या संख्या बदलने की कोशिश करता है, तो गणितीय पहेली विफल हो जाएगी, और सर्टिफिकेट अमान्य हो जाएगा।
AI एजेंट्स के लिए यह क्यों महत्वपूर्ण है
पेपर का तर्क है कि जैसे-जैसे AI एजेंट वास्तविक काम करने लगेंगे (फ्लाइट बुक करना, इनवॉइस अप्रूव करना, कोड तैनात करना), हमें उनके कार्यों को होने के बाद लॉग्स देखने के बजाय, होने से पहले सत्यापित करने के तरीके की आवश्यकता होगी।
- दोबारा चलाने की आवश्यकता नहीं: सर्टिफिकेट की जाँच करना तेज़ है। आपको AI के काम को दोबारा करने की ज़रूरत नहीं है।
- गोपनीयता (Privacy): "जीरो-नॉलेज" (Zero-Knowledge) विशेषताओं का उपयोग करके, AI यह सिद्ध कर सकता है कि उसने नियमों का पालन किया है बिना अपने निजी डेटा (जैसे आपका क्रेडिट कार्ड नंबर या गुप्त रणनीति) को प्रकट किए।
- अंधविश्वास की आवश्यकता नहीं: आपको AI के डेवलपर पर भरोसा करने की आवश्यकता नहीं है। आप केवल गणित पर भरोसा करते हैं।
यह पेपर क्या नहीं करता (महत्वपूर्ण सीमाएँ)
लेखक बहुत सावधानी से यह स्पष्ट करते हैं कि यह तकनीक क्या नहीं कर सकती:
- यह आपके लिए नियम नहीं लिखता। सर्टिफिकेट यह सिद्ध करता है कि AI ने उन नियमों का पालन किया जो आपने उसे दिए थे। यदि आपने एक बुरा नियम लिखा (जैसे, "सारा पैसा खर्च कर दो"), तो सर्टिफिकेट यह सिद्ध करेगा कि AI ने उस बुरे नियम का पूरी तरह से पालन किया।
- यह सुरक्षा की गारंटी नहीं देता। यह केवल यह गारंटी देता कि विशिष्ट गणितीय शर्त पूरी की गई थी। यह यह साबित नहीं करता कि वह शर्त स्वयं बुद्धिमानीपूर्ण, नैतिक या सुरक्षित थी।
- यह मानवीय निरीक्षण (human oversight) का स्थान नहीं लेता। मनुष्यों को अभी भी यह तय करने की आवश्यकता है कि नियम क्या होने चाहिए और सिस्टम का ऑडिट करना चाहिए।
सारांश
यह पेपर AI के लिए एक "प्रूफ-कैरिंग एक्शन" (Proof-Carrying Action) प्रणाली का प्रस्ताव करता है। जिस तरह एक ड्राइवर यह साबित करने के लिए लाइसेंस ले जा सकता है कि उसे गाड़ी चलाने की अनुमति है, उसी तरह एक AI एजेंट एक क्रिप्टोग्राफिक सर्टिफिकेट ले जाएगा जो यह सिद्ध करेगा कि उसका कार्य सही है।
यह औपचारिक तर्क (Formal Logic) (नियमों) और क्रिप्टोग्राफी (प्रमाण) के बीच के अंतर को पाटता है, जिससे हम AI के निजी डेटा को देखे बिना या उस पर भरोसा किए बिना यह सत्यापित कर सकते हैं कि वह सही व्यवहार कर रहा है। यह कहने का एक तरीका है: "मुझे आप पर भरोसा नहीं है, लेकिन मुझे उस गणित पर भरोसा है जो आपने अभी मुझे दिया है।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।