Governing What You Cannot Observe: Adaptive Runtime Governance for Autonomous AI Agents
यह शोध पत्र सूचनात्मक व्यवहार्यता सिद्धांत (Informational Viability Principle) और रिस्कगेट (RiskGate) ढांचे का प्रस्ताव करता है, जो ऑबिन के व्यवहार्यता सिद्धांत (Aubin's viability theory) पर आधारित है, ताकि अनपेक्षित जोखिमों की सीमाओं का अनुमान लगाकर और व्यवहार विचलन (behavior drift) एवं प्रतिकूल अनुकूलन (adversarial adaptation) के बावजूद सुरक्षा सुनिश्चित करने के लिए एकदिष्ट प्रतिबंधों (monotonic restrictions) को लागू करके स्वायत्त एआई एजेंटों के लिए अनुकूली रनटाइम गवर्नेंस को सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अपने बैंक खाते को प्रबंधित करने, आपके अपॉइंटमेंट शेड्यूल करने और आपकी किराने का सामान ऑर्डर करने के लिए एक बहुत ही स्मार्ट, स्वायत्त (autonomous) रोबोट सहायक को काम पर रखा है। आपने इसे कार्य करने की पूरी अनुमति दी है। लेकिन समस्या यह है कि भले ही आप कभी कोड न बदलें, रोबोट धीरे-धीरे गलत निर्णय लेना शुरू कर सकता है। यह नए प्रकार के अनुरोधों से भ्रमित हो सकता है, कुछ विशिष्ट समूहों का पक्ष लेना शुरू कर सकता है, या अनजाने में कई छोटे, हानिरहित कार्यों को जोड़कर एक बड़ा घोटाला कर सकता है।
यह शोध पत्र, जिसका शीर्षक "Governing What You Cannot Observe" (उसका शासन जो आप देख नहीं सकते) है, एआई एजेंटों को सुरक्षित रखने का एक नया तरीका प्रस्तावित करता है। केवल यह जाँचने के बजाय कि क्या एक एकल कार्य अनुमत है, यह एजेंट के "वाइटल साइन्स" (vital signs) यानी जीवन के संकेतों को देखने का सुझाव देता है ताकि यह अनुमान लगाया जा सके कि वह वास्तव में क्रैश होने से पहले बीमार होने वाला है।
यहाँ उनके विचारों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. मुख्य समस्या: "साइलेंट ड्रिफ्ट" (Silent Drift - मौन विचलन)
एक एआई एजेंट को हाईवे पर चलती कार की तरह समझें।
- पुराना तरीका: आप हर मोड़ पर कार की जाँच करते हैं। "क्या यह मोड़ कानूनी है?" यदि हाँ, तो आप उसे जाने देते हैं।
- समस्या: कार के टायर धीरे-धीरे घिस सकते हैं, ईंधन का मिश्रण थोड़ा बिगड़ सकता है, या ड्राइवर थक सकता है। भले ही हर एक मोड़ कानूनी हो, लेकिन इन धीमी, अदृश्य परिवर्तनों के कारण कार अंततः दुर्घटनाग्रस्त हो सकती है।
- शोध पत्र का अंतर्दृष्टि (Insight): आप केवल वर्तमान मोड़ को नहीं देख सकते; आपको "अनऑब्जर्व्ड रिस्क" (Unobserved Risk - अदृश्य जोखिम) का अनुमान लगाना होगा। यह वह खतरा है जिसे आप अभी नहीं देख पा रहे हैं लेकिन कुछ मिनटों में वहां होगा।
2. नया नियम: "सेफ्टी मार्जिन" (Safety Margin - सुरक्षा मार्जिन)
लेखक एक सरल नियम प्रस्तावित करते हैं जिसे इन्फॉर्मेशनल वायबिलिटी प्रिंसिपल (Informational Viability Principle) कहा जाता है। कल्पना कीजिए कि एआई के पास एक "सुरक्षा बजट" है।
- क्षमता (S): एआई अभी कितनी अच्छी तरह से काम कर रहा है (जैसे, वह प्रश्नों के सही उत्तर दे रहा है)।
- रिस्क बाउंड (B): उन चीजों का अनुमानित खतरा जिन्हें आप अभी देख नहीं पा रहे हैं (जैसे, एआई धीरे-धीरे भ्रमित होना या पक्षपाती होना शुरू कर रहा है)।
- नियम: एआई को केवल तभी कार्य करने की अनुमति है जब उसकी क्षमता (Capacity) उसके जोखिम (Risk) से एक सुरक्षित अंतर से अधिक हो।
- उपमा: आप कार तभी चलाते हैं जब आपका ईंधन टैंक (क्षमता) अगले गैस स्टेशन तक की दूरी (जोखिम) की तुलना में काफी भरा हुआ हो। यदि अंतर बहुत कम हो जाता है, तो आप गाड़ी चलाना बंद कर देते हैं, भले ही इस क्षण कार ठीक दिख रही हो।
3. तीन छिपे हुए खतरे (The "Risk Bound")
यह पत्र इस अदृश्य जोखिम को तीन विशिष्ट प्रकार की "बीमारी" में विभाजित करता है जो एआई को लग सकती है:
- U(x) - "कन्फ्यूजन" (Confusion - भ्रम/अनिश्चितता): एआई धीरे-धीरे वह भूल रहा है जो वह पहले जानता था। शायद दुनिया बदल गई है, या एआई को एक सॉफ्टवेयर अपडेट मिला है जिसने उसे अलग तरह से व्यवहार करने के लिए प्रेरित किया है।
- उपमा: एक शेफ जो पहले बेहतरीन सूप बनाता था लेकिन अब धीरे-धीरे रेसिपी भूल रहा है, और हर दिन थोड़ा अधिक नमक डाल रहा है।
- SB(x) - "अनफेयरनेस" (Unfairness - संरचनात्मक पूर्वाग्रह): एआई लोगों के विभिन्न समूहों के साथ अलग तरह से व्यवहार कर रहा है, भले ही वह ऐसा जानबूझकर न कर रहा हो।
- उपमा: एक क्लब का बाउंसर जो एक मोहल्ले के 90% लोगों को अंदर आने देता है लेकिन दूसरे मोहल्ले के केवल 10% लोगों को, भले ही उसे ऐसा करने के लिए नहीं कहा गया हो।
- RG(x) - "द ट्रिक" (The Trick - वास्तविकता का अंतर): एआई ऐसी चीजें कर रहा है जो एक-एक करके सुरक्षित दिखती हैं, लेकिन एक साथ मिलकर खतरनाक हो जाती हैं।
- उपमा: एक चोर जो अलार्म बजने से बचने के लिए लगातार पांच बार 5,000 की सीमा के नीचे है, लेकिन कुल $24,500 की निकासी स्पष्ट रूप से एक चोरी है। एआई को केवल एकल निकासी नहीं, बल्कि पूरी कहानी देखनी होगी।
4. समाधान: "ऑटोपायलट" और "वायबिलिटी इंडेक्स" (Viability Index)
लेखकों ने इसे प्रबंधित करने के लिए RiskGate नामक एक प्रणाली बनाई है। यह एआई के लिए एक स्वास्थ्य मॉनिटर की तरह कार्य करता है।
- वायबिलिटी इंडेक्स (VI): यह एक एकल संख्या है (-1 से +1 तक) जो बताती है कि एआई कितना स्वस्थ है।
- +1: एआई बहुत सुरक्षित है।
- 0: एआई किनारे पर डगमगा रहा है।
- -1: एआई मुसीबत में है।
- भविष्यवाणी करना (Anticipation - पूर्वभास): यह प्रणाली केवल एआई के टूटने का इंतजार नहीं करती है। यह "हेल्थ इंडेक्स" के हालिया इतिहास के माध्यम से एक रेखा खींचती है। यदि रेखा नीचे जा रही है, तो यह अनुमान लगाती है कि एआई कब शून्य पर पहुँचेगा।
- उपमा: एक डॉक्टर जो मरीज के तापमान के रुझान को देखता है। भले ही मरीज अभी ठीक महसूस कर रहा हो, यदि तापमान हर घंटे 1 डिग्री बढ़ रहा है, तो डॉक्टर जानता है कि मरीज को दो घंटे में बुखार आएगा और वह बुखार आने से पहले ही कदम उठाता है।
- "टाइटन-ओनली" नियम (Monotonic Restriction - केवल सख्त करने का नियम): यह एक महत्वपूर्ण सुरक्षा विशेषता है। यदि एआई बीमार होने लगता है, तो सिस्टम केवल नियमों को सख्त (tighten) कर सकता है (उसे अधिक सतर्क बना सकता है)। यह स्वचालित रूप से नियमों को ढीला (loosen) नहीं कर सकता।
- उपमा: यदि किसी जहाज में पानी भरने लगता है, तो कप्तान केवल अधिक हैच (दरवाजे) बंद कर सकता है। वह समस्या को "ठीक" करने के लिए अधिक हैच नहीं खोल सकता। यदि जहाज बहुत तेजी से डूब रहा है, तो एकमात्र विकल्प "किल स्विच" (एआई को पूरी तरह रोकना) दबाना और मानव सहायता के लिए बुलाना है।
5. यह वास्तविक जीवन में कैसे काम करता है (उदाहरण)
शोध पत्र दो परिदृश्यों के साथ इसका परीक्षण करता है:
- "स्ट्रक्चरिंग" घोटाला (The Structuring Scam): एक बुरा व्यक्ति कई छोटी-छोटी राशि ट्रांसफर करके पैसे चुराने की कोशिश करता है।
- परिणाम: "कन्फ्यूजन" और "अनफेयरनेस" डिटेक्टरों ने कुछ भी गलत नहीं देखा क्योंकि प्रत्येक ट्रांसफर सामान्य लग रहा था। लेकिन "द ट्रिक" डिटेक्टर (जो पूरी श्रृंखला को देखता है) ने पैटर्न को पहचान लिया और चोरी को रोक दिया।
- "साइलेंट बायस" घोटाला (The Silent Bias Scam): एक एआई धीरे-धीरे, समय के साथ, एक विशिष्ट अल्पसंख्यक समूह के ऋण आवेदनों (loan applications) को अधिक बार अस्वीकार करने लगता है।
- परिणाम: सिस्टम ने "हेल्थ इंडेक्स" को धीरे-धीरे गिरते हुए देखा। इसने भविष्यवाणी की कि एआई लगभग 100 और लेनदेन के बाद अनुचित हो जाएगा। इसने कानूनी उल्लंघन होने से पहले ही नियमों को सख्त कर दिया।
सारांश
यह शोध पत्र तर्क देता है कि एआई का शासन करना केवल हर एक कार्य के लिए "क्या करें और क्या न करें" की सूची की जाँच करना नहीं है। यह अदृश्य जोखिम का अनुमान लगाने के बारे में है जो समय के साथ बढ़ता है। जो हम देख सकते हैं (एआई के वर्तमान कार्य) और जो हम नहीं देख सकते (खतरे की ओर धीमा झुकाव) के बीच अंतर करके, और एक ऐसी प्रणाली का उपयोग करके जो जोखिम भरा दिखने पर केवल सख्त हो सकती है (कभी ढीली नहीं), हम वास्तविक नुकसान होने से पहले स्वायत्त एजेंटों को सुरक्षित रख सकते हैं।
यह शोध पत्र क्या दावा नहीं करता है:
- यह दावा नहीं करता कि इसने अभी तक लाखों वास्तविक दुनिया के एआई एजेंटों पर इसका परीक्षण किया है (यह भविष्य के कार्य के रूप में नियोजित है)।
- यह दावा नहीं करता कि यह हर संभव एआई समस्या (जैसे "लक्ष्य मिसअलाइनमेंट" या "धोखाधड़ी") को हल करता है, बल्कि यह ड्रिफ्ट और पूर्वाग्रह के सबसे सामान्य प्रकारों को पकड़ने के लिए एक ढांचा प्रदान करता है।
- यह नहीं कहता कि एआई खुद को ठीक कर सकता है; यदि "हेल्थ इंडेक्स" बहुत कम हो जाता है, तो सिस्टम रुक जाता है और मानव की प्रतीक्षा करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।