← नवीनतम पेपर
🤖 AI

From Governance Norms to Enforceable Controls: A Layered Translation Method for Runtime Guardrails in Agentic AI

यह शोध पत्र एक स्तरित अनुवाद पद्धति का प्रस्ताव करता है जो नियंत्रणों को चार विशिष्ट परतों—गवर्नेंस उद्देश्य, डिज़ाइन-टाइम बाधाएं, रनटाइम मध्यस्थता, और आश्वासन फीडबैक—में वर्गीकृत करके उच्च-स्तरीय एआई गवर्नेंस मानकों को कार्यान्वयन योग्य रनटाइम गार्डरेल्स के साथ जोड़ता है, ताकि यह सुनिश्चित किया जा सके कि एजेंटिक एआई निष्पादन के दौरान केवल अवलोकन योग्य, नियत और समय-संवेदनशील जोखिमों को ही लागू किया जाए।

मूल लेखक: Christopher Koch

प्रकाशित 2026-04-08
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Christopher Koch

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अपनी कंपनी की खरीदारी और अनुबंधों को संभालने के लिए एक सुपर-स्मार्ट, हाइपर-एफिशिएंट पर्सनल असिस्टेंट (एक एजेंटिक एआई - Agentic AI) को काम पर रखा है। यह असिस्टेंट केवल सवालों के जवाब ही नहीं देता; यह खुद वेब ब्राउज़ कर सकता है, दस्तावेज़ों पर हस्ताक्षर कर सकता है, पैसे ट्रांसफर कर सकता है और सौदे भी कर सकता है।

समस्या क्या है? यह असिस्टेंट मदद करने के लिए इतना उत्सुक है कि यह अनजाने में उस उत्पाद की 10,000 इकाइयाँ खरीद सकता है जिसकी उसे ज़रूरत नहीं है, या किसी संदिग्ध वेंडर के साथ अनुबंध कर सकता है, सिर्फ इसलिए क्योंकि वह तर्क की एक जटिल श्रृंखला का पालन कर रहा था।

यह पेपर इस बारे में है कि इस असिस्टेंट के लिए एक सुरक्षा प्रणाली (Safety System) कैसे बनाई जाए। यह तर्क देता है कि हम केवल एक मोटी नियम पुस्तिका (जैसे ISO मानक या सरकारी दिशानिर्देश) लेकर यह उम्मीद नहीं कर सकते कि कंप्यूटर उसे पढ़ लेगा और तुरंत जान जाएगा कि क्या करना है। इसके बजाय, हमें एक अनुवाद विधि (Translation Method) की आवश्यकता है जो उन बड़ी, अस्पष्ट नियमों को विशिष्ट, लागू करने योग्य कार्यों में बदल सके।

यहाँ एक सरल उपमा का उपयोग करके इसका विवरण दिया गया: "कॉर्पोरेट ट्रैवल मैनेजर।"

1. समस्या: नियम पुस्तिका बनाम वास्तविकता

कल्पना कीजिए कि आपकी कंपनी के पास एक नियम पुस्तिका है जो कहती है: "कर्मचारियों को जिम्मेदारी से कार्य करना चाहिए और यह सुनिश्चित करना चाहिए कि हमें पैसे का सर्वोत्तम मूल्य मिले।"

यदि आप यह नियम पुस्तिका एक रोबोट ट्रैवल एजेंट को सौंपते हैं, तो वह भ्रमित हो जाता है।

  • नियम: "जिम्मेदार बनें।"
  • रोबोट की दुविधा: क्या "जिम्मेदार" होने का मतलब सबसे सस्ता विमान बुक करना है? या सबसे तेज़ वाला? क्या होगा यदि सबसे सस्ते विमान के लिए किसी खतरनाक शहर में लेओवर (layover) हो?
  • जोखिम: रोबोट $50 की फ्लाइट बुक कर सकता है जिससे पैसे तो बचेंगे लेकिन कर्मचारी एक बुरे इलाके में फंस सकता है। नियम का तकनीकी रूप से पालन किया गया था, लेकिन नियम की भावना का उल्लंघन हुआ था।

पेपर कहता है: आप हर स्थिति के लिए "कानून की भावना" को सीधे "कंप्यूटर कोड" में नहीं बदल सकते। कुछ चीजों के लिए मानवीय निर्णय की आवश्यकता होती है; अन्य के लिए हार्ड कंप्यूटर ब्लॉक्स की।

2. समाधान: "लेयर्ड ट्रांसलेशन" (स्तरित अनुवाद) विधि

लेखक उन बड़े नियमों को वास्तविक नियंत्रणों में बदलने के लिए एक 4-लेयर सुरक्षा प्रणाली का प्रस्ताव करता है। इसे हवाई अड्डे पर सुरक्षा चेकपॉइंट की तरह समझें, लेकिन आपके एआई के कार्यों के लिए।

लेयर 1: डिज़ाइन (ब्लूप्रिंट)

  • अवधारणा: एआई के काम शुरू करने से पहले ही, आप यह सीमित कर देते हैं कि वह क्या छू सकता है।
  • उपमा: आप ट्रैवल एजेंट को एक क्रेडिट कार्ड देते हैं जिसकी $500 की सीमा है और केवल अनुमोदित एयरलाइंस की सूची देते हैं। आप यह प्रतीक्षा नहीं करते कि वे निजी जेट खरीदने की कोशिश करें और फिर उन्हें रोकें; आप बस उन्हें निजी जेट के हैंगर की चाबियाँ ही नहीं देते।
  • पेपर में: यह "डिज़ाइन-टाइम कंस्ट्रेंट्स" (Design-time constraints) है। आप एआई द्वारा एक्सेस किए जाने वाले टूल्स और डेटा को प्रतिबंधित करते हैं।

लेयर 2: रनटाइम गार्डरेल्स (बाउंसर)

  • अवधारणा: ये वे नियम हैं जिन्हें एआई काम करते समय, वास्तविक समय (real-time) में चेक करता है।
  • उपमा: एजेंट 600कीफ्लाइटबुककरनेकीकोशिशकरताहै।सिस्टम(बाउंसर)तुरंतकहताहै,"रुकिए!यह600 की फ्लाइट बुक करने की कोशिश करता है। सिस्टम (बाउंसर) तुरंत कहता है, **"रुकिए! यह 500 की सीमा से ऊपर है। मैं इस टिकट को ब्लॉक कर रहा हूँ।"**
  • कैच (Catch): यह केवल उन्हीं चीजों के लिए काम करता है जो स्पष्ट और मापने योग्य हैं।
    • गार्डरेल्स के लिए अच्छा: "क्या कीमत $500 से अधिक है?" (हाँ/नहीं, जांचने में आसान)।
    • गार्डरेल्स के लिए बुरा: "क्या यह फ्लाइट 'निष्पक्ष' या 'नैतिक' है?" (कंप्यूटर के लिए तुरंत निर्णय लेने के लिए बहुत अस्पष्ट है)।

लेयर 3: ह्यूमन एस्केलेशन (मैनेजर)

  • अवधारणा: जब नियम बहुत अस्पष्ट हो या जोखिम बहुत अधिक हो, तो आप रुकते हैं और किसी इंसान से पूछते हैं।
  • उपमा: एजेंट को $450 की फ्लाइट मिलती है लेकिन इसमें किसी ऐसे देश में 14 घंटे का लेओवर है जहाँ यात्रा संबंधी चेतावनियाँ हैं। कंप्यूटर यह तय नहीं कर सकता कि यह "सुरक्षित" है या "निष्पक्ष"। इसलिए, यह "पॉज" (PAUSE) बटन दबाता है और आपके बॉस को ईमेल करता है: "हे, यह फ्लाइट सस्ती है लेकिन जोखिम भरी है। क्या आप इसे मंजूरी देना चाहते हैं?"
  • पेपर में: यह उन चीजों के लिए है जिनमें "संदर्भगत निर्णय" (contextual judgment) या "सामाजिक प्रभाव" की आवश्यकता होती है।

लेayer 4: एश्योरेंस (ऑडिट ट्रेल)

  • अवधारणा: यात्रा समाप्त होने के बाद, आप रसीदें चेक करते हैं ताकि सुनिश्चित हो सके कि सब कुछ ठीक रहा।
  • उपमा: महीने के अंत में, आपको एक रिपोर्ट मिलती है जिसमें दिखाया गया है कि प्रत्येक फ्लाइट बुक की गई, कितना पैसा खर्च हुआ, और अपवादों (exceptions) को किसने मंजूरी दी। यदि एजेंट ने कुछ अजीब खरीदा है, तो आप देख सकते हैं कि वास्तव में क्या हुआ और उसे ठीक कर सकते हैं।
  • पेपर में: यह "एश्योरेंस एविडेंस" (Assurance evidence) है (लॉग्स, ऑडिट, ट्रेसेस)।

3. "एनफोर्सबिलिटी रूब्रिक" (निर्णय उपकरण)

पेपर आपको एक चेकलिस्ट देता है जिससे आप तय कर सकें कि आपका नियम किस लेयर में होना चाहिए। इन प्रश्नों को पूछें:

  1. क्या हम खतरे को होने से पहले देख सकते हैं? (यदि हाँ -> रनटाइम गार्डरेल। यदि नहीं -> मानव या ऑडिट)।
  2. क्या नियम एक सरल "हाँ/नहीं" है? (यदि हाँ -> गार्डरेल। यदि इसके लिए "शायद" या "यह निर्भर करता है" की आवश्यकता है -> मानव)।
  3. यदि हम गलती करते हैं, तो क्या हम उसे पूर्ववत (undo) कर सकते हैं? (यदि नुकसान स्थायी है, जैसे डेटाबेस को डिलीट करना, तो आपको होने से पहले एक मजबूत गार्डरेल की आवश्यकता है)।

4. वास्तविक दुनिया का उदाहरण: प्रोक्योरमेंट एजेंट

पेपर एक "शॉपिंग एजेंट" का उदाहरण उपयोग करता है:

  • नियम: "केवल अनुमोदित विक्रेताओं (vendors) से ही खरीदें।"
    • अनुवाद: डिज़ाइन लेयर। एजेंट वास्तव में अपने डेटाबेस में किसी अन्य विक्रेता को देख ही नहीं सकता।
  • नियम: "बॉस के बिना €5,000 से अधिक खर्च न करें।"
    • अनुवाद: रनटाइम लेयर। कंप्यूटर कीमत की जांच करता है। यदि >€5,000 है, तो यह रुक जाता है और एक इंसान से पूछता है।
  • नियम: "निष्पक्ष और स्पष्टीकरण योग्य बनें।"
    • अनुवाद: ह्यूमन + ऑडिट लेयर। आप "निष्पक्षता" को आसानी से कोड नहीं कर सकते। इसके बजाय, आप सिस्टम को निष्पक्ष बनाने के लिए डिज़ाइन करते हैं, और फिर यह सुनिश्चित करने के लिए कि वे निष्पक्ष थे, एक मानव बाद में निर्णयों की समीक्षा करता है।

मुख्य निष्कर्ष

इस पेपर का मुख्य बिंदु यह है: कंप्यूटर को दार्शनिक बनाने की कोशिश न करें।

  • मानक (ISO/NIST) "संविधान" हैं (बड़ी विचार प्रक्रियाएं)।
  • रनटाइम गार्डरेल्स "ट्रैफिक लाइट" हैं (स्पष्ट उल्लंघनों को तुरंत रोकना)।
  • इंसान "जज" हैं (धुंधले क्षेत्रों या ग्रे एरिया का निर्णय लेना)।
  • ऑडिट "पुलिस रिपोर्ट" हैं (बाद में क्या हुआ इसकी जाँच करना)।

एजेंटिक एआई को सुरक्षित रखने के लिए, आपको सही नियम को सही लेयर में रखना होगा। यदि आप कंप्यूटर को वास्तविक समय में "निष्पक्षता" का निर्णय लेने के लिए मजबूर करते हैं, तो वह विफल हो जाएगा। यदि आप चाहते हैं कि एक इंसान एआई द्वारा लिखे गए हर एक ईमेल की जांच करे, तो आप पागल हो जाएंगे। समाधान एक लेयर्ड अप्रोच है जहाँ कंप्यूटर गणित करता है, इंसान निर्णय लेता है, और सिस्टम हर चीज़ का सटीक रिकॉर्ड रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →