← नवीनतम पेपर
💻 computer science

Beyond Task Success: An Evidence-Synthesis Framework for Evaluating, Governing, and Orchestrating Agentic AI

यह शोधपत्र 24 स्रोतों से साक्ष्य संश्लेषित करके एजेंटिक एआई (Agentic AI) में गवर्नेंस-टू-एक्शन क्लोजर गैप को संबोधित करता है ताकि एक चार-स्तरीय ढांचे, एक ODTA रनटाइम-प्लेसमेंट परीक्षण, और एक न्यूनतम एक्शन-एविडेंस बंडल का प्रस्ताव दिया जा सके जो उच्च-स्तरीय मूल्यांकन/गवर्नेंस और ठोस, प्रमाण योग्य निष्पादन अनुपालन के बीच के विच्छेद को सामूहिक रूप से पाटते हैं।

मूल लेखक: Christopher Koch, Joshua Andreas Wellbrock

प्रकाशित 2026-04-23
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Christopher Koch, Joshua Andreas Wellbrock

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप "एजेंट" नामक एक बहुत ही बुद्धिमान, बहुत तेज़ व्यक्तिगत सहायक को काम पर रख रहे हैं। यह एजेंट केवल सवालों के जवाब ही नहीं देता; इसमें आपके बैंक खाते खोलने, अनुबंधों (contracts) पर हस्ताक्षर करने, आपूर्ति खरीदने और आपकी ओर से अन्य लोगों से बात करने की शक्ति है।

अतीत में, हमें केवल इस बात की परवाह थी कि एजेंट ने काम पूरा किया या नहीं। यदि आपने उससे "एक लैपटॉप खरीदने" के लिए कहा, और वह एक लैपटॉप लेकर आया, तो हमने कहा, "बहुत बढ़िया!"

लेकिन यह शोध पत्र तर्क देता है कि केवल काम पूरा करना अब पर्याप्त नहीं है।

यदि उस एजेंट ने 10,000कालैपटॉपखरीदाजबकिआपकाबजट10,000 का लैपटॉप खरीदा जबकि आपका बजट 500 था, या यदि उसने नियमों की जाँच किए बिना किसी स्कैमर से इसे खरीदा, तो उसने कार्य में तो "सफलता" प्राप्त की लेकिन वह भरोसेमंद होने में विफल रहा। समस्या यह है कि हम एक जटिल, बहु-चरणीय प्रक्रिया को एक साधारण "पास/फेल" ग्रेड से आंकने की कोशिश कर रहे हैं।

यहाँ इस पेपर का समाधान है, जिसे एक सरल उपमा के माध्यम से समझाया गया है: एक उच्च श्रेणी के रेस्तरां में "स्मार्ट शेफ"।

समस्या: "गवर्नेंस-टू-एक्शन" गैप (शासन-से-कार्रवाई अंतराल)

एक रेस्तरां की कल्पना करें जिसमें एक सख्त मुख्य शेफ (Governance - शासन स्तर) है। मुख्य शेफ एक नियम पुस्तिका लिखता है: "अनुमोदित आपूर्तिकर्ताओं से सामग्री न खरीदें," और "एक वस्तु पर $50 से अधिक खर्च न करें।"

फिर, आपके पास एजेंट है, जो वास्तव में खाना बनाने वाला 'सू शेफ' (sous-chef) है।

  • द गैप (अंतराल): मुख्य शेफ नियम लिखता है, लेकिन सू शेफ रसोई में इधर-उधर दौड़ रहा होता है। कभी-कभी सू शेफ एक अजीब सामग्री उठा लेता है क्योंकि वह सेल पर थी, यह सोचकर, "मुख्य शेफ को पता नहीं चलेगा।"
  • समस्या: हमारे पास एक नियम पुस्तिका (Governance) है और एक तैयार व्यंजन (Evaluation) है, लेकिन हमारे पास एक किचन मैनेजर की कमी है जो खाना बनाते समय वास्तविक समय (real-time) में यह देखने के लिए निगरानी करे कि नियमों का वास्तव में पालन किया जा रहा है या नहीं।

शोध पत्र इस लापता कड़ी को "Governance-to-Action Closure Gap" कहता है। यह "जो हमने कहा था कि क्या होना चाहिए" और "वास्तव में उस क्षण में क्या हुआ" के बीच का स्थान है।

समाधान: चार-स्तरीय ढांचा (Four-Layer Framework)

इसे ठीक करने के लिए, लेखक एक चार-स्तरीय प्रणाली का प्रस्ताव करते हैं, जैसे कि एक चार मंजिला इमारत जहाँ हर मंजिल का एक विशिष्ट कार्य है:

  1. लेयर 1: इवैल्यूएशन (भोजन समीक्षक / Evaluation)

    • कार्य: अंतिम व्यंजन को देखता है। क्या इसका स्वाद अच्छा था? क्या ग्राहक का पेट भर गया?
    • सीमा: समीक्षक केवल परिणाम देखता है। उन्हें नहीं पता कि शेफ ने ज़हर का उपयोग किया या सामग्री चुराई। हमें केवल प्लेट को नहीं, बल्कि पूरी प्रक्रिया को देखने की आवश्यकता है।
  2. लेयर 2: गवर्नेंस (मुख्य शेफ / नियम पुस्तिका / Governance)

    • कार्य: नियम लिखता है। "हम केवल जैविक (organic) चीजें खरीदते हैं," "$50 से अधिक खर्च न करें," "आपूर्तिकर्ता का लाइसेंस जांचें।"
    • सीमा: नियम पुस्तिका शेल्फ पर रखी रहती है। यह उस क्षण में जोश में गलत सामग्री उठाने से सू शेफ को नहीं रोक सकती।
  3. लेयर 3: ऑर्केस्ट्रेशन (किचन मैनेजर / Orchestration)

    • कार्य: यह सबसे महत्वपूर्ण नया स्तर है। यह वह व्यक्ति है जो चूल्हे के ठीक बगल में खड़ा है।
    • कार्रवाई: जब सू शेफ 60कास्टेकलेनेकेलिएहाथबढ़ाताहै,तोकिचनमैनेजरकहताहै,"रुको!यहबजटसेअधिकहै।इसकेबजाय60 का स्टेक लेने के लिए हाथ बढ़ाता है, तो किचन मैनेजर कहता है, "रुको! यह बजट से अधिक है। इसके बजाय 40 वाला स्टेक ले आओ।" या, "आप उस आपूर्तिकर्ता से नहीं खरीद सकते; मुझे पहले मुख्य शेफ को कॉल करने की आवश्यकता है।"
    • महत्व: यहीं पर नियमों को वास्तविक समय में लागू किया जाता है।
  4. लेयर 4: एश्योरेंस (सुरक्षा कैमरा और ऑडिट / Assurance)

    • कार्य: सब कुछ रिकॉर्ड करता है। यदि ग्राहक बाद में शिकायत करता है, तो हम वीडियो टेप चला सकते हैं।
    • कार्रवाई: यह साबित करता है कि बिल्कुल क्या हुआ। "हाँ, किचन मैनेजर ने महंगा स्टेक रोकने के लिए रोका था। यहाँ वीडियो, टाइमस्टैम्प और मैनेजर के हस्ताक्षर हैं।"

"ODTA" टेस्ट: यह तय करने के लिए कि कौन क्या करेगा

यह पेपर एक सरल परीक्षण पेश करता है जिसे ODTA कहा जाता है ताकि यह पता लगाया जा सके कि किस स्तर को किस नियम को संभालना चाहिए। इसे किचन मैनेजर के लिए एक चेकलिस्ट के रूप में समझें:

  • O (Observability - अवलोकन क्षमता): क्या हम होने से पहले कार्रवाई को देख सकते हैं? (क्या हम महंगे स्टेक की ओर हाथ बढ़ाते हुए शेफ को देख सकते हैं?)
  • D (Decidability - निर्णय क्षमता): क्या नियम स्पष्ट है? (क्या यह स्पष्ट है कि $60, $50 की सीमा से ऊपर है, या यह एक "शायद" वाली स्थिति है?)
  • T (Timeliness - सामयिकता): क्या हम इसे तेजी से रोक सकते हैं? (यदि हम स्टेक पकने तक प्रतीक्षा करते हैं, तो बहुत देर हो चुकी होगी।)
  • A (Attestability - साक्ष्य योग्यता): यदि हम चूक जाते हैं, तो क्या हम बाद में साबित कर सकते हैं कि क्या हुआ था? (क्या हमारे पास वीडियो रिकॉर्डिंग है?)

यदि चारों का उत्तर 'हाँ' है: तो किचन मैनेजर (Orchestration) को तुरंत रोकना चाहिए।
यदि उत्तर 'नहीं' है: तो शायद नियम मशीन के लिए बहुत अस्पष्ट है। इसे मानव (Human Judgment) के पास जाना चाहिए या बाद में सुरक्षा कैमरे (Assurance) द्वारा जांचा जाना चाहिए।

"मिनिमम एक्शन-एविडेंस बंडल" (MAEB)

अंत में, पेपर कहता है: "यदि आप एजेंट को कुछ जोखिम भरा करने (जैसे पैसा खर्च करना) देने जा रहे हैं, तो आपको एक विशिष्ट 'रसीद' सुरक्षित करनी चाहिए।"

यह केवल एक लॉग नहीं है जो कहता है "मैंने लैपटॉप खरीदा।" यह एक डिजिटल रसीद है जिसमें शामिल है:

  • आदेश किसने दिया?
  • वह सटीक नियम क्या था जिसने इसकी अनुमति दी?
  • कार्रवाई से पहले दुनिया की स्थिति क्या थी? (उदाहरण के लिए, "हमारे पास बजट में $40 बचे थे।")
  • किसने मंजूरी दी?
  • वीडियो प्रमाण का लिंक।

बिना इस "रसीद" के, यदि कुछ गलत हो जाता है, तो आप यह साबित नहीं कर पाएंगे कि यह किसने किया या क्यों किया।

वास्तविक दुनिया का उदाहरण: खरीद एजेंट (Procurement Agent)

पेपर एक "प्रोक्योरमेंट एजेंट" (एक रोबोट जो कंपनी के लिए चीजें खरीदता है) का उपयोग यह दिखाने के लिए करता है कि यह कैसे काम करता है।

  • खराब परिदृश्य: रोबोट $10,000 का प्रिंटर खरीदता है। उसने कार्य पूरा कर लिया! लेकिन उसने नियमों को तोड़ दिया।
  • अच्छा परिदृश्य (फ्रेमवर्क के साथ):
    1. गवर्नेंस (Governance) कहता है: "अधिकतम खर्च $5,000 है।"
    2. ऑर्केस्ट्रेशन (Orchestration) देखता है कि रोबोट $10k का प्रिंटर खरीदने की कोशिश कर रहा है। यह रोबोट को रोकता है और कहता है, "मानव अनुमोदन (human approval) आवश्यक है।"
    3. एक मानव इसे मंजूरी देता है।
    4. एश्योरेंस (Assurance) उस "रसीद" (MAEB) को सहेजता है जो दिखाता है कि रोबोट ने प्रयास किया, सिस्टम ने उसे रोका, मानव ने मंजूरी दी, और पैसा खर्च किया गया।

मुख्य निष्कर्ष

हम केवल AI पर "सही काम करने" के लिए भरोसा नहीं कर सकते, भले ही उसका अंतिम उत्तर सही हो। हमें एक ऐसी प्रणाली की आवश्यकता है जहाँ:

  1. नियम स्पष्ट रूप से लिखे गए हों।
  2. मैनेजर्स (Orchestration) उन नियमों को लागू करने के लिए वास्तविक समय में AI की निगरानी करें।
  3. रिकॉर्डर (Assurance) हर कदम का प्रमाण सुरक्षित रखें।

विश्वास AI के स्मार्ट होने से नहीं आता; यह एक ऐसी प्रणाली से आता है जो गलतियों को होने से पहले पकड़ लेती है और होने के बाद उन्हें साबित करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →