← नवीनतम पेपर
💰 quantitative finance

Model Validation of Agentic AI Systems: A POMDP-Based Framework for Belief-State, Forecast, and Policy Validation

यह शोध पत्र एजेंटिक एआई (agentic AI) प्रणालियों को मान्य करने के लिए एक पार्शियली ऑब्जर्वेबल मार्कोव डिसीजन प्रोसेस (POMDP)-आधारित ढांचे का प्रस्ताव करता है, जो स्वायत्त निर्णय लेने की प्रक्रिया को विश्वास निर्माण (belief formation), पूर्वानुमान (forecasting) और नीति चयन (policy selection) जैसे विशिष्ट घटकों में विभाजित करके एक कठोर मॉडल-जोखिम वर्गीकरण स्थापित करता है और एक पोर्टफोलियो-प्रबंधन केस स्टडी के माध्यम से इसकी प्रभावकारिता को प्रदर्शित करता है।

मूल लेखक: Matthew Francis Dixon

प्रकाशित 2026-06-17
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Matthew Francis Dixon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नए, अत्यंत बुद्धिमान वित्तीय सलाहकार (financial advisor) को काम पर रख रहे हैं। अतीत में, आप केवल उनके अंतिम रिपोर्ट कार्ड को देखते—"क्या उन्होंने सही स्टॉक चुने?" यदि उन्होंने पैसा कमाया, तो आपने उन्हें काम पर रखा। यदि उन्होंने पैसा खोया, तो आपने उन्हें निकाल दिया।

लेकिन यह शोध पत्र तर्क देता है कि आधुनिक "एजेंटिक एआई" (Agentic AI - वह एआई जो केवल भविष्यवाणी नहीं करता, बल्कि स्वयं कार्य भी करता है) के लिए, केवल अंतिम रिपोर्ट कार्ड देखना पर्याप्त नहीं है। यह एक शेफ (chef) को केवल सूप के स्वाद से आंकने जैसा है, बिना यह देखे कि क्या उन्होंने हाथ धोए थे, ताजी सामग्री चुनी थी, या रेसिपी का पालन किया था।

यहाँ इस शोध पत्र का एक सरल विवरण दिया गया है, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है।

मुख्य समस्या: "ब्लैक बॉक्स" शेफ

पारंपरिक एआई एक ऐसे शेफ की तरह है जो आपको केवल यह बताता है कि सूप का स्वाद कैसा होगा। आप केवल यह देखते हैं कि भविष्यवाणी सही थी या नहीं।
एजेंटिक एआई (Agentic AI) अलग है। यह एक ऐसा शेफ है जो:

  1. सामग्रियों को सूंघता है (सूचना एकत्र करता है)।
  2. रसोई में क्या गड़बड़ हो सकती है, इसका अनुमान लगाता है (छिपी हुई समस्याओं के बारे में अपने विश्वास/beliefs बनाता है)।
  3. तय करता है कि क्या पकाना है (एक पूर्वानुमान बनाता है)।
  4. वास्तव में बर्तन चलाता है और व्यंजन परोसता है (कार्य करता है)।
  5. देखता है कि ग्राहक खुश हैं या नहीं (पुरस्कार प्राप्त करता है)।

शोध पत्र कहता है: यदि एआई कोई गलत निर्णय लेता है, तो हमें यह जानने की आवश्यकता है कि वह कहाँ विफल हुआ। क्या उसने सामग्रियों को गलत तरीके से पहचाना? क्या उसने रसोई की छिपी हुई स्थिति को समझने में गलती की? या उसने बस एक खराब रेसिपी चुनी?

समाधान: एक "स्तरित" निरीक्षण (A "Layered" Inspection)

लेखक इस एआई एजेंटों का परीक्षण करने का एक नया तरीका प्रस्तावित करते हैं, जो POMDP (Partially Observable Markov Decision Process) नामक एक गणितीय विचार पर आधारित है। इसे "लेयर्ड इंस्पेक्शन" (स्तरित निरीक्षण) फ्रेमवर्क समझें। केवल सूप चखने के बजाय, आप खाना पकाने की प्रक्रिया के प्रत्येक चरण का अलग-अलग निरीक्षण करते हैं।

यह पेपर एआई के मस्तिष्क को परीक्षण के लिए पाँच परतों में विभाजित करता है:

1. विश्वास परत (The Belief Layer - "अंतर्मन की जाँच")

  • यह क्या है: एआई दुनिया को देखता है और कहता है, "मुझे लगता है कि मंदी की 60% संभावना है और उछाल की 40% संभावना है।"
  • परीक्षण: क्या एआई का "अंतर्मन का अहसास" वास्तविकता से मेल खाता है? यदि वह कहता है कि बारिश की 60% संभावना है, तो क्या वास्तव में 60% बार बारिश होती है?
  • शोध पत्र का निष्कर्ष: उनके परीक्षण में, एआई "मुद्रास्फीति" (Inflation) का अनुमान लगाने में अच्छा था, लेकिन वह "संकट" (Crisis) को लेकर थोड़ा अधिक डरा हुआ था (उसे लगा कि संकट वास्तव में होने की तुलना में अधिक बार हो रहे थे)।

2. पूर्वानुमान परत (The Forecast Layer - "भविष्यवाणी")

  • यह क्या है: उन विश्वासों के आधार पर, एआई भविष्य के स्टॉक मूल्यों की भविष्यवाणी करता है।
  • परीक्षण: क्या ये भविष्यवाणियां केवल कल के आंकड़ों के आधार पर अनुमान लगाने से बेहतर हैं?
  • शोध पत्र का निष्कर्ष: हाँ। जब एआई ने भविष्यवाणियों के लिए अर्थव्यवस्था के छिपे हुए पहलुओं के बारे में अपने "विश्वासों" का उपयोग किया, तो इसने केवल पिछले स्टॉक चार्टों को देखने की तुलना में बेहतर प्रदर्शन किया।

3. नीति परत (The Policy Layer - "निर्णय")

  • यह क्या है: एआई तय करता है कि विभिन्न स्टॉक्स में कितना पैसा लगाना है।
  • परीक्षण: क्या एआई ने अच्छे कदम उठाए? क्या उसने अन्य रणनीतियों की तुलना में बाजार गिरने के दौरान कम पैसा खोया?
  • शोध पत्र का निष्कर्ष: एआई की रणनीति में सबसे कम "ड्रॉडाउन" (drawdown - गिरावट) था और इसके जोखिम-समायोजित रिटर्न (risk-adjusted returns) सबसे अच्छे थे।

4. उपयोगिता परत (The Utility Layer - "लक्ष्य")

  • यह क्या है: क्या एआई ने वास्तव में वही हासिल किया जो मानव बॉस चाहता था?
  • परीक्षण: कभी-कभी एआई गणित में बहुत अच्छा होता है लेकिन वास्तविक लक्ष्य में विफल रहता है (जैसे, वह लाभ को अधिकतम करता है लेकिन कानून तोड़ देता है)। यह परत जांचती है कि क्या एआई के कार्य वास्तविक उद्देश्य के अनुरूप हैं।
  • शोध पत्र का निष्कर्ष: एआई ने सफलतापूर्वक उस विशिष्ट "हैप्पीनेस स्कोर" (उपयोगिता) को अधिकतम किया जो शोधकर्ताओं ने उसे दिया था।

5. स्टेट-स्पेस परत (The State-Space Layer - "मानचित्र")

  • यह क्या है: यह वह मानचित्र है जिसका उपयोग एआई दुनिया को समझने के लिए करता है। शोधकर्ताओं ने "AI Boom," "Soft Landing," या "Crisis" जैसे विशिष्ट "स्टेट्स" (स्थितियाँ) परिभाषित किए।
  • जोखिम: यदि मानचित्र गलत है (उदाहरण के लिए, यदि आपने "युद्ध" को एक संभावित स्थिति के रूप में शामिल करना भूल गए), तो एआई चाहे कितना भी स्मार्ट क्यों न हो, वह भटक जाएगा।
  • शोध पत्र का निष्कर्ष: शोधकर्ताओं ने स्वीकार किया कि यह एक अनुमान है। उन्होंने इस मानचित्र को जादुई शक्ति के बजाय आर्थिक अंतर्ज्ञान (economic intuition) के आधार पर बनाया है। यदि मानचित्र अधूरा है, तो पूरा सिस्टम दोषपूर्ण होगा।

प्रयोग: एक "कुकिंग कॉम्प" (The "Cook-Off")

इसे सिद्ध करने के लिए, लेखकों ने जून 2024 से जून 2026 तक प्रसिद्ध टेक और वित्तीय स्टॉक्स के पोर्टफोलियो का उपयोग करके एक सिमुलेशन (एक प्रतियोगिता) चलाया।

उन्होंने अपने "लेयर्ड एआई" की तुलना पाँच अन्य मानक रणनीतियों (जैसे "इक्वल वेट" या "रिस्क पैरिटी") से की।

परिणाम:

  • विजेता: "फोरकास्टिंग POMDP" (लेयर्ड एआई) ने जरूरी नहीं कि सबसे अधिक कच्चा पैसा कमाया (एक अन्य रणनीति ने अधिक कमाया), लेकिन इसने लिए गए जोखिम के सापेक्ष सबसे अच्छे निर्णय लिए। इसमें उच्चतम "शार्प रेशियो" (दक्षता का एक माप) और बाजार गिरने के दौरान सबसे कम नुकसान हुआ।
  • "एब्लेशन" टेस्ट (The "Remove an Ingredient" Test - "सामग्री हटाने का परीक्षण"): उन्होंने यह देखने के लिए एआई के कुछ हिस्सों को हटाने की कोशिश की कि क्या महत्वपूर्ण था।
    • जब उन्होंने "विश्वास" (Belief) वाले हिस्से को हटाया, तो प्रदर्शन गिर गया।
    • जब उन्होंने "मैक्रो" (बड़ी तस्वीर) डेटा को हटाया, तो प्रदर्शन गिर गया।
    • निष्कर्ष: "विश्वास" वाला हिस्सा वास्तव में काम कर रहा था। यह केवल स्टॉक चार्टों को दोहरा नहीं रहा था जो पहले से मौजूद थे; बल्कि यह नया मूल्य जोड़ रहा था।

मुख्य निष्कर्ष

इस शोध पत्र का मुख्य बिंदु यह विशेष एआई दुनिया का सबसे अच्छा निवेशक है, यह नहीं है। मुख्य बिंदु पारदर्शिता (Transparency) है।

एआई को अवलोकन (Observations) → विश्वास (Beliefs) → पूर्वानुमान (Forecasts) → क्रियाएं (Actions) → उपयोगिता (Utility) में तोड़कर, हम अंततः कह सकते हैं:

  • "एआई विफल हुआ क्योंकि इसने समाचारों को गलत समझा (Belief error)।"
  • या "एआई ने समाचारों को सही ढंग से समझा, लेकिन एक गलत ट्रेड किया (Policy error)।"

यह एक बहुत बड़ा बदलाव है। केवल यह कहने के बजाय कि "एआई गलत है," अब हम यह निदान (diagnose) कर सकते हैं कि वह क्यों गलत है, ठीक वैसे ही जैसे एक मैकेनिक बता सकता है कि कार खराब ईंधन, फ्लैट टायर या टूटे हुए इंजन के कारण खराब हुई है। यह ढांचा हमें इन स्वायत्त प्रणालियों (autonomous systems) पर भरोसा करने, उन्हें नियंत्रित करने और उन्हें वास्तविक दुनिया की गलतियाँ करने से पहले ठीक करने का एक तरीका प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →